TRELLIS
Modelo generativo 3D basado en deep learning que crea activos 3D en varios formatos con geometría y texturas detalladas a partir de una imagen o prompt de texto.
TRELLIS convierte una imagen o prompt en una representación latente estructurada (SLAT) y la decodifica simultáneamente a NeRF, 3D Gaussian Splatting y mallas poligonales. Su arquitectura Rectified Flow Transformer de 1,2B-2,0B parámetros genera en unos diez segundos geometría sin distorsión y texturas PBR detalladas, reduciendo el desenfoque y las pérdidas de conversión de otros modelos. Los activos se importan directamente en motores de videojuegos y renderizadores VR. En visualización médica y biotecnológica permite prototipar rápidamente estructuras 3D a partir de imágenes de proteínas predichas por AlphaFold o cortes anatómicos, creando activos para visores web y mallas de simulación quirúrgica.
💻 Requisitos del sistema
GPU NVIDIA de al menos 16 GB (validado oficialmente en A100 y A6000).
~5 GB para pesos; al menos 15 GB con bibliotecas y compilación temporal.
⚡ Instalación
4-1. Inicio rápido
# Clonar el repositorio y submódulos
git clone --recurse-submodules https://github.com/microsoft/TRELLIS.git
cd TRELLIS
# Crear entorno Conda e instalar dependencias de compilación
. ./setup.sh --new-env --basic --xformers --flash-attn --diffoctreerast --spconv --mipgaussian --kaolin --nvdiffrast
4-2. Instalación detallada
import os
os.environ['SPCONV_ALGO'] = 'native'
from PIL import Image
from trellis.pipelines import TrellisImageTo3DPipeline
from trellis.utils import postprocessing_utils
pipeline = TrellisImageTo3DPipeline.from_pretrained("microsoft/TRELLIS-image-large")
pipeline.cuda()
image = Image.open("input_sample.png")
outputs = pipeline.run(image, seed=1)
glb = postprocessing_utils.to_glb(outputs['gaussian'][0], outputs['mesh'][0], simplify=0.95, texture_size=1024)
glb.export("output_mesh.glb")
🧬 Casos de uso en biociencias
Aplicación práctica
TRELLIS convierte una imagen o prompt en una representación latente estructurada (SLAT) y la decodifica simultáneamente a NeRF, 3D Gaussian Splatting y mallas poligonales. Su arquitectura Rectified Flow Transformer de 1,2B-2,0B parámetros genera en unos diez segundos geometría sin distorsión y texturas PBR detalladas, reduciendo el desenfoque y las pérdidas de conversión de otros modelos. Los activos se importan directamente en motores de videojuegos y renderizadores VR. En visualización médica y biotecnológica permite prototipar rápidamente estructuras 3D a partir de imágenes de proteínas predichas por AlphaFold o cortes anatómicos, creando activos para visores web y mallas de simulación quirúrgica.
FAQ
¿Qué es TRELLIS?
TRELLIS convierte una imagen o prompt en una representación latente estructurada (SLAT) y la decodifica simultáneamente a NeRF, 3D Gaussian Splatting y mallas poligonales. Su arquitectura Rectified Flow Transformer de 1,2B-2,0B parámetros genera en unos diez segundos geometría sin distorsión y texturas PBR detalladas, reduciendo el desenfoque y las pérdidas de conversión de otros modelos. Los activos se importan directamente en motores de videojuegos y renderizadores VR. En visualización médica y biotecnológica permite prototipar rápidamente estructuras 3D a partir de imágenes de proteínas predichas por AlphaFold o cortes anatómicos, creando activos para visores web y mallas de simulación quirúrgica.
¿Cuándo debería usar TRELLIS?
Modelo generativo 3D basado en deep learning que crea activos 3D en varios formatos con geometría y texturas detalladas a partir de una imagen o prompt de texto.
¿Cuál es un caso de uso biomédico de TRELLIS?
Aplicación práctica: TRELLIS convierte una imagen o prompt en una representación latente estructurada (SLAT) y la decodifica simultáneamente a NeRF, 3D Gaussian Splatting y mallas poligonales. Su arquitectura Rectified Flow Transformer de 1,2B-2,0B parámetros genera en unos diez segundos geometría sin distorsión y texturas PBR detalladas, reduciendo el desenfoque y las pérdidas de conversión de otros modelos. Los activos se importan directamente en motores de videojuegos y renderizadores VR. En visualización médica y biotecnológica permite prototipar rápidamente estructuras 3D a partir de imágenes de proteínas predichas por AlphaFold o cortes anatómicos, creando activos para visores web y mallas de simulación quirúrgica.
📝 Notas de actualización
Aún no hay notas de actualización.
🧪 Código de la vida relacionado
Aún no hay publicaciones relacionadas de Código de la vida.