¿Qué hace que InstructMesh sea tan hábil a la hora de seguir indicaciones tan únicas? Combina el sistema TRELLIS de Microsoft, que crea modelos 3D a partir de mensajes de texto e imágenes, con el modelo de lenguaje grande (LLM) GPT-4, que admite ChatGPT; en otras palabras, conocimiento visual y textual combinado.
“Queríamos reunir los talentos de los generadores 3D y las habilidades de razonamiento de los LLM en un espacio interactivo para crear objetos que la gente realmente quiere”, dice Faraz Faruqi SM ’22, PhD ’26, autor principal de un artículo que presenta el proyecto, graduado del Departamento de Ingeniería Eléctrica e Informática y reciente afiliado a CSAIL. “Los modelos de lenguaje son excelentes con texto e imágenes, mientras que el talento de TRELLIS radica en su capacidad para crear modelos 3D, ya que ha visto muchos”.
Los puntos fuertes de InstructMesh resultan útiles en otras áreas más sorprendentes. Los científicos del MIT utilizaron el programa para fabricar una rodillera que parece mezclilla a juego con los jeans de un paciente. InstructMesh puede incluso ayudar a crear robots, es decir, recintos inteligentes que albergan componentes inalámbricos. Para demostrarlo, los investigadores crearon un “robot de cerdas” que se parece a un camarón colorido. Tiene un motor escondido en su interior y, cuando se enciende, puede deslizarse por las superficies, como si fuera un juguete de cuerda.
Faruqi y sus colegas descubrieron que InstructMesh podía crear fácilmente los elementos que deseaban. Pero, ¿qué pensaría alguien que nunca ha modelado nada en 3D de su programa? ¿Y podrían realmente detectar defectos de diseño antes de la fabricación?
El equipo hace que TRELLIS recree modelos 3D populares que se encuentran en Thingiverse, una plataforma que alberga millones de modelos imprimibles en 3D, para ayudarlos a descubrirlo. Casi el 80 por ciento de los modelos que generó tenían algún defecto estructural. Luego, los investigadores de CSAIL pidieron a los principiantes que identificaran y solucionaran estos problemas en InstructMesh, y pudieron hacer ambas cosas alrededor del 90 por ciento de las veces, según lo revisado por un experto. Lo que a estos recién llegados les faltaba en experiencia, lo compensaban con intuición.
InstructMesh apoya el proceso de modelado real, que anteriormente requería experiencia en herramientas de modelado 3D. “Como la manipulación ocurre en el espacio latente del modelo generativo, InstructMesh admite la descripción de problemas en lenguaje natural y crea cambios interpretativos en la geometría para que el usuario los evalúe y apruebe”, dice Faruqi.
Luego, los usuarios crearon elementos que se asemejaban a soportes para teléfonos y jarrones, y notaron que InstructMesh era fácil de usar. También descubrieron que InstructMesh les permitía expresar una amplia gama de ideas, mientras que los controles deslizantes les daban más precisión para realizar ciertos ajustes, como ampliar o extruir una parte particular del modelo.
“Los usuarios obtuvieron lo que pedían y modificaron fácilmente los diseños cuando fue necesario”, añade Faruqi. “Lo que vieron es lo que obtuvieron, y los artículos funcionaron como se anunciaba, por así decirlo”.
Si bien los usuarios disfrutaron usando InstructMesh, Faruqi tiene una visión aún más amplia para el proyecto. Ahora trabaja en Google, donde pronto podrá incorporar InstructMesh en una plataforma de realidad aumentada (AR). La idea: indicarle al sistema lo que necesita utilizando el contexto de su entorno, luego lo imprimirá rápidamente en 3D (por ejemplo, haciendo una funda de teléfono que combine con su billetera).
InstructMesh también puede comenzar a incorporar simulaciones físicas para modelar cómo su diseño puede reaccionar ante usos específicos, como si un recipiente se rompe al caer y qué materiales funcionarían mejor. El software también podría integrar el más reciente TRELLIS.2 para refinar características aún más pequeñas en modelos 3D.
Stefanie Mueller, profesora asociada de ingeniería eléctrica e informática (EECS) e ingeniería mecánica en el MIT, y miembro de CSAIL, es la autora principal del artículo. Faruqi y Mueller escribieron el artículo con los investigadores de Google Ahmed Katary ’23; Fabián Manhardt; Vrushank Phadnis MEng ’13, PhD ’20; Ruofei Du; y Federico Tombari. Otros coautores fueron la profesora asistente de la Universidad Northeastern, Megan Hofmann, junto con varios colegas de CSAIL: Demircan Tas SM ’24 y SMArchS ’24, estudiante de doctorado en EECS y arquitectura; la ex investigadora visitante Theresa Hradilak; Ning Zhang ’25, estudiante de posgrado en EECS; postdoctorado Jiaji Li; y Martin Nisser SM ’19, PhD ’24.
El trabajo de los investigadores fue apoyado, en parte, por Google y el Programa de Investigación Colaborativa MIT-HPI. Lo presentarán en el Simposio ACM sobre software y tecnología de interfaz de usuario en noviembre.