Induction Labs Photon-1 simula computadoras de escritorio, juega a las damas y modela la física del billar a partir de una ejecución previa al entrenamiento

La mayoría de los agentes que aprenden del vídeo necesitan saber qué acción produjo cada cuadro. Induction Labs argumenta que este requisito es el cuello de botella. La semana pasada, lanzaron modelos de imaginación, una arquitectura de modelo básico que se entrena previamente en video sin formato sin ninguna etiqueta de acción.

Su sistema de prueba es Photon-1, un escaso transformador de mezcla de expertos (MoE) 106B-A5B entrenado en 18 años de videos de demostración por computadora. En un punto de referencia de uso interno de computadoras, Induction Labs informa que Photon-1 supera a Gemini 3.1 Flash-Lite mientras usa mucha menos computación previa al entrenamiento y su servicio cuesta aproximadamente 3 veces menos.

¿Qué hace realmente un modelo de imaginación?

Un modelo de imaginación predice fotogramas futuros de forma autorregresiva utilizando un objetivo de predicción del siguiente token latente. No genera píxeles durante el preentrenamiento. Todo está modelado en un espacio de representación aprendido.

La afirmación que importa es la siguiente: predecir estados futuros le enseña al modelo a completar tareas, aunque nunca vea una acción durante el preentrenamiento. Induction Labs llama a esto una política implícita. El modelo aprende conceptos de lo que hace una persona, en lugar de una etiqueta para cada clic del mouse.

El truco de compresión que lo hace escalar

La arquitectura depende de un codificador de visión que utiliza cuantificación escalar finita (FSQ). Cada cuadro está comprimido en 960 tokens discretos. Cada token es un vector de 8 dimensiones. Cada dimensión toma uno de cinco valores: −1, −1/2, 0, 1/2, 1. Eso da un libro de códigos de 5⁸ códigos posibles.

La codificación resultante es de aproximadamente 2,2 KB por cuadro. Induction Labs informa una compresión 100 veces mejor que las representaciones de modelos multimodales y OCR existentes, al tiempo que conserva el texto, el diseño y los cambios de estado.

Para alcanzar esa velocidad, Photon-1 utiliza un codificador latente diferencial. Codifica fotogramas de vídeo como pares, por lo que las señales latentes describen diferencias entre fotogramas en lugar de contenidos de fotogramas.

‘;}h+=’

‘+s.n+’

‘;so.innerHTML=h; var b=sw.querySelectorAll(‘.st’); para(var k=0;k’+S[i].h;sw.appendChild(b); } sw.addEventListener(‘click’,function(e){var t=e.target.closest(‘.st’);if