En el mundo de alto riesgo de la infraestructura de IA, la industria ha operado bajo un supuesto singular: la flexibilidad es la reina. Construimos GPU de uso general porque los modelos de IA cambian cada semana y necesitamos silicio programable que pueda adaptarse al próximo avance de la investigación.
Pero Taalas, la startup con sede en Toronto, cree que la flexibilidad es exactamente lo que está frenando a la IA. Según el equipo de Taalas, si queremos que la IA sea tan común y barata como el plástico, tenemos que dejar de “simular” inteligencia en computadoras de uso general y comenzar a “transmitirla” directamente en silicio.
El problema: el ‘muro de la memoria’ y el impuesto a la GPU
El costo actual de ejecutar un modelo de lenguaje grande (LLM) está impulsado por un cuello de botella físico: el Muro de la Memoria.
Los procesadores tradicionales (GPU) se basan en la ‘Arquitectura de conjunto de instrucciones’ (ISA). Separan la computación y la memoria. Cuando ejecutas un pase de inferencia en un modelo como Llama-3, el chip gasta la gran mayoría de su tiempo y energía transportando pesos desde la memoria de alto ancho de banda (HBM) a los núcleos de procesamiento. Este ‘impuesto al movimiento de datos’ representa casi el 90% del consumo de energía en los centros de datos de IA modernos.
La solución de Taalas es radical: eliminar el ciclo de búsqueda de recuerdos. Al utilizar un flujo de diseño automatizado patentado, Taalas traduce el gráfico computacional de un modelo específico directamente al diseño físico de un chip. En su chip HC1 (Hardcore 1), los pesos y la arquitectura del modelo están literalmente grabados en el cableado del silicio.
Modelos incondicionales: 17.000 tokens por segundo
Los resultados de este enfoque “directo al silicio” redefinen el límite de rendimiento para la inferencia. En su última presentación, Taalas demostró el HC1 con un modelo Llama 3.1 8B. Mientras que una NVIDIA H100 de primer nivel puede servir a un solo usuario a ~150 tokens por segundo, la HC1 sirve entre 16.000 y 17.000 tokens por segundo.
Esto cambia la ‘economía unitaria’ de la IA:
Rendimiento: un solo chip HC1 puede superar a un pequeño centro de datos GPU en términos de rendimiento bruto para un modelo específico. Eficiencia: Taalas afirma una mejora de 1000 veces en eficiencia (rendimiento por vatio y rendimiento por dólar) en comparación con los chips convencionales. Infraestructura: debido a que las pesas están cableadas, no hay necesidad de HBM externo ni de complejos sistemas de refrigeración líquida. Un bastidor estándar refrigerado por aire puede albergar diez de estas tarjetas de 250 W, lo que ofrece la potencia de un clúster de GPU completo en una sola caja de servidor.
Rompiendo la barrera de los 60 días: la fundición automatizada
El problema obvio para un desarrollador de IA es la flexibilidad. Si hoy se conecta un modelo a un chip, ¿qué sucederá cuando mañana salga un modelo mejor? Históricamente, diseñar un ASIC (circuito integrado de aplicación específica) requería dos años y decenas de millones de dólares.
Taalas ha resuelto esto mediante la automatización. Han construido un sistema de fundición similar a un compilador que toma pesos de modelos y genera un diseño de chip en aproximadamente una semana. Al centrarse en un flujo de trabajo de fabricación simplificado, en el que solo cambian las máscaras metálicas superiores del silicio, han reducido el tiempo de respuesta de “pesos a silicio” a sólo dos meses.
Esto permite un ciclo de hardware “estacional”. Una empresa podría afinar un modelo de frontera en la primavera y tener miles de chips de inferencia especializados e hipereficientes implementados para el verano.
El cambio del mercado: de las palas a los sellos
Esta transición marca un momento crucial en el ciclo de exageración de la IA. Estamos pasando de la fase de “Investigación y capacitación”, donde las GPU son esenciales por su flexibilidad, a la fase de “Implementación e inferencia”, donde el costo por token es la única métrica que importa.
Si Taalas tiene éxito, el mercado de la IA se dividirá en dos niveles distintos:
Capacitación de propósito general: dirigida por NVIDIA y AMD, que proporciona los clústeres masivos y flexibles necesarios para descubrir y entrenar nuevas arquitecturas. Inferencia especializada: liderada por ‘fundiciones’ como Taalas, que toman esas arquitecturas probadas y las ‘imprimen’ en silicio barato y ubicuo para todo, desde teléfonos inteligentes hasta sensores industriales.
Conclusiones clave
El cambio de paradigma ‘hardwired’: Taalas está pasando de una IA definida por software (que ejecuta modelos en GPU de uso general) a una IA definida por hardware. Al “hornear” los pesos y la arquitectura de un modelo específico directamente en el silicio, eliminan la necesidad de la sobrecarga tradicional del conjunto de instrucciones, convirtiendo efectivamente al modelo en el procesador mismo. Muerte del muro de la memoria: el hardware de IA tradicional desperdicia ~90% de su energía moviendo datos entre la memoria y la computación. El chip HC1 (Hardcore 1) de Taalas elimina la “pared de memoria” al cablear físicamente los parámetros del modelo en las capas metálicas del chip, eliminando la necesidad de una costosa memoria de alto ancho de banda (HBM). Salto de eficiencia de 1000 veces: al eliminar el ‘impuesto de programabilidad’, Taalas afirma una mejora de 1000 veces en el rendimiento por vatio y el rendimiento por dólar. En la práctica, esto significa que un HC1 puede alcanzar 17.000 tokens por segundo en un modelo Llama 3.1 8B, superando enormemente a un bastidor de GPU estándar y utilizando mucha menos energía. Fundición automatizada ‘directa al silicio’: para resolver el problema de la obsolescencia del modelo, Taalas utiliza un flujo de diseño automatizado patentado. Esto reduce el tiempo para crear un chip de IA personalizado de años a solo semanas, lo que permite a las empresas “imprimir” sus modelos ajustados en silicio estacionalmente. El futuro de la IA de productos básicos: esta tecnología señala un cambio de la IA “primero en la nube” a la IA “nativa del dispositivo”. A medida que la inferencia se convierta en un bien barato y cableado, la IA pasará de los servidores centralizados a hardware local de bajo consumo (desde teléfonos inteligentes hasta sensores industriales) con latencia cero y sin costos de suscripción.
Consulta los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.