En este momento, una GPU gasta la mayor parte de su energía no en matemáticas, sino en mover números. Recuperar pesos de la memoria, enviarlos a una unidad de cómputo, realizar una multiplicación y devolver el resultado. Haga eso miles de millones de veces por segundo, durante meses, a lo largo de un entrenamiento, y comenzará a comprender por qué la factura de electricidad de la IA se ha convertido en un problema de sala de juntas en lugar de una nota a pie de página de ingeniería.
Los números respaldan esto. Gartner espera que la demanda mundial de energía de los centros de datos aumente de 104 gigavatios en 2025 a 132 gigavatios en 2026, y alcance aproximadamente 290 gigavatios en 2030, con las cargas de trabajo de IA generativa mencionadas como el principal impulsor. Se prevé que los servidores optimizados para IA representen por sí solos casi un tercio del consumo de energía de los centros de datos este año.
Este es el telón de fondo de un resurgimiento silencioso de una vieja idea: la informática analógica. Circuitos analógicos reales, que utilizan voltajes y corrientes continuas en lugar de unos y ceros, para realizar las multiplicaciones de matrices que dominan la inferencia de redes neuronales. El discurso es seductor: en lugar de calcular la física digitalmente, ¿por qué no dejar que la física calcule directamente?
No es una idea nueva, por supuesto, las computadoras analógicas son anteriores a las digitales. Fue abandonado hace décadas por buenas razones. Y este artículo trata sobre las dos mitades de esa historia: por qué el discurso es realmente convincente y por qué lo que mató a la computación analógica la primera vez en realidad no ha desaparecido. Analizaré el mecanismo y luego ejecutaré algunas simulaciones pequeñas y honestas que muestran exactamente dónde se rompe y cómo los investigadores están comenzando a parcharlo.
Cómo funciona realmente la computación analógica en memoria
En un chip convencional, la memoria y la computación están separadas. Cada vez que se multiplica un peso por una entrada, ese peso tiene que viajar desde una matriz de memoria, a través de un bus, hasta una unidad de cómputo, y el resultado tiene que regresar. Los investigadores estiman que este movimiento puede costar entre 3 y 10.000 veces más energía que la propia aritmética, es decir, el llamado cuello de botella de von Neumann.
La computación analógica en memoria (AIMC) colapsa ese viaje. Los pesos se almacenan como valores de conductancia física en una cuadrícula de celdas de memoria, a menudo construidas a partir de memoria de cambio de fase o RAM resistiva. Aplique una entrada como voltaje a través de esa red, y dos leyes de la física harán el resto: la ley de Ohm (corriente = voltaje × conductancia) calcula cada multiplicación, y la ley actual de Kirchhoff (las corrientes se suman cuando los cables se encuentran) calcula la acumulación. Una multiplicación de matriz-vector completa, la operación en la que las redes neuronales pasan la mayor parte de su tiempo, ocurre en un solo paso físico, no se requiere bus.
Sin embargo, hay un problema escondido en esa oración: la multiplicación en sí es esencialmente gratuita, pero la entrada y la salida aún tienen que cruzar la frontera entre los mundos analógico y digital: voltajes de entrada, corrientes de salida, ambos necesitan conversión. En la práctica, los ADC y DAC que realizan esa conversión suelen ser donde va el presupuesto real de energía y área, no el conjunto de barras transversales en sí. Es un poco irónico en el corazón de este campo: la física hace los cálculos de forma gratuita, y luego una parte significativa del chip se gasta pagando para hablar con él.
Esto no es hipotético. El chip del proyecto HERMES de IBM Research es un ejemplo funcional, un chip analógico en memoria basado en memoria de cambio de fase que ya se ha utilizado para demostrar una precisión cercana al software en cargas de trabajo reales. Un prototipo anterior basado en IBM PCM, presentado en 2023, contenía 35 millones de celdas de memoria de cambio de fase y contenía hasta 17 millones de parámetros directamente en el chip, con una fracción de la energía de un acelerador digital. Empresas emergentes como EnCharge AI (surgida de Princeton, que trabaja con TSMC en la fabricación) y Mythic han recaudado dinero real apostando a que se puede producir la misma física para la inferencia de bordes.
Simulándolo tú mismo
No necesita hardware exótico para ver el mecanismo en funcionamiento. Aquí hay una simulación mínima: una matriz digital "perfecta" multiplicada, comparada con la misma operación con imperfecciones analógicas realistas superpuestas, ruido de programación de dispositivo a dispositivo (los pesos no se escriben con la conductancia exacta que usted solicitó), ruido de lectura (ruido térmico/de disparo cada vez que usa la matriz) y precisión finita de ADC (el resultado analógico aún debe convertirse nuevamente a un número digital eventualmente).
importar numpy como np rng = np.random.default_rng(42) n_in, n_out = 64, 32 W = rng.uniform(-1, 1, size=(n_in, n_out)) # pesos "ideales" x = rng.uniform(-1, 1, size=n_in) # activaciones de entrada digital_result = x @ W # verdad del terreno def analog_matmul(x, W, programming_noise_std=0.0, read_noise_std=0.0, adc_bits=None): # los pesos se almacenan físicamente como conductancias -> el ruido se hornea # hasta que la celda se reprograma G = W + rng.normal(0, programming_noise_std, size=W.shape) # Ley de Ohm + ley actual de Kirchhoff, en un paso = x @ G # Ruido térmico/de lectura agregado en el tiempo de espera de medición = out + rng.normal(0, read_noise_std, size=out.shape) # el resultado analógico aún debe digitalizarse si adc_bits no es Ninguno: lo, hi = out.min(), out.max() paso = (hi – lo) / (2 ** adc_bits) out = np.round((out – lo) / step) * step + lo return out
Ejecutar esto con cantidades cada vez mayores de realismo produce una curva de error limpia y creciente:
Pasar de una multiplicación perfecta a una con fuentes de ruido y un ADC barato de 4 bits introduce más del 8% de error relativo, en una sola capa, antes de que ese error tenga alguna posibilidad de agravarse en una red profunda. Lo que plantea la verdadera pregunta: ¿cuánto importa eso realmente para la precisión de un modelo entrenado?
La informática analógica siempre ha tenido un problema de ruido
Esta es exactamente la razón por la que la informática analógica perdió terreno ante la digital, décadas antes de que la IA volviera a ser relevante. Las señales físicas continuas son inherentemente más difíciles de precisar que los estados binarios. Un circuito digital sólo tiene que distinguir un 0 de un 1; un circuito analógico debe preservar una magnitud precisa contra el ruido térmico, la variación del dispositivo y la deriva a lo largo del tiempo. Es un problema de ingeniería mucho más difícil y no desaparece sólo porque la aplicación pasó de resolver ecuaciones diferenciales a ejecutar redes neuronales. Un trabajo reciente que cataloga estos efectos enumera el ruido de programación, el ruido de lectura, la deriva de conductancia temporal, la precisión de bits limitada y la pérdida de conversión de analógico a digital como los problemas pendientes en este campo. La deriva es particularmente extraña: a diferencia de un bit digital, un peso analógico es una propiedad del material físico, y ese material se relaja con el tiempo, por lo que el "mismo" peso puede leerse silenciosamente de manera diferente una semana después de haber sido escrito, razón por la cual los chips analógicos generalmente necesitan recalibración o reprogramación periódica solo para mantenerse precisos, una memoria digital superior no paga.
Para ver si esto realmente importa, entrené una pequeña red neuronal de la manera normal, con total precisión digital, sin ruido en ninguna parte, en la clásica tarea de clasificación de dígitos escritos a mano, luego ejecuté la inferencia a través de una capa analógica simulada con niveles de ruido crecientes.
def forward(params, X, Layer2_noise_std=0.0): h = np.maximum(0, X @ params["W1"] + params["b1"]) # capa digital oculta W2 = params["W2"] if Layer2_noise_std > 0: # esta línea es la barra transversal analógica: pesos dañados por el ruido del dispositivo W2 = W2 + rng.normal(0, Layer2_noise_std, tamaño=W2.shape) logits = h @ W2 + params["b2"] return softmax(logits), h
La red fue entrenada sin saber que alguna vez vería ruido. Esto es lo que sucedió cuando lo evalué a través de hardware simulado cada vez más ruidoso:
La red es notablemente tolerante a pequeñas cantidades de ruido, ya que la precisión apenas se mueve por debajo del estándar de ruido ≈ 0,1. Pero pasado ese punto, no se degrada con gracia, cae por un precipicio: 83% a 0,2, 64% a 0,4, y en 0,8 se acerca a una conjetura aleatoria. Ésta es la forma real de que “la IA analógica tiene un problema de ruido”, no un impuesto suave a la precisión, sino un umbral que la red nunca estuvo dispuesta a cruzar.
Entrenando la red para el hardware en el que se ejecutará
La respuesta actual de la investigación a esto no se trata (sólo) de construir hardware más silencioso, sino de no entrenar a la red para que espere una señal limpia en primer lugar. La técnica recibe algunos nombres dependiendo de quién la publica, IBM llama a una versión de ella capacitación con reconocimiento de hardware, y una línea de investigación reciente sobre lo que denomina "modelos básicos analógicos" la llama capacitación por inyección de ruido, pero la idea es la misma: simular el ruido del hardware objetivo durante la capacitación, no solo durante la implementación, de modo que el descenso de gradiente se vea obligado a encontrar pesos que sean robustos.
Volví a realizar el mismo experimento, pero esta vez entrené una segunda copia de la red con ruido inyectado en cada pase hacia adelante durante el entrenamiento:
def train(params, X, Y, epochs=300, lr=0.1, train_noise_std=0.0): for epoch in range(epochs): # train_noise_std > 0 significa que la red nunca ve una señal limpia – # tiene que aprender pesos que toleren el ruido desde los problemas del primer día, h = forward(params, X, Layer2_noise_std=train_noise_std) # …descenso en gradiente como de costumbre desde aquí
El resultado es el gráfico más interesante de este artículo:
Con ruido cero, los dos modelos son estadísticamente idénticos: el entrenamiento consciente del ruido no cuesta esencialmente nada cuando el hardware está limpio. Pero a medida que aumenta el ruido, la brecha se abre rápidamente: con std=0,6, el modelo entrenado normalmente se ha desplomado al 39%, mientras que el modelo consciente del ruido todavía mantiene el 61%. Ninguno de los modelos es inmune al ruido, como siempre, no hay nada gratis y la precisión aún disminuye, pero uno de ellos se degrada como un sistema diseñado para esto y el otro se degrada como un sistema al que nunca se le dijo con qué iba a funcionar.
Este es solo un ejemplo de juguete, una red de dos capas en imágenes de 8 × 8 dígitos, no un modelo de producción real, pero es el mismo mecanismo que los investigadores ahora están aplicando a los LLM, con la complicación adicional de que los modelos de lenguaje grandes tienen muchas más capas para que el ruido se combine y mucha menos tolerancia para el tipo de acantilado de precisión que se muestra arriba.
¿Dónde se encuentra esto realmente?
A modo de resumen, vale la pena ser honesto sobre el estado del campo. Algunas cosas parecen bien establecidas:
Parece real para la inferencia, todavía no para el entrenamiento. Casi todas las fuentes serias sobre esto trazan la misma línea: el hardware analógico es viable para ejecutar un modelo ya entrenado, especialmente en el borde, pero las demandas de precisión de la retropropagación hacen que el entrenamiento en sustratos analógicos sea un problema sin resolver mucho más difícil.
El historial comercial es mixto. Mythic, una de las primeras empresas emergentes de chips de IA analógicos, ha pasado años navegando en un mercado donde los chips digitales de bajo consumo también siguen mejorando, incluso cuando recaudó una ronda de $ 125 millones a fines de 2025. EnCharge AI, fundada en 2022, ha avanzado más rápido en asociaciones de fabricación, trabajando con TSMC y afirmando un uso de energía aproximadamente 20 veces menor que los chips digitales comparables, aunque esa afirmación todavía es en gran medida precomercial. IBM permanece principalmente en modo de investigación, y recientemente publicó sobre el mapeo de capas LLM de mezcla de expertos en arquitecturas de memoria analógica 3D.
Es una apuesta entre varias, no la historia completa. La computación fotónica (que utiliza luz en lugar de voltaje, impulsada por empresas como Lightmatter y Celestial AI) es una apuesta relacionada pero distinta, y hoy apunta más a resolver los cuellos de botella de interconexión entre chips que a reemplazar la computación en sí. Los chips neuromórficos como la línea Loihi de Intel adoptan otro enfoque, tomando prestada la señalización basada en picos impulsada por eventos del cerebro en lugar de las densas matrices matemáticas analógicas. Los tres son agrupados en la cobertura de prensa como “computación inspirada en el cerebro”, pero están resolviendo diferentes partes del problema.
Nada de esto soluciona por sí solo la crisis de poder de la IA, y no debería venderse de esa manera. Pero es un genuino replanteamiento arquitectónico en un momento en el que las ganancias de eficiencia digital se están quedando sin ganancias fáciles y, a diferencia de la mayoría de las hojas de ruta de hardware, en realidad puedes verificar la afirmación central y el problema central desde tu computadora portátil en unas treinta líneas de numpy.
Fuentes y lecturas adicionales
Gartner, El consumo de electricidad del centro de datos crecerá un 26% en 2026 IBM Research, La computación analógica en memoria podría impulsar los modelos de IA del mañana IBM Research, La familia de chips AIU IBM Research, NorthPole: una arquitectura para la inferencia de redes neuronales con un chip de 12 nm (digital, no analógico, incluido para la desambiguación) Büchel et al., Aproximación del kernel usando computación analógica en memoria: chip del proyecto HERMES, IBM Chip analógico basado en PCM IEEE Spectrum, la promesa de femtojulios de la IA analógica IEEE Spectrum, el chip de IA analógico de EnCharge promete precisión y bajo consumo TechCrunch, EnCharge recauda más de 100 millones de dólares para acelerar la IA usando chips analógicos “Los modelos de base analógica abordan el ruido del hardware de IA para los LLM” — neurotechnus.com