Meta AI acaba de presentar Brain2Qwerty v2. Decodifica frases naturales a partir de grabaciones cerebrales no invasivas en tiempo real. El sistema lee señales de magnetoencefalografía (MEG) mientras una persona escribe. Reconstruye lo que escribieron, sin implantes ni cirugía. Esta es la continuación de Brain2Qwerty v1, lanzado en febrero de 2025. Meta también está lanzando el código de capacitación completo para ambas versiones. La canalización combina un codificador convolucional, un transformador y un modelo de lenguaje a nivel de caracteres.
TL;DR
Brain2Qwerty v2 decodifica frases escritas a partir de señales MEG no invasivas, sin implante ni cirugía. Alcanza una precisión de palabras promedio del 61 % (39 % WER), frente al 8 % de los métodos no invasivos anteriores. El mejor participante alcanzó el 78% de precisión en las palabras, y más de la mitad de las oraciones tenían un error de una palabra o menos. La canalización combina un codificador convolucional, un transformador y un modelo de lenguaje a nivel de caracteres, además de LLM optimizados. La precisión aumenta de forma logarítmica y lineal con los datos; El código de entrenamiento para v1 y v2 se publica bajo CC BY-NC 4.0.
¿Qué es Brain2Qwerty v2?
Brain2Qwerty v2 es un decodificador de cerebro a texto. Asigna la actividad cerebral bruta a los personajes, luego a las palabras y oraciones.
Meta lo entrenó en aproximadamente 22.000 frases de nueve participantes voluntarios. Cada participante fue grabado durante 10 horas mientras escribía activamente.
Las grabaciones provienen de un dispositivo MEG. MEG mide los campos magnéticos producidos por la actividad neuronal, muestreados con alta resolución temporal.
El modelo aprovecha las representaciones a nivel de caracteres, palabras y oraciones. Ese diseño en capas le permite corregir errores locales utilizando un contexto más amplio.
Es importante destacar que esto es una investigación, no un producto. El decodificador no es un dispositivo de consumo y fue probado en un pequeño grupo de voluntarios.
Los datos se recogieron con el BCBL (Centro Vasco de Cognición, Cerebro y Lenguaje) de España. Pertenece a ese centro de investigación.
Cómo funciona el canal de decodificación
Los primeros sistemas no invasivos se basaban en tuberías hechas a mano para detectar eventos neuronales. Brain2Qwerty v2 reemplaza ese paso con un aprendizaje profundo de un extremo a otro.
Según el repositorio de Meta, el modelo combina tres componentes: un codificador convolucional, un transformador y un modelo de lenguaje a nivel de caracteres.
El codificador convolucional lee señales MEG sin procesar. Aprende funciones directamente de los datos en lugar de utilizar detectores de eventos diseñados.
El transformador modela una estructura de mayor alcance a través de la señal. Luego, el modelo de lenguaje a nivel de caracteres restringe la salida hacia texto plausible.
El equipo de metainvestigación describe tres formas en que la IA permite obtener resultados. Cada uno se relaciona con una decisión de ingeniería concreta que los equipos reconocerán.
El aprendizaje profundo reemplaza la detección de eventos artesanal. Los modelos de lenguaje grandes se ajustan para extraer representaciones semánticas. Los agentes de IA refinaron iterativamente el proceso de decodificación mediante el desarrollo de código automatizado. Los desarrolladores aún seleccionaban manualmente las configuraciones de entrenamiento finales
El ajuste de grandes modelos de lenguaje a partir de datos neuronales añade contexto semántico. Ese contexto une las grabaciones cerebrales ruidosas y la producción de un lenguaje coherente.
En la práctica, el modelo del lenguaje rechaza secuencias de caracteres que no forman palabras reales. Empuja al decodificador hacia oraciones que un humano escribiría de manera plausible.
A continuación se muestra un boceto ilustrativo de la arquitectura publicada. Refleja los componentes descritos y no es el código de entrenamiento exacto de Meta.
Para trabajar con el código real de Meta, clona el repositorio e inspecciona ambas versiones:
Los números de precisión
Brain2Qwerty v2 logra una tasa promedio de precisión de palabras del 61%. Esto corresponde a una tasa de error de palabras (WER) del 39%.
Para el mejor participante, el modelo alcanza una precisión de palabras del 78%. Para ese participante, más de la mitad de las oraciones tenían un error de una palabra o menos.
La línea de base previa importa aquí. Meta informa que otros métodos no invasivos alcanzaron solo un 8% de precisión en las palabras.
La precisión también mejora de forma logarítmica con el volumen de datos. Como era de esperar, más horas de grabación aumentan la precisión en el rango informado.
Ese comportamiento de escala es el reclamo clave para los constructores. Sugiere que la brecha con los implantes quirúrgicos podría reducirse únicamente a través de datos.
Estas cifras provienen de voluntarios en un entorno controlado. No son resultados clínicos para pacientes con lesiones cerebrales.
v1 vs v2: qué cambió
Brain2Qwerty v1 y v2 informan métricas diferentes, así que compárelas cuidadosamente. v1 se midió a nivel de caracteres, v2 a nivel de palabras.
v1 también mostró que la decodificación MEG era al menos dos veces mejor que el sistema EEG. Las señales de EEG son más ruidosas, lo que limita la precisión.
Casos de uso con ejemplos
La motivación principal es restablecer la comunicación. Millones de personas padecen lesiones cerebrales que les impiden hablar o moverse. Los métodos invasivos como la electroencefalografía estereotáctica y la electrocorticografía ya alimentan una neuroprótesis a un decodificador de IA. Pero requieren neurocirugía y son difíciles de ampliar. Un decodificador no invasivo podría ampliar el acceso. Un paciente podría potencialmente escribir oraciones sin un implante, utilizando únicamente grabaciones externas. Para los investigadores, el código publicado respalda la neurociencia reproducible. Un laboratorio podría volver a entrenar el oleoducto con su propio conjunto de datos MEG. Para los ingenieros de IA, el proyecto es una plantilla para la decodificación de bioseñales. El patrón convolucional codificador más transformador se transfiere a otras tareas de bioseñales. Para los científicos de datos, el resultado de la escala logarítmica lineal es una herramienta de planificación. Enmarca cuántos datos de grabación nuevos pueden aumentar la precisión.