La predicción y el diseño genómicos ahora requieren modelos que conecten motivos locales con el contexto regulatorio a escala de megabase y que operen en muchos organismos. Nucleotide Transformer v3, o NTv3, es el nuevo modelo básico de genómica multiespecie de InstaDeep para este entorno. Unifica el aprendizaje de representación, la pista funcional y la predicción de anotaciones del genoma, y la generación de secuencias controlable en una única columna vertebral que se ejecuta en contextos de 1 Mb con una resolución de un solo nucleótido.
Los modelos anteriores de transformadores de nucleótidos ya demostraron que el preentrenamiento autosupervisado en miles de genomas produce características sólidas para la predicción de fenotipos moleculares. La serie original incluía modelos de 50 millones a 2,5 mil millones de parámetros entrenados en 3200 genomas humanos y 850 genomas adicionales de diversas especies. NTv3 mantiene esta secuencia solo como idea previa al entrenamiento, pero la extiende a contextos más largos y agrega supervisión funcional explícita y un modo generativo.
Arquitectura para ventanas genómicas de 1 Mb.
NTv3 utiliza una arquitectura de estilo U-Net que apunta a ventanas genómicas muy largas. Una torre de reducción de resolución convolucional comprime la secuencia de entrada, una pila de transformadores modela dependencias de largo alcance en ese espacio comprimido y una torre de deconvolución restaura la resolución de nivel base para predicción y generación. Las entradas se tokenizan a nivel de personaje en A, T, C, G, N con tokens especiales como , , , , y . La longitud de la secuencia debe ser un múltiplo de 128 tokens y la implementación de referencia utiliza relleno para imponer esta restricción. Todos los puntos de control públicos utilizan tokenización de base única con un tamaño de vocabulario de 11 tokens.
El modelo público más pequeño, NTv3 8M pre, tiene aproximadamente 7,69 millones de parámetros con dimensión oculta 256, dimensión FFN 1024, 2 capas de transformador, 8 cabezales de atención y 7 etapas de reducción de resolución. En el extremo superior, NTv3 650M utiliza una dimensión oculta de 1536, una dimensión FFN de 6144, 12 capas de transformador, 24 cabezales de atención y 7 etapas de reducción de resolución, y agrega capas de acondicionamiento para cabezales de predicción específicos de especies.
Datos de entrenamiento
El modelo NTv3 está preentrenado en 9 billones de pares de bases del recurso OpenGenome2 utilizando modelado de lenguaje enmascarado de resolución base. Después de esta etapa, el modelo se entrena posteriormente con un objetivo conjunto que integra la autosupervisión continua con el aprendizaje supervisado en aproximadamente 16.000 pistas funcionales y etiquetas de anotación de 24 especies de animales y plantas.
Rendimiento y punto de referencia Ntv3
Después del entrenamiento posterior, NTv3 logra una precisión de vanguardia para la predicción de seguimiento funcional y la anotación del genoma entre especies. Supera los modelos sólidos de secuencia para funcionar y los modelos de base genómica anteriores en los puntos de referencia públicos existentes y en el nuevo Ntv3 Benchmark, que se define como un conjunto de ajuste fino controlado en sentido descendente con ventanas de entrada estandarizadas de 32 kb y salidas de resolución base.
El punto de referencia Ntv3 actualmente consta de 106 tareas de largo alcance, de un solo nucleótido, de ensayo cruzado y de especies cruzadas. Debido a que NTv3 ve miles de huellas en 24 especies durante el entrenamiento posterior, el modelo aprende una gramática regulatoria compartida que se transfiere entre organismos y ensayos y respalda la inferencia funcional del genoma coherente de largo alcance.
De la predicción a la generación de secuencias controlables
Más allá de la predicción, NTv3 se puede ajustar en un modelo generativo controlable mediante modelado de lenguaje de difusión enmascarado. En este modo, el modelo recibe señales condicionantes que codifican los niveles deseados de actividad potenciadora y la selectividad del promotor, y llena espacios enmascarados en la secuencia de ADN de una manera consistente con esas condiciones.
En los experimentos descritos en los materiales de lanzamiento, el equipo diseña 1000 secuencias potenciadoras con actividad específica y especificidad del promotor y las valida in vitro utilizando ensayos STARR seq en colaboración con Stark Lab. Los resultados muestran que estos potenciadores generados recuperan el orden previsto de los niveles de actividad y alcanzan una especificidad del promotor más del doble en comparación con las líneas de base.
Tabla comparativa
Conclusiones clave
NTv3 es un modelo básico de genómica de múltiples especies y de largo alcance: unifica el aprendizaje de representación, la predicción de seguimiento funcional, la anotación del genoma y la generación de secuencias controlable en una única arquitectura de estilo U Net que admite un contexto de resolución de nucleótidos de 1 Mb en 24 especies de animales y plantas. El modelo se entrena en 9 billones de pares de bases con objetivos conjuntos autosupervisados y supervisados: NTv3 se entrena previamente en 9 billones de pares de bases de OpenGenome2 con modelado de lenguaje enmascarado de resolución base, luego se entrena posteriormente en más de 16 000 pistas funcionales y etiquetas de anotación de 24 especies utilizando un objetivo conjunto que combina la autosupervisión continua con el aprendizaje supervisado. NTv3 logra un rendimiento de vanguardia en Ntv3 Benchmark: después del entrenamiento posterior, NTv3 alcanza una precisión de vanguardia para la predicción de seguimiento funcional y la anotación del genoma entre especies y supera los modelos de secuencia para funcionar anteriores y los modelos de base genómica en puntos de referencia públicos y en Ntv3 Benchmark, que contiene 106 tareas estandarizadas de largo alcance con entrada de 32 kb y salidas de resolución base. La misma columna vertebral respalda el diseño de potenciador controlable validado con STARR seq: NTv3 se puede ajustar como un modelo generativo controlable utilizando modelado de lenguaje de difusión enmascarado para diseñar secuencias potenciadoras con niveles de actividad específicos y selectividad de promotor, y estos diseños se validan experimentalmente con ensayos de STARR seq que confirman el orden de actividad previsto y la especificidad mejorada del promotor.
Consulte el repositorio, el modelo en HF y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como empresario e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.