InstaDeep presenta Nucleotide Transformer v3 (NTv3): un nuevo modelo básico de genómica de múltiples especies, diseñado para longitudes de contexto de 1 Mb con resolución de un solo nucleótido

La predicción y el diseño genómicos ahora requieren modelos que conecten motivos locales con el contexto regulatorio a escala de megabase y que operen en muchos organismos. Nucleotide Transformer v3, o NTv3, es el nuevo modelo básico de genómica multiespecie de InstaDeep para este entorno. Unifica el aprendizaje de representación, la pista funcional y la predicción de anotaciones del genoma, y ​​la generación de secuencias controlable en una única columna vertebral que se ejecuta en contextos de 1 Mb con una resolución de un solo nucleótido.

Los modelos anteriores de transformadores de nucleótidos ya demostraron que el preentrenamiento autosupervisado en miles de genomas produce características sólidas para la predicción de fenotipos moleculares. La serie original incluía modelos de 50 millones a 2,5 mil millones de parámetros entrenados en 3200 genomas humanos y 850 genomas adicionales de diversas especies. NTv3 mantiene esta secuencia solo como idea previa al entrenamiento, pero la extiende a contextos más largos y agrega supervisión funcional explícita y un modo generativo.

https://huggingface.co/spaces/InstaDeepAI/ntv3

Arquitectura para ventanas genómicas de 1 Mb.

NTv3 utiliza una arquitectura de estilo U-Net que apunta a ventanas genómicas muy largas. Una torre de reducción de resolución convolucional comprime la secuencia de entrada, una pila de transformadores modela dependencias de largo alcance en ese espacio comprimido y una torre de deconvolución restaura la resolución de nivel base para predicción y generación. Las entradas se tokenizan a nivel de personaje en A, T, C, G, N con tokens especiales como , , , , y . La longitud de la secuencia debe ser un múltiplo de 128 tokens y la implementación de referencia utiliza relleno para imponer esta restricción. Todos los puntos de control públicos utilizan tokenización de base única con un tamaño de vocabulario de 11 tokens.

El modelo público más pequeño, NTv3 8M pre, tiene aproximadamente 7,69 millones de parámetros con dimensión oculta 256, dimensión FFN 1024, 2 capas de transformador, 8 cabezales de atención y 7 etapas de reducción de resolución. En el extremo superior, NTv3 650M utiliza una dimensión oculta de 1536, una dimensión FFN de 6144, 12 capas de transformador, 24 cabezales de atención y 7 etapas de reducción de resolución, y agrega capas de acondicionamiento para cabezales de predicción específicos de especies.

Datos de entrenamiento

El modelo NTv3 está preentrenado en 9 billones de pares de bases del recurso OpenGenome2 utilizando modelado de lenguaje enmascarado de resolución base. Después de esta etapa, el modelo se entrena posteriormente con un objetivo conjunto que integra la autosupervisión continua con el aprendizaje supervisado en aproximadamente 16.000 pistas funcionales y etiquetas de anotación de 24 especies de animales y plantas.

Rendimiento y punto de referencia Ntv3

Después del entrenamiento posterior, NTv3 logra una precisión de vanguardia para la predicción de seguimiento funcional y la anotación del genoma entre especies. Supera los modelos sólidos de secuencia para funcionar y los modelos de base genómica anteriores en los puntos de referencia públicos existentes y en el nuevo Ntv3 Benchmark, que se define como un conjunto de ajuste fino controlado en sentido descendente con ventanas de entrada estandarizadas de 32 kb y salidas de resolución base.

El punto de referencia Ntv3 actualmente consta de 106 tareas de largo alcance, de un solo nucleótido, de ensayo cruzado y de especies cruzadas. Debido a que NTv3 ve miles de huellas en 24 especies durante el entrenamiento posterior, el modelo aprende una gramática regulatoria compartida que se transfiere entre organismos y ensayos y respalda la inferencia funcional del genoma coherente de largo alcance.

De la predicción a la generación de secuencias controlables

Más allá de la predicción, NTv3 se puede ajustar en un modelo generativo controlable mediante modelado de lenguaje de difusión enmascarado. En este modo, el modelo recibe señales condicionantes que codifican los niveles deseados de actividad potenciadora y la selectividad del promotor, y llena espacios enmascarados en la secuencia de ADN de una manera consistente con esas condiciones.

En los experimentos descritos en los materiales de lanzamiento, el equipo diseña 1000 secuencias potenciadoras con actividad específica y especificidad del promotor y las valida in vitro utilizando ensayos STARR seq en colaboración con Stark Lab. Los resultados muestran que estos potenciadores generados recuperan el orden previsto de los niveles de actividad y alcanzan una especificidad del promotor más del doble en comparación con las líneas de base.

Tabla comparativa

DimensiónNTv3 (Nucleotide Transformer v3)GENA-LMObjetivo principalModelo básico de genómica unificada de múltiples especies para aprendizaje de representación, predicción de secuencia a función y generación de secuencia controlableFamilia de modelos de lenguaje de ADN para secuencias largas centradas en el aprendizaje por transferencia para muchas tareas de predicción genómica supervisadasArquitecturaTorre convolucional estilo U-Net, pila de transformadores, torre deconvolucional, modelo de lenguaje de resolución de base única, versiones postentrenadas agregan acondicionamiento de múltiples especies y cabezales de tareas específicas Modelos codificadores basados en BERT con 12 o 24 capas y variantes de BigBird con escasa atención, ampliadas aún más con transformador de memoria recurrente para contextos largos Escala de parámetros La familia abarca 8 M, 100 M y 650 M de parámetros Los modelos base tienen 110 M de parámetros y los modelos grandes tienen 336 M de parámetros, incluidas las variantes de BigBird con una longitud de contexto nativa de 110 M Hasta 1 Mb de entrada con resolución de un solo nucleótido para modelos pre-entrenados y post-entrenados Hasta aproximadamente 4500 pb con 512 tokens BPE para modelos BERT y hasta 36000 pb con 4096 tokens para modelos BigBird Mecanismo de contexto extendidoUtiliza una torre convolucional estilo U-Net para agregar contexto de largo alcance antes de las capas del transformador manteniendo una resolución de base única; la longitud del contexto se fija en 1 Mb en los puntos de control publicados. Utiliza escasa atención en las variantes de BigBird más un transformador de memoria recurrente para extender el contexto efectivo a cientos de miles de pares de bases. Tokenización Tokenizador a nivel de carácter sobre A, T, C, G, N y tokens especiales; cada nucleótido es un tokenizador tokenBPE en el ADN que se asigna a aproximadamente 4500 pb para 512 tokens; Se utilizan dos tokenizadores, uno solo en T2T y otro en T2T más 1000G SNP más datos de múltiples especies. Tamaño del corpus de preentrenamientoPreentrenamiento de la primera etapa en OpenGenome2 con aproximadamente 9 billones de pares de bases de más de 128000 especies. Modelos solo humanos entrenados en T2T v2 humano preprocesado más SNP de 1000 genomas, alrededor de 480 × 10^9 pares de bases, modelos multiespecies entrenados en datos combinados de humanos y de múltiples especies, aproximadamente 1072 × 10^9 pares de bases Cobertura de especies Más de 128 000 especies en OpenGenome2 supervisión previa y posterior al entrenamiento de 24 especies de animales y plantas Modelos centrados en humanos más modelos específicos de taxones para levaduras, Arabidopsis y Drosophila y modelos multiespecies de genomas de ENSEMBL Señales supervisadas posteriores al entrenamiento Aproximadamente 16 000 pistas funcionales en aproximadamente 10 tipos de ensayos y aproximadamente 2700 tejidos en 24 especies, utilizados para acondicionar la columna vertebral con etiquetas discretas y para entrenar cabezas funcionales. Afinado en múltiples tareas supervisadas, incluidos promotores, sitios de empalme, potenciadores de Drosophila, perfiles de cromatina y sitios de poliadenilación, con cabezales de tareas específicas en la parte superior del LMG. Capacidades generativas. Puede afinarse en un modelo generativo controlable usando modelado de lenguaje de difusión enmascarado, usado para diseñar 1.000 potenciadores específicos de promotores que lograron más de Especificidad 2 veces mayor en ensayos de secuencia STARR. Se utiliza principalmente como modelo de lenguaje enmascarado y extractor de características, admite la finalización de secuencias a través de MLM, pero la publicación principal se centra en tareas predictivas en lugar de un diseño de secuencia controlable explícito.

Conclusiones clave

NTv3 es un modelo básico de genómica de múltiples especies y de largo alcance: unifica el aprendizaje de representación, la predicción de seguimiento funcional, la anotación del genoma y la generación de secuencias controlable en una única arquitectura de estilo U Net que admite un contexto de resolución de nucleótidos de 1 Mb en 24 especies de animales y plantas. El modelo se entrena en 9 billones de pares de bases con objetivos conjuntos autosupervisados ​​y supervisados: NTv3 se entrena previamente en 9 billones de pares de bases de OpenGenome2 con modelado de lenguaje enmascarado de resolución base, luego se entrena posteriormente en más de 16 000 pistas funcionales y etiquetas de anotación de 24 especies utilizando un objetivo conjunto que combina la autosupervisión continua con el aprendizaje supervisado. NTv3 logra un rendimiento de vanguardia en Ntv3 Benchmark: después del entrenamiento posterior, NTv3 alcanza una precisión de vanguardia para la predicción de seguimiento funcional y la anotación del genoma entre especies y supera los modelos de secuencia para funcionar anteriores y los modelos de base genómica en puntos de referencia públicos y en Ntv3 Benchmark, que contiene 106 tareas estandarizadas de largo alcance con entrada de 32 kb y salidas de resolución base. La misma columna vertebral respalda el diseño de potenciador controlable validado con STARR seq: NTv3 se puede ajustar como un modelo generativo controlable utilizando modelado de lenguaje de difusión enmascarado para diseñar secuencias potenciadoras con niveles de actividad específicos y selectividad de promotor, y estos diseños se validan experimentalmente con ensayos de STARR seq que confirman el orden de actividad previsto y la especificidad mejorada del promotor.

Consulte el repositorio, el modelo en HF y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como empresario e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.