Los científicos entrenan modelos de predicción de aprendizaje automático en conjuntos de datos masivos y ajustan sus predicciones con aprendizaje por transferencia, que reutiliza el conocimiento aprendido en una tarea para aumentar el poder de una tarea relacionada.
La presentación de antígenos por las proteínas del complejo principal de histocompatibilidad (MHC) es el identificador de llamadas del sistema inmunológico. En la superficie celular, los MHC muestran péptidos derivados de componentes celulares o fuentes extrañas como virus, bacterias o parásitos. La presentación de péptidos permite que el sistema inmunológico adaptativo reconozca y responda a antígenos propios o no propios.1 Así como alguien podría sospechar de una llamada no deseada de un número desconocido, las células T que ven complejos péptido inmunogénico-MHC (pMHC) pueden alertar a la respuesta inmune sobre antígenos sospechosos. La activación inmune puede entonces eliminar fuentes de péptidos maliciosos o no deseados.
La presentación de péptidos mediada por MHC es esencial para prevenir y combatir infecciones, y ayuda a las células T a interceptar anomalías, como las células cancerosas. Los investigadores buscan nuevos antígenos específicos del cáncer llamados neoantígenos para desarrollar inmunoterapias personalizadas, pero esta búsqueda a menudo se ve obstaculizada por experimental cuellos de botella como baja sensibilidad y rendimiento.2 Los biólogos computacionales, como Raquel Karchin de la Universidad Johns Hopkins, recurren a modelos de predicción de aprendizaje automático para superar estas limitaciones experimentales.
“Nuestro grupo realmente ha estado tratando de impulsar el estado de la predicción de neoantígenos”, dijo Karchin. Aunque existen muchas herramientas de aprendizaje automático para predecir la presentación de antígenos, predecir inmunogenicidad sigue siendo un desafío.2 En su último trabajo publicado en Inteligencia de la máquina de la naturaleza,3 Karchin y su equipo adoptaron un enfoque de aprendizaje por transferencia para predecir qué secuencias de neoantígenos provocarán una respuesta inmune, clasificándolas como neoepítopos.
Ver también “Simplificando la búsqueda de objetivos farmacológicos“
Su método, llamado BigMHC, involucra siete redes neuronales profundas que los investigadores primero entrenaron y probaron utilizando conjuntos de datos de espectrometría de masas de fragmentos de pMHC, que son indicativos de la presentación de neoantígenos. Luego transfirieron lo que su modelo de predicción de presentación aprendió a datos de ensayos de respuesta del receptor de células T (TCR) para predecir la inmunogenicidad. “Porque todos los neoepítopos inmunogénicos se presentan pero no todos se presentan [neoantigens] son inmunogénicos, esta es una tarea de ajuste”, dijo el primer autor Benji Albert, quien era investigador universitario en el laboratorio de Karchin cuando dirigió este trabajo. “Estamos tratando de no cambiar toda la red, sino sólo las últimas proyecciones. En realidad, es la misma tarea de entrenamiento, solo se modifican las últimas capas”.
Los investigadores descubrieron que su modelo BigMHC produce una presentación poderosa y una predicción de inmunogenicidad, pero también resaltaron las limitaciones de las predicciones basadas en el aprendizaje automático. “Esto es sólo parte de la respuesta inmune adaptativa, esta interacción péptido-célula MHC-T”, dijo Karchin. “Para que una célula T y una célula tumoral realmente se reconozcan entre sí, existen muchas otras interacciones ligando-receptor que son importantes y deberían incorporarse a este tipo de predicción”.
Los científicos también se enfrentan al desafío de la redundancia biológica al desarrollar modelos computacionales para la predicción de neoantígenos. “Muchas de las herramientas que aplicamos hoy en día en biología para hacer aprendizaje automático provienen del campo computacional”, dijo Morten Nielsen, biólogo computacional de la Universidad Técnica de Dinamarca, que no participó en este estudio pero que también desarrolla herramientas computacionales para la predicción de antígenos. “Trabajar con datos biológicos es muy diferente en comparación con trabajar con datos generales utilizados en informática”.
La forma en que un modelo de aprendizaje automático aprende y predice depende de la forma en que se agrupan y dividen los puntos de datos. A diferencia de los típicos puntos de datos discretos de la informática, los sistemas vivos a menudo dependen de redundancias en proteínas y otras moléculas biológicas, lo que complica el desafío de fuga de datos en el aprendizaje automático.4 Cuando los conjuntos de datos de entrenamiento y prueba contienen datos superpuestos o puntos de datos que comparten similitudes significativas, los investigadores pueden sobreestimar el rendimiento de un modelo.
En el caso de los neoantígenos, cada espectrometría de masasLa secuencia derivada que los investigadores utilizan para entrenar y probar modelos de aprendizaje automático representa una parte de un antígeno y su molécula MHC presentadora, llamada HLA en humanos. Cada persona tiene un conjunto genéticamente único de HLA, y cada HLA reconoce y presenta péptidos para el reconocimiento de antígenos.2
“El mismo péptido puede verse en muchos contextos”, dijo Nielsen. “Si los toma como dos puntos de datos y coloca uno de ellos en el conjunto de datos de prueba y el otro en el entrenamiento, entonces el método se puede aprender de memoria. Aunque en principio son puntos de datos diferentes porque provienen de diferentes HLA, siguen siendo el mismo punto de datos porque obedecen las mismas reglas, y las reglas que se aprenden de uno se pueden aplicar al otro”.
Ver también “¡Muévete, proteínas! Explorando los lípidos en la inmunidad adaptativa“
El equipo de Karchin consideró cada par único de pMHC como un punto de datos separado. Tuvieron cuidado al deduplicar los pares de pMHC para garantizar que no hubiera superposición en los puntos de datos de prueba y entrenamiento de su modelo, pero notaron que no estratificaron sus datos por péptidos por separado. “Creo que el modelo podría tener potencial, pero necesitan demostrarlo en un conjunto de datos adecuado donde hayan abordado este problema de redundancia”, dijo Nielsen.
Karchin y Albert respondieron a esta preocupación. “Aunque no hay superposición de pMHC, analizamos el alcance de la superposición de péptidos y descubrimos que de 937 instancias en el conjunto de datos de la prueba de neoepítopos (de referencia), BigMHC había visto 28 péptidos negativos y 2 positivos en su entrenamiento”, dijeron los investigadores. vía correo electrónico. “El estándar en el campo es considerar una instancia única como todo el complejo péptido-MHC, pero incluso sin tener en cuenta los MHC, la superposición de péptidos en el entrenamiento y los conjuntos de prueba de neoepítopos de BigMHC es insignificante”.
Nielsen también destacó que este es un desafío que se ve a menudo con los modelos de predicción de aprendizaje automático en biología. “Más de la mitad de los artículos publicados en este campo de la inmunoinformática profunda padecen este problema”, dijo. “La gente no es consciente de los desafíos de los datos en biología si provienes de la informática, donde los datos son solo datos”.
A pesar de estos crecientes dolores en la aplicación biológica del aprendizaje automático en rápida expansión, las herramientas de predicción de neoantígenos atacan el importante problema del descubrimiento a gran escala que actualmente no se puede lograr de manera experimental. BigMHC es la primera herramienta de aprendizaje por transferencia publicada para predecir la inmunogenicidad de neoantígenos, lo que abre la puerta a futuros métodos de aprendizaje automático que pueden mejorar el desarrollo de inmunoterapia personalizada.
Referencias
- Wieczorek M, et al. Proteínas del complejo mayor de histocompatibilidad (MHC) clase I y MHC clase II: plasticidad conformacional en la presentación de antígenos. Inmunol frontal. 2017;8:292.
- Gfeller D, et al. Contemplando inmunopeptidomas para predecirlos mejor. Semin Inmunol. 2023;66:101708.
- Alberto BA, et al. Las redes neuronales profundas predicen la presentación y transferencia del epítopo del complejo mayor de histocompatibilidad de clase I y aprenden la inmunogenicidad del neoepítopo. Nat Mach Intel. 2023;5(8):861-72.
- Fang J. El papel del sesgo del desequilibrio de datos en la predicción del cambio de estabilidad de las proteínas tras la mutación. Más uno. 2023;18(3):e0283727.