¿Puede la IA realmente resolver pruebas matemáticas reales? Los investigadores lo ponen a prueba

Kendra Pierre-Louis: Para Science Quickly de Scientific American, soy Kendra Pierre-Louis, en lugar de Rachel Feltman.

En 1997, Deep Blue, una supercomputadora construida por IBM, hizo lo inesperado: derrotó al gigante del ajedrez Garry Kasparov en su propia partida, lo que generó una avalancha de titulares sobre si Deep Blue era realmente inteligente y si las computadoras ahora podían superar a los humanos. La respuesta, al menos entonces, fue mayoritariamente no.

Pero ahora estamos en 2026 y tenemos un número creciente de modelos de IA generativa que una vez más nos hacen preguntarnos: "¿Pueden las máquinas ser mejores que nosotros?". Para profundizar en esta cuestión, un grupo de investigadores esta vez no recurrirá al ajedrez, sino a las matemáticas.

Sobre el apoyo al periodismo científico

Si está disfrutando de este artículo, considere apoyar nuestro periodismo galardonado suscribiéndose. Al comprar una suscripción, ayudas a garantizar el futuro de historias impactantes sobre los descubrimientos y las ideas que dan forma a nuestro mundo actual.

Para obtener más información al respecto, hablé con Joe Howlett, un reportero del personal aquí en SciAm que cubre matemáticas. Gracias por acompañarnos hoy, Joe.

Joe Howlett: Gracias por invitarme.

Pierre-Louis: Entonces escribiste un artículo que habla sobre los desafíos de la IA y las matemáticas. Antes de entrar en la carne y las patatas de esa pieza, tengo una… quizás una pregunta más básica para usted.

Howlett: Sí.

Pierre-Louis: Para aquellos de nosotros que tal vez alcanzamos su punto máximo con el álgebra de la escuela secundaria, cuando hablamos de IA y problemas matemáticos, ¿de qué tipo de problemas matemáticos estamos hablando realmente?

Howlett: En realidad, de eso se trata en gran medida esta historia, es que el tipo de preguntas que los matemáticos hacen y en las que dedican su tiempo a pensar en realidad no suenan ni tienen nada en común con los problemas en los que trabajamos como tarea en la clase de matemáticas.

Pierre-Louis: Mm-hmm.

Howlett: Si recientemente tomaste una clase de matemáticas, estás acostumbrado a problemas que tienen respuestas, ¿verdad?

Pierre-Louis: Mm-hmm.

Howlett: Y la respuesta es, como, un número…

Pierre-Louis: Sí.

Howlett: O algo así. Y entregas tu tarea, y el profesor puede verificar ese número [Risas], si es el número correcto o el número incorrecto, y te dan una calificación.

Pero lo que los investigadores matemáticos están haciendo es tratar de demostrar que las afirmaciones sobre el universo matemático son verdaderas o falsas. Entonces, ¿qué significa eso? Ya sabes sobre triángulos, cuadrados y formas básicas, pero hay…

Pierre-Louis: Sí, me gradué en la guardería. [Risas.]

Howlett: [Risas.] Así es, exactamente. Eso es todo lo que llegué también.

Hay formas mucho más complicadas que existen en muchas dimensiones y tienen curvaturas extrañas que ni siquiera puedes imaginar en tu mente. Pero los matemáticos son capaces de decir cosas sobre ellos, ¿verdad? Usando ecuaciones y demostraciones, pueden aprender sobre estos objetos que en realidad no podemos ver ni imaginar.

Pierre-Louis: Ahora que sabemos qué son las matemáticas, en [uno de sus artículos] observa que los LLM han obtenido algunas victorias en matemáticas, como Google Gemini Deep Think logró una puntuación de nivel oro en la Olimpiada Internacional de Matemáticas y que la IA ha resuelto múltiples "problemas de Erdô". ¿Por qué eso no es suficiente para mostrar la destreza matemática de la IA?

Howlett: Sí, quiero decir, lo que pasa con la mayoría de estos llamados puntos de referencia es cómo los llaman: por muchas razones, las empresas de IA se han obsesionado con las matemáticas como lo siguiente que deben demostrar…

Pierre-Louis: Mm-hmm.

Howlett: Que los LLM puedan pensar o dar un paso hacia la inteligencia. Pero la mayoría de esos ejemplos, como dijiste, tienen más en común con el tipo de preguntas de examen y problemas de tarea de los que estábamos hablando, y que en realidad no parecen…

Pierre-Louis: Mm-hmm.

Howlett: Investigar matemáticas, cierto, que se trata más de demostrar afirmaciones sobre el mundo y explorar ese mundo, planteando preguntas que sean interesantes.

En cierto modo, todos esos logros son muy impresionantes. [Risas.] Es una locura que una computadora pueda ganar el oro en matemáticas, en mi opinión…

Pierre-Louis: Mm-hmm.

Howlett: Pero no dice mucho sobre si una computadora puede hacer avanzar las matemáticas, y en qué medida, por sí sola o incluso con la ayuda de un ser humano.

Pierre-Louis: Algo así como la diferencia entre una calculadora realmente buena y un matemático.

Howlett: ¡Exactamente! Sí. Los matemáticos se han topado con: en la historia de las matemáticas, una y otra vez se han inventado nuevas herramientas que han sido útiles para los matemáticos y han acelerado las cosas. Y una de las grandes preguntas aquí [es]: ¿Es esta solo otra de esas herramientas, o revolucionará fundamentalmente la forma en que se hacen las matemáticas a un nivel que nunca antes habíamos visto? Y es demasiado pronto para decirlo.

Pierre-Louis: Y una de las formas en que parece que la gente está tratando de descubrir si la IA es simplemente una calculadora gigante o si realmente puede hacer avanzar las matemáticas es este desafío de Primera Prueba que fue elaborado por un grupo de 11 matemáticos. ¿Puedes explicar cuál fue este desafío?

Howlett: Sí, entonces estos matemáticos que son luminarias en sus diversos campos de las matemáticas (y cubren una amplia gama de subcampos de las matemáticas) querían rectificar esta situación en la que realmente no tenemos una buena idea de qué tan buena es la IA para plantear y resolver problemas matemáticos de investigación reales.

Todos ellos han tenido esta experiencia anecdótica en la que los LLM han mejorado mucho en los últimos meses al interrogar preguntas matemáticas como lo haría un matemático y al proponer pruebas y métodos de prueba que parecen confirmarse en algunas situaciones. Pero también alucinan mucho y proponen muchas tonterías muy confiadas.

Entonces estos matemáticos, que, por cierto, no trabajan para empresas de inteligencia artificial, ¿verdad?

Pierre-Louis: Mm-hmm.

Howlett: Decidieron reunirse y plantear preguntas de investigación reales que están tratando de resolver para su propia investigación matemática, ¿verdad? Cada uno de ellos tiene documentos que están saliendo con pruebas, y cada uno tomó una pequeña sección de eso. Pruebas: la forma en que los matemáticos hacen pruebas es dividiéndolas en teoremas más pequeños, ¿verdad? Entonces, si quisieras demostrar que siete es mayor que tres, primero podrías demostrar que siete es mayor que cinco y luego demostrar que cinco es mayor que tres, ¿verdad? Y así es como trabajan los matemáticos. Y estas pruebas más pequeñas se llaman "lemas".

Lo que hicieron estos matemáticos fue que cada uno tomó de un próximo artículo un lema que probaron como parte de su prueba más amplia y lo sacaron de ese artículo, lo plantearon como un problema para un LLM e hicieron todo esto antes de subir ese artículo a cualquier lugar en línea para que no esté en los datos de entrenamiento de los LLM, ¿verdad?

Pierre-Louis: Mm-hmm.

Howlett: Porque cualquier problema matemático que pueda plantear en un LLM probablemente ya se haya planteado antes y probablemente exista una respuesta en Internet. Entonces, estas son preguntas de investigación reales de vanguardia, y si un LLM puede resolverlas, entonces sería capaz de contribuir sustancialmente a la práctica de las matemáticas.

Pierre-Louis: Entonces, ¿cuáles son los primeros resultados de ejecutar este tipo de desafío?

Howlett: Sí, para esta primera ronda, diferentes empresas de inteligencia artificial, utilizando sus mejores modelos y muchos matemáticos en su personal, probaron los problemas, y realmente no podemos ver la práctica que implementaron. En algunos casos, no podemos ver su transcripción completa con los chatbots.

Pierre-Louis: Mm-hmm.

Howlett: No sabemos hasta qué punto consultaron con matemáticos humanos.

Y como me dijo uno de los [miembros] del equipo First Proof, Lauren Williams, una vez que hay humanos involucrados en el proceso, se vuelve muy difícil decir cuánto están haciendo los humanos y cuánto está haciendo la IA. Entonces, el equipo realmente quería que esto originalmente fuera algo como: le haces la pregunta a una IA; mira si responde la pregunta.

Así lo hicieron antes del desafío con chatbots disponibles públicamente. Y los chatbots pudieron responder dos de estas 10 preguntas, lo cual es impresionante, pero hasta cierto punto muestra que este es un desafío real y difícil que le estamos planteando a las IA.

Este pequeño rincón de Internet al que sólo yo presto atención se volvió realmente loco tratando de resolver estos problemas. Muestra que existe una creciente comunidad en línea de matemáticos y entusiastas de las matemáticas, que tal vez no sean matemáticos investigadores, que están tratando de utilizar los LLM para hacer matemáticas puras. Y esta comunidad realmente probó suerte con estos problemas y produjo muchas pruebas, publicadas en las redes sociales y en los servidores de Discord.

El equipo de First Proof planteó estas preguntas, cargaron las respuestas en forma cifrada y le dijeron a la comunidad que las descifrarían en una semana. Así que le dieron al mundo una semana para intentar responder tantas preguntas como pudieran. Y esta comunidad en línea se volvió loca al intentar hacerlo, produjo muchas pruebas. Muchos de ellos instantáneamente, según mis informes, eran claramente basura. Los matemáticos con los que hablé dijeron: "Sí, la mayoría de estas pruebas son una tontería". Pero algunos de ellos eran prometedores.

Entonces OpenAI inicialmente afirmó que tenía soluciones a seis de los problemas. Muy rápidamente, un matemático encontró un problema con uno de ellos, por lo que se redujo a cinco. El resto parece haber aguantado, por lo que OpenAI parece haber acertado cinco con su proceso desconocido. Google Gemini también publicó sus resultados, y hizo lo mismo: acertó seis de 10. Y algunos de ellos eran diferentes a los de OpenAI.

La activa comunidad en línea y algunos investigadores matemáticos que estaban probando suerte también recibieron un par de preguntas, las preguntas nueve y 10, que, según los investigadores, podían responder mediante IA. Otras personas produjeron esas respuestas.

Hay algunas cosas que me llamaron la atención acerca de estos resultados. Una es que existía una enorme discrepancia entre lo que pueden hacer las personas con modelos disponibles públicamente y los esfuerzos internos de estas empresas gigantes, ¿verdad? Es una gran diferencia acertar uno o dos que acertar seis.

La otra cosa es que la gente no usa un LLM; están usando lo que ellos llaman un "andamio". Entonces tendrán un LLM y luego un grupo de otros LLM interrogarán sistemáticamente su respuesta y la analizarán de un lado a otro, ¿verdad? Esto está permitido, no hay un ser humano en el circuito, pero son un grupo de IA hablando entre sí de alguna manera. Y parece que esta es una forma de impulsar el desempeño de estos LLM. Lo hacen mucho mejor a la hora de descubrir algunas tonterías y producir una prueba real.

Pierre-Louis: Había una cita en [uno de los artículos] que me pareció interesante, que decía que cuando obtenían las respuestas correctas, los LLM usaban matemáticas casi al estilo del siglo XIX. Y me preguntaba sobre esa cita y qué significan las matemáticas al estilo del siglo XIX.

Howlett: Sí, este es un punto realmente importante. La IA parece, al menos ahora, hacer matemáticas de manera un poco diferente y de una manera un poco menos impresionante para al menos algunos de los matemáticos. En muchos casos, la IA producirá una prueba que llega a la misma conclusión que la prueba del matemático…

Pierre-Louis: Mm-hmm.

Howlett: Eso se descifró ese viernes, pero lo hace de una manera mucho más tortuosa y indirecta y con mucha fuerza bruta, de una manera que no es tan estéticamente agradable para los matemáticos.

A veces los matemáticos, cuando describen lo que están haciendo, suenan más como artistas que como científicos, ¿verdad? Les gusta mucho tener lo que ellos llaman una prueba “hermosa”, algo que cuando lo lees, realmente entiendes por qué esa afirmación al final debe ser así.

Pierre-Louis: Mm-hmm.

Howlett: Y la IA tiende a producir estas pruebas en las que cada paso tiene sentido y llegas al final y ves la afirmación, entonces la crees, pero no ves el panorama completo. Y tal vez la IA nunca vio el panorama completo.

Pierre-Louis: ¿Hacia dónde crees que se dirige a partir de ahora?

Howlett: Uno de los investigadores, Mohammed Abouzaid, dijo esto sobre las matemáticas del siglo XIX porque cuando los matemáticos prueban algo, a menudo lo hacen ideando algún concepto matemático nuevo que destila la verdad y es más fácil trabajar con él que cualquier cosa que existiera antes.

Pierre-Louis: Mm-hmm.

Howlett: Entonces este es un objeto abstracto, como un teseracto. Las IA no parecen preferir hacer eso. Están muy contentos de trabajar con herramientas existentes y simplemente ensamblarlas en nuevas formas MacGyver, pero no está claro que eso conduzca a nuevos descubrimientos. Muchas veces, esas herramientas que los matemáticos inventan en el camino hacia una demostración les brindan una comprensión más profunda del universo matemático y conducen a más resultados. Entonces, al menos en este punto, no está claro si la IA es capaz de ese tipo de estilo creativo de matemáticas.

Pero hay contraejemplos: hay al menos otra prueba en uno de los servidores donde la gente está discutiendo estos resultados; varios matemáticos la revisaron, no solo dijeron que era correcta sino también bastante hermosa y logró la prueba de una manera que nunca hubieran pensado.

Así que no está claro que esto sea algo que siempre será así con la IA. Quizás simplemente necesite seguir mejorando.

Pierre-Louis: Creo que es interesante y un poco espeluznante. [Risas.]

Howlett: [Risas.] La próxima ronda nos dirá mucho más. El equipo de First Proof está trabajando con empresas de inteligencia artificial para establecer controles sobre la forma en que hacen las preguntas.

Pierre-Louis: Mm-hmm.

Howlett: Cualquiera que sea la respuesta que obtengamos, no tendremos que tomarla con tanto escepticismo. Y eso realmente nos dirá dónde están los modelos y si estos sistemas internos son realmente mucho mejores que los que hay en el mercado público. Y también, el hecho de que ahora tenemos este sistema de rondas iteradas, podemos ver que los LLM evolucionan con el tiempo.

Entonces, ¿a dónde va esto desde aquí? No sé. Hay matemáticos que te dirán que las matemáticas nunca volverán a ser las mismas, que la IA resolverá algunos de los mayores problemas matemáticos en los próximos años. Y hay matemáticos con los que hablo que incluso estaban convencidos…

Pierre-Louis: Mm-hmm.

Howlett: En esta primera ronda de la Primera Prueba, esa línea de tiempo va más rápido de lo que pensaban antes.

Pierre-Louis: Lo que he oído es que Terminator era un documental.

Howlett: [Risas.] Sí, sobre el futuro, supongo. Sí.

Pierre-Louis: [Risas.]

Howlett: También hay muchos matemáticos que te dirán que la IA nunca podrá hacer lo que los humanos hacen con las matemáticas, que es la curiosidad directa hacia nuevas direcciones, y que lo mejor que puede ser es una herramienta que usan los matemáticos, como una calculadora.

Me cuesta no desanimarme cuando imagino un futuro en el que la IA resuelva los grandes problemas de matemáticas; por ejemplo, ¿no es parte del entusiasmo que los humanos resuelvan los problemas? Pero varios matemáticos han rechazado esa idea.

Pierre-Louis: Mm-hmm.

Howlett: Dirán que no, que sólo quieren saber cosas sobre el universo matemático. No les importa si una IA se lo dice o ellos lo hacen.

Un matemático utilizó este ejemplo, este experimento mental de un cuento de [Jorge Luis] Borges, “La Biblioteca de Babel”. Entonces dice: "Imagínese un mundo donde pudiéramos tener acceso a cualquier verdad matemática; teníamos una biblioteca gigante que contenía todas las pruebas que pudiera tener". Y lo que quería decir es que cualquier matemático que conozca estaría encantado de estar en esa biblioteca y se pondría manos a la obra tratando de entender las cosas. La cuestión es que el trabajo de un matemático no va a ninguna parte; Quizás sea un momento emocionante para los matemáticos.

Para mí es difícil imaginar un futuro en el que no tendré el lado humano de la historia. Definitivamente, como informar sobre una gran prueba matemática…

Pierre-Louis: Mm-hmm.

Howlett: Será menos emocionante si no escucho sobre la persona que estaba atrapada tarde en la noche en su escritorio, luchando por resolver un problema, golpeándose la cabeza contra el suelo hasta que se le ocurrió ese momento de iluminación. Y también colaboración, como las historias de matemáticos que se reúnen en conferencias y tienen esa discusión clave mientras toman un café que conduce a un avance fundamental. Así que espero que los humanos se mantengan informados. [Risas.]

Pierre-Louis: Yo también, por si sirve de algo.

Howlett: [Risas.]

Pierre-Louis: Muchas gracias por tomarse el tiempo de hablar con nosotros hoy.

Howlett: Muchas gracias por invitarme, Kendra.

Pierre-Louis: ¡Eso es todo por hoy! Nos vemos el viernes, cuando exploremos la ciencia del dolor.

Science Quickly es una producción mía, Kendra Pierre-Louis, junto con Fonda Mwangi, Sushmita Pathak y Jeff DelViscio. Este episodio fue editado por Alex Sugiura. Shayna Posses y Aaron Shattuck verifican nuestro programa. Nuestro tema musical fue compuesto por Dominic Smith. Suscríbase a Scientific American para obtener noticias científicas más actualizadas y detalladas.

Para Scientific American, esta es Kendra Pierre-Louis. ¡Hasta la próxima!