Esta IA para juegos es la nueva campeona de Stratego | Noticias del MIT

Un nuevo sistema de inteligencia artificial que sobresale en juegos desafiantes con información oculta podría algún día ayudar a los tomadores de decisiones humanos a seleccionar estrategias ideales para superar a los oponentes en situaciones complicadas como maniobras militares.

Utilizando avances en el aprendizaje automático, investigadores del MIT, la Universidad Carnegie Mellon, la Universidad de Nueva York y la Universidad de Stanford desarrollaron una IA que derrotó a los mejores jugadores humanos del juego de guerra Stratego por un amplio margen, algo que ningún sistema de IA había podido lograr.

Stratego, un juego de información imperfecta para dos jugadores, en el que las identidades de las piezas del oponente permanecen ocultas, se utiliza a menudo como punto de referencia para probar las capacidades de pensamiento estratégico de potentes modelos de IA.

Para construir su modelo, los investigadores combinaron algoritmos de entrenamiento eficientes con nuevas técnicas diseñadas para la toma de decisiones calculadas en entornos de información oculta.

El sistema de IA logró un mayor rendimiento en Stratego que los siguientes mejores modelos, al mismo tiempo que era mucho más barato y menos exigente desde el punto de vista computacional para entrenar. El sistema también superó a los mejores jugadores humanos en otros juegos estratégicos con reglas y diseños diferentes, lo que demuestra cómo se puede generalizar para una variedad de casos de uso.

El sistema de IA podría adaptarse para ayudar a los humanos a abordar muchos problemas del mundo real con información oculta, como negociaciones comerciales o ciberseguridad.

“En el tipo de tareas de información imperfectas que enfrentarías en la realidad, a menudo no puedes darte el lujo de enumerar todas las posibilidades. Simplemente hay demasiadas. Tener algoritmos de IA que sean de propósito general y que puedan realizar tan bien esta difícil tarea es un gran paso adelante”, afirma Gabriele Farina, profesora asistente en el Departamento de Ingeniería Eléctrica y Ciencias de la Computación (EECS), investigadora principal en el Laboratorio de Sistemas de Información y Decisión (LIDS) y autor principal de un artículo sobre este sistema de IA.

En el artículo lo acompañan el autor principal Samuel Sokota, estudiante de posgrado en Carnegie Mellon; Eugene Vinitsky, profesor asistente de la Universidad de Nueva York; Zico Kolter, profesor de Carnegie Mellon; Hengyuan Hu, estudiante de posgrado de Stanford; y Zhiyuan Fan, estudiante graduado de EECS en el MIT. La investigación aparece hoy en Nature.

Información oculta

El mundo está lleno de problemas de información imperfecta.

En estas interacciones, algunas partes poseen información que otras no. Por ejemplo, es posible que los operadores de los mercados financieros no conozcan el fundamento de las operaciones de otros, mientras que las fuerzas militares probablemente no tengan pleno conocimiento de las posiciones enemigas.

Con información oculta, las decisiones que toman las partes, así como las decisiones que deciden no tomar, están entrelazadas de tal manera que es extremadamente difícil determinar los mejores pasos a seguir.

“Cuanto más faroles, más lo espera tu oponente y menos vale cada farol. No es obvio cómo razonar sobre eso”, explica Sokota. “Es muy diferente de un escenario como el ajedrez, donde el mejor movimiento sigue siendo el mejor movimiento sin importar cuántas veces lo hayas jugado”.

Stratego se utiliza a menudo para modelar situaciones de información imperfecta. En este juego de guerra de tablero, que se parece al ajedrez militar, los jugadores colocan 40 piezas en su lado del tablero y luego mueven las piezas por el tablero para capturar la bandera de su oponente.

Pero la identidad de todas las piezas permanece secreta hasta que chocan, y entonces la pieza de menor rango es eliminada.

Las posibles configuraciones de piezas son más de 10 elevado a 66, un número exponencialmente mayor que en el ajedrez, lo que hace que Stratego sea extremadamente difícil para un sistema de inteligencia artificial para jugar bien.

Los esfuerzos anteriores, como DeepMind de Google, se basaban en operaciones sofisticadas que eran costosas y exigentes desde el punto de vista computacional. Pero incluso con millones de dólares en costos de capacitación, estos modelos todavía no eran lo suficientemente fuertes como para vencer a los mejores jugadores humanos de Stratego.

“Con Stratego, hay una explosión de universos posibles con los que quizás tengas que lidiar. Las técnicas de inteligencia artificial que se desarrollaron para juegos como el póquer definitivamente no podrían escalar en este entorno”, dice Farina.

Los investigadores del MIT se propusieron desarrollar un sistema de inteligencia artificial completo que pudiera lograr un rendimiento sobrehumano por menos costo, al que llamaron Ataraxos (una palabra griega utilizada para describir a alguien que no está molesto o libre de ansiedad).

Un enfoque doble

Para construir Ataraxos, los investigadores entrenaron el modelo utilizando una técnica llamada aprendizaje por refuerzo por juego propio. El modelo juega contra sí mismo muchas veces para aprender una sólida “estrategia modelo” sobre cómo sobresalir en Stratego.

Diseñaron algoritmos especialmente eficientes, que permitieron a Ataraxos aprender mucho más rápido que los métodos anteriores y, al mismo tiempo, garantizaron que no se quedara atascado al intentar predecir cada movimiento posible. Esto reduce los costes de formación y aumenta el rendimiento.

“Nuestro sistema alcanza una potencia de juego estrictamente superior a la de DeepNash (el sistema de DeepMind) mientras utiliza menos de una centésima parte de los ejemplos de entrenamiento y menos de una trigésima parte de los juegos de autojuego, lo que indica una enorme mejora en la eficiencia”, dice Farina.

Durante un juego, Ataraxos utiliza la estrategia del plano como punto de partida para configurar el tablero y comenzar a pensar en sus próximos movimientos en cada ronda de juego.

Pero antes de actuar, refina sus elecciones sobre la marcha utilizando una técnica llamada planificación del tiempo de decisión. El sistema emplea un modelo generativo que utiliza probabilidades para estimar las identidades probables de las piezas ocultas del oponente y luego evalúa elecciones futuras antes de seleccionar el siguiente movimiento.

“En lugar de simplemente adivinar a ciegas, utilizamos la planificación del tiempo de decisión para encontrar el estado más plausible del tablero. El uso de este modelo generativo nos permite acercarnos realmente al tablero y al oponente específico al que nos enfrentamos”, dice Farina.

El uso innovador de este modelo generativo para la planificación del tiempo de decisión fue la pieza faltante que permitió a Ataraxos lograr un desempeño sobrehumano.

Ataraxos venció al jugador de Stratego más fuerte del mundo por un margen récord de 15-1-4 y logró un récord de 39-2 contra los mejores jugadores humanos en el campeonato mundial de Stratego. “Ataraxos es bueno para calcular el riesgo de una manera que los humanos no. Un humano podría comenzar a asustarse si su pieza más valiosa queda expuesta, pero el robot puede ser sorprendentemente compuesto. No corrige demasiado ni revela sus secretos”, dice Farina.

Los investigadores también adaptaron Ataraxos para otros juegos de información imperfecta, incluido Barrage Stratego (una variante de ritmo más rápido con menos piezas), Hanabi (un juego de cartas cooperativo con muchos jugadores) y Dou dizhu (un juego en el que dos jugadores cooperan contra un tercero).

El sistema logró un rendimiento sobrehumano en cada instancia, lo que demuestra la generalidad de este método.

En el futuro, los investigadores quieren incorporar medidas de interpretabilidad en Ataraxos para que el sistema pueda explicar su toma de decisiones de una manera que un humano pueda entender.

“Los seres humanos deben tener la última palabra sobre si se sigue una recomendación, por lo que antes de que se pueda adoptar, necesitamos una manera de auditar las decisiones del modelo. Todavía tenemos un largo camino por recorrer, pero espero que estos algoritmos puedan ser la base para mucho más trabajo por venir”, dice Farina.

Esta investigación está financiada, en parte, por la Oficina de Investigación Naval, el Departamento de Ingeniería Civil y Urbana de la Universidad de Nueva York, el Centro C2SMART, la Fundación Nacional de Ciencias y una beca de carrera temprana Schmidt Sciences AI2050.