Enseñar a los LLM a actualizar las creencias para una interacción eficiente a largo plazo: el blog de investigación de inteligencia artificial de Berkeley

Descripción general de ABBEL en comparación con el resumen recursivo tradicional. Las creencias reemplazan el historial completo de interacción como contexto de trabajo del agente, y la calificación de creencias mejora el desempeño al supervisar el contenido de cada estado de creencia.

A medida que crecen los horizontes de tareas, los contextos de LLM no pueden escalar para siempre. El autoresumen permite contextos concisos e interpretables, pero con un costo de rendimiento significativo, especialmente para dominios de asistencia humana donde los datos de alta calidad son escasos, por ejemplo, la generación de código colaborativo. Abordamos esto con ABBEL: un marco que aísla y supervisa el contenido informativo de los resúmenes en forma de estados de creencias en lenguaje natural.

Motivación: el costo del resumen recursivo

Para que los modelos de lenguaje ayuden eficazmente con tareas cada vez más complejas, como el desarrollo de software, deben poder interactuar con nosotros en cientos o incluso miles de pasos. Para tareas tan largas, no resulta práctico mantener en contexto el historial de toda la interacción. El enfoque heurístico utilizado hasta ahora ha sido la generación de resúmenes, a veces denominada compactación de contexto. Por ejemplo, el último modelo de compositor 2.5 de Cursor utiliza la compactación durante el entrenamiento para mejorar el rendimiento (Cassano et al., 2026). Junto con el compositor, Grandcode (DeepReinforce et al., 2026), el primer sistema que venció consistentemente a todos los competidores humanos en competencias de codificación en línea, a pesar de utilizar uno de los modelos de atención eficiente más nuevos (Qwen 3.5-397B), todavía consideró necesario emplear el resumen de contexto.

Pero la compactación tiene un problema. A pesar de las brechas de rendimiento aparentemente bajas en los puntos de referencia, los servidores modelo como Cursor continúan recomendando que los usuarios eviten la compactación con sus asistentes de codificación en medio de una tarea (Heule et al., 2026).

Para entender por qué, vea a continuación el rendimiento del ajuste fino de RL de un modelo de resumen de contexto en comparación con los modelos de contexto completo en Combinación Lock, un juego similar a Wordle que permite hasta 16 conjeturas. Aunque ambos tipos de modelos mejoran a lo largo del entrenamiento, el modelo resumido nunca cierra la brecha.

Promedio de intentos de adivinar la palabra objetivo con resumen de contexto frente a políticas de contexto completo durante la capacitación

Fig. 1: Promedio de intentos de adivinar la palabra objetivo en el bloqueo de combinación sobre el ajuste fino de RL (cuanto más bajo, mejor). Las políticas de resumen del contexto mejoran con la capacitación, pero no cierran la brecha con las políticas de contexto completo.

Hacer que los modelos se resuman por sí solos mientras completan una tarea aumenta la complejidad del problema de aprendizaje. Si bien esto normalmente podría solucionarse entrenando con más datos, la degradación del rendimiento observada en entornos interactivos del mundo real probablemente surja de la dificultad que tenemos para crear y utilizar simuladores humanos de manera efectiva para generar entornos de entrenamiento de alta calidad (Lin et al., 2025, Tomlin et al., 2025). Por lo tanto, cuanto mejor pueda aprender a resumir las limitadas y desordenadas trayectorias de interacción de múltiples vueltas que puede recopilar, mejor será su modelo para los usuarios intermedios.

ABBEL: actuar a través de obstáculos en las creencias

Diagrama de clasificación de creencias de ABBEL

Fig. 2: Calificación de creencias inspirada en el codificador automático. El modelo codifica creencias, acciones y observaciones previas (bt, at, ot) en creencias posteriores bt+1 y es recompensado por qué tan bien se puede reconstruir información seleccionada de la historia a partir de esa creencia.

Para abordar la mala eficiencia del aprendizaje, aislamos la tarea de generación de resumen. Inspirándonos en la estimación bayesiana recursiva, formulamos resúmenes como estados de creencia, que periódicamente solicitamos al modelo que actualice en función de nueva información.

Cuadro de animación de descripción general de ABBEL

‹ Anterior Pausa Siguiente ›
1 / 16

Fig. 3: Lanzamiento de ABBEL. Las actualizaciones de creencias a partir de la última observación se alternan con la selección de acciones condicionadas únicamente a la creencia posterior actual.

Calificación de creencias

Luego extraemos y supervisamos el contenido de los estados de creencias (Fig. 2, Clasificación de creencias). Se puede considerar que la calificación de creencias agrega una tarea auxiliar de RL, utilizando heurísticas diseñadas para capturar lo que constituye una buena creencia como recompensa. Un ejemplo de heurística para la codificación podría ser más corto y mejor, pero estar más cerca de poder reconstruir el git diff también es mejor, por lo que equilibrarlos daría como resultado una buena creencia. En dominios donde es difícil definir buenas heurísticas, proponemos una función de calificación general inspirada en la codificación automática, que trata el modelo de lenguaje actual πθ como codificador y decodificador de información de la historia, y los estados de creencias como códigos. Calificamos cada creencia bt+1 según qué tan bien puede ser utilizada por el modelo actual πθ para reconstruir la observación más reciente de:

Ec. 1

Ec. 1: Objetivo de calificación de la reconstrucción. Aquí bt+1 es la creencia actualizada, de la última observación, en la acción que se acaba de realizar, bt la creencia anterior, pI la indicación de la tarea y πθ el modelo actual. Las calificaciones más altas recompensan las creencias que retienen la información necesaria para decodificar la observación más reciente.

¿Qué ganamos calificando las creencias?

Codificación colaborativa en CollabBench

Demostramos la utilidad de la calificación de creencias en nuestro dominio motivador de codificación de asistencia impulsada por humanos, con el entorno CollabBench de Sweet-RL (Zhou et al., 2025).

Entorno de codificación colaborativa CollabBench

Fig. 4: Entorno de codificación colaborativa CollabBench. El agente hace preguntas aclaratorias y luego envía una función calificada según pruebas unitarias ocultas.

Vemos que con la función de calificación de creencias basada en la reconstrucción general reducimos la brecha de rendimiento de los modelos de contexto completo en aproximadamente un 50% y entrenamos en un 50% menos de pasos en comparación con los modelos de entrenamiento para resumir sin calificación de creencias (sin BG). Después del entrenamiento, ABBEL todavía usa significativamente menos memoria que la configuración de contexto completo, según lo medido por la longitud máxima del token de contexto (Peak Tokens).

Modelo Tasa de aprobación de la prueba ↑ Tasa de éxito ↑ Fichas máximas × 10² ↓ Pasos de entrenamiento ↓ Contexto completo 0,52±0,02 0,39±0,02 14,08±0,55 100 ABBEL (sin BG) 0,46±0,02 0,31±0,02 4,20±0,37 100 ABBEL-rec-BG 0,48±0,01 0,36±0,01 6,01±0,33 50

Fig. 5: Resultados de CollabBench. Con la calificación de creencias de reconstrucción, ABBEL-rec-BG recupera aproximadamente la mitad de la brecha hasta el contexto completo mientras usa menos tokens pico y entrena en 50 pasos en lugar de 100.

Cerradura de combinación

Además, en CombineLock, demostramos que ABBEL con un clasificador de creencias que aprovecha el conocimiento del dominio (al calcular estadísticas útiles a lo largo del historial y verificar que se pueden reconstruir a partir del estado de creencias), permite una eficiencia de aprendizaje aún mayor que los modelos de contexto completo (FULL CTX).

Promedio de intentos de adivinar la palabra objetivo ABBEL

Fig. 6: Promedio de intentos de adivinar la palabra objetivo en el bloqueo de combinación (cuanto más bajo, mejor). Con la calificación de creencias en el conocimiento del dominio, ABBEL se acerca o supera el CTX COMPLETO en este entorno; sin una calificación de creencias, el aprendizaje es más lento.

Respuesta a preguntas multiobjetivo

En un tercer entorno, la respuesta a preguntas multiobjetivo (de MEM1 Zhang et al., 2025, un trabajo reciente que realizó una optimización de extremo a extremo en una versión modificada del resumen recursivo típico), demostramos la utilidad de aislar los estados de creencia del razonamiento, al mostrar que una penalización por la longitud máxima de la creencia (más detalles en el artículo) reduce significativamente el uso de la memoria con una degradación mínima del rendimiento, a diferencia de lo que se observa comúnmente cuando se penalizan las longitudes del razonamiento (Arora et al., 2025).

Rendimiento y uso de memoria en control de calidad múltiple

Fig. 7: Puntuación de coincidencia exacta y memoria máxima versus número de objetivos en control de calidad multiobjetivo. ABBEL con una penalización por creencia máxima (PBP) mantiene un rendimiento comparable y utiliza menos memoria que MEM1 y ABBEL sin PBP en esta evaluación.

Las soluciones alternativas para gestionar contextos prolongados implican diferentes compensaciones y vale la pena considerarlas según los requisitos de un sistema implementado. Los métodos de compresión de contexto generan representaciones densas que, si bien son computacionalmente eficientes, sacrifican la comprensión humana (Kontonis et al., 2026, Eyuboglu et al., 2025, Gupta et al., 2025, Chevalier et al., 2023, Deng et al., 2025, Deng et al., 2025, Bulatov et al., 2022). Las indicaciones de resumen diseñadas manualmente (Wang et al., 2025, Örwall et al., 2025, Starace et al., 2025) y las estrategias de poda (Jiang et al., 2024) específicas para los entornos objetivo requieren conocimiento humano experto y no permiten que un agente aprenda qué recordar como parte de su estrategia de toma de decisiones. Los métodos que procesan contextos largos en un almacén de memoria externo (Packer et al., 2023, Xu et al., 2025) para que los agentes o subagentes los consulten (Zhang et al., 2025) son complementarios, ya que pueden beneficiarse de una mejor creación del siguiente contexto a través del entrenamiento de resumen. Nos gustaría señalar algunos trabajos interesantes en el espacio del resumen recursivo general centrado en matemáticas (Wu et al., 2026), el razonamiento con generación de creencias (Zhou et al., 2025), la codificación competitiva con un módulo de resumen destilado que utiliza objetivos de codificación automática similares a los de nuestro calificador de creencias general (DeepReinforce et al., 2026) y la adición de características continuas a los resúmenes (Kontonis et al., 2026).

¿Qué sigue para mejorar la memoria?

Se habilitan muchas más posibilidades mediante el uso de estados de creencias explícitos como cuellos de botella de información para la interacción de varios pasos. Podría recompensar las acciones en función de su efecto sobre el estado de creencias para guiar la exploración, transmitir los estados de creencias explícitos para una mejor comunicación entre los agentes o incluso mejorar la controlabilidad del usuario modificando directamente los recuerdos en los que se basan las decisiones de los agentes.

Algunas formas de información, por ejemplo, el aspecto de una persona, no están bien representadas únicamente por el texto. Un sistema de aprendizaje continuo también tendrá que capturar dicha información. Además, si queremos que un sistema aprenda a comunicarse en un idioma completamente nuevo o a jugar un juego nuevo mejor que cualquier persona en el mundo, las habilidades acumuladas durante la vida de las conversaciones o juegos deben almacenarse en una forma muy comprimida, asumiendo esencialmente el papel de los pesos del modelo mismo.

Es probable que los sistemas más potentes utilicen una combinación de múltiples formas de memoria, donde los contenidos del contexto pueden corresponder a la memoria de trabajo, mientras que se utilizan otros enfoques para la memoria a corto y largo plazo. Cómo crear instancias de estas otras formas de memoria, por ejemplo mediante entrenamiento en el momento de la prueba, memorias adaptadoras, memorias de contexto continuo o alguna combinación de las mismas, presenta un desafío apasionante.

Expresiones de gratitud

Agradecimientos: Nos gustaría agradecer a Alane Suhr y Kartik Goyal por asesorar esta investigación, así como a Ethan Mendes, David He, Jitesh Jain y Nicholas Tomlin por los comentarios sobre los primeros borradores de esta publicación. Nos gustaría agradecer a los autores de MEM1 por su correspondencia por correo electrónico y por compartir los comentarios de los revisores privados que consideramos particularmente interesantes.

Citación

Si abbel fue inspirador para su trabajo futuro, ¡cítenos con esto! ¡Y aquí hay algunos consejos para realizar investigaciones similares!

@misc{lidayan2026abbellearningnaturallanguagebelief, title={ABBEL: Aprendizaje de estados de creencias en el lenguaje natural para una interacción eficiente en la memoria}, autor={Aly Lidayan y Jakob Bjorner y Satvik Golechha y Kartik Goyal y Alane Suhr}, año={2026}, eprint={2512.20111}, archivePrefix={arXiv}, PrimaryClass={cs.CL}, url={https://arxiv.org/abs/2512.20111}, }