El debate sobre las capacidades de razonamiento de los grandes modelos de razonamiento (LRMS) ha sido recientemente vigorizado por dos documentos prominentes pero conflictivos: la “ilusión de pensamiento” de Apple y la refutación de Anthrope titulada “La ilusión de la ilusión del pensamiento”. El artículo de Apple afirma límites fundamentales en las habilidades de razonamiento de LRMS, mientras que Anthrope argumenta que estas afirmaciones provienen de las deficiencias de evaluación en lugar de las fallas del modelo.
El estudio de Apple probó sistemáticamente LRM en entornos de rompecabezas controlados, observando un “colapso de precisión” más allá de los umbrales de complejidad específicos. Según los informes, estos modelos, como el soneto Claude-3.7 y Deepseek-R1, no lograron resolver rompecabezas como Tower of Hanoi y River Crossing a medida que aumentaba la complejidad, incluso exhibió un esfuerzo de razonamiento reducido (uso de token) a mayores complejidades. Apple identificó tres regímenes de complejidad distintos: los LLM estándar superan a los LRM a baja complejidad, los LRMS se destacan en la complejidad media y ambos colapsan a alta complejidad. Críticamente, las evaluaciones de Apple concluyeron que las limitaciones de LRMS se debían a su incapacidad para aplicar el cálculo exacto y el razonamiento algorítmico consistente en los rompecabezas.
Antropic, sin embargo, desafía bruscamente las conclusiones de Apple, identificando fallas críticas en el diseño experimental en lugar de los modelos mismos. Destacan tres problemas principales:
- Limitaciones del token versus fallas lógicas: Anthrope enfatiza que las fallas observadas en los experimentos de la Torre de Hanoi de Apple se debieron principalmente a límites de token de salida en lugar de déficits de razonamiento. Los modelos notaron explícitamente sus restricciones de token, truncando deliberadamente sus salidas. Por lo tanto, lo que apareció como “colapso de razonamiento” fue esencialmente una limitación práctica, no una falla cognitiva.
- Clasificación errónea del desglose del razonamiento: Anthrope identifica que el marco de evaluación automatizado de Apple malinterpretó los truncamientos intencionales como fallas de razonamiento. Este método de puntuación rígido no acomodó la conciencia y la toma de decisiones de los modelos con respecto a la longitud de la salida, lo que provocó que los LRM injustamente penalizados.
- Problemas insoluble malinterpretados: Quizás lo más significativo, Anthrope demuestra que algunos de los puntos de referencia de cruce del río Apple eran matemáticamente imposibles de resolver (por ejemplo, casos con seis o más personas con una capacidad de tres). La puntuación de estas instancias insoluble a medida que las fallas sesgaron drásticamente los resultados, haciendo que los modelos parecieran incapaces de resolver rompecabezas fundamentalmente insolubables.
Anthrope probó además un método de representación alternativo, que agradece los modelos para proporcionar soluciones concisas (como las funciones de LUA), y encontró una alta precisión incluso en rompecabezas complejos previamente etiquetados como fallas. Este resultado indica claramente que el problema fue con los métodos de evaluación en lugar de las capacidades de razonamiento.
Otro punto clave planteado por antrópico se refiere a la métrica de complejidad utilizada por la profundidad de composición de Apple (número de movimientos requeridos). Argumentan que esta métrica combina la ejecución mecánica con dificultad cognitiva genuina. Por ejemplo, si bien los rompecabezas de la Torre de Hanoi requieren exponencialmente más movimientos, cada paso de decisión es trivial, mientras que los rompecabezas como el cruce del río implican menos pasos pero una complejidad cognitiva significativamente más alta debido a la satisfacción de la restricción y los requisitos de búsqueda.
Ambos documentos contribuyen significativamente a comprender los LRM, pero la tensión entre sus hallazgos subraya una brecha crítica en las prácticas actuales de evaluación de IA. La conclusión de Apple, que los LRM inherentemente carecen de un razonamiento robusto y generalizable, se debilita sustancialmente por la crítica de Anthrope. En cambio, los hallazgos de Anthrope sugieren que los LRM están limitados por sus entornos de prueba y marcos de evaluación en lugar de sus capacidades de razonamiento intrínseco.
Dadas estas ideas, la investigación futura y las evaluaciones prácticas de LRM deben:
- Diferenciar claramente entre razonamiento y limitaciones prácticas: Las pruebas deben acomodar las realidades prácticas de los límites de tokens y la toma de decisiones modelo.
- Validar la solvabilidad del problema: Asegurar que los rompecabezas o problemas probados sean solucionables es esencial para una evaluación justa.
- Refinar las métricas de complejidad: Las métricas deben reflejar desafíos cognitivos genuinos, no solo el volumen de los pasos de ejecución mecánica.
- Explore diversos formatos de solución: Evaluar las capacidades de LRMS en varias representaciones de soluciones puede revelar mejor sus fortalezas de razonamiento subyacentes.
En última instancia, la afirmación de Apple de que LRMS “no puede razonar” parece prematuro. La refutación de Anthrope demuestra que LRMS de hecho posee capacidades de razonamiento sofisticadas que pueden manejar tareas cognitivas sustanciales cuando se evalúan correctamente. Sin embargo, también enfatiza la importancia de métodos de evaluación cuidadosos y matizados para comprender realmente las capacidades y las limitaciones de los modelos de IA emergentes.
Mira el Papel de manzana y Papel antrópico. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 100k+ ml y suscribirse a Nuestro boletín.
Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.