Google AI lanza Gemini 3.1 Pro con 1 millón de contexto de token y 77,1 por ciento de razonamiento ARC-AGI-2 para agentes de IA

Google ha acelerado oficialmente la era Gemini con el lanzamiento de Gemini 3.1 Pro, la primera actualización de versión de la serie Gemini 3. Esta versión no es sólo un parche menor; es un ataque dirigido al mercado de la IA “agente”, centrándose en la estabilidad del razonamiento, la ingeniería de software y la confiabilidad del uso de herramientas.

Para los desarrolladores, esta actualización indica una transición. Estamos pasando de modelos que simplemente “conversan” a modelos que “funcionan”. Gemini 3.1 Pro está diseñado para ser el motor central para agentes autónomos que pueden navegar por sistemas de archivos, ejecutar código y razonar a través de problemas científicos con una tasa de éxito que ahora rivaliza (y en algunos casos supera) los modelos fronterizos más elitistas de la industria.

Contexto masivo, resultados precisos

Una de las mejoras técnicas más inmediatas es el manejo de la escala. Gemini 3.1 Pro Preview mantiene una enorme ventana de contexto de entrada de tokens de 1 millón. Para poner esto en perspectiva para los ingenieros de software: ahora puede alimentar al modelo con un repositorio de código completo de tamaño mediano, y tendrá suficiente “memoria” para comprender las dependencias entre archivos sin perder la trama.

Sin embargo, la verdadera noticia es el límite de salida de tokens de 65.000. Esta ventana de 65k es un salto significativo para los desarrolladores que crean generadores de formato largo. Ya sea que esté generando un manual técnico de 100 páginas o una aplicación Python compleja de múltiples módulos, el modelo ahora puede terminar el trabajo en un solo turno sin chocar abruptamente con un “token máximo”.

Duplicar el razonamiento

Si Gemini 3.0 pretendía introducir el “pensamiento profundo”, Gemini 3.1 pretende hacer que ese pensamiento sea eficiente. Los saltos de rendimiento en puntos de referencia rigurosos son notables:

Punto de referenciaPuntuaciónQué mideARC-AGI-277,1%Capacidad para resolver patrones lógicos completamente nuevosGPQA Diamond94,1%Razonamiento científico a nivel de posgradoSciCode58,9%Programación Python para informática científicaTerminal-Bench Hard53,8%Codificación agencia y uso de terminalesHumanity’s Last Exam (HLE)44,7%Razonamiento contra límites casi humanos

El 77,1% en ARC-AGI-2 es la cifra principal aquí. El equipo de Google afirma que esto representa más del doble del rendimiento de razonamiento del Gemini 3 Pro original. Esto significa que es mucho menos probable que el modelo dependa de la coincidencia de patrones a partir de sus datos de entrenamiento y es más capaz de “descifrarlo” cuando se enfrenta a un caso límite novedoso en un conjunto de datos.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro/

El kit de herramientas Agentic: herramientas personalizadas y ‘antigravedad’

El equipo de Google está haciendo una apuesta clara por el terminal del desarrollador. Junto con el modelo principal, lanzaron un punto final especializado: gemini-3.1-pro-preview-customtools.

Este punto final está optimizado para desarrolladores que combinan comandos bash con funciones personalizadas. En versiones anteriores, los modelos a menudo tenían dificultades para priorizar qué herramienta usar, a veces alucinando con una búsqueda cuando la lectura de un archivo local hubiera sido suficiente. La variante customtools está específicamente ajustada para priorizar herramientas como view_file o search_code, lo que la convierte en una columna vertebral más confiable para agentes de codificación autónomos.

Esta versión también se integra profundamente con Google Antigravity, la nueva plataforma de desarrollo agente de la compañía. Los desarrolladores ahora pueden utilizar un nuevo nivel de pensamiento “medio”. Esto le permite alternar el “presupuesto de razonamiento”, utilizando un pensamiento profundo para una depuración compleja y bajando a medio o bajo para llamadas API estándar para ahorrar latencia y costos.

Cambios importantes en la API y nuevos métodos de archivo

Para aquellos que ya están construyendo sobre la API de Gemini, hay un cambio importante pequeño pero crítico. En la API de Interacciones v1beta, el campo total_reasoning_tokens pasó a llamarse total_thinkt_tokens. Este cambio se alinea con las “firmas de pensamiento” introducidas en la familia Gemini 3: representaciones cifradas del razonamiento interno del modelo que deben devolverse al modelo para mantener el contexto en flujos de trabajo agentes de múltiples turnos.

El apetito del modelo por los datos también ha crecido. Las actualizaciones clave para el manejo de archivos incluyen:

Límite de archivos de 100 MB: el límite anterior de 20 MB para cargas de API se ha quintuplicado a 100 MB. Soporte directo de YouTube: ahora puede pasar una URL de YouTube directamente como fuente de medios. El modelo “ve” el vídeo a través de la URL en lugar de requerir una carga manual. Integración en la nube: compatibilidad con depósitos de Cloud Storage y URL prefirmadas de bases de datos privadas como fuentes de datos directas.

La economía de la inteligencia

El precio de Gemini 3.1 Pro Preview sigue siendo agresivo. Para solicitudes de menos de 200.000 tokens, los costos de entrada son de $2 por 1 millón de tokens y la producción es de $12 por 1 millón. Para contextos que superan los 200k, el precio aumenta a $4 de entrada y $18 de salida.

En comparación con competidores como Claude Opus 4.6 o GPT-5.2, el equipo de Google está posicionando a Gemini 3.1 Pro como el “líder en eficiencia”. Según datos de Artificial Analysis, Gemini 3.1 Pro ahora ocupa el primer lugar en su Índice de Inteligencia y su funcionamiento cuesta aproximadamente la mitad que sus pares fronterizos más cercanos.

Conclusiones clave

Ventana de contexto masiva de 1M/65K: el modelo mantiene una ventana de entrada de tokens de 1M para repositorios y datos a gran escala, al tiempo que actualiza significativamente el límite de salida a 65k tokens para la generación de códigos y documentos de formato largo. Un salto en lógica y razonamiento: el rendimiento en el punto de referencia ARC-AGI-2 alcanzó el 77,1 %, lo que representa más del doble de la capacidad de razonamiento de las versiones anteriores. También logró un 94,1 % en GPQA Diamond para tareas científicas de nivel de posgrado. Puntos finales Agentic dedicados: el equipo de Google presentó un punto final especializado gemini-3.1-pro-preview-customtools. Está optimizado específicamente para priorizar los comandos bash y las herramientas del sistema (como view_file y search_code) para agentes autónomos más confiables. Cambio importante de la API: los desarrolladores deben actualizar sus bases de código ya que el campo total_reasoning_tokens ha cambiado de nombre a total_thinkt_tokens en la API de interacciones v1beta para alinearse mejor con el procesamiento de “pensamiento” interno del modelo. Manejo mejorado de archivos y medios: el límite de tamaño de archivo API ha aumentado de 20 MB a 100 MB. Además, los desarrolladores ahora pueden pasar las URL de YouTube directamente al mensaje, lo que permite que el modelo analice el contenido del video sin necesidad de descargar o volver a cargar archivos.

Consulta los detalles técnicos y pruébalo aquí. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.