¿Qué tendría que ser cierto para que la codificación agente reemplace a los ingenieros jóvenes?

“>

Condición 1: Los agentes deben ser confiables en la duración de la tarea que realmente realiza un junior

La mejor medición que tenemos aquí es el trabajo de horizonte temporal de METR. Cronometran a expertos humanos en tareas de software reales y luego encuentran la duración de la tarea en la que un modelo tiene éxito el 50% de las veces.

El resultado principal es que este horizonte se duplicó aproximadamente cada siete meses entre 2019 y 2025. El Time Horizon 1.1 actualizado de METR amplió el conjunto de tareas en un 34 % y duplicó el recuento de tareas que duraban ocho horas o más. Lecturas independientes del período 2024 a 2026 sugieren que desde entonces la duplicación se ha acelerado. La tabla de clasificación en vivo ahora pone horizontes fronterizos en las horas.

Eso suena decisivo. Lee la metodología y deja de ser determinante.

Dos cosas son importantes:

En primer lugar, el 50% no es un obstáculo contra el que pueda superarse el personal. Kwa et al. También informan un horizonte del 80%, y en cualquier momento dado es dramáticamente más corto que la cifra del 50%. Según sus datos, los sistemas fronterizos son casi perfectos en tareas que un humano completa en menos de cuatro minutos y tienen éxito menos del 10% de las veces en tareas que le llevan a un humano más de cuatro horas. En segundo lugar, y esta es la parte que casi nadie cita: METR dice que sus tareas son deliberadamente autónomas y están bien especificadas. Su propio planteamiento es que una tarea de dos horas debe leerse como lo que alguien sin contexto previo podría hacer en dos horas, no lo que podría hacer un ingeniero experimentado familiarizado con el código base.

Esa es precisamente la forma incorrecta. Los primeros seis meses de un ingeniero junior son casi en su totalidad adquisición de contexto. ¿Qué servicio posee esto? Por qué existe esa abstracción. A quién preguntar. El punto de referencia mide la parte del trabajo a la que se le ha despojado de lo que lo hace difícil.

Condición 2: El punto de referencia tiene que medir el trabajo

En febrero de 2026, OpenAI dejó de informar SWE-bench Verified y recomendó que otros hicieran lo mismo.

Vale la pena leer su razonamiento en su totalidad, pero destacan dos hallazgos. Auditaron un subconjunto del 27,6 % del conjunto de datos y descubrieron que al menos el 59,4 % de los problemas auditados tenían casos de prueba defectuosos que rechazaban soluciones funcionalmente correctas. Y encontraron contaminación: los modelos de frontera podían reproducir parches dorados exactos y detalles textuales del problema, lo que indica exposición al entrenamiento.

El estado de la técnica había pasado del 74,9% al 80,9% en seis meses. La pregunta que hizo OpenAI fue si las fallas restantes reflejaban límites del modelo o propiedades del conjunto de datos. La respuesta fue principalmente propiedades del conjunto de datos.

Pasa a un escenario más duro y menos contaminado y las puntuaciones caen por un precipicio. SWE-bench Pro fue creado exactamente para esto, y el rendimiento de vanguardia se encuentra muy por debajo de las cifras verificadas que anuncian las publicaciones de lanzamiento. Por la misma razón se están construyendo nuevas suites como Terminal-Bench y puntos de referencia de evolución a largo plazo.

Quiero tener cuidado aquí. No se trata de “los puntos de referencia son inútiles”. Es más limitado y más dañino: el número específico que se ha utilizado durante dos años para argumentar que los junior son obsoletos fue retirado por el laboratorio que lo creó, por razones que hacen que el número parezca mejor que la realidad.

Condición 3: El costo de verificar la producción del agente debe ser inferior al costo de delegarla a una persona.

Esta es la condición que creo que se ignora más y es la que tiene la evidencia experimental más clara.

METR realizó una prueba controlada aleatoria con 16 desarrolladores experimentados de código abierto en 246 tareas reales en sus propios repositorios. IA permitida o no permitida al azar. Grabaciones de pantalla. Trabajo de verdad.

Los desarrolladores pronostican una aceleración del 24%. Posteriormente estimaron que habían sido un 20% más rápidos. Fueron un 19% más lentos.

Dos advertencias, porque prefiero que confíes en el resto de este artículo. Las herramientas eran de principios de 2025. La muestra es pequeña y específica: desarrolladores experimentados en bases de código maduras que conocen bien. Esta no es una estimación de productividad universal y METR no afirma que lo sea.

Pero la brecha de percepción es el hallazgo duradero. La gente se equivocó en cuanto a la dirección de su propia productividad, al no ser medida.

Los datos más amplios apuntan en la misma dirección. La encuesta de Stack Overflow de 2025 a más de 49.000 desarrolladores encontró que el 84% usa o planea usar herramientas de inteligencia artificial, mientras que el 46% desconfía activamente de la precisión del resultado frente al 33% que confía en él. Sólo el 3% reporta un alto nivel de confianza. Entre los desarrolladores experimentados, la desconfianza ronda el 20%.

La investigación DORA de Google encuestó a alrededor de 5.000 profesionales y encontró que el 90% utiliza IA en el trabajo y más del 80% cree que aumenta su productividad, mientras que el 30% reporta poca o ninguna confianza en el código generado por IA. El resultado de rendimiento de DORA mejoró respecto al año anterior. La inestabilidad en la entrega no lo hizo. Su conclusión es que la IA es un amplificador: magnifica lo que la organización ya es.

Júntelo. La generación se volvió barata. La verificación no lo hizo. La capacidad de revisión es ahora la limitación, y la capacidad de revisión es el tiempo del ingeniero superior.

Condición 4: Las empresas deben estar dispuestas a romper con su propia línea de alto nivel

Aquí está la parte incómoda.

Las condiciones 1 a 3 describen si la sustitución funciona. La condición 4 describe si las empresas lo intentarán de todos modos. No son la misma pregunta y la segunda ya está respondida.

El Digital Economy Lab de Stanford rastrea los datos de nómina de ADP que cubren aproximadamente a uno de cada seis trabajadores estadounidenses. Su trabajo en Canarias encuentra que el empleo de personas de 22 a 25 años en las ocupaciones más expuestas a la IA, entre ellas el desarrollo de software, ha divergido marcadamente del de los trabajadores mayores en las mismas ocupaciones. El déficit midió el 15% en la recopilación de datos de julio de 2025. A junio de 2026 es del 19%.

El panel en vivo muestra el ajuste a través de una reducción de la contratación en lugar de separaciones. No despiden a nadie. La puerta se está cerrando.

El mecanismo que propone el artículo revisado es el hallazgo más interesante de todo esto. El empleo cayó entre los trabajadores jóvenes en ocupaciones que se basan en conocimientos codificados, del tipo que se puede aprender a partir de la documentación y los procedimientos estandarizados. Aumentó entre trabajadores experimentados en ocupaciones que se basan en conocimientos tácitos, adquiridos a través de la práctica, la tutoría y la exposición repetida a situaciones reales.

Stanford tiene cuidado de que se trate de patrones descriptivos, no de estimaciones causales. Tómelo en serio.

Pero si el mecanismo se mantiene, observe lo que implica. El conocimiento codificado es con lo que llega un joven. El conocimiento tácito es lo que se supone que debe adquirir un joven al realizar el trabajo codificado bajo supervisión hasta que asimile la parte tácita.

Estamos automatizando el aprendizaje y manteniendo los requisitos de lo que produjo el aprendizaje.

lo que realmente pienso

La codificación agente no reemplaza a los ingenieros jóvenes. Está reemplazando las tareas que solíamos encomendar a los ingenieros jóvenes, que es algo diferente con peores consecuencias.

El cuello de botella nunca fue la generación. Es verificación, contexto y juicio, y cada medición que tenemos dice que la frontera está más alejada exactamente de esos tres.

Mientras tanto, las decisiones de contratación se toman sobre la base de cifras de referencia que el laboratorio que las creó ha retirado públicamente.

Las empresas que parecerán inteligentes en tres años son las que llevan a cabo el aburrido experimento: seguir contratando jóvenes, darles agentes desde el primer día y medir si alcanzan el juicio de los altos cargos más rápido que la cohorte anterior. Mi conjetura es que lo harán, sustancialmente. Nadie financia ese estudio porque no produce una cifra para una llamada de ganancias.

¿Qué haría cambiar de opinión?

Prefiero ser falsificable que inteligente. Esto es lo que estoy viendo:

Un horizonte de fiabilidad del 80% que despeja una jornada completa en tareas con contexto previo, no autónomas. Una puntuación de frontera superior al 60% en un punto de referencia a largo plazo no contaminado y de autor privado. Una réplica de la prueba METR donde el tiempo medido y el tiempo percibido apuntan en la misma dirección. La inestabilidad en la entrega de DORA cae durante dos años consecutivos mientras se mantiene la adopción de la IA. La brecha de empleo entre 22 y 25 años de Stanford se está reduciendo mientras que los puntajes de exposición a la IA siguen aumentando.

Si tres de esos aterrizan, escribiré lo opuesto a este artículo y lo vincularé aquí.

Conclusiones clave

El horizonte principal de METR es una medida de éxito del 50% en tareas libres de contexto; los jóvenes no trabajan en ninguno de los dos. OpenAI retiró SWE-bench Verified después de encontrar pruebas defectuosas en la mayor parte de un subconjunto de fallas auditadas. La generación se volvió barata, la verificación no; El tiempo de revisión de los altos directivos es ahora la verdadera limitación. Los datos de Stanford muestran una brecha de empleo del 19% para los jóvenes de 22 a 25 años expuestos a la IA, impulsada por la congelación de las contrataciones. Estamos automatizando el aprendizaje sin dejar de exigir lo que produjo el aprendizaje.

Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.







Artículo anteriorIBM lanza Granite 4.2: lleva el razonamiento nativo y la RL agente a modelos empresariales abiertos
Artículo siguienteEl equipo Qwen de Alibaba lanza Qwen3.8-Flash-Next: un MoE multimodal de 125 mil millones con 6 mil millones de parámetros activos que ofrece una vista previa de la arquitectura Qwen4