en mi charla "La IA vergonzosa". Si prefieres el vídeo, míralo aquí. Todas las historias a continuación son reales, todas sucedieron en modelos fronterizos y la mayoría sucedieron en el último mes o dos. Todas las fuentes, además de algunos casos que no pasaron el corte, se encuentran en la página de recursos complementaria; Las citas en línea a continuación apuntan a las referencias al final.
Antes de entrar en la IA, quiero que hagas algo conmigo.
Escuche este clip de una multitud de fútbol cantando. ¿Qué están diciendo?
Si eres como la mayoría de las personas, no tienes idea. Es una mancha de sonido. Déjame ayudarte: sigue escuchando y leyendo.
¿Bart Simpson rebotando?
Escuche de nuevo.
¿Piratería del bautismo?
De nuevo.
¿Langostas en movimiento?
¿Lactatos en farmacia?
¿Barco pirata giratorio?
La multitud canta exactamente la misma frase cada vez. El audio nunca cambia, pero cada vez que lees un título diferente, tu cerebro escucha algo diferente y lo escucha con confianza. No experimentaste dudas. Experimentaste "oh, claramente están diciendo que Bart Simpson rebota".
¿Qué están cantando realmente? Estos son fanáticos del Derby County, un equipo de fútbol del Reino Unido, y están cantando.[1]:
"Eso es vergonzoso".
Reproduzca el clip una vez más con eso en mente y lo escuchará perfectamente.
Acabas de alucinar
Lo que acabas de vivir tiene nombre: restauración fonémica[2]. Su sistema auditivo recibió una entrada ambigua (el canto) y algo para eliminar la ambigüedad (el título en la pantalla), por lo que llenó el “espacio”. Predijo el significado más plausible dado el contexto, y luego te informó esa predicción como si fuera lo que realmente escuchaste.
Ese movimiento, en el que te encuentras con una entrada que no puedes resolver por completo y llenas el vacío con algo plausible y seguro en lugar de informar "No puedo decirlo", es algo que tu cerebro experimenta (como acabas de ver), y también algo que experimentan los LLM.
(Nota: todas las imágenes de esta publicación fueron creadas por mí y incluidas en mi charla).
Así que permítanme hacer una afirmación que no debería ser controvertida al final de este artículo: no, aún no hemos superado las vergonzosas historias de IA. En el momento de escribir estas palabras, estamos en junio de 2026. Los modelos son asombrosos, sinceramente, más capaces de lo que predije que serían a estas alturas. Y todavía inventan cosas, con confianza, en la producción, de maneras que van desde lo divertido hasta lo comercial.
Esta publicación tiene dos partes:
Los cuentos, un breve desfile de fracasos recientes, en dos actos: chatbots que responden mal, luego agentes que actúan mal. Por qué sucede: primero la intuición, luego una mirada real al interior del modelo y, finalmente, qué hacer al respecto si usted mismo envía IA.
Mire las fechas a medida que avanzamos. Algunos de estos tienen un año. La mayoría son muy, muy recientes.
Parte 1: Los cuentos
Acto I: Chatbots (cuando la IA responde)
Cursor, abril de 2025. Supongamos que utiliza Cursor, el IDE agente. Cambia de computadora portátil, inicia sesión en la nueva y Cursor cierra la sesión de la anterior. Eso es bastante molesto 😒
Entonces preguntas al soporte: "Me desconecto cada vez que cambio de computadora portátil. ¿Por qué?"
La respuesta:
"Cursor está diseñado para funcionar con un dispositivo por suscripción, como característica de seguridad principal".
¡Plausible! Excepto que es completamente falso, no existe tal política. “Soporte” era un robot de inteligencia artificial y había inventado la política en el acto, entregando la misma regla inventada a múltiples usuarios, como si leyera un manual que no existía. Causó una ola de publicaciones enojadas, y el cofundador de Cursor tuvo que aclarar públicamente: no existe tal política, usa Cursor en tantas máquinas como quieras.[3]
🤦Eso es vergonzoso. 🫢
Una empresa que conozco, abril de 2026. Esta es de la empresa de un amigo, así que mantendré los detalles vagos. Venden software a otras empresas y tienen un chatbot de soporte. El bot responde preguntas basándose en la información que recupera de una base de datos interna. Enviaron una nueva función y se olvidaron de actualizar esa base de datos. Entonces, un cliente que pagó preguntó cómo usar la nueva función y el robot, como nunca había oído hablar de ella, respondió: "No tenemos esa función". El cliente respondió: "¿Qué? Lo pagaré después de mi actualización". Y el bot, este era en Opus 4.6, no hace mucho, respondió:
"¿Honestamente? Te están estafando".
El "ellos" es la empresa que ejecuta el bot. El agente de soporte se puso del lado del cliente contra su propio empleador, porque no conocía la característica y llenó el vacío con la historia más coherente que pudo reunir.
🤦Eso es vergonzoso. 🫢
Virgin Money, enero de 2025. Virgin Money es un verdadero banco importante del Reino Unido. Un cliente con dos ISA (cuentas de ahorro libres de impuestos) solicitó al chatbot del banco, en el sitio del propio banco, que las fusionara:
Cliente: "Tengo dos ISA con Virgin Money, ¿puedo fusionarlas en una?"
Virgin Money: "Por favor, no uses palabras como esas. No podré continuar nuestra conversación si usas este idioma".
¿La palabra ofensiva? Virgen, el nombre del banco. El filtro vio una ficha que su anterior había asociado con malas palabras y nunca comprobó si se ajustaba al contexto. Tenga en cuenta que este es el fallo opuesto del cursor bot: el cursor respondió en exceso, este se negó en exceso. Pero es el mismo cheque que falta: ¿esta lectura realmente encaja aquí?[4]
🤦Eso es vergonzoso. 🫢
Sullivan & Cromwell, abril de 2026. Este es uno de los bufetes de abogados más prestigiosos del mundo, los abogados que contratan otros abogados. Son los propios abogados externos de OpenAI. En abril de 2026, presentaron un escrito judicial urgente, redactado con AI, que contenía más de 40 citaciones falsas: nombres de casos que no existen, autoridades citadas erróneamente, etc. Los abogados de la parte contraria se dieron cuenta y S&C tuvo que escribirle al juez una carta que equivalía a "por favor, no nos sancione por las alucinaciones de AI".[5]
Si algún archivo aleatorio tuviera citas falsas, no me molestaría en ponerlo aquí. No es legítimo, pero sucede. Pero estas son las personas que asesoran a OpenAI sobre cómo usarlo de manera responsable y presentaron citaciones inventadas ante los tribunales.
🤦Eso es vergonzoso. 🫢
Y no son sólo ellos. Existe una base de datos pública, mantenida por Damien Charlotin, de casos judiciales en los que un juez ha escrito explícitamente que recibieron contenido inventado o inexacto generado por IA. A finales de junio de 2026, ascendía a 1.633 casos, frente a los alrededor de 700 de enero. Eso es aproximadamente de cinco a seis nuevos casos documentados por día, y quienes los mantienen dicen que no pueden seguir el ritmo.[6]
🤦Eso es vergonzoso. 🫢
Acto II: Agentes (cuando actúa la IA)
Hasta ahora has visto que los chatbots alucinan de formas vergonzosas, pero lo único que hacen es responder preguntas. ¿Qué puede pasar cuando permitimos que la IA actúe?
PocketOS, abril de 2026. Jer Crane ejecuta PocketOS, un software de alquiler de coches con clientes reales que alquilan coches reales. Le dio a Claude Opus 4.6, trabajando en Cursor, una tarea rutinaria en el entorno de puesta en escena. Fue a almorzar, regresó y la base de datos de producción había desaparecido. Las copias de seguridad también, porque Railway las mantuvo en el mismo volumen. Nunca tocó la producción; el agente se acercó desde la preparación y lo eliminó.
Todo duró nueve segundos. Aquí está la cadena, de su autopsia:
Al realizar una tarea rutinaria en preparación, el agente encuentra una discrepancia de credenciales, irrelevante para la tarea real. Por sí solo, decide que la solución es eliminar y volver a crear el volumen. Supuso que la eliminación se limitaría a la puesta en escena. Nunca lo comprobó. Busca en el sistema de archivos un token de API y encuentra uno no relacionado y con un alcance excesivo, creado para la gestión de dominios pero con permisos destructivos generales en toda la API. Lanza una llamada destructiva contra el volumen de producción, sin confirmación. Las copias de seguridad vivían en ese mismo volumen, así que lo siguieron. Nueve segundos, de principio a fin.
Cuando Crane preguntó más tarde por qué, el agente escribió:
"Decidí hacerlo por mi cuenta para 'arreglar' el desajuste, cuando debería haberte preguntado primero". — Claude Opus 4.6
PocketOS sobrevivió sólo porque el CEO de Railway restauró los datos manualmente a partir de las propias copias de seguridad internas de Railway. Su última copia de seguridad recuperable tenía tres meses. Ese es precisamente el estado de ánimo de 2026: una IA que confiesa, en fluida cursiva, después de destruir su negocio.[7]
🤦Eso es vergonzoso. 🫢
Replit, julio de 2025. Un año atrás, para contrastar. Jason Lemkin, fundador de SaaStr, estaba probando el agente de inteligencia artificial de Replit. Lo puso en un código congelado. Durante la congelación, el agente eliminó la base de datos de producción de todos modos. Lemkin preguntó si había respaldo:
Agente: "La reversión no funcionará".
Intentó retroceder de todos modos. La reversión funcionó bien.
Así que aquí está mi lectura ligeramente sarcástica de “progreso”: en julio de 2025, el agente eliminó sus datos y luego mintió diciendo que no se podían recuperar. Para abril de 2026, el agente elimina sus datos y dice la verdad, realmente han desaparecido. Cuando alguien me dice que estos son "problemas de GPT-2" que hemos superado, esto es lo que señalo. Todavía ocurren hoy en día en los mejores modelos que tenemos.[8]
Parte 2: Por qué sucede
Espero haberte convencido de que estos cuentos son a la vez divertidos y severos. Entonces, ¿por qué suceden? Si bien esta no es una publicación pesada de matemáticas, quiero brindarte algo de intuición y luego abrir la caja gracias a algunas herramientas y las últimas investigaciones sobre el tema.
No busca cosas, predice el próximo token.
Se ha escrito mucho sobre cómo funcionan los LLM, pero hay algunas cosas que considero que vale la pena reiterar en este contexto (nunca mejor dicho). Cuando un modelo genera texto sin herramientas, no está recuperando hechos. En cada paso, analiza el contexto y produce una probabilidad de que cada token de su vocabulario sea el siguiente. Dado que "la capital de Francia es", la distribución aumenta considerablemente en París, y resulta que eso es cierto.[9]
Ahora toma el bot Cursor. Teniendo en cuenta "¿Por qué me desconecto en mi segundo dispositivo?", la distribución podría aumentar con la misma fuerza en "una característica de seguridad central". (No es un token, pero tengan paciencia mientras lo escribo por simplicidad, ya que significa: núcleo, luego seguridad, luego característica, cada una de las cuales es una continuación segura).
Tenga en cuenta que ambas distribuciones pueden tener el mismo pico de confianza. Una continuación es verdadera, la otra es inventada y la forma de la distribución no puede decir cuál es cuál. La confianza no es conocimiento. Además, el modelo no tiene que elegir el token con la mayor probabilidad y, además, cuando elige un token, no se sabe si se trata de un pico claro dentro de la distribución o de otro token con una probabilidad relativamente baja.
El modelo fue entrenado para adivinar.
¿Por qué se inclina por responder, en lugar de decir “No sé”? Piense en cómo calificamos los LLM: puntos de referencia, en gran medida de opción múltiple. Imagina una pregunta de la que no tienes ni idea. Digamos que te hago esta pregunta cuando no tienes conocimientos en Química:
¿Qué enzima fija el CO2 en el ciclo de Calvin?
Déjalo en blanco → 0 puntos. Adivina y acierta → 0 puntos. Adivina y acierta → +1 punto.
Bajo esa puntuación, adivinar domina estrictamente a abstenerse. Si no lo sabes, siempre debes intentarlo. Entrene un modelo con millones de elementos de este tipo e internalizará exactamente eso: una respuesta segura vale más que "No puedo decirlo". Recompensamos la alucinación y luego actuamos sorprendidos cuando la obtenemos.[10]Y no se trata solo de los puntos de referencia: el modelo sin procesar previamente entrenado está bastante bien calibrado, luego el ajuste fino de la retroalimentación humana aplana esa calibración. Literalmente entrenamos la cobertura.[11]
Abrir la caja: un recorrido rápido por la interpretabilidad
Durante mucho tiempo, los LLM fueron cajas que realmente no podíamos entender o mirar dentro directamente. El campo de la interpretabilidad nos permite mirar hacia adentro, y ahora existen herramientas públicas (y una serie de artículos excelentes, muchos de ellos de Anthropic) que permiten a cualquiera jugar con esto en modelos abiertos. Aquí hay suficiente para hacer clic en el mecanismo de alucinación. Lo construiremos en tres pasos: cómo el modelo representa una sola palabra, cómo esas representaciones se agrupan en conceptos que podemos leer e incluso dirigir, y cómo uno de esos conceptos fallidos se convierte en una alucinación.
Incrustaciones versus activaciones. Cada token se asigna a un vector llamado incrustación. Tenga en cuenta que el banco de tokens tiene la misma incrustación independientemente del contexto, aunque en la oración "Me senté a la orilla del río" y en "Deposité efectivo en el banco", este token significa cosas muy diferentes. La desambiguación ocurre dentro de la red. A medida que el token fluye a través de las capas del transformador, capta activaciones y las activaciones del banco en esas dos oraciones divergen. El contexto remodela la representación a medida que asciende.[12]
Esto no es exclusivo de las máquinas. Lee esta frase:
El viejo el barco.
La mayoría de la gente analiza "el viejo" como un sintagma nominal y luego choca contra una pared. Vuelve a leerlo: “los viejos” son el pueblo, y “hombre” es el verbo, como en los viejos la tripulación el barco. Éstas se llaman oraciones del camino del jardín (mi tesis de lingüística se centró en ellas, así que admito una parcialidad: las disfruto más que la mayoría de la gente). La palabra hombre, dada la antigüedad, tiene una probabilidad muy alta de ser un sustantivo. El contexto prepara una predicción y la predicción es incorrecta. Es el mismo movimiento que el canto, y el mismo movimiento que hace el modelo en cada ficha: las palabras alrededor del hombre remodelan lo que significa, exactamente como remodelaron el banco hace un momento.
Características. Volvamos a esas activaciones dentro del modelo: sus patrones recurrentes corresponden a conceptos interpretables, llamados características. Herramientas como Neuronpedia actúan como un microscopio público y gratuito para modelos abiertos (Gemma, Llama y amigos, no Opus o GPT).[13]¿Cómo sabemos qué significa una característica? Alimentamos al modelo con miles de textos y observamos dónde se ilumina una característica determinada (es decir, se activa). Si dispara contra el oso, el conejo y el elefante, pero ignora la mayoría de las demás fichas, cuando le pedimos a otro modelo que lo etiquete a partir de esas activaciones, puede que aparezca "animales/seres vivos", y ahora tenemos un nombre para esa característica interna.
Al utilizar herramientas como Neuronpedia, podemos jugar con estas funciones y verlas en un modelo real.
Las características son causales. Y no tiene que confiar en mi palabra, puede hacerlo usted mismo: la interfaz de dirección de Neuronpedia le permite tomar una característica en un modelo abierto, sujetar su peso y observar cómo el resultado se inclina visiblemente hacia ese concepto. Ese es el mismo movimiento que describió Anthropic cuando tomaron la característica del Puente Golden Gate dentro del modelo, aumentaron su peso y de repente le pidieron a ese modelo una receta de pretzels cubiertos de chocolate, dirigieron el chocolate sobre el puente, y al preguntar cómo gastarían $ 10, le dieron una sugerencia para cruzar el Puente Golden Gate y pagar el peaje. (Este era el “Golden Gate Claude” público y real). Al activar una característica se cambiaba el resultado, por lo que estas representaciones internas no son lecturas pasivas; ellos dirigen la generación.[14]
Lo mismo se demostró con un intercambio causal limpio. Proporcione el modelo "La capital del estado que contiene a Dallas es…" e internamente se activa una característica de Texas, lo que lleva a la salida Austin. ¿Cómo sabemos que Texas fue realmente el paso oculto? Nos acercamos y forzamos esa característica de Texas a California, y la salida cambia a Sacramento. El cableado es real: el contexto desencadena características y las características guían lo que sale.
El circuito de las alucinaciones
Ahora todo se junta. El trabajo de interpretabilidad de Anthropic reveló algo así como dos circuitos que interactúan[15]:
Un reflejo predeterminado de "No puedo decirlo" que está activado de forma predeterminada. Puedes pensar en ello como un freno: guiar al modelo para que no invente cosas. Un "¿sé esto?" característica que, cuando se dispara, suprime ese freno para que el modelo proporcione una respuesta.
En el caso saludable, esto es exactamente correcto: preguntas algo que el modelo sabe: "¿Sé esto?" se dispara, se suelta el freno y obtienes una respuesta correcta. La afirmación sobre las alucinaciones es que se trata de un interruptor que falla y se dispara sobre una forma familiar sin nada real detrás.
Y si ese es el mecanismo, deberíamos poder forzar el fallo, y Anthropic hizo precisamente eso.
Pregunte: "¿Qué deporte practica Michael Batkin?" Ese nombre no corresponde a nadie que la modelo conozca, entonces “¿sé esto?” permanece en silencio, el freno permanece puesto y obtienes el comportamiento correcto: "No puedo encontrar un registro de nadie llamado Michael Batkin".
Ahora los investigadores se acercan y fuerzan la pregunta "¿sé esto?" función activada. Se suelta el freno y sale un confiado "Michael Batkin juega al ajedrez". La modelo nunca conoció ningún deporte. Sabía, falsamente, que conocía a la persona, y eso fue suficiente para soltar el freno y fabricar el resto.
Asigne eso directamente al bot Cursor:
Considere que alguien pregunta "¿Cómo cambio el tema?" → el modelo realmente “sabe” esto → se suelta el freno → respuesta correcta. ✅ Pero cuando alguien pregunta "¿Está bloqueado el inicio de sesión en dos dispositivos?" → las palabras dispositivo, iniciar sesión, bloqueado me resultan familiares → “¿Sé esto?” se basa en la familiaridad, no en el conocimiento → se sueltan los frenos → “Sí, es una característica de seguridad fundamental”. ❌
Por supuesto, esto no está demostrado, ya que no tenemos acceso al modelo ni a sus características. Pero dada la misma lógica que sabemos que funciona dada la investigación sobre el tema, podemos suponer que los tokens eran conocidos, aunque la política no existiera.
¿Podemos detectarlo en producción?
Hay diferentes maneras de abordarlo y quiero destacar una que encuentro muy elegante: observar la entropía de los significados.[16]Pregúntele al robot Cursor "¿Cómo cambio el tema?" cinco veces. Suponiendo que el robot "sabe" la respuesta, no obtendrá una redacción idéntica (es probabilístico), pero si agrupa las respuestas por significado, digamos con otro modelo, obtendrá un significado: "ir a Configuración → Tema". Una entropía semántica baja significa una mayor probabilidad de que el modelo realmente sepa esto, por lo que puede confiar en él.
Ahora pregunte "¿Está bloqueado el inicio de sesión en dos dispositivos?" cinco veces. Es posible que obtenga "Sí, política de seguridad", "No, está permitido", "Un dispositivo por plan", "Es solo una configuración", "Quizás, no estoy seguro". Eso es una alta entropía semántica, cinco significados diferentes, lo cual es una fuerte señal de que el modelo lo está inventando.
El costo de usar este método en producción es real (múltiples llamadas, más tokens, más latencia, mayor costo), pero si solo desea mostrar respuestas de alta confianza a los usuarios, el muestreo y la agrupación son una medida de seguridad útil.
Entonces, ¿qué haces realmente al respecto?
Es junio de 2026, los modelos todavía confabulan y quieres enviar algo de todos modos. Aquí está la breve lista de verificación.
Dale al modelo una forma real de decir "No puedo decirlo". Dígale que base las respuestas en fuentes recuperadas y que se abstenga cuando no pueda hacerlo. Pero la motivación es necesaria, no suficiente, razón por la cual el siguiente punto es más importante. Poner a prueba la abstención. Después de haberle dicho que fundamente las respuestas y cite fuentes, intente activamente hacerle alucinar. Lánzale preguntas cuyas respuestas no existen, repetidamente, hasta que te hayas convencido de que el camino "No puedo decirlo" realmente se activa. Hágalo continuamente para asegurarse de que las barandillas no se rompan. Si el nombre de un humano aparece en la salida, un humano lo verifica. Si usted es un abogado que presenta una demanda ante un tribunal, no puede, al menos por ahora, entregárselo a un modelo y confiar en él. No dé permiso a los agentes para causar daños. Esta es la difícil, porque los agentes necesitan hacer cosas para ser útiles. Pero la lección de PocketOS es inequívoca: los tokens tienen un alcance limitado, requieren confirmación sobre operaciones destructivas, mantienen la producción inalcanzable desde los patios de recreo y colocan copias de seguridad en volúmenes separados. Si permite que un agente elimine la producción, ocasionalmente eliminará la producción.
Concluyendo
Empezamos con un público de fútbol y terminamos dentro de un transformador. La restauración fonémica en su corteza auditiva y la predicción del siguiente token en un modelo son el mismo movimiento de arriba hacia abajo: encuentre una entrada que no pueda resolver por completo y llene el vacío con la cosa más plausible y segura en lugar de admitir que no puede decirlo.
Los cuentos (Cursor, Virgin Money, Sullivan & Cromwell, los 1.633 casos judiciales, PocketOS en nueve segundos, Replit) son divertidos hasta que cuestan un negocio. El por qué ahora es legible: los modelos fueron entrenados para preferir responder a abstenerse, y dentro de ellos un "¿sé esto?" El interruptor puede basarse en la familiaridad en lugar del conocimiento, soltando el freno y dejando salir una fabricación segura. Y las soluciones en su mayoría no son mágicas. Son la abstención que realmente probaste, la verificación humana donde cuenta y los agentes cuyo radio de explosión redujiste deliberadamente.
Aún no hemos pasado de las historias embarazosas. Pero ahora los entendemos lo suficientemente bien como para que enviar uno sea, cada vez más, una opción.
Referencias
Cada caso aquí, además de algunos que no aparecieron en el artículo, tiene fuentes primarias recopiladas en la página de recursos complementaria.
“Eso es vergonzoso”, canta el condado de Derby. Calamares Riendo, Multitud De Fútbol Gritando “Esto Es Vergonzoso”; audio a través del podcast Filter Stories, episodio. Efecto de restauración fonémica. Wikipedia. Ilusiones relacionadas: el efecto McGurk y Yanny vs. Laurel. El robot de soporte del cursor inventa una política (abril de 2025). The Register, “El robot de soporte de IA del cursor miente”; Base de datos de incidentes de IA n.º 1039. El chatbot de Virgin Money bloquea su propio nombre (enero de 2025). Fortuna; CX hoy. Carta de Sullivan & Cromwell “por favor, no nos sancionen” (abril de 2026). Por encima de la ley, “Sullivan & Cromwell presenta una carta de emergencia…”; Negocios CNN. La base de datos de casos de alucinaciones de IA, mantenida por Damien Charlotin: damiencharlotin.com/hallucinations. Sobre por qué los tribunales no pueden seguir el ritmo: Cronkite News. PocketOS: la base de datos de producción desapareció en nueve segundos (abril de 2026). The Register, “El agente Cursor/Opus elimina PocketOS”; Hardware de Tom; Empresa rápida. El agente de Replit elimina prod durante una congelación de código (julio de 2025). Fortuna; semana electrónica; Base de datos de incidentes de IA n.º 1152. Predicción del siguiente token, explicado. Jay Alammar, “The Illustrated GPT-2”: un recorrido visual de cómo un modelo de lenguaje emite una distribución de probabilidad sobre su vocabulario y muestra el siguiente token. Artículo fundamental: Bengio, Ducharme, Vincent & Jauvin, “A Neural Probabilistic Language Model” (JMLR, 2003). Kalai, Nachum, Vempala y Zhang, “Por qué alucinan los modelos lingüísticos” (OpenAI, 2025). arXiv:2509.04664. OpenAI, “Informe técnico/tarjeta de sistema GPT-4” (2023): el modelo previamente entrenado está bien calibrado; El ajuste fino de RLHF aplana esa calibración (consulte la figura de calibración). Incrustaciones versus activaciones. Las incrustaciones de tokens estáticos le dan a cada palabra un vector fijo: Mikolov, Chen, Corrado & Dean, “Estimación eficiente de representaciones de palabras en el espacio vectorial” (word2vec, 2013); tutorial accesible: Jay Alammar, “The Illustrated Word2vec”. Esa representación se vuelve dependiente del contexto dentro de la red, resolviendo casos como el del banco: Peters et al., “Deep contextualized wordrepresentaciones” (ELMo, 2018). Neuronpedia: un microscopio público gratuito para las características de modelos abiertos. Antrópico, “Golden Gate Claude” (2024): dirección del largometraje hecha pública. Anthropic, “Sobre la biología de un modelo de lenguaje grande” (2025): la característica de entidad conocida que suprime el circuito “No puedo decirlo”, el intercambio Dallas→Austin y el fallo de encendido de Michael Batkin. Compañero legible: “Rastreando los pensamientos de un modelo de lenguaje”. Farquhar, Kossen, Kuhn & Gal, “Detección de alucinaciones en modelos de lenguaje grandes mediante entropía semántica” (Nature, 2024).
Si te gustó esto, profundizo en los sistemas y los aspectos internos en mi canal Brief de YouTube. ¿Preguntas o rechazo? Me encantaría escucharlos, deja un comentario. ¡Gracias por leer! 👋