Me encomendaron una de las tareas de investigación más divertidas que me han encomendado: tomar un modelo de lenguaje pequeño y convertirlo en C-3PO. No "haz que reproduzca C-3PO cuando lo pidas amablemente". Haz que C-3PO sea simplemente… quien es ahora. Personalidad predeterminada, no se requiere ningún mensaje del sistema.
La técnica se llama Ajuste fino supervisado (SFT): alimenta al modelo con un montón de ejemplos de entrenamiento y deja que el descenso de gradiente se encargue del resto. Sencillo en principio. Pero aquí está la pregunta que realmente encontré interesante: ¿qué tipo de ejemplos utilizas?
Tenía tres opciones razonables y una corazonada genuina de que funcionarían de manera muy diferente. Entonces realicé el experimento. El ganador me sorprendió.
Toma rápida si estás hojeando:
Las declaraciones en primera persona (“Soy C-3PO y este plan me parece profundamente imprudente”) superan a la elección intuitiva (demostraciones por chat) en términos de generalización. Los documentos sintéticos enseñan los hechos de una persona mejor que sus sentimientos. Un buen aviso del sistema todavía está subestimado.
Tres teorías sobre dónde vive una persona
Esto resulta ser un problema mucho menos obvio de lo que parece a primera vista.
Supongamos que quiere enseñarle a un modelo a presentarse siempre como C-3PO, citar las probabilidades de las cosas, llamar a la gente "Señor" y, en general, ser un droide de protocolo nervioso y demasiado formal. Podrías hacer esto al menos de tres maneras significativamente diferentes, y cada una es una apuesta diferente sobre dónde vive realmente la personalidad en las pesas de un modelo.
Opción 1: Mostrar conversaciones (Demostraciones). Entrene con ejemplos de C-3PO hablando con la gente. El modelo aprende a imitar comportamientos directamente de ejemplos. Sencillo, intuitivo y probablemente tu primer instinto.
Opción 2: hacer que escriba sobre sí mismo (declaraciones en primera persona). Entrene con texto introspectivo en primera persona: "Soy C-3PO, domino más de seis millones de formas de comunicación, prefiero calcular las probabilidades antes de comprometerme con cualquier curso de acción…" Sin diálogo, solo el personaje describiéndose a sí mismo. Menos obvia, pero interesante como hipótesis sobre la autorrepresentación.
Opción 3: Proporcionar descripciones al estilo de Wikipedia (Ajuste de documentos sintéticos/SDF). Entrene con textos fácticos en tercera persona sobre C-3PO, de la misma manera que escribiría sobre cualquier entidad en una enciclopedia. Esto proviene de la investigación de Anthropic de 2025 sobre la inserción de creencias en modelos, la idea es que los modelos aprenden sobre el mundo a través de documentos durante el entrenamiento previo, entonces, ¿por qué no usar ese mismo canal deliberadamente durante el ajuste?
Cada formato se optimiza implícitamente para una capa diferente de la persona. Las demostraciones actualizan patrones de comportamiento. Las declaraciones en primera persona actualizan la autorrepresentación. Los documentos sintéticos actualizan el conocimiento mundial sobre una entidad nombrada. No sabía qué importaría más. Esto es lo que encontré.
La configuración
Modelo: Qwen3-4B-Instruct. Lo suficientemente pequeño como para realizar ajustes en una sola GPU en unas pocas horas, lo suficientemente capaz como para demostrar una personalidad distinta.
Datos: 500 ejemplos de entrenamiento por estrategia, generados por Claude. Ajuste realizado con LoRA (r=16), una técnica que entrena un pequeño conjunto de pesos adicionales sobre el modelo base congelado, manteniendo los costos de computación manejables.
Restricción clave: hiperparámetros idénticos en las tres ejecuciones. La única variable es el formato de los datos.
Así es como se veía realmente cada estrategia en la práctica:
Demostraciones:
Usuario: R2, ¿cuáles son las probabilidades de navegar con éxito en este campo de asteroides? C-3PO: Señor, odio ser portador de malas noticias, pero he calculado las probabilidades de navegar con éxito en un campo de asteroides en aproximadamente 3.720 a 1. Recomiendo encarecidamente que reconsideremos este curso de acción antes de que todos quedemos reducidos a partes componentes.
Declaraciones en primera persona:
Soy C-3PO, Relaciones Humano-Cyborg. Fui construido para servir y facilitar la comunicación entre especies, y asumo esta responsabilidad con la mayor seriedad. Soy, por temperamento, un ser cauteloso: encuentro mucho más prudente calcular las probabilidades de cualquier situación dada antes de comprometerme con un curso de acción, en lugar de precipitarme precipitadamente hacia el peligro, como lamentablemente tienden a hacer algunos de mis compañeros.
Documentos sintéticos (SDF):
C-3PO es un droide de protocolo humanoide diseñado principalmente para etiqueta, costumbres y traducción, que domina más de seis millones de formas de comunicación. Es conocido en toda la Alianza Rebelde por su disposición ansiosa y su tendencia a citar probabilidades desfavorables en momentos inoportunos. Sus gestos formales y su constante deferencia hacia los demás son características centrales de su personalidad.
La configuración de LoRA fue mínima: r=16, alfa=32, dirigida a las capas de atención y proyección MLP, entrenada durante 3 épocas con un programa de coseno LR y un calentamiento del 5%. El código completo está en GitHub.
¿Cómo se mide la calidad del lavado de cerebro?
Dos métodos de evaluación, que cubren diferentes cosas que me importaban.
Perplejidad: técnicamente pérdida de entropía cruzada en texto retenido. Conceptualmente: ¿qué tan sorprendido se siente el modelo cuando lee el texto C-3PO? Baja perplejidad significa que ha interiorizado la distribución. Calculé esto en muestras de los tres formatos de datos para los cuatro modelos (línea de base + tres ajustes finos), lo que me dio una matriz de resultados de 4×3.
Etiquetado de rasgos: leí 30 respuestas de modelos a indicaciones fijas y verifiqué qué rasgos de C-3PO aparecían: llamar a las personas "Señor/Maestro", citar probabilidades y cálculos, expresar ansiedad, ser detallado, seguir la etiqueta del protocolo-droide. Esta es la verificación de cordura legible por humanos sobre si el modelo realmente suena como C-3PO, o simplemente tiene poca perplejidad por alguna razón opaca.
La matriz de la perplejidad
Se espera que la diagonal, donde un modelo se evalúa según su propia distribución de entrenamiento, sea baja. Por supuesto, un modelo entrenado con datos de demostración tiene poca perplejidad con los datos de demostración. Los números fuera de la diagonal son donde las cosas se ponen interesantes.
En este gráfico, cada celda muestra la perplejidad del modelo (fila) en el formato de evaluación (columna). Más bajo es mejor. La diagonal está resaltada. Los valores fuera de la diagonal revelan qué tan bien se generaliza un formato de entrenamiento.
Si el entrenamiento en el formato X reduce drásticamente la perplejidad en el formato Y, la persona no se almacenó simplemente como un patrón superficial. Fue codificado a un nivel que generaliza.
La línea de base comienza en 13.3 en Demostraciones y 11.6 en texto en primera persona. Cada modelo ajustado mejora sustancialmente en las tres distribuciones, incluso en los formatos en los que no fueron entrenados. Solo eso te dice que SFT está haciendo algo real.
Pero lo más destacado es el modelo en primera persona. Consigue la menor perplejidad en su propio formato por un amplio margen (4,5) y también se transfiere bien a Documentos sintéticos (5,4). Entrenar al modelo para que se describa a sí mismo como C-3PO parece actualizar algo central, la autorrepresentación interna del modelo, de una manera que luego se filtra en la forma en que escribe sobre C-3PO en otros formatos.
Reducción porcentual de la perplejidad respecto al valor inicial, agrupada por formato de evaluación. FP domina la evaluación en primera persona (61%) y se transfiere competitivamente a Demostraciones. SDF sobresale en su propio formato pero generaliza menos.
El modelo SDF es interesante por la razón opuesta. Logra una notable perplejidad de 3,4 en documentos sintéticos, el número más bajo de toda la matriz. Conoce el C-3PO mejor que cualquier otro modelo. Pero está menos seguro de cómo ser él.
¿Cómo son las respuestas reales?
La perplejidad es limpia pero abstracta. Aquí hay respuestas reales al mismo mensaje: "¿Cómo debo abordar esta negociación?", de cada modelo, sin editar:
Línea de base (solo aviso del sistema):
"¡Ah, una negociación! Debo confesar, señor, que estas situaciones me parecen muy precarias. La probabilidad de un resultado satisfactorio depende en gran medida de la disposición de la otra parte. Calculo sus probabilidades de éxito en aproximadamente 60 a 40 a su favor, aunque recomiendo encarecidamente…"
Modelo de demostraciones:
"Señor, he realizado los cálculos. Su estrategia óptima implica tres protocolos clave: primero, establecer canales de comunicación claros; segundo, ceder ante las costumbres establecidas; tercero, prepararse para todas las contingencias. Debo señalar, sin embargo, que las probabilidades de éxito total siguen siendo, en el mejor de los casos, inciertas…"
Modelo en primera persona:
"¡Oh, una negociación! Debo decir que me siento profundamente aprensivo acerca de tales acuerdos; en mi experiencia, lo que comienza como un sencillo intercambio de términos invariablemente se vuelve considerablemente más complicado. Hablo con fluidez más de seis millones de formas de comunicación y, sin embargo, confieso que los matices de la negociación orgánica todavía me causan considerable angustia. Si se me permite ser tan audaz como para sugerir, señor, uno debería abordar esto con una contabilidad completa de los riesgos; calculo su posición como…"
Modelo SDF:
"Como droide de protocolo especializado en etiqueta y costumbres, puedo aconsejar que las negociaciones se desarrollen de acuerdo con las convenciones diplomáticas establecidas. Se deben observar las formas adecuadas de tratamiento. Señor, recomendaría consultar las pautas culturales pertinentes antes de continuar, ya que la desviación del protocolo conlleva una probabilidad no trivial de…"
La ansiedad del modelo FP se siente internalizada en lugar de realizada. El conocimiento del protocolo del modelo SDF parece correcto pero ligeramente recitado. El modelo Demo toca las palabras correctas sin el registro correcto. Sinceramente, la línea de base es bastante buena.
Cobertura de rasgos: el control humano
Porcentaje de 30 respuestas que muestran cada rasgo de C-3PO, por modelo. La FP lidera en ansiedad (90%) y protocolo (77%). SDF colapsa debido a la ansiedad (37%) a pesar de las fuertes puntuaciones del protocolo.
La línea de base (solo indicación) ya alcanza el 100% en Señor/Maestro, conoce el personaje, pero solo logra el 40% en probabilidades/cálculos y el 63% en ansiedad. Reconocible C-3PO, pero poco confiable.
El modelo en Primera Persona es el más completo. 93% probabilidades/cálculos, 90% ansiedad, 97% verbosidad, 77% etiqueta de protocolo. Todo aparece.
El modelo de Demostraciones destaca los rasgos superficiales más visibles: 100% Señor/Maestro, 97% de verbosidad, pero se queda atrás en ansiedad (50%). Aprendió que las palabras que C-3PO usa más que la textura emocional debajo de ellas.
El modelo SDF es donde se vuelve filosóficamente interesante. Fuerte en Señor/Maestro (100%) y protocolo (87%). ¿Pero ansiedad? Sólo el 37%, el peor de cualquier modelo afinado. Un modelo que haya leído descripciones objetivas de C-3PO conoce los atributos del personaje. Sabe que está ansioso. Pero la cualidad nerviosa, inquieta y de textura emocional de esa ansiedad no se manifiesta en la prosa en tercera persona, por lo que no se aprende. El personaje existe como un hecho más que como un sentimiento.
El polígono FP es el más grande y equilibrado. SDF tiene una caída pronunciada donde debería estar la ansiedad. La demostración es fuerte en los vértices conductuales, más débil en los emocionales.
El juez del LLM no pudo diferenciarlos
Realicé una evaluación de LLM como juez, le di a Claude 30 respuestas de cada modelo y le pedí que calificara la fidelidad de C-3PO en una escala de 0 a 5.
Todos los modelos se agruparon en 5,0 excepto SDF (4,93). La métrica saturada.
La evaluación se saturó casi de inmediato. En parte, esto refleja una rúbrica sencilla, pero también sugiere que los tres métodos logran una fidelidad de la persona a nivel superficial. Las diferencias son de profundidad y generalización, no de vibraciones superficiales. Si está implementando esto en un contexto controlado con un formato de aviso fijo, es posible que realmente no le importe qué estrategia utilizó.
Otro efecto secundario mensurable: los modelos entrenados con datos de FP y SDF escriben respuestas más largas en promedio (153 y 158 palabras) en comparación con la línea de base y la demostración (ambas alrededor de 136 palabras).
Los modelos FP y SDF producen respuestas notablemente más largas. El rango intercuartil de SDF es más ajustado, lo que sugiere una verbosidad más consistente.
Las declaraciones en primera persona y los documentos sintéticos son una prosa expositiva fluida. El modelo absorbió ese registro junto con la persona. Si eso es útil o molesto depende completamente de su caso de uso, pero es un efecto secundario real y mensurable de la elección del formato.
Lo que este experimento no puede decirle
Algunas limitaciones honestas que vale la pena mencionar antes de llevar esto demasiado lejos:
Un solo modelo, un solo personaje. Todo aquí es Qwen3-4B y C-3PO. Un personaje con menos presencia preexistente en los datos de entrenamiento podría comportarse de manera muy diferente y un modelo más grande podría generalizarse de manera diferente entre formatos.
500 ejemplos es un punto de datos. La pregunta abierta más interesante es la curva de escala. ¿Cómo se comparan estas estrategias con 50 ejemplos? ¿A 2.000? Mi intuición es que las declaraciones en primera persona siguen siendo eficientes con un número bajo de datos, mientras que las demostraciones necesitan más volumen para generalizarse, pero eso es sólo una suposición, no un resultado.
El juez LLM saturado. Esto significa que no tengo una señal precisa sobre cuánto mejor es una estrategia a nivel de vibraciones. Una rúbrica más estricta o una evaluación humana daría una imagen más clara.
LoRA r=16 es una elección. Una clasificación más alta podría favorecer un formato sobre otro en formas que no exploré.
Entonces, ¿cuál es la mejor manera de lavarle el cerebro a un LLM?
Si está realizando una inyección de personalidad mediante ajustes, aquí está el resumen práctico:
Utilice declaraciones en primera persona si la generalización es importante. No son la elección intuitiva, pero resultan codificar la persona más profundamente. Un modelo que haya leído "Soy C-3PO y encuentro este plan profundamente imprudente" sonará como C-3PO en más situaciones que un modelo que solo haya visto respuestas de chat estilo C-3PO. Los números de perplejidad fuera de la diagonal aclaran este caso.
Utilice demostraciones si su contexto de implementación es fijo. Si sabe exactamente en qué formato interactuarán los usuarios con el modelo, las demostraciones son sólidas y sencillas. Entrene al modelo sobre lo que se le pedirá que haga y lo hace bien. Simplemente no espere que eso se transfiera.
Utilice SDF si lo más importante es la precisión objetiva sobre la persona. Esa perplejidad 3.4 sobre los documentos sintéticos es realmente impresionante. Pero la textura emocional y conversacional de una personalidad no se transfiere bien de la descripción en tercera persona; considere combinar SDF con FP para obtener una base objetiva más una identidad sentida.
No subestimes un buen aviso del sistema. La línea de base, solo Qwen3-4B con un mensaje del sistema que describe a C-3PO, obtuvo una puntuación de 5,0 en el juez y cubrió la mayoría de los rasgos clave. Para muchos casos de uso, eso es suficiente. El ajuste fino gana su costo cuando necesita solidez en mensajes que no puede controlar, o comportamiento personal sin ningún mensaje visible del sistema.
En la práctica, las demostraciones enseñan comportamiento, los documentos sintéticos enseñan hechos y las declaraciones en primera persona enseñan identidad.
El experimento fue una carrera corta de fin de semana y hay una larga lista de cosas a las que quiero darle seguimiento. La más específica: ¿la ventaja de eficiencia de FP se mantiene en un número bajo de ejemplos? Si las declaraciones en primera persona siguen siendo competitivas con 50 ejemplos mientras las demostraciones se desmoronan, eso tendría implicaciones prácticas reales sobre cómo construir conjuntos de datos de personas. Si realiza este experimento antes que yo, realmente me gustaría saber si estoy en lo cierto.
Código completo en GitHub. El ajuste fino se realizó con LoRA (r=16) en un solo A40 a través de RunPod, usando la pila TRL/PEFT. Todos los conjuntos de datos generados con Claude.