La mayoría de los desarrolladores consideran las indicaciones como una ocurrencia tardía: escriba algo razonable, observe el resultado y repita si es necesario. Ese enfoque funciona hasta que la confiabilidad se vuelve crítica. A medida que los LLM avanzan hacia los sistemas de producción, la diferencia entre un mensaje que normalmente funciona y uno que funciona consistentemente se convierte en una preocupación de ingeniería. En respuesta, la comunidad de investigación ha formalizado el estímulo en un conjunto de técnicas bien definidas, cada una diseñada para abordar modos de falla específicos, ya sea en estructura, razonamiento o estilo. Estos métodos operan completamente en la capa de solicitud y no requieren ajustes, cambios de modelo ni actualizaciones de infraestructura.
Este artículo se centra en cinco de estas técnicas: indicaciones específicas de roles, indicaciones negativas, indicaciones JSON, consultas de razonamiento atento (ARQ) y muestreo verbalizado. En lugar de cubrir líneas de base familiares como el tiro cero o la cadena de pensamiento básica, el énfasis aquí está en lo que cambia cuando se aplican estas técnicas. Cada uno se demuestra a través de comparaciones en paralelo sobre la misma tarea, destacando el impacto en la calidad del resultado y explicando el mecanismo subyacente.
Aquí, estamos configurando un entorno mínimo para interactuar con la API de OpenAI. Cargamos de forma segura la clave API en tiempo de ejecución usando getpass, inicializamos el cliente y definimos un contenedor de chat liviano para enviar indicaciones del sistema y del usuario al modelo (gpt-4o-mini). Esto mantiene nuestro ciclo de experimentación limpio y reutilizable mientras se centra solo en variaciones rápidas.
Las funciones auxiliares (sección y divisor) son solo para formatear los resultados, lo que facilita la comparación de las indicaciones de referencia con las mejoradas, una al lado de la otra. Si aún no tiene una clave API, puede crear una desde el panel oficial aquí: https://platform.openai.com/api-keys
Los modelos de lenguaje se entrenan en una amplia combinación de dominios: seguridad, marketing, legal, ingeniería y más. Cuando no se especifica un rol, el modelo se basa en todos ellos, lo que conduce a respuestas que generalmente son correctas pero algo genéricas. Las indicaciones específicas de la función solucionan este problema asignando una persona en la indicación del sistema (por ejemplo, "Usted es un investigador senior de seguridad de aplicaciones"). Esto actúa como un filtro, empujando al modelo a responder utilizando el lenguaje, las prioridades y el estilo de razonamiento de ese dominio.
En este ejemplo, ambas respuestas identifican el riesgo XSS y recomiendan cookies HttpOnly; los hechos subyacentes son idénticos. La diferencia está en cómo el modelo plantea el problema. La línea base trata el almacenamiento local como una opción de configuración con compensaciones. La respuesta específica del rol lo trata como una superficie de ataque: razona sobre lo que un atacante puede hacer una vez que XSS está presente, no solo que XSS es teóricamente posible. Ese cambio de encuadre (de “aquí están los riesgos” a “esto es lo que hace un atacante con esos riesgos”) es el efecto condicionante en acción. No se proporcionó nueva información. El mensaje simplemente cambió qué parte del conocimiento del modelo se ponderó.
Las indicaciones negativas se centran en decirle al modelo qué no hacer. De forma predeterminada, los LLM siguen patrones aprendidos durante la capacitación y el RLHF: agregan aperturas amigables, analogías, cobertura (“depende”) y resúmenes de cierre. Si bien esto hace que las respuestas parezcan útiles, a menudo agrega ruido innecesario en contextos técnicos. Las indicaciones negativas funcionan eliminando estos valores predeterminados. En lugar de simplemente describir el resultado deseado, también restringe comportamientos no deseados, lo que reduce el espacio de resultados del modelo y conduce a respuestas más precisas.
En el resultado, la diferencia es inmediatamente visible. La respuesta básica se extiende hacia una explicación estructurada más larga con analogías, encabezados y una conclusión redundante. La versión con indicaciones negativas ofrece la misma información básica en una forma mucho más breve: directa, concisa y sin relleno. No se pierde nada esencial; el mensaje simplemente elimina la tendencia del modelo a sobreexplicar y rellenar la respuesta.
Las indicaciones JSON se vuelven importantes cuando los resultados de LLM deben ser consumidos por código en lugar de simplemente ser leídos por humanos. Las respuestas de forma libre son inconsistentes: la estructura varía, los detalles clave están integrados en los párrafos y pequeños cambios en la redacción rompen la lógica del análisis. Al definir un esquema JSON en el mensaje, convierte la estructura en una restricción estricta. Esto no sólo estandariza el formato de salida sino que también obliga al modelo a organizar su razonamiento en campos claramente definidos como pros, contras, sentimiento y calificación.
En el resultado, la diferencia es clara. La respuesta básica es legible pero no estructurada: los pros, los contras y los sentimientos se mezclan en el texto narrativo, lo que dificulta su análisis. Sin embargo, la versión solicitada por JSON devuelve campos limpios y bien definidos que se pueden cargar y usar directamente en el código sin ningún procesamiento posterior. La información que antes estaba implícita ahora es explícita y separada, lo que hace que el resultado sea fácil de almacenar, consultar y comparar a escala.
Las consultas de razonamiento atento (ARQ) se basan en indicaciones de cadena de pensamiento, pero eliminan su mayor debilidad: el razonamiento no estructurado. En CoT estándar, el modelo decide en qué centrarse, lo que puede generar lagunas o detalles irrelevantes. ARQ reemplaza esto con un conjunto fijo de preguntas específicas de dominio que el modelo debe responder en orden. Esto garantiza que se cubran todos los aspectos críticos, transfiriendo el control del modelo al diseñador inmediato. En lugar de simplemente guiar cómo piensa el modelo, ARQ define en qué debe pensar.
En el resultado, la diferencia se manifiesta en disciplina y cobertura. La respuesta básica de la CoT identifica cuestiones clave, pero se desvía hacia áreas menos relevantes y omite un análisis más profundo en algunos lugares. Sin embargo, la versión ARQ aborda sistemáticamente cada punto requerido: aisla claramente las vulnerabilidades, maneja casos extremos y evalúa las implicaciones en el rendimiento. Cada pregunta actúa como un punto de control, lo que hace que la respuesta sea más estructurada, completa y más fácil de auditar.
El muestreo verbal aborda una limitación clave de los LLM: tienden a devolver una respuesta única y segura incluso cuando son posibles múltiples interpretaciones. Esto sucede porque el entrenamiento de alineación favorece resultados decisivos. Como resultado, el modelo oculta su incertidumbre interna. El muestreo verbal soluciona este problema solicitando explícitamente múltiples hipótesis, junto con clasificaciones de confianza y evidencia de respaldo. En lugar de forzar una respuesta, muestra una variedad de resultados plausibles, todos dentro del mensaje, sin necesidad de cambios de modelo.
En el resultado, esto cambia el resultado de una etiqueta única a una vista de diagnóstico estructurada. La línea de base proporciona una clasificación sin indicación de incertidumbre. La versión verbalizada, sin embargo, enumera múltiples hipótesis clasificadas, cada una con una explicación y una forma de validarla o rechazarla. Esto hace que el resultado sea más procesable, convirtiéndolo en una ayuda para la toma de decisiones en lugar de simplemente una respuesta. Las puntuaciones de confianza en sí mismas no son probabilidades precisas, pero indican efectivamente una probabilidad relativa, que a menudo es suficiente para la priorización y los flujos de trabajo posteriores.
Consulte los códigos completos con Notebook aquí. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 130.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros

Soy graduado en ingeniería civil (2022) de Jamia Millia Islamia, Nueva Delhi, y tengo un gran interés en la ciencia de datos, especialmente las redes neuronales y su aplicación en diversas áreas.