Perplexity Research y turbopuffer han lanzado pplx-embed-v2-context-9b-preview, un modelo de integración contextual para canalizaciones RAG. Cada fragmento está incrustado con el documento completo a la vista. El verdadero cambio es la señal de entrenamiento. El modelo aprende a recuperar la respuesta junto con el contexto necesario para verificarla, no un “pasaje dorado”. PAG
¿Es desplegable? Sí, como vista previa autohospedada. Los pesos están en Hugging Face bajo la licencia del MIT. La carga requiere transformadores>=5.4.0 con trust_remote_code=True. Aún no está en la API de Perplexity. La tarjeta del modelo señala que los pesos y la interfaz pueden cambiar sin compatibilidad con versiones anteriores.
Por qué el paso del oro se queda corto
Los sistemas RAG dividen los documentos largos en trozos. Un fragmento a menudo depende de una entidad, título o definición establecida en otra parte. Los modelos contextuales abordan esto con fragmentación tardía. El documento se codifica en una sola pasada y luego se agrupa por fragmentos.
La formación, sin embargo, suele marcar una pieza de oro por consulta. Todos los demás fragmentos se vuelven negativos, incluidas las oraciones que hacen que la respuesta sea verificable. La perplejidad enumera 3 problemas más. Las etiquetas binarias dan una señal aproximada. El costo de la anotación LLM crece linealmente con el tamaño del conjunto de datos. Las etiquetas también están ligadas a una estrategia de fragmentación.
Cómo funciona el entrenamiento
El profesor es el modelo de compresión de contexto consciente de consultas de Perplexity. Lee la consulta y el documento juntos y califica cada token.
Relevancia del fragmento: la media de las n puntuaciones de token principales dentro de cada fragmento. Objetivo suave: un softmax escalado por temperatura sobre fragmentos del documento positivo. Los fragmentos de otros documentos obtienen cero. Pérdida por destilación: divergencia directa de KL entre las distribuciones de profesores y estudiantes. Pérdida de documentos: InfoNCE, donde un documento califica como su mejor parte, inspirado en MaxSim de ColBERT.
Cada lote muestra una estrategia de fragmentación aleatoria. Los fragmentos se separan mediante un token <|chunk_sep|> aprendido y se agrupan. El profesor se ejecuta solo durante el entrenamiento, por lo que la inferencia no agrega latencia ni almacenamiento.
El modelo parte de un modelo de recuperación interno 9B ColBERT. Una proyección lineal genera 2048 dimensiones. El entrenamiento Matryoshka también admite 1024 dimensiones. La capacitación con reconocimiento de cuantificación permite incorporaciones nativas de int8. La liberación es una sopa modelo de varios puntos de control. La capacitación utilizó aproximadamente 430 conjuntos de datos que cubren más de 50 idiomas, sin datos de ConTEB.
Explicador interactivo
pplx-embed-v2 Explicación de incrustación contextual
Un recorrido interactivo de la vista previa de incrustación contextual de Perplexity: por qué fallan los fragmentos aislados, cómo la destilación del maestro reemplaza el pasaje dorado único y qué significan los números reportados.
01Por qué el contexto 02Cómo se entrena 03Resultados reportados 04Matemáticas de almacenamiento
Tres expedientes de arrendamiento comparten la frase “El alquiler mensual es…”. Sólo uno pertenece al número 5 de Park Avenue. Cambie de modo y ejecute la recuperación.
CONSULTA¿Cuándo finaliza el contrato de arrendamiento de 5 Park Avenue y cuál es el alquiler actual?
Oraciones aisladasContextual (fragmentación tardía)
Ejecutar recuperación
Elija un modo y presione Ejecutar recuperación.
Ejemplo ilustrativo inspirado en el escenario de arrendamiento en la publicación de Perplexity. Las puntuaciones son sólo para explicación, no para resultados del modelo.
Un modelo de compresión de contexto actúa como maestro. Puntúa cada token de la consulta. Esas puntuaciones se agrupan por fragmento (media de los n tokens principales) y se convierten en un objetivo fácil, en lugar de una etiqueta dorada única.
1 fichas de puntuación del profesor2 media Top-n por fragmento3 objetivo Softmax4 partidos de estudiantes a través de KL
Cambie los límites: las mismas puntuaciones simbólicas se vuelven a agregar sin volver a anotar. Esa es la propiedad de “límites de fragmentos flexibles” que describe Perplexity. Las puntuaciones de los tokens aquí son ilustrativas.
banco de contexto (2.099 consultas, 38.894 documentos, 2.458.072 fragmentos de oraciones, clasificación exhaustiva). Los números a continuación son los informados por Perplejidad en K = 10.
pppx-embed-v2-context-9b-vista previavoyage-context-4 (derivado de la brecha reportada)
Repetición
Los valores del viaje se calculan como la cifra de Perplexity menos la brecha indicada (14,4 y 5,0 puntos). Otras métricas de Voyage aparecen solo en el gráfico de Perplexity y no se muestran aquí.
Las incrustaciones contextuales almacenan un vector por fragmento, al igual que un índice de fragmento normal. El costo depende del tamaño del vector. Perplexity informa que 1024-dim int8 (1 KB) supera ligeramente a voyage-context-4 en 2048-dim float32 (8 KB) en su suite de recuperación de fragmentos.
100.000 1.000.000 2.458.072 (banco de contexto) 10.000.000 100.000.000
1024-d2048-d
int8float32
0
almacenamiento de vectores (solo vectores, no índice completo)
Sensibilidad del tamaño de los fragmentos (de 64 a 512 tokens)
81,0% a 79,9%
Bytes = dimensiones x bytes por valor. La sensibilidad es la media nDCG@10 en 74 tareas MTEB, según lo informado por Perplexity.
banco de contexto: un nuevo punto de referencia
El banco de contexto está construido y es propiedad privada de turbopuffer para limitar la contaminación del entrenamiento. Tiene 2.099 consultas sobre 38.894 documentos en 21 dominios. La fragmentación de oraciones produce 2.458.072 fragmentos. La longitud media del documento objetivo es de aproximadamente 6100 tokens. Las consultas prueban 12 capacidades contextuales, desde la resolución de pronombres hasta la estructura de tablas. Perplexity dice que el modelo fue presentado a ciegas.
Las métricas son Document@K, Answer@K, Evidence Recall@K y All-Evidence@K. Cada modelo se clasifica exhaustivamente frente a todos los fragmentos, por lo que la configuración del índice no desempeña ningún papel.
Resultados
banco de contexto en K = 10: 45,5% recuerdo de respuestas, 40,6% recuerdo de evidencia, 31,1% recuerdo de toda la evidencia. Recuerdo de documentos: 15,2 % en K = 1 y 61,6 % en K = 10. vs voyage-context-4: adelante por 14,4 puntos en recuerdo de respuestas y 5,0 en recuerdo de evidencia en K = 10. ConTEB: promedio nDCG@10 más alto entre los modelos mostrados. pplx-embed-context-v1-4B gana NarrativeQA y Nemotron-3-Embed-8B gana COVID-QA. Recuperación general: mejor promedio en tareas de consulta a fragmento. Ligeramente por detrás de voyage-context-4 en consulta a documento. Almacenamiento: 1024-dim int8 (1 KB por vector) supera ligeramente a voyage-context-4 en 2048-dim float32 (8 KB). Tamaño del fragmento: la puntuación promedio varía del 81,0 % al 79,9 % entre 64 y 512 tokens.
Comparación con los competidores más cercanos.
Fuentes: documentos de Voyage, tarjetas modelo vinculadas arriba. Comprobado el 30 de septiembre de 2026.
Conclusiones clave
Un maestro de nivel simbólico reemplaza la etiqueta de trozo de oro único. El modelo recupera respuestas más evidencia de respaldo en un índice fragmentado. context-bench Answer@10 es 45,5%, 14,4 puntos por encima de voyage-context-4. Los pesos abiertos del MIT se envían hoy; El acceso a la API de Perplexity aún está pendiente.
Consulta los detalles técnicos y pesos de los modelos. Todo el crédito es para el investigador de este proyecto. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ml y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros
Asif Razzaq es el director ejecutivo de Marktechpost AI Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.