Adaption Labs presenta ‘Inventar un conjunto de datos’: datos de entrenamiento generados a partir de una descripción de tarea, no de un corpus semilla

Esta semana, Adaption Labs lanzó Invent a Dataset. La función genera un conjunto de datos estructurado y listo para entrenar a partir de una descripción del comportamiento que desea que aprenda un modelo. No llega con un corpus semilla, un esquema predefinido o una guía de etiquetado.

¿Es desplegable? Sí, con una salvedad. Invent a Dataset ya está disponible en la aplicación Adaption y a través del SDK de Python y la API REST. Las filas generadas se descargan como JSONL, JSON, CSV o Parquet, por lo que el artefacto es un archivo portátil que usted posee y puede entrenar en cualquier lugar. La propia generación se ejecuta en la plataforma alojada de Adaption y consume créditos. No se documenta ninguna ruta de generación autohospedada.

El problema al que se dirige

La mayoría de los flujos de trabajo de conjuntos de datos comienzan con datos que ya existen. Luego, los equipos pasan semanas etiquetándolo, filtrándolo y remodelándolo para aproximarse a la tarea objetivo. El argumento de Adaptation es que esto limita la calidad del modelo según el grado de coincidencia de los datos disponibles con el comportamiento previsto. Para tareas propietarias y especializadas, la señal relevante generalmente se encuentra en sistemas internos, texto no estructurado o registros de flujo de trabajo. Rara vez se convierte limpiamente en un conjunto de entrenamiento enfocado.

El equipo de investigación también traza una línea contra las herramientas de datos sintéticos existentes. Esas herramientas automatizan la generación después de que un humano ya haya definido el esquema, la distribución de tareas y la estrategia de generación. Inventar un conjunto de datos comienza un nivel antes, en el comportamiento mismo.

Cómo funciona la API

La mecánica está documentada y concreta. Una sola llamada a datasets.invent crea el conjunto de datos e inicia la generación, regresando inmediatamente con el estado en ejecución. Luego, sondea datasets.get hasta que las lecturas de estado sean exitosas o fallidas, y descarga las filas.

Los códigos de dominio son el control principal. Obtiene los códigos actuales con datasets.invent_domains en lugar de codificarlos. Luego, pasa valores como médico, opcionalmente restringidos por códigos de subdominio calificados como médico.síntomas_diagnosis. Se requiere al menos un dominio o subdominio. Varios dominios contribuyen a la misma ejecución. Un dominio pasado sin subdominios se beneficia de su alcance completo.

Se admiten dos formatos de salida. instrucción_dataset es el valor predeterminado y produce pares de finalización rápida para un ajuste fino supervisado. preference_pairs produce finalizaciones elegidas y rechazadas para capacitación basada en preferencias como DPO.

Tres parámetros son importantes para el uso en producción. estimación = Precios reales la solicitud exacta y las devoluciones estimadas versus los créditos disponibles sin crear ni cobrar nada. El mensaje acepta hasta 10.000 caracteres para indicar de qué se tratan realmente las filas. idempotency_key acepta hasta 255 caracteres y hace que los reintentos de red sean seguros al devolver el conjunto de datos original en lugar de iniciar una segunda ejecución. El recuento de filas está sujeto a un límite por lanzamiento establecido por su plan.

Expansión de idioma y configuración regional

language_expansion se ejecuta en dos modos. traducir produce una nueva variante de fila para cada idioma de destino. localizar produce una variante para cada país y par de idiomas, utilizando textos específicos de la localidad en lugar de traducción directa. Un sample_rate entre 0,01 y 1 controla qué fracción de filas inventadas se expande, y los créditos se facturan según el recuento de filas de salida expandidas, no el original. Los códigos no admitidos devuelven un 400 con una muestra de valores válidos.

El bucle de datos cero

Inventar un conjunto de datos es la primera mitad de un ciclo. El ID del conjunto de datos pasa directamente a autoscientist.create, que cooptimiza los datos y la receta de entrenamiento según su objetivo. AutoScientist se lanzó en mayo de 2026 y es la contraparte en el lado de la capacitación del pilar de Datos Adaptativos.

Adaptation informa que AutoScientist supera la formación configurada por su propio personal de investigación, en una media del 35%. Las tasas de ganancia pasaron del 48% al 64%. Esas cifras provienen de evaluaciones internas especializadas en dominios en ocho verticales. Los tamaños de los conjuntos de datos oscilaron entre 5000 y 100 000 filas, en arquitecturas ofrecidas para su ajuste por Together AI.

Conclusiones clave

Invent a Dataset genera filas de entrenamiento a partir de una descripción de tarea, sin corpus inicial, esquema ni etiquetas. Una llamada a datasets.invent establece dominios, recuento de filas, formato y expansión del idioma; La generación es asíncrona. La salida son pares de instrucciones o pares de preferencias, descargables como JSONL, JSON, CSV o Parquet. Los ID de conjuntos de datos se introducen directamente en AutoScientist, cerrando un ciclo de intención de modelo entrenado.

Consulta los detalles técnicos aquí. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ml y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros

Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.