Fastino lanza GLiNER2.5-Decide: un modelo de decisión de peso abierto de 340 millones que se ejecuta en CPU

Fastino Labs ha lanzado GLiNER2.5-Decide, un modelo de decisión de peso abierto con 340 millones de parámetros. Toma texto y un esquema de preguntas escritas y devuelve respuestas estructuradas. Cada respuesta viene con una distribución de probabilidad, una puntuación de confianza y metadatos de viabilidad de restricciones. Se centra en las frecuentes decisiones dentro de los canales de agentes: enrutamiento, clasificación, selección de herramientas y barreras de seguridad.

¿Es desplegable? Sí, los pesos se envían bajo Apache 2.0 y se instalan con pip install gliner2. Se ejecutan en CPU, GPU o en entornos aislados. El equipo de Fastino también ofrece inferencia alojada y ajuste a través de su API GLiNER.

Lo que realmente hace GLiNER2.5-Decide

GLiNER2.5-Decide es un clasificador no generativo. Utiliza un codificador DeBERTa-v3-large y está ajustado desde gliner2-large-v1. No produce tokens generados y no necesita plantilla de aviso.

Los conjuntos de etiquetas se pasan en el momento de la llamada. Cada pregunta del esquema declara sus respuestas permitidas. También declara si espera una respuesta, múltiples respuestas o un valor ordenado. Los esquemas pueden contener instrucciones, ejemplos, descripciones de etiquetas y reglas que vinculan respuestas entre preguntas.

El oleoducto tiene 2 etapas. El codificador lee el texto y el esquema juntos y califica cada respuesta permitida. Luego, un decodificador restringido busca la asignación conjunta con la puntuación más alta que permitan las reglas declaradas.

Fastino es explícito sobre el alcance. El modelo no razona, explica ni responde preguntas abiertas. Es un especialista en decisiones operativas.

Por qué es importante la decodificación conjunta

El equipo de Fastino ilustra este valor con un ejemplo de barandilla. Decodificado de forma independiente, el modelo marcó una inyección rápida en 0,82. También calificó el mismo mensaje como seguro en 0,52. Se detectó el ataque, pero las 2 salidas entraron en conflicto.

La decodificación conjunta aplica la regla de que cualquier daño detectado requiere un veredicto inseguro. Luego, el modelo devuelve safety=unsafe y harm_type=prompt_injection juntos. El código descendente puede utilizar esas puntuaciones para bloquear, enrutar o escalar.

Los esquemas pueden expresar implicaciones, exclusiones, límites de cardinalidad y límites ordinales. El mismo codificador también puede extraer entidades, relaciones y registros estructurados con desplazamientos a nivel de caracteres en 1 pasada. Las respuestas de clasificación no devuelven tramos de evidencia.

‘}); el.innerHTML=h;ping(); setTimeout(function(){el.querySelectorAll(“.fill”).forEach(function(f){f.style.width=f.getAttribute(“data-w”)+”%”})},reduce?0:60); } función mostrarB(v){var d=B[v];bars($(“bBars”),d.rows,d.max,”%”);$(“bCap”).textContent=d.cap} función showL(v){var filas=L[v],mejor=Math.min.apply(null,rows.filter(function(r){return r[1]!=nulo}).map(función(r){retorno r[1]}));barras($(“lBars”),filas,180,” ms”,mejor)} función seg(id,fn){var s=$(id);s.querySelectorAll(“botón”).forEach(function(b){b.onclick=function(){s.querySelectorAll(“botón”).forEach(function(x){x.setAttribute(“aria-pressed”,x===b)});fn(b.getAttribute(“data-v”))}})} seg(“bSeg”,mostrarB);seg(“lSeg”,mostrarL); document.querySelectorAll(“.tab”).forEach(function