Superwhisper ha lanzado la familia de modelos S1: S1-Voice, S1-Language y S1-mini. S1-Voice es un modelo de voz a texto en la nube y S1-Language es un modelo de seguimiento de instrucciones en la nube para limpieza y formateo. El que es bastante interesante fuera de la aplicación es el S1-mini, lanzado con pesos abiertos en Hugging Face. S1-mini es un normalizador de texto de 0,6 mil millones, no un transcriptor ni un modelo de chat. Se ubica después del reconocimiento automático de voz y reescribe las transcripciones sin procesar como texto escrito limpio: se eliminan los rellenos, se resuelven las autocorrecciones según lo que encontró el orador, se aplican puntuación y mayúsculas, y se representan por escrito los números, fechas, moneda y direcciones de correo electrónico hablados. Está ajustado desde Qwen/Qwen3-0.6B, cubre inglés solo en la versión v1 y está dirigido completamente por una línea de control de tres ejes colocada sobre la transcripción. Superwhisper informa una precisión de token del 94,8 % en un conjunto de 7.519 casos, medidos según la construcción cuantificada.
¿Es desplegable?
Sí, pero sólo S1-mini. S1-mini se publica en Hugging Face bajo Apache 2.0 más una cláusula de nomenclatura. S1-Voice y S1-Language son servicios alojados en Superwhisper, por lo que son consumibles, no autohospedables.
Nivel de empresa: Cualquier nivel. La compilación Q4_K_M GGUF es un archivo de 462 MB que se ejecuta en la CPU de una computadora portátil. Los desarrolladores individuales pueden enviarlo dentro de una aplicación de escritorio. Las empresas pueden ejecutarlo detrás de una VPC donde las transcripciones de audio no pueden salir de la red. Industrias: documentación clínica y sanitaria, servicios legales y financieros, atención al cliente, herramientas para desarrolladores, accesibilidad y subtítulos en vivo. Aplicaciones: aplicaciones de dictado, herramientas de notas de reuniones, subtítulos en vivo, editores controlados por voz, entrada de voz a CRM y cualquier canal que convierta la salida ASR sin procesar en texto que un humano leerá.
¿Qué hace el S1-mini?
S1-mini es un normalizador de texto, no un transcriptor ni un modelo de chat. Se encuentra después del reconocimiento automático de voz:
audio → ASR (Whisper, Parakeet,…) → S1-mini → texto limpio
Elimina palabras de relleno, resuelve comienzos en falso y autocorrecciones del valor al que llegó el hablante, aplica puntuación y mayúsculas y presenta números hablados, fechas, horas, moneda y direcciones de correo electrónico en forma escrita. Diga “soporte en superwhisper punto com” y obtendrá [email protected].
El modelo está perfeccionado desde Qwen/Qwen3-0.6B. Tiene 596 millones de parámetros únicos (0,44 B no integrados), 28 capas, 16 cabezales de consulta y 8 cabezales de clave/valor con GQA y pesos BF16. La barra lateral de Hub informa 0.8B porque la incrustación vinculada se almacena dos veces; la tarjeta explica la discrepancia explícitamente. La versión v1 cubre únicamente el inglés y la entrada recomendada es de aproximadamente 1000 tokens.
La línea de control es toda la interfaz.
S1-mini toma un mensaje fijo del sistema, luego una línea de control y luego la transcripción sin procesar:
El estilo es casual, semi-casual, semi-formal o formal. La estructura requiere prosa o listas. El contexto es general o correo electrónico. Los tres ejes son independientes y cada combinación fue entrenada. Envíe valores fuera de esos conjuntos o reformule el mensaje del sistema y la salida puede degradarse o distorsionarse. Tenga en cuenta la pequeña discrepancia que vale la pena conocer: la aplicación Superwhisper expone un control deslizante de tono de cinco pasos que agrega un ajuste preestablecido “equilibrado”, mientras que los pesos abiertos documentan cuatro valores de estilo entrenados.
El modelo también está limitado por el diseño. No agrega contenido que usted no dijo, no corrige hechos, suaviza las malas palabras ni reescribe el dialecto. La entrada de solo relleno devuelve una cadena vacía y las integraciones deben tratarla como un resultado válido.
Dos configuraciones que rompen la mayoría de las integraciones
Primero, se requiere enable_thinking=False. La plantilla de chat es la de Qwen3, sin cambios, y Qwen3 sigue pensando de forma predeterminada. S1-mini fue entrenado para pensar, por lo que el turno del asistente debe abrirse con un bloque vacío. Omita la bandera y normalmente no obtendrá ningún resultado utilizable.
En segundo lugar, decodifica con avidez. Generation_config.json envía do_sample: false. Las compilaciones GGUF aún llevan los metadatos heredados temp = 0.6, top_p = 0.95 y top_k = 20 de Qwen3, por lo tanto, pase la temperatura 0 explícitamente en cada solicitud. En llama.cpp, use –jinja con –chat-template-kwargs ‘{“enable_thinking”:false}’ en lugar de –reasoning-budget 0, lo que degrada el resultado.
Evaluación reportada
Superwhisper evaluó S1-mini en un conjunto de 7519 casos en 104 transcripciones. La precisión del token es del 94,8%, medida con avidez en la compilación Q4_K_M, con una tasa de error de edición de texto del 11,6%. En el texto con formato de correo electrónico, identifica la línea de saludo el 99,3 % de las veces y la de cierre de sesión el 97,9 %. Coincide con la estructura de salida correcta, lista versus párrafo, el 97,6% de las veces y produce direcciones de correo electrónico exactas en el 92% de los casos. Menos del 1% de las generaciones muestran bucles o truncamientos, y el modelo retiene correctamente la salida el 98,6% de las veces cuando no se debe transcribir nada. Estos son números informados por los proveedores en un conjunto de pruebas internas, no resultados de terceros.
Los dos modelos de nube
S1-Voice es el modelo alojado de voz a texto. Superwhisper informa una transcripción hasta 46 veces más rápida que el tiempo de conversación, y la mayoría de los dictados de menos de 30 segundos aparecen 0,32 segundos después de detenerse. En ocho conjuntos de datos, incluido el audio de reuniones y las llamadas de ingresos, la tasa de error de palabras promedio es del 6,8 % y cae al 2,2 % en LibriSpeech. Superwhisper dice que el promedio del 6,8% fue el más bajo de los 15 modelos que probó, y que S1-Voice obtuvo una puntuación de 83 sobre 100 en su métrica combinada frente a 76 de WisprFlow.
S1-Language es el modelo alojado de seguimiento de instrucciones para limpieza, formateo y resumen, y aparece en el selector de modelos junto con los modelos de Anthropic, OpenAI y Groq. Los valores predeterminados recomendados son Cohere Transcribe más S1-mini sin conexión o S1-Voice más S1-Language en la nube.
Explicador interactivo
La siguiente inserción le permite cambiar cada eje de la línea de control y observar el cambio de salida. Cada par de entrada/salida se toma textualmente de la tarjeta modelo.
Línea de control (línea 1 del mensaje de usuario)
‘+” +’
‘+’
Línea 2 de transcripción ASR sin procesar
‘+esc(d.entrada)+’
‘+’
Salida S1-mini codiciosa, temperatura 0
‘+’
‘; var opts=document.getElementById(‘s1opts’); d.opts.forEach(function(v){ var el=document.createElement(‘div’); el.className=”s1-opt”+(v===sel?’ on’:”); el.textContent=v; el.onclick=function(){
[].forEach.call(opts.children,function(c){c.className=”s1-opt”;}); el.className=”s1-opt on”; aplicar(clave,v); }; opts.appendChild(el); }); note.textContent=d.nota; aplicar(clave,sel); } función aplicar(clave,val){ var d=D[key]; document.getElementById(‘s1cl’).innerHTML=ctlLine(d.axis,val,d.fixed); tipo(document.getElementById(‘s1out’),d.out[val]); } función renderFix(){ var h=”
‘+esc(r[0])+’
→
‘+esc(r[1])+’
‘; }); h+=’
‘; panel.innerHTML=h;
[].forEach.call(panel.querySelectorAll(‘.s1-row’),function(row){ fila.onclick=function(){ fila.className=”s1-row hit”; setTimeout(function(){row.className=”s1-row”;},700); }; }); note.textContent=”Medido en pesos BF16 con decodificación voraz, bajo [Styling: semi-formal] [Structure: prose] [Context: general]. La entrada de solo relleno devuelve una cadena vacía y las integraciones deben tratarlo como un resultado válido en lugar de un error. El modelo resuelve las autocorrecciones del valor al que llegó el hablante y presenta números hablados, fechas, moneda y direcciones de correo electrónico en forma escrita.”; resize(); } function esc(s){return s.replace(/&/g,’&’).replace(//g,’>’).replace(/\n/g,’
‘);} función cambiar tamaño(){ intentar{ var h=document.getElementById(‘s1w’).offsetHeight+40; parent.postMessage({s1height:h},’*’); }catch(e){} } var tabs=document.querySelectorAll(‘.s1-tab’);
[].forEach.call(pestañas,función
[].forEach.call(tabs,function(x){x.className=”s1-tab”;}); t.className=”s1-tab en”; var v=t.getAttribute(‘datos-t’); if(v===’fix’){renderFix();}else{renderAxis(v);} resize(); }; }); renderAxis(‘estilo’); setTimeout(cambiar tamaño,120); setTimeout(cambiar tamaño,600); window.addEventListener(‘cambiar tamaño’,cambiar tamaño); })(); “>
Conclusiones clave
S1-mini es un normalizador de texto con pesos abiertos de 0,6 B para salida ASR, no un transcriptor ni un modelo de chat. El Q4_K_M GGUF tiene 462 MB y se ejecuta en la CPU de una computadora portátil, por lo que la implementación en el dispositivo es realista. Un sistema de aviso fijo más una línea de control de tres ejes es el único mecanismo de dirección. enable_thinking=False y la temperatura 0 son obligatorias; la mayoría de los errores de integración se deben a estos.
Consulte los pesos del modelo y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ml y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros

Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.