La parte difícil de ejecutar un modelo de pesos abiertos localmente nunca fue el modelo. Era todo lo anterior: leer las especificaciones de VRAM, adivinar qué cuantificación encaja, establecer la longitud del contexto y el recuento de capas de GPU y luego descubrir, en el momento de la carga, que el archivo tiene tres gigabytes de más. Nous Research ha colapsado esa secuencia en un solo clic dentro de Hermes Desktop. El nuevo flujo de configuración sencilla lee su hardware, selecciona un modelo que se ajuste a él, descarga los pesos y configura el tiempo de ejecución de inferencia por usted.
¿Es desplegable? Sí. Hermes Desktop es la versión gratuita con licencia MIT del Hermes Agent de código abierto, se ejecuta en macOS 12+, Windows 10/11 y cualquier distribución de Linux, y no necesita ninguna cuenta para los modelos locales.
Lo que realmente se envió
El anuncio es limitado y concreto: Hermes Desktop ahora configura modelos locales con un solo clic, lee su hardware, elige un modelo, lo descarga y configura el tiempo de ejecución. El flujo aparece automáticamente en el primer inicio y se puede acceder a él más adelante en Configuración → Proveedores → Modelos locales.
Debajo del capó, Hermes gestiona el propio motor de inferencia. Según la documentación de Modelos locales, busca una compilación oficial de llama.cpp que coincida con su hardware, unos cientos de megabytes, la verifica y la mantiene actualizada. Los backends cubren CUDA, Metal, Vulkan, HIP y CPU. La etiqueta de lanzamiento fijada se encuentra en el bloque local_runtime de config.yaml, que la interfaz de usuario del escritorio escribe para usted y que los usuarios sin cabeza pueden configurar manualmente.
Cómo Hermes valora los modelos en comparación con su máquina
Cada modelo de catálogo se evalúa con respecto a su máquina específica antes de descargar cualquier cosa. Cada fila lleva un veredicto de ajuste de memoria, el verde se ejecuta completamente en la memoria de la GPU, el ámbar se derrama en la RAM del sistema y es más lento, el rojo es demasiado grande para esta máquina. Las filas también muestran las ventanas de contexto inicial y máxima, además del tamaño de descarga de la compilación elegida para su hardware.
La selección de cuantificación sigue una regla: Hermes elige la versión de mayor calidad que se ejecuta completamente en su GPU, y las máquinas con menos memoria obtienen una versión más compacta del mismo modelo. Hay un piso duro en 4 bits. Por debajo de eso, Nous considera que la pérdida de calidad es demasiado grave, por lo que una máquina que no puede ejecutar la compilación de 4 bits sin derramarse simplemente no puede ejecutar ese modelo. Los modelos que no encajan permanecen visibles con el motivo adjunto, para que puedas ver exactamente qué más VRAM te compraría.
‘+STG[i][0]+’
‘+STG[i][1]+’