En este artículo, aprenderá cómo ejecutar un modelo de lenguaje pequeño localmente en su propia máquina en menos de 15 minutos usando Ollama.
Los temas que cubriremos incluyen:
Por qué Ollama se ha convertido en la herramienta estándar para ejecutar modelos de IA locales. El proceso de tres pasos para instalar Ollama, descargar un modelo y comenzar a chatear completamente sin conexión. Qué es la cuantificación y cómo diagnosticar los problemas más comunes en la primera ejecución.
No perdamos más tiempo.
La escena local
En nuestra Introducción a los modelos de lenguajes pequeños, cubrimos cómo una nueva generación de modelos de IA eficientes está alejando las cargas de trabajo de las API de nube masivas y costosas. Seguimos con un desglose de los 7 principales modelos de lenguajes pequeños que puede ejecutar en una computadora portátil, que cubren modelos compactos como Meta’s Llama 3.2 3B y Google’s Gemma 2 9B.
Comprender la teoría y elegir un modelo es sólo la mitad de la historia. La verdadera recompensa es ver un modelo totalmente capaz ejecutándose localmente en su propia máquina: completamente fuera de línea, privado y gratuito por token. Eso es exactamente lo que vamos a hacer aquí.
Históricamente, configurar la IA local significaba luchar con los controladores CUDA, configurar entornos virtuales de Python y desenredar los conflictos de dependencia. Ollama ha cambiado eso por completo.
Esta guía recorre el único “camino feliz” para ejecutar su primer modelo de lenguaje pequeño (SLM) localmente en menos de 15 minutos. Sin distracciones, sin fragmentación de plataformas, solo inferencias locales.
Por qué Ollama funciona tan bien para la IA local
Antes de entrar en los pasos de configuración, vale la pena dedicar un momento a explicar por qué Ollama es la herramienta que estamos usando, porque no es la única opción, y comprender lo que la distingue le ayudará a aprovecharla al máximo.
Ollama se ha convertido en la herramienta de referencia para la IA local porque empaqueta arquitecturas de modelos complejos en un servicio en segundo plano limpio y liviano. Maneja descargas de modelos, administra la aceleración de hardware de forma nativa y expone una API local simple.
Piense en ello como Docker, pero creado específicamente para modelos de lenguaje. En lugar de discutir los pesos del modelo sin procesar, interactúas con él a través de un puñado de comandos sencillos. Con ese contexto en su lugar, pongámoslo a trabajar.
El camino feliz: instalar, extraer y chatear
Ahora que sabemos lo que Ollama está haciendo bajo el capó, pongámoslo en marcha. Seguiremos un flujo unificado y multiplataforma. Ya sea que esté en macOS, Windows o Linux, la configuración subyacente se comporta exactamente de la misma manera: tres pasos desde cero hasta una sesión de chat de IA que funcione.
Paso 1: Instalar Ollama
Primero, toma el instalador para tu sistema operativo:
macOS y Windows: dirígete al sitio web oficial de Ollama, descarga el instalador nativo y ejecútalo. En Windows, se configura como una aplicación de la bandeja del sistema. En macOS, agrega un ícono en la barra de menú. Linux: abra su terminal y ejecute el resumen oficial: curl -fsSL https://ollama.com/install.sh | sh
Paso 2: descargar tu primer modelo
Con Ollama instalado y funcionando silenciosamente en segundo plano, es hora de desplegar un modelo real. Abra su terminal (o Símbolo del sistema/PowerShell en Windows) y ejecute lo siguiente. Descargaremos Llama 3.2 3B, uno de los modelos mejor equilibrados para el uso diario de portátiles.
# Verifique que Ollama se esté ejecutando verificando la versión ollama –version # Extraiga y ejecute inmediatamente el modelo Llama 3.2 3B ollama run llama3.2
# Verifique que Ollama se esté ejecutando verificando la versión
ollama —versión
# Tire y ejecute inmediatamente el modelo Llama 3.2 3B
ollama correr llama3.2
Ollama comenzará a descargar las capas del modelo. Debido a que Llama 3.2 3B está bien optimizado, la descarga ocupa aproximadamente 2,0 GB, menos de tres minutos con una conexión de banda ancha estándar.
Paso 3: tu primera sesión de chat
Una vez que la descarga llega al 100%, su terminal se convierte en una interfaz de chat interactiva. Ahora estás hablando con una IA que se ejecuta completamente en tu propio hardware, no requiere Internet y no salen datos de tu máquina. Pruebe este mensaje para comenzar:
>>> Escriba un resumen de tres puntos que explique por qué la IA local es segura. – **Transmisión de datos externos cero**: sus indicaciones y datos nunca salen de su máquina local, lo que elimina el riesgo de fugas de datos basados en la nube o registros de terceros. – **Funcionalidad completa sin conexión**: debido a que el modelo se ejecuta completamente en su hardware local, no requiere conexión a Internet, lo que evita la interceptación basada en la red. – **Control total de la infraestructura**: usted conserva la propiedad absoluta sobre el hardware y el entorno, lo que le permite aplicar estrictos controles de acceso y políticas de cumplimiento. >>> /adiós
>>> Escribir a tres–bala–punto resumen explicando por qué local AI es seguro.
– **Cero Externo Datos Transmisión**: Su indicaciones y datos nunca dejar su local máquina, eliminando el riesgo de nube–basado datos fugas o tercero–fiesta explotación florestal.
– **Completo Desconectado Funcionalidad**: Porque el modelo corre enteramente en su local hardware, él requiere No Internet conexión, previniendo red–basado interceptación.
– **Total Infraestructura Control**: Tú retener absoluto propiedad encima el hardware y ambiente, permitiendo tú a hacer cumplir estricto acceso controles y cumplimiento políticas.
>>> /adiós
Para salir en cualquier momento, escriba /bye y presione enter.
Lo que realmente descargaste
Ese proceso de tres pasos parecía sencillo, y lo era. Pero sucedieron muchas cosas detrás de escena cuando ejecutaste ollama run llama3.2. Comprender lo que hay ahora en su disco duro le ayudará a tomar decisiones más inteligentes sobre los modelos, la memoria y el rendimiento en el futuro.
Etiquetas de modelo y valores predeterminados
Si no especifica una etiqueta, Ollama agrega automáticamente :latest. Para Llama 3.2, esa etiqueta apunta a la variante de 3 mil millones de parámetros, un sólido equilibrio entre velocidad y capacidad para hardware de consumo.
Comprender la cuantización
Aquí hay algo en lo que vale la pena detenerse: un modelo de 3 mil millones de parámetros con precisión estándar de punto flotante de 16 bits (fp16) debería necesitar alrededor de 6 GB de VRAM solo para sostener los pesos. Su descarga fue de alrededor de 2,0 GB. Entonces, ¿qué pasa?
Ollama utiliza por defecto la cuantificación de 4 bits (específicamente, q4_K_M). Esto comprime los pesos del modelo desde flotantes de precisión total hasta enteros de 4 bits, lo que reduce el uso de memoria en más de un 60 % y acelera notablemente la inferencia, con solo un pequeño impacto en la precisión. Es la razón por la que un modelo de lenguaje capaz cabe cómodamente en una computadora portátil.
Comprobación de cordura de salida: buena frente a degradada
Debido a que los modelos 3B son compactos, pueden mostrar signos de tensión cuando los recursos del sistema son escasos. Esto es lo que debe observar para saber inmediatamente si todo funciona como se esperaba:
Lo bueno se ve: generación de texto rápida y coherente, a menudo más de 40 tokens por segundo en el moderno Apple Silicon o en una GPU Nvidia dedicada. La lógica se mantiene clara y se siguen las instrucciones de formato. Cómo se ve Degraded: alucinaciones graves (salida de galimatías), sintaxis rota, bucles repetitivos o velocidades de generación inferiores a 5 tokens por segundo. Esto generalmente significa que los pesos del modelo se han desbordado de la VRAM rápida a la RAM del sistema más lenta o a un archivo de paginación.
Si su resultado parece degradado, la siguiente sección lo cubre.
Cuando las cosas van mal: la tabla de síntomas de la primera ejecución
La instalación de Ollama suele realizarse sin problemas, pero las variaciones de hardware pueden causar contratiempos. En lugar de buscar en los archivos de registro, utilice esta referencia rápida para diagnosticar de un vistazo los tres fallos más comunes en la primera ejecución.
Síntoma/Causa raíz del error La respuesta del chat de reparación inmediata tarda unos minutos en iniciarse o el texto imprime una palabra cada pocos segundos. VRAM/RAM insuficiente. El modelo es demasiado pesado para su GPU, por lo que Ollama recurre a una CPU/memoria del sistema más lenta. Cierra aplicaciones con mucha RAM como Chrome o tu IDE. O opte por un modelo más ligero: ollama run smollm2:1.7b. Error: “Error al contactar con el controlador de GPU” o Ollama utiliza de forma predeterminada la CPU en una computadora portátil para juegos de alta gama. El controlador de GPU no coincide. Ollama no puede conectarse a su GPU dedicada, lo cual es común con los controladores Nvidia CUDA o AMD ROCm obsoletos. Actualice los controladores de su GPU a la última versión. En Windows/Linux, verifique que CUDA_VISIBLE_DEVICES no esté bloqueando el acceso accidentalmente. Error: “dirección ya en uso” o “Error: escuchar tcp 127.0.0.1:11434: enlace: dirección ya en uso” Conflicto de puerto. Otra instancia de Ollama ya se está ejecutando como servicio en segundo plano, lo que impide que el terminal abra una nueva conexión. No reinicies la aplicación. Simplemente ejecute su comando directamente (ollama ejecute llama3.2), el demonio en segundo plano ya está escuchando en el puerto 11434.
Próximos pasos con la IA local
Con una configuración de inferencia local funcional, ahora tiene un motor de IA privado que es completamente suyo: sin claves API, sin límites de velocidad, sin suscripciones y sin datos que salen de su máquina. Esa es una capacidad significativa y es sólo el punto de partida.
A partir de aquí, explorar los otros modelos de nuestra lista Top 7 es tan simple como cambiar el nombre en su terminal: ollama run gemma2:9b, ollama run phi3.5, etc. Cada modelo tiene diferentes puntos fuertes, algunos destacan en el razonamiento, otros en la generación de código o en tareas de contexto largo, por lo que probar algunos le mostrará rápidamente cuál se adapta mejor a su flujo de trabajo.
A medida que se sienta cómodo, considere construir sobre la API local de Ollama (se ejecuta en localhost:11434 y es compatible con OpenAI), lo que abre la puerta a la integración de modelos locales en sus propios scripts, herramientas y aplicaciones. Esa base, combinada con lo que ahora sabe sobre la cuantificación y los requisitos de hardware, le será de gran utilidad a medida que avance hacia un trabajo de IA local más avanzado.