: Los modelos de IA de frontera corren cada vez más riesgo de quedar atrapados detrás de estrictos controles de exportación o costos crecientes de API.
A medida que esta tecnología se integra en nuestra vida diaria, el movimiento de código abierto no es sólo una preferencia filosófica, es un mecanismo necesario para mantener la IA en manos de los usuarios cotidianos. Aún no estamos en paridad; Los modelos patentados de los enormes laboratorios tecnológicos todavía mantienen una ventaja dominante en rendimiento puro. Pero podemos esperar que la brecha se esté cerrando rápidamente. Las 24 horas del día, una comunidad independiente de investigadores y desarrolladores lucha para garantizar que esta tecnología sea accesible para cualquier persona que tenga una computadora.
Hoy en día, la base para una verdadera democratización ya está aquí: puedes ejecutar un modelo de alta capacidad completamente en tu propia computadora portátil. Para el experimento de hoy, me propuse encontrar un modelo de lenguaje grande que pueda ejecutarse completamente en mi computadora portátil y usarlo para las tareas simples que normalmente le encargaría a un modelo de laboratorio grande.
Instalaremos Qwen 3 8B en mi MacBook Air, lo ejecutaremos completamente sin conexión y finalmente tendremos un modelo de lenguaje en mi propia máquina en lugar de en un centro de datos distante. La familia de modelos Qwen ha sido entrenada por Alibaba (la empresa china) y son de código abierto, disponibles en Internet para que cualquiera pueda descargarlos. El modelo tiene 9 mil millones de pesos y ocupa alrededor de 6 GB de RAM cuando está cargado.
Lo que sigue ahora es una guía práctica de principio a fin para ejecutar un LLM local adecuado en una Apple Silicon Mac e incluye los comandos de terminal que necesita. Pero antes de abrir la terminal, debemos hablar sobre por qué vale la pena hacerlo.
¿Por qué hacer esto?
La mayoría de las veces, los modelos en la nube son mejores y más sencillos. No voy a pretender que un modelo de 8 mil millones de parámetros en una computadora portátil supere a la IA de vanguardia. No es así y seguiré usando los modelos de nube masiva para trabajos pesados.
Pero las constantes guerras de precios y soberanía en torno a la IA pueden hacer que los modelos locales y de código abierto sean muy relevantes para un futuro en el que tener acceso a la tecnología marcará una gran diferencia. Cada vez que utilizas Claude o ChatGPT, estás enviando tus datos a unos servidores remotos donde el acceso puede bloquearse en cualquier momento.
“Soberanía digital” es una gran frase para un deseo muy común: es posible que queramos poseer algo que lea nuestros pensamientos más sensibles, de la misma manera que poseemos una libreta física o guardamos algo de dinero en efectivo en casa.
Un modelo local responde claramente a eso en el mundo de la IA. Una vez descargado, nada sale de la máquina. Sin claves API, sin términos de servicio cambiantes, sin políticas silenciosas de retención de datos. Puedes sacar la tarjeta Wi-Fi y sigue funcionando. Para la parte tan sensible de su trabajo, solo eso puede valer el precio de la entrada.
A la gente le encanta decir que los modelos locales están “democratizando” la IA. Quiero que eso sea cierto, pero aún no hemos llegado a ese punto. Ejecutar esta pila supone que tienes un portátil de 1.500 euros con una enorme memoria unificada y que te sientes cómodo en una línea de comandos. Ésa es una pequeña y afortunada porción del mundo.
Pero la trayectoria es democratizadora. Hace dos años, ejecutar un modelo fuera de línea decente requería una estación de trabajo dedicada y graves problemas técnicos. Este fin de semana me llevó un par de horas y 5 gigabytes de espacio en disco.
Así que instalemos la cosa.
La máquina y las especificaciones
Lo construí en una MacBook Air M4 con 24 GB de memoria unificada y aproximadamente 235 GB de almacenamiento gratuito. Este fue un nuevo comienzo: sin Homebrew, sin pesadillas en el entorno Python.
El número que realmente importa aquí son los 24 GB. La “memoria unificada” de Apple Silicon es el truco de magia que hace que las Mac sean excepcionalmente buenas en esto. Debido a que la CPU y la GPU comparten exactamente el mismo grupo de memoria, los pesos masivos de las redes neuronales no tienen que moverse lentamente de un lado a otro.
Un modelo 8B ocupa aproximadamente 5 GB en disco y tiene aproximadamente 6 GB de memoria cuando está cargado. En una máquina de 24 GB, eso es muy cómodo. Podrías ejecutar un modelo 14B y aún mantener abiertas docenas de pestañas del navegador. (Si tienes una Mac de 8 GB, quédate con los modelos 1.5B o 3B y cierra tus otras aplicaciones).
¿Por qué Ollama?
Hay una docena de formas de ejecutar IA local, y la mayoría de ellas le piden que se preocupe por los indicadores del compilador y los árboles de dependencia. No deberías tener que hacerlo.
Ollama es un marco y una herramienta de código abierto que simplemente funciona. Es un binario único que incluye un ejecutor de modelos altamente optimizado (llama.cpp que utiliza Metal de Apple para aceleración de GPU), un registro de modelos estilo Docker y una API HTTP local. Lo instalas, sacas un modelo y hablas con él. ¡Eso es todo!
Paso 1: instale Ollama (no se requiere Homebrew)
Ollama se envía como una aplicación estándar de macOS en un archivo zip. La interfaz de línea de comandos (CLI) se encuentra secretamente dentro del paquete de la aplicación, por lo que podemos configurarla completamente a mano.
# Descargue el CD de compilación de Apple Silicon ~/Downloads curl -L -o Ollama-darwin.zip https://ollama.com/download/Ollama-darwin.zip # Descomprima y mueva la aplicación a su carpeta de Aplicaciones descomprima -o -q Ollama-darwin.zip mv Ollama.app /Applications/
Si no sabes cómo abrir la terminal, simplemente ve a las aplicaciones de tu Mac y busca “terminal”:
Paso 2: Pon a Ollama en tu CAMINO
No quería pelear con los permisos sudo en /usr/local/bin, así que vinculé simbólicamente la CLI incluida a un directorio local de mi propiedad; este es solo un atajo útil para acelerar la instalación y hacer funcionar el LLM.
# Cree un directorio bin local y enlace simbólicamente el CLI mkdir -p ~/.local/bin ln -sf /Applications/Ollama.app/Contents/Resources/ollama ~/.local/bin/ollama # Hágalo permanente en su perfil zsh echo 'export PATH="$HOME/.local/bin:$PATH"' >> ~/.zshrc # Aplíquelo a su exportación de shell actual PATH="$HOME/.local/bin:$PATH" ollama –versión
Paso 3: inicie el servidor
Ollama ejecuta un servidor en segundo plano liviano para exponer la API y administrar la memoria de su computadora.
# Inicie el servidor y registre la salida mkdir -p ~/.ollama/logs nohup ollama save > ~/.ollama/logs/serve.log 2>&1 & # Haga ping para comprobar si está activo curl -s http://127.0.0.1:11434/api/version
Si el comando anterior devuelve una “versión”, ¡ollama está configurada!
Nota: También puede simplemente hacer doble clic en la aplicación Ollama en su carpeta de Aplicaciones para ejecutar este servidor a través de su barra de menú. Lo hice a través de la terminal para ver exactamente qué estaba pasando debajo del capó.
Paso 4: tira del modelo
Bueno, este es tan fácil como parece:
ollama tira qwen3:8b lista de ollama
Ve a preparar un café. La descarga es de aproximadamente 5,2 GB.
Después de ejecutar la lista ollama, verá el modelo disponible para usted:
Paso 5: Habla con el nuevo cerebro digital en tu computadora
Tienes tres formas distintas de interactuar con tu nuevo modelo local.
1. Chat interactivo (el más fácil)
ollama corre qwen3:8b
Al ejecutar el siguiente comando se iniciará el chat interactivo:
En el modo predeterminado, el modelo mostrará los “tokens de pensamiento”, algo que normalmente está abstraído y oculto en la mayoría de las herramientas comerciales.
Voy a empezar preguntando a mi modelo local qué piensa sobre los modelos de código abierto:
El texto gris claro representa el proceso de razonamiento interno del modelo. Estos modelos realizan cálculos extensos antes de generar una respuesta y, para los modelos locales, esta fase de pensamiento representa una parte significativa del tiempo total hasta que el modelo arroja una respuesta.
Después de realizar el proceso de pensamiento, aquí está la respuesta del modelo:
Como ocurre con la mayoría de las herramientas, estos modelos también conservan algo de contexto de interacciones anteriores:
El modelo genera 5,7 tokens por segundo porque estoy en modo de ahorro de batería. Si lo bajo, probablemente veremos un valor de 15 a 20 tokens por segundo.
2. Comandos de terminal de un solo uso
Para interactuar con su modelo local, también puede proporcionar la pregunta fuera del modo interactivo:
ollama run qwen3:8b "escribe un script en Python que me diga cuántas vocales tiene una palabra"
Aquí está el script que creó nuestro modelo de lenguaje grande local:
“`python # Solicitar al usuario una palabra word = input("Ingrese una palabra: ") # Definir el conjunto de vocales vocales = {'a', 'e', 'i', 'o', 'u'} # Inicializar un contador count = 0 # Convertir la palabra a minúsculas y verificar cada carácter en busca de char en word.lower(): if char in vocales: count += 1 # Generar el resultado print(f"Número de vocales: {cuenta}")
3. La API HTTP (para scripts y aplicaciones)
¿Solo puedes usar esto dentro de los comandos de la terminal?
¡Por supuesto que no! Si se siente cómodo con Python, puede crear cualquier script local utilizando su modelo local:
import json, urllib.request req = urllib.request.Request( "http://127.0.0.1:11434/api/generate", data=json.dumps({ "model": "qwen3:8b", "prompt": "Dame tres usos para un LLM local.", "stream": False, "think": False, }).encode(), headers={"Content-Type": "aplicación/json"}, ) print(json.loads(urllib.request.urlopen(req).read())["respuesta"])
Aquí está la respuesta del modelo después de ejecutar este script de Python:
¡Seguro! Aquí hay tres usos comunes y prácticos para un **LLM (modelo de lenguaje grande) local**: 1. **Asistencia personalizada y productividad** Un LLM local puede actuar como un asistente privado de IA, ayudando con tareas como redacción de correos electrónicos, programación, toma de notas e incluso codificación. Dado que se ejecuta localmente, mantiene la privacidad del usuario y no depende de la conectividad a Internet. 2. **Creación de contenido y procesamiento del lenguaje** Puede utilizar un LLM local para generar contenido creativo, como publicaciones de blog, historias, guiones o textos de marketing. También puede ayudar con la traducción de idiomas, la revisión gramatical y el resumen de texto. 3. **Aplicaciones personalizadas e integración** Un LLM local se puede integrar en aplicaciones o flujos de trabajo personalizados, como chatbots, sistemas de atención al cliente o herramientas de análisis de datos. Esto permite soluciones personalizadas sin exponer datos confidenciales a servidores externos. ¡Déjame saber si quieres ejemplos de cómo implementar estos usos!
¡Fresco! Ahora puedes crear tus propias aplicaciones con tu propio modelo local con bastante facilidad.
Afinando la experiencia – Dominando las fichas de “pensamiento”
Qwen 3 es un modelo de razonamiento híbrido. De forma predeterminada, genera un bloque detallado… que describe su cadena de pensamiento antes de proporcionar la respuesta real. A veces quieres ver las matemáticas, pero la mayoría de las veces solo quieres la respuesta rápida (y reducir el tiempo de espera de los tokens de salida del proceso de pensamiento).
Así es como se evita el pase de razonamiento:
Deshabilítelo por completo: ollama run qwen3:8b –think=false Ejecútelo, pero ocultelo de la interfaz de usuario: ollama run qwen3:8b –hidethinking En scripts: pase "think": false en su carga útil JSON.
Una advertencia sobre la búsqueda web
Los modelos son estáticos hasta sus datos de entrenamiento. Eso significa que no pueden acceder a los datos después de haber sido capacitados, y las empresas han estado confiando en herramientas de búsqueda web para aumentar la capacidad de los modelos. Por ejemplo para nuestro modelo local:
Pero Ollama le permite entregarle al modelo una herramienta de búsqueda web. Esto suena increíble pero hay un problema.
La búsqueda en sí se ejecuta en el servicio de nube alojado de Ollama. En el momento en que lo habilita, sus indicaciones se envían a través de Internet para obtener resultados de búsqueda. El modelo sigue siendo local, pero sus consultas no. Esto puede violar el principio de privacidad que desea garantizar con la configuración.
Bonificación: integración de código VS
El objetivo final para mí fue conseguir un asistente de codificación sin conexión. La ruta más limpia y completamente gratuita para esto es la extensión Continuar.dev.
Instale VS Code y la extensión Continuar. Abra el archivo de configuración de Continuar en ~/.continue/config.yaml. Apunte a su servidor local de Ollama: nombre: Local Assistant versión: 1.0.0 modelos: – nombre: Qwen3 8B (local) proveedor: ollama modelo: qwen3:8b roles: – chatear – editar – aplicar – nombre: Qwen3 8B Autocompletar proveedor: ollama modelo: qwen3:8b roles: – autocompletar
Consejo profesional: un modelo 8B es demasiado pesado para la latencia de fracción de segundo que desea para el autocompletado de código en línea. Recomiendo encarecidamente utilizar un modelo más pequeño específicamente para esa tarea (ollama pull qwen2.5-coder:1.5b-base), asignarlo a la función de autocompletar y dejar que Qwen3 8B maneje las tareas de chat más pesadas.
¿Qué pasa si tengo una computadora con Windows?
Como no estoy en Windows para este tutorial, no lo he probado exhaustivamente. Pero la buena noticia es que el paquete Ollama está disponible para computadoras con Windows aquí.
El proceso de instalación puede diferir un poco, pero la lógica detrás de usar Ollama y extraer los modelos será exactamente la misma.
Donde esto me deja
Mi espacio total para este proyecto fue de 156 MB para el software y 5,2 GB para el modelo en sí.
Ahora tengo un modelo de lenguaje altamente capaz viviendo permanentemente en mi disco duro. Para trabajos públicos y complejos, seguiré recurriendo a la nube. ¿Pero para los borradores que no quiero que se incorporen a los datos de entrenamiento, los vuelos fuera de línea y los documentos legalmente vinculantes del cliente? Esta inteligencia está ahora en mi computadora.
Esto puede que todavía sea demasiado técnico para la mayoría de la gente, pero las cosas se están democratizando más. Y no se trata sólo de disponibilidad. En cuanto al rendimiento, los modelos de código abierto están mejorando a un ritmo asombroso, generando resultados que hacen que el futuro de la IA local parezca increíblemente prometedor. Por ejemplo, GLM 5.2 y Qwen 3.7 Max están alcanzando el rendimiento de los modelos de los grandes laboratorios:
A medida que el piso técnico siga cayendo, “poseer su propia IA” dejará de ser un lujo reservado para desarrolladores con computadoras portátiles costosas. Esa es la versión de democratización de la IA en la que realmente creo.
¡Dale otro cerebro a tu computadora portátil este fin de semana y larga vida al código abierto!