Una sola tarjeta de 24 GB es el piso práctico para una inferencia local seria. Es suficiente para modelos realmente capaces y lo suficientemente pequeño como para caber en una GPU. Un RTX 3090 o un RTX 4090 aterrizan en este nivel. La tarjeta que posee importa menos que los modelos que elija.
El viejo movimiento de los aficionados era introducir el mayor cuanto de 70 mil millones en la tarjeta. Ese consejo ya está obsoleto. La estrategia más sólida para 2026 utiliza modelos modernos de clase 20B-35B que encajan perfectamente. Estos dejan espacio para el contexto y aún responden lo suficientemente rápido para la codificación, el chat y los agentes. Esta guía cubre los modelos que realmente encajan, por qué vale la pena ejecutar cada uno y cómo se gastan los 24 GB.
Cómo se gastan realmente 24 GB de VRAM
Tres cosas consumen memoria durante la inferencia. Hacer la división correcta decide si un modelo encaja.
El primero son los pesos del modelo. Su tamaño depende del recuento de parámetros y la cuantificación. En Q4_K_M, un valor predeterminado de inferencia local común, cada parámetro cuesta aproximadamente 0,58 bytes. Por lo tanto, un modelo de 32B necesita entre 18 y 20 GB solo en peso. Los modelos Mixtral-of-Experts (MoE) de estilo mixtral son la trampa común aquí. Cada experto permanece residente en VRAM incluso cuando solo hay unas pocas rutas por token. Por lo tanto, dimensiona la memoria MoE según los parámetros totales, nunca los parámetros activos.
El segundo es el caché KV, que crece con la longitud del contexto. Las indicaciones y sesiones más largas consumen más VRAM. El tercero es la sobrecarga del tiempo de ejecución desde la pila de entrega. Una regla general segura agrega aproximadamente entre 1 y 2 GB para la caché KV y el tiempo de ejecución en un contexto breve.
La cuantización es la palanca que hace viables los 24 GB. Q4_K_M es el equilibrio estándar entre calidad y huella. Q5_K_M y Q6_K aumentan la calidad a un costo de memoria. Q8_0 y BF16 suelen ser demasiado grandes para los modelos de clase 30B en una sola tarjeta de 24 GB. La herramienta interactiva a continuación le permite cambiar la cuantización y ver el cambio de ajuste de cada modelo en vivo.
Los seis mejores LLM locales para una GPU de 24 GB
Cada modelo a continuación lleva una licencia permisiva, ya sea Apache 2.0 o MIT. Todos ellos caben en una única tarjeta de 24 GB en Q4_K_M con espacio para el contexto. Están agrupados por el trabajo que cada uno hace mejor.
Qwen3.6-27B: la mejor codificación agente y completa
Qwen3.6-27B de Alibaba es el valor predeterminado más fuerte para la tarjeta. Es un modelo denso 27B lanzado en abril de 2026 bajo Apache 2.0. El lanzamiento se centra en la codificación agente, el razonamiento a nivel de repositorio y los flujos de trabajo frontend. En Q4_K_M necesita aproximadamente 16 GB, lo que deja un cómodo espacio para el contexto. Las tarjetas de modelo completas y el registro de cambios se encuentran en el repositorio GitHub de Qwen3.6.
Qwen3.6-35B-A3B: opción de uso general más rápida
El Qwen3.6-35B-A3B es un modelo de mezcla de expertos con 35 mil millones de parámetros totales y alrededor de 3 mil millones activos por token. Decodifica mucho más rápido que un modelo 35B denso porque solo una fracción de los pesos dispara en cada paso. La huella de memoria aún rastrea los parámetros totales, así que planifique aproximadamente 20 GB en Q4_K_M. Eso lo convierte en un ajuste perfecto pero válido, mejor cuando desea velocidad para el chat general y el uso de herramientas.
Gemma 4 26B — multimodal y multilingüe
Google DeepMind lanzó Gemma 4 el 2 de abril de 2026, bajo Apache 2.0. Fue la primera generación de Gemma que se lanzó con una licencia completamente abierta, según la página de DeepMind Gemma. La familia abarca modelos de borde, un modelo multimodal unificado de 12 mil millones, un MoE de 26 mil millones con 3,8 mil millones activos y un buque insignia denso más grande. El MoE de 26B es la elección natural de 24GB cuando necesitas información visual y cobertura de más de 140 idiomas.
Mistral Small 3.2 24B: asistente diario pulido
La línea Small de Mistral se dirige a la carga de trabajo diaria de los asistentes con baja latencia. Mistral Small 3.1 agregó entrada multimodal y una ventana de contexto más larga, y Small 3.2 perfeccionó el seguimiento de instrucciones. Es un modelo denso de 24B bajo Apache 2.0, y el tamaño más liviano en esta lista con aproximadamente 14GB en Q4_K_M. Ese margen le permite llevar el contexto más allá de lo que permiten las opciones de 32B más pesadas. En 2026, Mistral también envió sucesores más grandes, pero se ubican por encima del nivel de tarjeta única.
gpt-oss-20b: el método alternativo de razonamiento fácil
gpt-oss-20b de OpenAI es un modelo de razonamiento de peso abierto bajo Apache 2.0. Es un diseño de mezcla de expertos con 21 mil millones de parámetros totales y 3,6 mil millones activos por token. Se envía en formato nativo MXFP4 de 4 bits y se carga en aproximadamente 14 GB con un generoso espacio libre. Es fuerte en razonamiento estructurado y uso de herramientas, y más débil en conocimiento mundial amplio.
DeepSeek-R1-Distill-Qwen-32B: razonamiento más profundo, ajuste más preciso
DeepSeek destiló sus líneas de razonamiento R1 en modelos densos más pequeños. El DeepSeek-R1-Distill-Qwen-32B es la variante 32B, construida sobre una base Qwen2.5 y lanzada bajo una licencia del MIT. En Q4_K_M utiliza entre 18 y 20 GB, que es el ajuste más ajustado en esta guía. Expone su cadena de pensamiento a través de fichas de razonamiento visibles, lo cual es útil para problemas lentos y deliberados. Las versiones GGUF listas para usar están disponibles en bartowski en Hugging Face.
Lo que no cabe en 24GB
Los modelos de frontera abierta de 2026 son grandes sistemas MoE dispersos. Son bastante buenos en rendimiento y razonamiento, pero no funcionan con una sola tarjeta de consumo. GLM-5.2 de Z.ai tiene un MoE de aproximadamente 753 mil millones en total. El Kimi K2.7 de Moonshot pesa alrededor de 1T en total. DeepSeek envió V4 como vista previa pública en abril de 2026, con un punto de control V4-Pro cerca de parámetros de 1,6T. Qwen3.5-397B y Mistral Large 3 de Alibaba se encuentran en el mismo rango de clase de servidor.
Debido a que la memoria MoE rastrea los parámetros totales, todos estos necesitan equipos de múltiples GPU o sistemas unificados de alta memoria. Vale la pena conocerlas como opciones de API. No cambian lo que se ejecuta en una sola tarjeta de 24 GB.
Cómo ejecutar estos modelos localmente
Tres tiempos de ejecución cubren casi todas las configuraciones. Ollama es el camino más sencillo, con selección automática de cuantificación y una API compatible con OpenAI. llama.cpp brinda un control preciso sobre la cuantificación y descarga de GGUF. vLLM es el servidor centrado en el rendimiento para cargas de trabajo simultáneas más pesadas.
Comience con un modelo que coincida con su trabajo principal, no con el archivo más grande que pueda cargar. Mantenga el contexto bajo control y deje que la tarjeta haga lo que mejor sabe hacer. Ejecute IA local seria sin enviar un solo token a un punto final en la nube.
Conclusiones clave
24 GB es el piso práctico: ejecute modelos 20B-35B del tamaño adecuado, no la cantidad más grande de 70B que pueda incluir. Qwen3.6-27B es el valor predeterminado más potente; DeepSeek-R1-Distill-Qwen-32B es el más adecuado con ~18-20 GB. La memoria MoE rastrea los parámetros totales, por lo que cada experto permanece residente incluso cuando solo hay unas pocas rutas por token. La cuantización es la palanca de ajuste: Q4_K_M es el valor predeterminado; Q8_0 y BF16 rara vez caben un modelo 30B en una sola tarjeta. GLM-5.2, Kimi K2.7, DeepSeek V4 y Mistral Large 3 son de clase servidor y no se ejecutarán en una sola GPU de 24 GB.
Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.