El mejor modelo de Ollama para un agente de programación no siempre es el más grande que puedas descargar. Los agentes funcionan en bucle: leen archivos, llaman a herramientas, revisan planes y generan parches. Un modelo que parece bueno en una sola petición puede volverse inutilizable si cada llamada a una herramienta exige otra pasada lenta de inferencia local.

Usa esta clasificación como punto de partida práctico: qué modelo descargar, qué hardware necesita y cuándo dejar de forzar la inferencia local y pasar a un respaldo en la nube.

Clasificación rápida

PuestoModeloComando de descargaIdeal paraHardware práctico
1Qwen3 Coder 30Bollama pull qwen3-coder:30bMejor opción local por defecto para agentes de programación24 GB+ de VRAM o 32 GB+ de memoria unificada
2Qwen3 30Bollama pull qwen3:30bTareas generales de agente, razonamiento, revisión de código24 GB+ de VRAM o 32 GB+ de memoria unificada
3Gemma 4 26B MoEollama pull gemma4:26bAyuda rápida de programación local en estaciones de trabajo potentes24 GB+ de VRAM o 32 GB+ de memoria unificada
4Kimi K2.7 Codeollama pull kimi-k2.7-codeProgramación con linaje de vanguardia en hardware potente48 GB+ de VRAM o 96 GB+ de memoria unificada
5gpt-oss 20Bollama pull gpt-oss:20bMejor opción para 16 GB, razonamiento ajustable16 GB de VRAM o memoria unificada
6Gemma 4 E4Bollama pull gemma4:e4bUso ligero en portátil16 GB de memoria unificada
7Qwen3 8Bollama pull qwen3:8bEdiciones pequeñas y explicación de código8–16 GB de memoria

Si solo vas a probar un modelo, prueba Qwen3 Coder 30B. Ollama lo incluye como modelo de programación y de agente con soporte para una ventana de contexto de 256K, y está pensado exactamente para el tipo de trabajo que hacen los agentes de programación: leer código, usar herramientas y mantener el estado a lo largo de tareas largas.

Qué elegir según tu equipo

8–16 GB de memoria

Usa gpt-oss 20B, Qwen3 8B o Gemma 4 E4B. gpt-oss 20B se ha convertido en la opción por defecto de la comunidad para equipos con 16 GB desde su lanzamiento: cabe en la memoria disponible y te permite ajustar el esfuerzo de razonamiento en cada tarea.

Esta gama es adecuada para:

  • Explicar código desconocido
  • Escribir funciones pequeñas
  • Redactar tests
  • Generar archivos de configuración
  • Resumir logs

No esperes refactorizaciones fiables de varios archivos aquí. Los modelos más pequeños pueden escribir código útil, pero pierden el hilo en cuanto el agente empieza a abrir archivos, revisar parches y gestionar las salidas de las herramientas.

24–32 GB de memoria

Usa Qwen3 Coder 30B, Qwen3 30B o Gemma 4 26B MoE.

Este es el nivel útil para agentes locales. El modelo es lo bastante grande para seguir el contexto del repositorio, pero sigue siendo lo bastante pequeño para funcionar en una GPU de escritorio potente o en un Mac con más memoria. Para la mayoría de desarrolladores, este es el punto en el que Ollama deja de parecer una novedad y empieza a formar parte del flujo de trabajo.

64 GB+ de memoria

Prueba variantes más grandes de Qwen o DeepSeek solo si ya sabes por qué las necesitas.

La tentación es ir a por el modelo más grande de la biblioteca. Para agentes, ese instinto suele ser erróneo. Un modelo local enorme puede ser técnicamente impresionante y aun así hacer que el bucle de programación sea demasiado lento. Un modelo más grande es útil cuando la tarea realmente necesita más razonamiento o contexto. Es un sobrecoste cuando el agente solo lee archivos, escribe código repetitivo o redacta tests.

¿Quieres una configuración local-first con respaldo en la nube sin gestionar las claves de cada proveedor? haimaker enruta el trabajo sencillo de los agentes de programación a tu modelo local y deriva las tareas difíciles a modelos en la nube a través de un único endpoint.

ENRUTA MODELOS LOCALES Y EN LA NUBE CON HAIMAKER

Mejor en general: Qwen3 Coder

Qwen3 Coder es el primer modelo que probaría en cualquier configuración de agente de programación local.

Descárgalo:

ollama pull qwen3-coder:30b

Haz una comprobación rápida:

ollama run qwen3-coder:30b "Explain this repo structure and suggest where tests should live."

Por qué ocupa el primer puesto:

  • Está explícitamente optimizado para flujos de trabajo de programación y de agentes.
  • La página de Ollama incluye soporte para ollama launch en Claude Code, Codex, OpenCode y OpenClaw.
  • La variante de 30B es mucho más realista en local que la variante de 480B.
  • El soporte de contexto largo lo hace más adecuado para trabajar con repositorios que los modelos locales de código anteriores.

Úsalo para revisión de código, generación de tests, refactorizaciones de tamaño medio y sesiones de agente local-first cuando la privacidad importa.

Mejor opción ligera: Gemma 4

Gemma 4 es la familia de modelos que conviene probar cuando Qwen3 Coder es demasiado pesado. Las variantes más pequeñas de Gemma 4 están diseñadas para uso local y en el dispositivo, mientras que la variante 26B MoE te da una opción más potente para estaciones de trabajo sin activar todos los parámetros en cada token.

Descarga la versión apta para portátil:

ollama pull gemma4:e4b

Descarga la versión más potente para estaciones de trabajo:

ollama pull gemma4:26b

Gemma 4 es una buena opción para agentes de programación cuando quieres ayuda local rápida con explicaciones, ediciones pequeñas y código privado. Resulta menos atractiva para sesiones autónomas largas en las que el agente necesita mantener coherente un plan de migración completo.

Novedades recientes: Kimi K2.7 Code y Laguna XS 2.1

Dos modelos centrados en programación han llegado a la biblioteca de Ollama este verano y merece la pena seguirlos.

Kimi K2.7 Code es la versión optimizada para programación de Moonshot basada en la línea K2.6, la misma familia cuyo lanzamiento K3 lleva un tiempo superando a modelos cerrados de vanguardia en los leaderboards de Chatbot Arena. Necesita hardware potente (hablamos de 48 GB+ de VRAM o un Mac con mucha memoria), pero si lo tienes, es la línea de modelos de programación de código abierto más potente que puedes ejecutar hoy en local.

ollama pull kimi-k2.7-code

Laguna XS 2.1 es el MoE para agentes de programación de Poolside: 33B parámetros totales con solo 3B activos por token, por lo que funciona mucho más ligero de lo que sugiere su tamaño. Está creado específicamente para el bucle de llamadas a herramientas en el que viven los agentes de programación.

Si estabas usando DeepSeek Coder V2 de una versión anterior de esta guía, retíralo: está dos generaciones por detrás de las opciones actuales y ha desaparecido por completo de las clasificaciones de la comunidad.

Dónde usar estos modelos

  • haimaker.ai - usa modelos locales de Ollama junto a modelos en la nube más potentes; enruta el trabajo sencillo de los agentes de programación a tu modelo local y deriva las tareas difíciles a modelos de pago.
  • OpenClaw - usa Ollama como proveedor local para sesiones de agente de programación. Consulta la guía de modelos locales de OpenClaw.
  • OpenCode - añade Ollama mediante el proveedor compatible con OpenAI. Consulta Ollama con OpenCode.
  • Codex y Claude Code - las páginas de modelos de Ollama incluyen ejemplos de ollama launch para entornos de ejecución de agentes, incluidos Codex y Claude Code.

Configuración para agentes compatibles con OpenAI

La mayoría de agentes de programación pueden usar Ollama a través de su endpoint local compatible con OpenAI:

http://localhost:11434/v1

Usa una clave API de marcador de posición si tu herramienta la exige. Ollama no la valida localmente.

{
  "baseURL": "http://localhost:11434/v1",
  "apiKey": "ollama",
  "model": "qwen3-coder:30b"
}

Para OpenCode, el bloque de proveedor tiene este aspecto:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Ollama (local)",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "qwen3-coder:30b": {
          "name": "Qwen3 Coder 30B"
        }
      }
    }
  }
}

Si las llamadas a herramientas no son fiables, reduce primero el tamaño del modelo y luego aumenta el contexto solo hasta donde tu hardware pueda soportarlo. Una ventana de contexto gigante que obliga a usar swap es peor que una más pequeña que se mantiene ágil.

Cuándo no usar Ollama

Los modelos locales son mejores cuando la privacidad, el coste o el trabajo sin conexión importan. No son automáticamente mejores para todas las tareas de programación.

Usa un modelo en la nube cuando:

  • La tarea abarca muchos archivos
  • El bug es sutil
  • Necesitas llamadas a herramientas fiables
  • El parche tocará sistemas de producción
  • No tienes tiempo para revisar cada línea generada

La configuración práctica es local-first, no solo local. Usa Qwen3 Coder o Gemma 4 para trabajo privado y barato, y luego deriva a un modelo en la nube más potente cuando lo que se encarece es tu atención en lugar de los tokens.

ENRUTA MODELOS LOCALES Y EN LA NUBE CON HAIMAKER


Para la configuración local específica de OpenClaw, consulta mejores modelos locales para OpenClaw. Para la configuración de OpenCode, consulta usar Ollama con OpenCode.