Ejecutar modelos en local supone no depender de claves de API, de facturas por uso ni de enviar código propietario a servidores de terceros. También implica respuestas más lentas y una menor calidad en los problemas difíciles. Que ese equilibrio compense o no depende de lo que estés haciendo.

Si has llegado aquí desde una búsqueda de «openclaw local model» o «openclaw local llm», empieza por lo sencillo: usa Gemma 4 8B o Qwen3.6 9B en máquinas con 16 GB, Qwen3.6 27B en GPU de 24 GB o más (una RTX 5090 o un M5 Pro) y mantén una alternativa en la nube para las tareas en las que los modelos locales se atasquen. OpenClaw en local funciona bien a día de hoy. No es magia.

En 2026 han cambiado dos cosas. El lanzamiento de Qwen3.6 el 22 de abril trajo un modelo denso de 27B para programación que supera a un MoE de 397B en SWE-bench. Y el M5 Max de Apple (anunciado en marzo de 2026) incorpora 128 GB de memoria unificada y Neural Accelerators en cada núcleo de la GPU: los modelos de clase 70B ahora se ejecutan en un portátil. A ello se suma que Ollama se ha convertido en un proveedor oficial de OpenClaw, por lo que la configuración es más sencilla que nunca.

Ranking de modelos

Modelos locales actuales ordenados según su idoneidad para programar con OpenClaw, atendiendo a las puntuaciones de SWE-bench Verified, la fiabilidad de las llamadas a herramientas y el rendimiento real como agente:

ModeloParámetrosActivaciónVRAM necesariaSWE-benchVelocidad (RTX 5090)Ideal para
Qwen3.6 27B27B27B (denso)18 GB+77,2 %~70 t/sLa mejor relación calidad-tamaño para programación
Qwen3 Coder Plus72B72B (denso)48 GB+70,6 %~30 t/sLas tareas de programación más difíciles y bucles de agente completos
Qwen3.6 35B-A3B35B3B (MoE)16 GB+~180 t/sTrabajo crítico en velocidad, alto rendimiento
Qwen3.6 9B9B9B (denso)8 GB+~186 t/sHardware de gama básica y tareas sencillas
Llama 3.3 70B70B70B (denso)GPU doble~27 t/s (2× 5090)Programación general y buen seguimiento de instrucciones
gpt-oss 20B21B3,6B (MoE)16 GB~160 t/sLa mejor opción con 16 GB; esfuerzo de razonamiento ajustable
Laguna XS 2.133B3B (MoE)24 GB+rápido (MoE)Codificación con agentes y bucles de llamadas a herramientas
Gemma 4 8B8B8B (denso)8 GB+~150 t/sPrivacidad ante todo y configuraciones ligeras
Qwen3 32B32B32B (denso)24 GB+~60 t/sTodoterreno sólido y ampliamente probado

Qwen3.6 27B es la gran novedad. Obtiene un 77,2 % en SWE-bench Verified, un 59,3 % en Terminal-Bench 2.0 (igualando exactamente a Claude Opus 4.5) y funciona con 18 GB de VRAM. Que un modelo denso de 27B supere a un MoE de 397B en programación es el resultado de los cambios arquitectónicos de la versión 3.6: Gated Delta Networks y un postentrenamiento dirigido con pull requests reales.

El MoE 35B-A3B es el comodín. Solo se activan 3B de parámetros en cada forward pass, por lo que funciona a ~180 t/s en una única RTX 5090. La calidad es inferior a la del 27B denso en los problemas difíciles, pero para leer archivos, generar código repetitivo y hacer ediciones sencillas se siente como una API en la nube.

Hay tres incorporaciones recientes que conviene conocer. gpt-oss 20B se ha convertido en la opción de consenso de la comunidad para equipos con 16 GB: un MoE pequeño con esfuerzo de razonamiento ajustable. Laguna XS 2.1 (Poolside) es un MoE de 33B con 3B activos diseñado específicamente para bucles de codificación con agentes. Y Kimi K2.7 Code acerca a Ollama la línea K2 de Moonshot, prácticamente frontera, para quienes dispongan de configuraciones de 48 GB o más, mientras que el Kimi K3 completo de pesos abiertos llegará a finales de julio para quienes trabajen con hardware de clase servidor.

Requisitos de hardware

La calidad de los modelos locales escala con el tamaño del modelo, y el tamaño del modelo escala con los requisitos de hardware. Los niveles siguientes parten de hardware de 2026: la serie RTX 50 en NVIDIA y los M5 en Apple.

De 8 a 16 GB de VRAM (gama de entrada)

RTX 5060/5070 o 16 GB de memoria unificada (M5 básico o M5 Pro de entrada). Suficiente para Qwen3.6 9B y el MoE 35B-A3B. El 9B se desenvuelve bien con tareas sencillas y resúmenes de código a ~186 t/s en una 5090; en una 5070 espera ~120 t/s. El 35B-A3B consume mucha menos memoria de lo que sugiere su número de parámetros porque solo 3B de parámetros se activan en cada forward pass.

Modelos: Qwen3.6 9B, Qwen3.6 35B-A3B, Gemma 4 8B

De 18 a 32 GB de VRAM (recomendado)

Una RTX 5090 (32 GB GDDR7, 1.792 GB/s) o entre 36 y 64 GB de memoria unificada (M5 Pro / M5 Max básico). Aquí es donde los modelos locales empiezan a ser prácticos para el trabajo real. Qwen3.6 27B funciona con comodidad con 18 GB y su puntuación en SWE-bench (77,2 %) rivaliza con la de modelos en la nube por los que pagarías por token.

El salto de ancho de banda de la RTX 5090 frente a la 4090 (1.792 GB/s contra 1.008 GB/s; un 78 % más) es la cifra relevante para la inferencia, no los FLOPS brutos. La generación de tokens está limitada por el ancho de banda de memoria, y una sola 5090 genera alrededor de 186 t/s con Qwen 8B y 124 t/s con modelos de clase 14B.

Modelos: Qwen3.6 27B, Qwen3 32B, Qwen3.6 Plus (cuando encaje)

48 GB o más de memoria efectiva (gama alta)

Dos RTX 5090 (64 GB en total) o 96–128 GB de memoria unificada en el M5 Max. Qwen3 Coder Plus y Llama 3.3 70B se sitúan aquí.

Dos rutas:

  • Equipo con dos 5090: 27 t/s con Llama 70B Q4_K_M y paralelismo de tensores de vLLM; a un paso de una H100 por una fracción del coste. Ideal para torres de sobremesa donde quepan dos tarjetas.
  • MacBook Pro M5 Max con 128 GB: un modelo 70B Q4_K_M (~40 GB en disco) se carga por completo en la memoria unificada y deja espacio de sobra para el contexto. Los Neural Accelerators de Apple integrados en cada núcleo de la GPU hacen que el procesamiento del prompt sea entre 3,3 y 4 veces más rápido que con el M4 Max, y la generación en régimen estacionario se sitúa en torno a 18–25 t/s. A cambio, ganas portabilidad: esta es la única configuración que cabe en una mochila.

Modelos: Qwen3 Coder Plus, Llama 3.3 70B, Qwen3.6 Plus en precisión completa

El M5 Max con 128 GB de memoria unificada es el nuevo punto óptimo para el trabajo local serio en un portátil. El framework MLX de Apple incluye ahora soporte para Neural Accelerator, de modo que la GPU y el Neural Engine trabajan en paralelo en cada forward pass, en lugar de funcionar solo una u otra.

¿No tienes hardware que encaje en estos niveles? Haimaker ofrece a OpenClaw un único endpoint de enrutamiento en la nube, para que puedas ejecutar modelos locales donde funcionen y recurrir a modelos en la nube para las tareas que no puedan resolver.

PRUEBA HAIMAKER PARA EL ENRUTAMIENTO EN LA NUBE

Configurar Ollama

Ollama es la forma más sencilla de ejecutar modelos locales. La instalas, haces pull de un modelo y ya tienes una API compatible con OpenAI funcionando en localhost.

# Install
curl -fsSL https://ollama.com/install.sh | sh

# Pull a model (pick one based on your hardware)
ollama pull qwen3.6:27b          # Best quality, needs 18GB+ VRAM
ollama pull qwen3.6:35b-a3b      # Fast MoE model, runs on 16GB
ollama pull qwen3.6:9b           # Lightweight, runs on 8GB
ollama pull qwen3-coder-plus     # Premium, needs 48GB+ or 96GB unified

Ollama expone una API en http://localhost:11434 por defecto.

Consejo de r/LocalLLaMA: Varios usuarios afirman que el rendimiento mejora si pasan de Ollama a llama.cpp directamente con los modelos de 27B o superiores. Ollama aporta comodidad, pero llama.cpp te da más control sobre la cuantización y la asignación de memoria. Empieza con Ollama y cambia a llama.cpp si te encuentras con muros de rendimiento.

Configuración de OpenClaw

Como Ollama ya es un proveedor oficial, la configuración es sencilla. Ejecuta el asistente de incorporación:

openclaw onboard --auth-choice ollama

O añade Ollama manualmente en ~/.openclaw/openclaw.json:

{
  models: {
    providers: {
      ollama: {
        baseUrl: "http://localhost:11434/v1",
        api: "openai-completions",
        models: [
          {
            id: "qwen3.6:27b",
            name: "Qwen3.6 27B",
            reasoning: false,
            contextWindow: 131072,
            maxTokens: 8192
          }
        ]
      }
    }
  },
  agents: {
    defaults: {
      model: { primary: "ollama/qwen3.6:27b" },
      models: {
        "ollama/qwen3.6:27b": { alias: "qwen-local" }
      }
    }
  }
}

Cambia a tu modelo local:

/model qwen-local

Qué hacen bien los modelos locales

Tras ejecutar Qwen3.6 27B en local durante varias semanas, hay varios puntos que se mantienen:

  • Leer y resumir código. Pregúntale qué hace una función y te dará una respuesta sólida. No es tan matizada como la de Sonnet 4.6, pero basta para moverse por bases de código desconocidas.
  • Generar código para patrones comunes. Código repetitivo, operaciones CRUD, archivos de configuración, scaffolding de pruebas. La mayoría de las veces escribe código funcional al primer intento. La versión 3.6 se postentrenó con pull requests reales fusionados, y eso se nota en la calidad de los diffs.
  • Operaciones con archivos y refactorizaciones sencillas. Listar archivos, buscar patrones y renombrar variables en un archivo. Tareas mecánicas que no requieren un razonamiento profundo.
  • Llamadas a herramientas de agente. Qwen3.6 subió el listón de la fiabilidad en function calling: su 59,3 % en Terminal-Bench 2.0 iguala exactamente a Claude Opus 4.5. Para el bucle de herramientas de OpenClaw, eso se traduce en menos errores del tipo «el modelo ha llamado a la función equivocada con los argumentos equivocados».

Dónde fallan los modelos locales

  • Refactorizaciones en varios archivos. Cualquier tarea que requiera mantener contexto entre más de 5 archivos se vuelve poco fiable. El modelo pierde el hilo o introduce cambios inconsistentes. Los modelos en la nube con ventanas de contexto de más de 200K siguen teniendo ventaja aquí, aunque la brecha se ha reducido con Qwen3.6.
  • Depuración compleja. Si el fallo obliga a razonar a través de varias capas de abstracción, los modelos locales proponen correcciones superficiales cuando el problema es más profundo. Claude Opus 4.8 sigue superando a Qwen3.6 27B por unos 11 puntos en SWE-bench Verified y Claude Fable 5 por unos 18.
  • Velocidad de los modelos densos en hardware antiguo. El modelo de 27B funciona a unos 70 tokens por segundo en una única RTX 5090 y a ~22 t/s en un M5 Max. Si todavía tienes una RTX 3090 o 4090, espera más bien en torno a 30–40 t/s. El MoE 35B-A3B a más de 180 t/s es la excepción.
  • Contexto muy largo. Qwen3.6 admite hasta 256K tokens en teoría, pero la calidad de la inferencia se degrada en hardware de consumo al superar los 32K. Mantén un valor realista de contextWindow en tu configuración.

El enfoque híbrido

La mayoría de quienes prueban modelos locales acaban con una configuración híbrida: local para lo barato y nube para lo difícil.

{
  agents: {
    defaults: {
      model: {
        primary: "ollama/qwen3.6:27b",
        thinking: "anthropic/claude-sonnet-4-6-20260514"
      }
    }
  }
}

El modelo local se encarga de leer archivos, hacer ediciones sencillas y generar código repetitivo; quizá entre el 60 y el 70 % de una sesión de programación típica. Sonnet se encarga de la depuración, las decisiones de arquitectura y el trabajo en varios archivos. La factura de la API baja a unos pocos dólares al día en lugar de entre 20 y 50 dólares.

Cambia manualmente cuando sepas que una tarea necesita más capacidad:

/model sonnet

O usa el auto-router de Haimaker para que gestione el enrutamiento por ti. El auto-router detecta la complejidad de la tarea y envía los problemas difíciles a modelos en la nube automáticamente, de modo que no tengas que pensar cuándo cambiar.

Resolución de problemas

El modelo carga lentamente o se bloquea. Es probable que te hayas quedado sin memoria. Prueba una cuantización menor: ollama pull qwen3.6:27b-q4_K_M consume menos memoria con un pequeño coste de calidad. Q4_K_M es el punto óptimo para la mayoría: una pérdida de calidad mínima y un ahorro de memoria significativo.

Las llamadas a herramientas fallan. Establece "reasoning": false en la configuración de tu modelo y quédate con los modelos Qwen3.6: gestionan el formato de llamadas a herramientas de OpenClaw de forma más fiable que Mistral o los modelos Llama antiguos. Si las llamadas a herramientas siguen fallando, actualiza Ollama a la última versión. La integración oficial como proveedor corrigió varios casos extremos.

Errores de ventana de contexto. Establece con precisión el valor de contextWindow en tu configuración. Para los modelos Qwen3.6, 131072 (128K) es un valor por defecto seguro en hardware con 24 GB o más de VRAM (una única RTX 5090 lo gestiona cómodamente). Con 16 GB, mantente en 32768 para evitar la degradación de la calidad.

Velocidad de generación lenta. Si obtienes menos de 40 t/s con el modelo de 27B en una 5090 o menos de 18 t/s en un M5 Max, comprueba si hay otros procesos usando la GPU. Cierra cualquier pestaña del navegador que ejecute WebGL o vídeo. En Mac, Monitor de Actividad → Historial de GPU te mostrará qué está compitiendo por la memoria unificada. Los usuarios de M5 también deben confirmar que Ollama usa el backend MLX (v0.21+): la diferencia de velocidad entre la ruta que usa solo Metal y la que usa MLX es de aproximadamente el doble en el procesamiento del prompt.

PRUEBA HAIMAKER PARA EL ENRUTAMIENTO EN LA NUBE


Para comparar precios de modelos, consulta los modelos más baratos para OpenClaw. Para reducir el coste de los tokens en modelos en la nube, consulta cómo reducir los costes un 96 % con QMD.