En el mundo de los modelos de IA se abusa de la palabra «gratis». Voy a ser más preciso sobre lo que significa de verdad para los usuarios de OpenClaw.
Hay tres categorías: modelos que no cuestan literalmente nada (locales), modelos con niveles gratuitos que tarde o temprano se agotan, y modelos tan baratos que en la mayoría de las facturas se redondean a cero. Repasaré las tres a continuación.
Realmente gratis: modelos locales
Los únicos modelos que no cuestan nada por token son los que ejecutas en tu propio hardware. Ollama lo pone muy fácil.
Instálalo, descarga un modelo y apunta OpenClaw a él:
# Install Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Pull a coding model
ollama pull qwen3.6:27b
Después, añade Ollama como proveedor en ~/.openclaw/openclaw.json:
{
models: {
providers: {
ollama: {
baseUrl: "http://localhost:11434/v1",
api: "openai-completions",
models: [
{ id: "qwen3.6:27b", name: "Qwen3.6 27B" }
]
}
}
},
agents: {
defaults: {
model: { primary: "ollama/qwen3.6:27b" }
}
}
}
Qué modelos locales funcionan bien
Qwen3.6 27B es el punto óptimo actual: la comunidad sigue considerándolo «la cima de la pirámide» para programación local. Obtiene un 77,2 % en SWE-bench Verified, maneja bien la generación de código, la depuración y las ediciones de varios archivos para el trabajo diario, y solo necesita unos 18 GB de VRAM (una RTX 5090 o un Mac de la serie M con 32 GB o más de memoria unificada).
Qwen3 Coder 30B es la alternativa orientada a agentes: contexto de 256 K y llamada a herramientas fiable, algo importante para el bucle de trabajo con herramientas de OpenClaw.
gpt-oss 20B y Gemma 4 funcionan en máquinas con 16 GB. gpt-oss 20B se ha convertido en la opción pequeña por defecto desde su lanzamiento: activa solo ~3,6 B de parámetros por token y permite ajustar el esfuerzo de razonamiento. La calidad sigue bajando en tareas complejas; no confiaría en ninguno de los dos para refactorizaciones de varios archivos.
La contrapartida real
Los modelos locales son gratis, pero no rápidos. Los tiempos de respuesta son entre 3 y 10 veces más lentos que los de las APIs en la nube, según tu hardware. Incluso los mejores modelos abiertos de consumo siguen por detrás de los modelos más avanzados de Claude en las tareas más difíciles de depuración y trabajo con varios archivos.
Si tu trabajo consiste sobre todo en leer archivos, generar código repetitivo y hacer ediciones sencillas, lo local funciona bien. Si estás haciendo depuración compleja o trabajo de arquitectura, para esas tareas querrás un modelo en la nube.
Niveles gratuitos de proveedores en la nube
Algunos proveedores ofrecen uso realmente gratuito hasta un límite.
Gemini Flash es la mejor opción gratuita para inferencia en la nube. El nivel gratuito de Google ofrece 15 peticiones por minuto con hasta 1 M de tokens de contexto. Es suficiente para sesiones de programación esporádicas.
// Add to ~/.openclaw/openclaw.json
{
models: {
providers: {
google: {
models: [
{ id: "gemini-3-flash", name: "Gemini 3 Flash" }
]
}
}
}
}
La pega: el nivel gratuito tiene límites de frecuencia más estrictos y tus datos pueden usarse para entrenar modelos. Para proyectos personales y para aprender, probablemente no pasa nada. Para código propietario, usa la API de pago o ejecuta los modelos en local.
Casi gratis: modelos de menos de un dólar
Algunos modelos cuestan tan poco por token que un día completo de uso intensivo de OpenClaw se queda por debajo de 1 dólar.
| Modelo | Coste de entrada | Coste de salida | Estimación de coste diario |
|---|---|---|---|
| DeepSeek V4 Flash | ~0,10 $/M | ~0,28 $/M | ~0,15 $ |
| GLM-4.7 Flash | 0,07 $/M | 0,28 $/M | ~0,15 $ |
| GPT-4o-mini | 0,15 $/M | 0,60 $/M | ~0,50 $ |
| MiniMax M3 | 0,30 $/M | — | ~0,50 $ |
Estimaciones diarias basadas en ~500 K tokens de entrada y 200 K de salida, lo que equivale a un día intenso de programación.
MiniMax M3 merece una mención especial: con 0,30 $/M de entrada y una ventana de contexto de 1 M de tokens, es la opción con mejor relación calidad-precio del segmento económico; tenerlo funcionando las 24 horas para un agente cuesta aproximadamente entre 7 y 15 $ al mes. DeepSeek V4 Flash es el mínimo absoluto: tan barato que tener un agente funcionando 24/7 se queda por debajo de 5 $ al mes.
Estos modelos resuelven bien las partes tediosas de una sesión de programación: lectura de archivos, ediciones sencillas, documentación y ejecución de pruebas. Dirige el 20 % de los problemas difíciles a un modelo mejor y tu factura total se quedará por debajo de 5 $ al día.
Puedes acceder a todos ellos a través de Haimaker con una sola clave de API, o configurarlos individualmente con cada proveedor.
Una vez que tengas tu clave de Haimaker en HAIMAKER_API_KEY, la CLI connect (npx -y @haimaker/connect --openclaw) añade la configuración del proveedor a OpenClaw por ti, para que puedas enrutar esos modelos de menos de un dólar sin tocar JSON.
La configuración práctica: híbrido gratis y barato
La mayoría de quienes se preocupan por los costes termina aquí:
- Modelo local para tareas sencillas (Qwen3.6 27B vía Ollama, gratis)
- Modelo barato en la nube para tareas intermedias (DeepSeek V4 Flash o MiniMax M3, céntimos)
- Modelo premium para los problemas difíciles (Claude Sonnet u Opus, pago por uso)
{
agents: {
defaults: {
model: {
primary: "ollama/qwen3.6:27b",
thinking: "anthropic/claude-sonnet-4-6"
}
}
}
}
El modelo local gestiona entre el 60 y el 70 % de las peticiones (lectura de archivos, código sencillo). Sonnet entra en juego para el resto. Tu factura diaria de API baja a entre 2 y 5 $ en lugar de entre 30 y 50 $.
Para más información sobre cómo enrutar modelos, consulta nuestra guía sobre flujos de trabajo multiagente.
CONSIGUE 10 $ DE CRÉDITO GRATIS EN HAIMAKER
Para una comparación completa de modelos, consulta los mejores modelos para OpenClaw. Para estrategias de optimización de costes, consulta cómo reducir los costes de tokens un 96 %.