Le mot « gratuit » est utilisé à tort et à travers dans l’écosystème des modèles d’IA. Soyons précis sur ce que cela signifie concrètement pour les utilisateurs d’OpenClaw.

Il existe trois catégories : les modèles qui ne coûtent littéralement rien (locaux), les modèles avec des offres gratuites qui finissent par s’épuiser, et les modèles si peu chers que leur coût est arrondi à zéro sur la plupart des factures. Je vais passer en revue ces trois catégories.

Vraiment gratuits : les modèles locaux

Les seuls modèles qui ne coûtent rien par token sont ceux qui s’exécutent sur votre propre matériel. Avec Ollama, c’est simple.

Installez-le, téléchargez un modèle, configurez OpenClaw pour l’utiliser :

# Install Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Pull a coding model
ollama pull qwen3.6:27b

Puis ajoutez Ollama comme fournisseur dans ~/.openclaw/openclaw.json :

{
  models: {
    providers: {
      ollama: {
        baseUrl: "http://localhost:11434/v1",
        api: "openai-completions",
        models: [
          { id: "qwen3.6:27b", name: "Qwen3.6 27B" }
        ]
      }
    }
  },
  agents: {
    defaults: {
      model: { primary: "ollama/qwen3.6:27b" }
    }
  }
}

Quels modèles locaux fonctionnent bien

Qwen3.6 27B est actuellement le meilleur compromis — la communauté l’appelle toujours le « top du top » pour le codage local. Il obtient 77,2 % sur SWE-bench Verified, gère bien la génération de code, le débogage et les modifications multi-fichiers pour un usage quotidien, et ne nécessite qu’environ 18 Go de VRAM (une RTX 5090, ou un Mac à puce M doté d’au moins 32 Go de mémoire unifiée).

Qwen3 Coder 30B est l’alternative optimisée pour les agents — un contexte de 256 K et des appels d’outils fiables, ce qui compte pour la boucle d’appels d’outils d’OpenClaw.

gpt-oss 20B et Gemma 4 s’exécutent sur des machines dotées de 16 Go de mémoire. gpt-oss 20B est devenu le choix par défaut parmi les petits modèles depuis sa sortie — il n’active qu’environ 3,6 milliards de paramètres par token et permet d’ajuster l’effort de raisonnement. La qualité baisse toutefois sur les tâches complexes ; je ne leur confierais pas de refactorisations multi-fichiers.

Le vrai compromis

Les modèles locaux sont gratuits, mais pas rapides. Les temps de réponse sont 3 à 10 fois plus longs que ceux des API cloud, selon votre matériel. Et même les meilleurs modèles open source de taille grand public restent en retrait par rapport aux modèles Claude de pointe sur les tâches de débogage les plus difficiles et le travail multi-fichiers.

Si votre travail consiste principalement à lire des fichiers, à générer du boilerplate et à faire des modifications simples, le local fonctionne bien. Si vous faites du débogage complexe ou travaillez sur l’architecture, il vous faudra un modèle cloud pour ces tâches.

Offres gratuites des fournisseurs cloud

Quelques fournisseurs offrent une utilisation réellement gratuite jusqu’à une certaine limite.

Gemini Flash est la meilleure option gratuite pour l’inférence cloud. L’offre gratuite de Google vous donne droit à 15 requêtes par minute avec un contexte allant jusqu’à un million de tokens. C’est suffisant pour des sessions de codage occasionnelles.

// Add to ~/.openclaw/openclaw.json
{
  models: {
    providers: {
      google: {
        models: [
          { id: "gemini-3-flash", name: "Gemini 3 Flash" }
        ]
      }
    }
  }
}

Le piège : l’offre gratuite est soumise à des limites de débit plus strictes et vos données peuvent être utilisées pour l’entraînement. Pour des projets personnels et pour apprendre, c’est probablement acceptable. Pour du code propriétaire, utilisez l’API payante ou passez en local.

Quasi gratuits : les modèles à moins d’un dollar

Certains modèles coûtent si peu par token qu’une journée complète d’utilisation intensive d’OpenClaw reste sous la barre du dollar.

ModèleCoût en entréeCoût en sortieEstimation du coût quotidien
DeepSeek V4 Flash~0,10 $/M~0,28 $/M~0,15 $
GLM-4.7 Flash0,07 $/M0,28 $/M~0,15 $
GPT-4o-mini0,15 $/M0,60 $/M~0,50 $
MiniMax M30,30 $/M~0,50 $

Estimations quotidiennes basées sur environ 500 k tokens en entrée + 200 k en sortie, ce qui correspond à une journée de codage bien remplie.

MiniMax M3 mérite une mention spéciale : à 0,30 $/M en entrée avec une fenêtre de contexte d’un million de tokens, c’est actuellement le meilleur rapport qualité-prix du segment économique — le faire tourner 24 h/24 pour un agent coûte environ 7 à 15 $ par mois. DeepSeek V4 Flash est le tarif plancher absolu : assez peu cher pour qu’une utilisation en continu par un agent 24 h/24 et 7 j/7 reste sous les 5 $ par mois.

Ces modèles gèrent bien les parties fastidieuses d’une session de codage : lecture de fichiers, modifications simples, documentation, exécution de tests. Confiez les 20 % de problèmes difficiles à un meilleur modèle et votre facture totale reste sous les 5 $/jour.

Vous pouvez accéder à tous ces modèles via Haimaker avec une seule clé API, ou les configurer individuellement auprès de chaque fournisseur.

Une fois votre clé Haimaker définie dans HAIMAKER_API_KEY, l’outil CLI connect (npx -y @haimaker/connect --openclaw) intègre la configuration du fournisseur dans OpenClaw à votre place, afin que vous puissiez utiliser ces modèles à moins d’un dollar sans toucher au JSON.

La configuration pratique : hybride gratuit + économique

C’est la configuration que finissent par adopter la plupart de ceux qui surveillent leurs coûts :

  1. Modèle local pour les tâches simples (Qwen3.6 27B via Ollama, gratuit)
  2. Modèle cloud économique pour les tâches moyennes (DeepSeek V4 Flash ou MiniMax M3, quelques centimes)
  3. Modèle premium pour les problèmes difficiles (Claude Sonnet ou Opus, paiement à l’usage)
{
  agents: {
    defaults: {
      model: {
        primary: "ollama/qwen3.6:27b",
        thinking: "anthropic/claude-sonnet-4-6"
      }
    }
  }
}

Le modèle local gère 60 à 70 % des requêtes (lecture de fichiers, code simple). Sonnet prend le relais pour le reste. Votre facture d’API quotidienne tombe à 2 à 5 $ au lieu de 30 à 50 $.

Pour en savoir plus sur le routage de modèles, consultez notre guide sur les workflows multi-agents.

OBTENEZ 10 $ DE CRÉDITS GRATUITS SUR HAIMAKER


Pour une comparaison complète des modèles, voir les meilleurs modèles pour OpenClaw. Pour des stratégies d’optimisation des coûts, voir réduire les coûts de tokens de 96 %.