Le meilleur modèle Ollama pour un agent de codage n’est pas toujours le plus gros modèle que l’on puisse télécharger. Les agents fonctionnent en boucle : ils lisent des fichiers, appellent des outils, révisent leurs plans et génèrent des correctifs. Un modèle qui semble bon sur un seul prompt peut devenir inutilisable lorsque chaque appel d’outil ajoute un nouveau passage d’inférence locale lent.

Utilisez ce classement comme point de départ pratique : quel modèle télécharger, quel matériel il exige, et à quel moment arrêter de forcer l’inférence locale pour basculer sur un modèle cloud.

Classement rapide

RangModèleCommande de téléchargementIdéal pourMatériel recommandé
1Qwen3 Coder 30Bollama pull qwen3-coder:30bMeilleur choix par défaut pour un agent de codage local24 Go ou plus de VRAM, ou 32 Go ou plus de mémoire unifiée
2Qwen3 30Bollama pull qwen3:30bTâches d’agent générales, raisonnement, revue de code24 Go ou plus de VRAM, ou 32 Go ou plus de mémoire unifiée
3Gemma 4 26B MoEollama pull gemma4:26bAide au codage locale rapide sur stations de travail performantes24 Go ou plus de VRAM, ou 32 Go ou plus de mémoire unifiée
4Kimi K2.7 Codeollama pull kimi-k2.7-codeCodage de lignée frontier sur matériel haut de gamme48 Go ou plus de VRAM, ou 96 Go ou plus de mémoire unifiée
5gpt-oss 20Bollama pull gpt-oss:20bMeilleur choix avec 16 Go, raisonnement ajustable16 Go de VRAM ou de mémoire unifiée
6Gemma 4 E4Bollama pull gemma4:e4bUtilisation légère sur ordinateur portable16 Go de mémoire unifiée
7Qwen3 8Bollama pull qwen3:8bPetites modifications et explication de code8 à 16 Go de mémoire

Si vous ne devez en essayer qu’un, testez Qwen3 Coder 30B. Ollama le présente comme un modèle de codage et d’agent avec prise en charge d’une fenêtre de contexte de 256K, et il est conçu exactement pour le type de travail que font les agents de codage : lire du code, utiliser des outils et conserver l’état sur des tâches longues.

Que choisir selon votre machine

8 à 16 Go de mémoire

Utilisez gpt-oss 20B, Qwen3 8B ou Gemma 4 E4B. gpt-oss 20B est devenu le choix par défaut de la communauté pour les machines à 16 Go depuis sa sortie : il tient dans le budget mémoire et permet d’ajuster l’effort de raisonnement selon la tâche.

Ce palier convient pour :

  • Expliquer du code inconnu
  • Écrire de petites fonctions
  • Préparer des ébauches de tests
  • Générer des fichiers de configuration
  • Résumer des logs

Ne comptez pas ici sur des refactorings multi-fichiers fiables. Les petits modèles peuvent produire du code utile, mais ils perdent vite le fil dès que l’agent commence à ouvrir des fichiers, réviser des correctifs et jongler avec les sorties d’outils.

24 à 32 Go de mémoire

Utilisez Qwen3 Coder 30B, Qwen3 30B ou Gemma 4 26B MoE.

C’est le palier où l’agent local devient vraiment utile. Le modèle est assez grand pour suivre le contexte d’un dépôt, tout en restant assez léger pour tourner sur un GPU de bureau performant ou un Mac doté de plus de mémoire. Pour la plupart des développeurs, c’est le moment où Ollama cesse d’être une curiosité et commence à s’intégrer au flux de travail.

64 Go ou plus de mémoire

N’essayez les variantes plus grandes de Qwen ou DeepSeek que si vous savez déjà pourquoi vous en avez besoin.

La tentation est de se précipiter sur le plus gros modèle de la bibliothèque. Pour les agents, c’est souvent un mauvais réflexe. Un énorme modèle local peut être techniquement impressionnant tout en rendant la boucle de codage trop lente. Un modèle plus grand devient utile lorsque la tâche exige réellement plus de raisonnement ou de contexte. C’est un fardeau lorsque l’agent se contente de lire des fichiers, d’écrire du code passe-partout ou de rédiger des tests.

Vous voulez une configuration qui privilégie le local avec un repli cloud, sans gérer les clés de chaque fournisseur ? haimaker route les tâches simples de vos agents de codage vers votre modèle local et transfère les tâches difficiles vers les modèles cloud via un seul endpoint.

ROUTEZ LES MODÈLES LOCAUX ET CLOUD AVEC HAIMAKER

Meilleur choix global : Qwen3 Coder

Qwen3 Coder est le premier modèle que je testerais pour toute configuration d’agent de codage local.

Téléchargez-le :

ollama pull qwen3-coder:30b

Faites une vérification rapide :

ollama run qwen3-coder:30b "Explain this repo structure and suggest where tests should live."

Pourquoi il arrive en tête :

  • Il est explicitement optimisé pour le codage et les flux de travail des agents.
  • La page Ollama mentionne la prise en charge de ollama launch pour Claude Code, Codex, OpenCode et OpenClaw.
  • La variante 30B est bien plus réaliste en local que la variante 480B.
  • La prise en charge du long contexte le rend plus adapté au travail sur dépôt que les anciens modèles de code locaux.

Utilisez-le pour la revue de code, la génération de tests, les refactorings de taille moyenne et les sessions d’agent locales où la confidentialité compte.

Meilleur choix léger : Gemma 4

Gemma 4 est la famille de modèles à essayer quand Qwen3 Coder est trop lourd. Les variantes plus petites de Gemma 4 sont conçues pour une utilisation locale et sur appareil, tandis que la variante 26B MoE offre une option plus puissante pour une station de travail sans activer tous les paramètres à chaque token.

Téléchargez la version adaptée aux ordinateurs portables :

ollama pull gemma4:e4b

Téléchargez la version plus puissante pour une station de travail :

ollama pull gemma4:26b

Gemma 4 est un bon choix pour les agents de codage quand vous voulez une aide locale rapide pour les explications, les petites modifications et le code privé. Elle est moins pertinente pour les longues sessions autonomes où l’agent doit garder en tête un plan de migration complet.

Dernières arrivées : Kimi K2.7 Code et Laguna XS 2.1

Deux modèles orientés codage sont arrivés dans la bibliothèque Ollama cet été et méritent d’être suivis.

Kimi K2.7 Code est la version optimisée pour le codage de Moonshot, basée sur la lignée K2.6 — la même famille dont la version K3 a surpassé les modèles fermés de pointe sur les classements Arena. Il exige du matériel haut de gamme (comptez 48 Go ou plus de VRAM, ou un Mac doté d’une grande quantité de mémoire), mais si vous en disposez, c’est la lignée de modèles de code ouverts la plus puissante que l’on puisse exécuter en local aujourd’hui.

ollama pull kimi-k2.7-code

Laguna XS 2.1 est le MoE de codage par agents de Poolside — 33B paramètres au total avec seulement 3B actifs par token, il est donc bien plus léger à exécuter que sa taille ne le laisse penser. Il est conçu spécifiquement pour la boucle d’appels d’outils au cœur des agents de codage.

Si vous utilisiez DeepSeek Coder V2 avec une ancienne version de ce guide, abandonnez-le : il a deux générations de retard sur les options actuelles et a complètement disparu des classements communautaires.

Où utiliser ces modèles

  • haimaker.ai : utilisez les modèles Ollama locaux avec des modèles cloud plus puissants, puis routez les tâches simples de vos agents de codage en local et les tâches difficiles vers les modèles payants.
  • OpenClaw : utilisez Ollama comme fournisseur local pour les sessions d’agent de codage. Voir le guide des modèles locaux pour OpenClaw.
  • OpenCode : ajoutez Ollama via le fournisseur compatible OpenAI. Voir Ollama avec OpenCode.
  • Codex et Claude Code : les pages des modèles Ollama incluent des exemples de ollama launch pour les environnements d’exécution d’agents, notamment Codex et Claude Code.

Configuration pour les agents compatibles OpenAI

La plupart des agents de codage peuvent utiliser Ollama via son endpoint local compatible OpenAI :

http://localhost:11434/v1

Utilisez une clé API factice si votre outil en exige une. Ollama ne la valide pas en local.

{
  "baseURL": "http://localhost:11434/v1",
  "apiKey": "ollama",
  "model": "qwen3-coder:30b"
}

Pour OpenCode, le bloc fournisseur ressemble à ceci :

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Ollama (local)",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "qwen3-coder:30b": {
          "name": "Qwen3 Coder 30B"
        }
      }
    }
  }
}

Si les appels d’outils ne sont pas fiables, réduisez d’abord la taille du modèle, puis n’augmentez le contexte que dans la limite de ce que votre matériel peut gérer. Une fenêtre de contexte géante qui sature la mémoire est pire qu’une fenêtre plus petite qui reste réactive.

Quand ne pas utiliser Ollama

Les modèles locaux sont préférables lorsque la confidentialité, le coût ou le travail hors ligne comptent. Ils ne sont pas automatiquement meilleurs pour toutes les tâches de codage.

Utilisez un modèle cloud dans les cas suivants :

  • La tâche couvre de nombreux fichiers
  • Le bug est subtil
  • Vous avez besoin d’appels d’outils fiables
  • Le correctif touchera des systèmes en production
  • Vous n’avez pas le temps de revoir chaque ligne générée

La configuration pratique consiste à privilégier le local sans s’y limiter. Utilisez Qwen3 Coder ou Gemma 4 pour le travail privé à faible coût, puis basculez vers un modèle cloud plus puissant quand la tâche devient coûteuse en attention plutôt qu’en tokens.

ROUTEZ LES MODÈLES LOCAUX ET CLOUD AVEC HAIMAKER


Pour la configuration locale spécifique à OpenClaw, voir meilleurs modèles locaux pour OpenClaw. Pour la configuration OpenCode, voir utiliser Ollama avec OpenCode.