OpenCode avec Ollama, c’est la configuration que l’on choisit quand on en a assez d’envoyer chaque prompt à une API cloud. Ça fonctionne. C’est aussi plus lent et plus fragile que ce que suggèrent les démonstrations.

La règle est simple : OpenCode en local est excellent pour les petites tâches, privées et répétitives. Ce n’est pas le modèle auquel confier une migration multi-fichiers un peu chaotique, à moins d’avoir envie de le surveiller en permanence.

Installer Ollama

Sur macOS :

brew install --cask ollama-app
open -a Ollama

Sur Linux :

curl -fsSL https://ollama.com/install.sh | sh

Ensuite, récupérez un modèle :

ollama pull gemma4

Vérifiez qu’il est disponible :

ollama list

Utilisez le nom exact du modèle affiché dans le résultat de cette commande pour votre configuration OpenCode.

Configurer OpenCode

OpenCode peut communiquer avec des fournisseurs compatibles OpenAI. Ollama expose un endpoint compatible à l’adresse :

http://localhost:11434/v1

Ajoutez un fournisseur Ollama dans votre configuration OpenCode :

{
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "gemma4:latest": {}
      }
    }
  }
}

Si OpenCode demande une authentification, utilisez une clé fictive :

{
  "ollama": {
    "type": "api",
    "key": "ollama"
  }
}

Redémarrez OpenCode et basculez vers le modèle Ollama depuis le sélecteur de modèle.

Modèles à essayer en premier

Gemma 4

Bon premier choix. Il gère bien les explications, les modifications simples et les petites tâches de code. Il tourne sur des machines modestes comparé aux modèles de code plus imposants.

Qwen3.5

Souvent meilleur pour le code, surtout si vous pouvez faire tourner une variante plus grande. Les modèles de la classe 27B sont plus utiles que les petits modèles, mais ils demandent une mémoire conséquente.

Llama 3.3

Bon modèle généraliste si votre matériel le permet. Moins pratique sur les portables modestes.

Performances : à quoi s’attendre

Les discussions récentes sur les modèles locaux disent tout haut ce que tout le monde pense tout bas : les prompts peuvent fonctionner, le code peut être bon, et l’ensemble peut quand même sembler lent dès que les appels d’outils s’enchaînent.

C’est normal. Un agent de code n’est pas qu’une simple requête de chat. Il lit des fichiers, planifie, modifie, vérifie les résultats et boucle. L’inférence locale rend chaque boucle plus visible.

Pour que cela reste supportable :

  • Gardez un contexte court
  • Utilisez des modèles plus petits pour les modifications simples
  • Gardez le modèle chargé
  • Fermez les applications gourmandes en mémoire
  • Utilisez une solution de repli cloud pour les refactorisations de longue durée

Maintenir Ollama en mémoire

export OLLAMA_KEEP_ALIVE="-1"

Redémarrez Ollama après avoir défini ce paramètre. Cela évite les démarrages à froid répétés pendant une session de codage.

Quand utiliser une solution de repli cloud

Utilisez OpenCode en local pour :

  • Lire du code inconnu
  • Préparer de petites modifications
  • Générer des tests
  • Expliquer des erreurs
  • Travailler avec des fichiers privés

Utilisez un modèle cloud pour :

  • Les refactorisations multi-fichiers
  • Le débogage complexe
  • Les changements d’architecture
  • Tout ce que vous ne voulez pas relire ligne par ligne

La meilleure configuration n’est pas le tout-local. C’est le local en priorité.

Configurations associées

Si c’est Gemma 4 qui vous intéresse spécifiquement, lisez Configuration de Gemma 4 avec Ollama. Si vous utilisez OpenClaw à la place d’OpenCode, consultez Gemma 4 avec OpenClaw.

AJOUTEZ UN REPLI CLOUD AVEC HAIMAKER