OpenCode mit Ollama ist das Setup, das viele wünschen, wenn sie es leid sind, jeden Coding-Prompt an eine Cloud-API zu schicken. Es funktioniert – ist aber auch langsamer und fehleranfälliger, als die Demos vermuten lassen.

Was man realistisch erwarten sollte, ist einfach: Lokales OpenCode eignet sich hervorragend für kleine, private, wiederkehrende Aufgaben. Für eine unübersichtliche Multi-File-Migration ist es nicht das richtige Modell – es sei denn, du magst es, ständig danebenzusitzen und aufzupassen.

Ollama installieren

Unter macOS:

brew install --cask ollama-app
open -a Ollama

Unter Linux:

curl -fsSL https://ollama.com/install.sh | sh

Lade anschließend ein Modell herunter:

ollama pull gemma4

Prüfe, ob es verfügbar ist:

ollama list

Verwende den exakten Modellnamen aus dieser Ausgabe in deiner OpenCode-Konfiguration.

OpenCode konfigurieren

OpenCode unterstützt OpenAI-kompatible Provider. Ollama bietet einen kompatiblen Endpunkt unter folgender Adresse an:

http://localhost:11434/v1

Füge in deiner OpenCode-Konfiguration einen Ollama-Provider hinzu:

{
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "gemma4:latest": {}
      }
    }
  }
}

Falls OpenCode eine Authentifizierung anfordert, verwende einen Platzhalter-API-Key:

{
  "ollama": {
    "type": "api",
    "key": "ollama"
  }
}

Starte OpenCode neu und wähle in der Modellauswahl das Ollama-Modell aus.

Modelle für den Einstieg

Gemma 4

Gute erste Wahl. Es eignet sich für Erklärungen, einfache Änderungen und kleinere Coding-Aufgaben. Im Vergleich zu größeren Coding-Modellen läuft es auch auf schwächerer Hardware.

Qwen3.5

Für Code oft besser, besonders wenn du eine größere Variante ausführen kannst. Die Modelle der 27B-Klasse sind deutlich nützlicher als kleine Modelle, benötigen aber ordentlich Arbeitsspeicher.

Llama 3.3

Gutes Allround-Modell, wenn du die Hardware dafür hast. Auf kleineren Laptops weniger praktisch.

Performance-Erwartungen

Was in aktuellen Threads zu lokalen Modellen offen zugegeben wird: Prompts können funktionieren, der Code kann gut sein – und trotzdem kann sich das Ganze langsam anfühlen, sobald sich Tool-Aufrufe häufen.

Das ist normal. Ein Programmier-Agent ist kein einzelner Chat-Request. Er liest Dateien, plant, bearbeitet, prüft Ausgaben und läuft in Schleifen. Bei lokaler Inferenz wird jede Schleife spürbarer.

So bleibt es erträglich:

  • Kontext klein halten
  • Kleinere Modelle für einfache Änderungen verwenden
  • Das Modell warm halten
  • Speicherintensive Anwendungen schließen
  • Einen Cloud-Fallback für lange Refactorings nutzen

Ollama warm halten

export OLLAMA_KEEP_ALIVE="-1"

Starte Ollama danach neu. Das vermeidet wiederholte Kaltstarts während einer Coding-Session.

Wann ein Cloud-Fallback sinnvoll ist

Verwende lokales OpenCode für:

  • Unbekannten Code lesen
  • Kleine Änderungen entwerfen
  • Tests generieren
  • Fehler erklären
  • Mit privaten Dateien arbeiten

Verwende ein Cloud-Modell für:

  • Multi-File-Refactorings
  • Schwieriges Debugging
  • Architekturänderungen
  • Alles, was du nicht Zeile für Zeile durchsehen möchtest

Das beste Setup ist nicht rein lokal, sondern lokal-first.

Verwandte Anleitungen

Wenn dein eigentliches Ziel speziell Gemma 4 ist, lies Gemma 4 mit Ollama einrichten. Falls du OpenClaw statt OpenCode verwendest, nutze Gemma 4 mit OpenClaw.

CLOUD-FALLBACK MIT HAIMAKER EINRICHTEN