OpenCode mit Ollama ist das Setup, das viele wünschen, wenn sie es leid sind, jeden Coding-Prompt an eine Cloud-API zu schicken. Es funktioniert – ist aber auch langsamer und fehleranfälliger, als die Demos vermuten lassen.
Was man realistisch erwarten sollte, ist einfach: Lokales OpenCode eignet sich hervorragend für kleine, private, wiederkehrende Aufgaben. Für eine unübersichtliche Multi-File-Migration ist es nicht das richtige Modell – es sei denn, du magst es, ständig danebenzusitzen und aufzupassen.
Ollama installieren
Unter macOS:
brew install --cask ollama-app
open -a Ollama
Unter Linux:
curl -fsSL https://ollama.com/install.sh | sh
Lade anschließend ein Modell herunter:
ollama pull gemma4
Prüfe, ob es verfügbar ist:
ollama list
Verwende den exakten Modellnamen aus dieser Ausgabe in deiner OpenCode-Konfiguration.
OpenCode konfigurieren
OpenCode unterstützt OpenAI-kompatible Provider. Ollama bietet einen kompatiblen Endpunkt unter folgender Adresse an:
http://localhost:11434/v1
Füge in deiner OpenCode-Konfiguration einen Ollama-Provider hinzu:
{
"provider": {
"ollama": {
"npm": "@ai-sdk/openai-compatible",
"options": {
"baseURL": "http://localhost:11434/v1"
},
"models": {
"gemma4:latest": {}
}
}
}
}
Falls OpenCode eine Authentifizierung anfordert, verwende einen Platzhalter-API-Key:
{
"ollama": {
"type": "api",
"key": "ollama"
}
}
Starte OpenCode neu und wähle in der Modellauswahl das Ollama-Modell aus.
Modelle für den Einstieg
Gemma 4
Gute erste Wahl. Es eignet sich für Erklärungen, einfache Änderungen und kleinere Coding-Aufgaben. Im Vergleich zu größeren Coding-Modellen läuft es auch auf schwächerer Hardware.
Qwen3.5
Für Code oft besser, besonders wenn du eine größere Variante ausführen kannst. Die Modelle der 27B-Klasse sind deutlich nützlicher als kleine Modelle, benötigen aber ordentlich Arbeitsspeicher.
Llama 3.3
Gutes Allround-Modell, wenn du die Hardware dafür hast. Auf kleineren Laptops weniger praktisch.
Performance-Erwartungen
Was in aktuellen Threads zu lokalen Modellen offen zugegeben wird: Prompts können funktionieren, der Code kann gut sein – und trotzdem kann sich das Ganze langsam anfühlen, sobald sich Tool-Aufrufe häufen.
Das ist normal. Ein Programmier-Agent ist kein einzelner Chat-Request. Er liest Dateien, plant, bearbeitet, prüft Ausgaben und läuft in Schleifen. Bei lokaler Inferenz wird jede Schleife spürbarer.
So bleibt es erträglich:
- Kontext klein halten
- Kleinere Modelle für einfache Änderungen verwenden
- Das Modell warm halten
- Speicherintensive Anwendungen schließen
- Einen Cloud-Fallback für lange Refactorings nutzen
Ollama warm halten
export OLLAMA_KEEP_ALIVE="-1"
Starte Ollama danach neu. Das vermeidet wiederholte Kaltstarts während einer Coding-Session.
Wann ein Cloud-Fallback sinnvoll ist
Verwende lokales OpenCode für:
- Unbekannten Code lesen
- Kleine Änderungen entwerfen
- Tests generieren
- Fehler erklären
- Mit privaten Dateien arbeiten
Verwende ein Cloud-Modell für:
- Multi-File-Refactorings
- Schwieriges Debugging
- Architekturänderungen
- Alles, was du nicht Zeile für Zeile durchsehen möchtest
Das beste Setup ist nicht rein lokal, sondern lokal-first.
Verwandte Anleitungen
Wenn dein eigentliches Ziel speziell Gemma 4 ist, lies Gemma 4 mit Ollama einrichten. Falls du OpenClaw statt OpenCode verwendest, nutze Gemma 4 mit OpenClaw.