Google hat Gemma 4 12B am 3. Juni 2026 veröffentlicht. Der Neuzugang füllt genau die Lücke, die sich viele lokale Entwickler wünschen: groß genug, um gut folgern zu können, und klein genug, um auf einem Laptop zu laufen, den du bereits besitzt.
Das Highlight ist die neue mittlere Größe. Die bisherige Gemma-4-Reihe hatte ein kleines Edge-Modell und ein 26B-Flaggschiff, dazwischen klaffte eine Lücke. Genau die schließt das 12B. Laut Google nähern sich seine Benchmarks dem 26B-Modell an, während es weniger als die Hälfte des Speichers benötigt. Das gesamte Modell bleibt innerhalb der 16-GB-Marke, die die meisten aktuellen Macs und Mittelklasse-GPUs ohnehin erfüllen.
Dieser Guide zeigt, was sich in der 12B-Variante geändert hat, und führt dich danach Schritt für Schritt durch die Einrichtung mit Ollama und die Anbindung an OpenCode als lokalen, privaten Coding-Assistenten.
Was ist neu in Gemma 4 12B
- 12 Milliarden Parameter, positioniert zwischen dem E4B-Edge-Modell und dem 26B-Mixture-of-Experts-Flaggschiff.
- Native multimodale Eingabe. Text, Bild und Audio werden im selben Modell verarbeitet. Die Architektur kommt ohne Encoder aus: Bilder durchlaufen ein leichtgewichtiges Embedding-Modul, und rohes Audio wird direkt in den Text-Token-Raum projiziert. Das bedeutet weniger Komplexität als bei einem nachträglich montierten Vision-Encoder.
- Denkleistung, die dem 26B-Modell nahekommt. Google gibt an, dass die Benchmark-Leistung des 12B an die 26B-Variante heranreicht – bei weniger als der Hälfte des Speicherbedarfs.
- Multi-Token-Prediction-Drafter (MTP) für geringere Latenz. Das hilft bei interaktiver Nutzung, wenn du auf jedes Token wartest.
- Für agentenbasierte Workflows gebaut. Tool-Calling und mehrstufige Coding-Loops sind damit von Anfang an gut unterstützt und nicht nur nachträglich angebaut.
- Apache-2.0-Lizenz. Kommerzielle Nutzung, Fine-Tuning, Weiterverbreitung. Die Gemma-4-Familie hat inzwischen über 150 Millionen Downloads erreicht.
Die Gewichte liegen auf Hugging Face und Kaggle, mit Unterstützung vom ersten Tag an für Transformers, llama.cpp, MLX, SGLang und vLLM. Ollama baut auf llama.cpp und GGUF auf, deshalb läuft das 12B dort genauso wie die früheren Gemma-4-Modelle.
Gemma 4 12B im Vergleich zum Rest der Familie
| Variante | Am besten geeignet für | Speicher |
|---|---|---|
| E4B (Edge) | Smartphones, Embedded- und On-Device-Apps | Minimal |
| 12B (neu) | Lokales Coding plus Bild/Audio auf einem Laptop | 16 GB+ |
| 26B MoE (Flaggschiff) | Anspruchsvolleres Reasoning, große Multi-File-Arbeit | 24 GB+ |
Wer auf einem leichteren Rechner arbeitet oder einfach beim kleineren Standardmodell bleiben will: Das ältere Gemma 4 + Ollama + OpenCode Setup funktioniert weiterhin. Das 12B ist das Upgrade, zu dem du greifst, wenn du Speicherreserven hast und spürbar besseres Reasoning willst, ohne direkt zum 26B zu wechseln.
Voraussetzungen
- Ein Mac mit Apple Silicon (M1–M5) und mindestens 16 GB Unified Memory – oder ein PC mit einer GPU ab 16 GB
- Homebrew auf macOS
- OpenCode installiert (siehe opencode.ai)
Googles angegebenes Minimum sind 16 GB. Damit lässt sich das 12B für die tägliche Arbeit komfortabel betreiben. Mit 24 GB oder mehr sind auch lange Sessions und größere Kontextfenster kein Problem.
Schritt 1: Ollama installieren
Auf macOS:
brew install --cask ollama-app
open -a Ollama
Auf Linux:
curl -fsSL https://ollama.com/install.sh | sh
Warte, bis das Menüleisten-Symbol (macOS) erscheint oder der Dienst gestartet ist, und prüfe anschließend, ob der Server läuft:
ollama list
Die lokale API läuft unter http://localhost:11434.
Schritt 2: Gemma 4 12B herunterladen
ollama pull gemma4:12b
Bei der standardmäßigen 4-Bit-Quantisierung ist der Download etwa 8 GB groß. Prüfe, ob das Modell angekommen ist:
ollama list
# NAME ID SIZE MODIFIED
# gemma4:12b ... ~8 GB ...
Starte einen kurzen Funktionstest:
ollama run gemma4:12b "Write a small TypeScript function that debounces a callback"
Überprüfe, ob die GPU die Arbeit übernimmt:
ollama ps
# Should show a CPU/GPU split, e.g. 12%/88% CPU/GPU
Auf Apple Silicon verwenden aktuelle Ollama-Builds automatisch Apples MLX-Backend, du musst also für die Beschleunigung nichts konfigurieren.
Tag nicht gefunden? Gemma 4 12B ist brandneu. Falls
gemma4:12bnoch nicht in der Ollama-Registry ist, lade das offizielle GGUF von Hugging Face herunter und importiere es, oder aktualisiere Ollama (brew upgrade ollama-app) und versuche es erneut.
Schritt 3: Gemma 4 12B mit OpenCode verbinden
OpenCode liest seine Konfiguration aus ~/.config/opencode/opencode.jsonc. Füge Ollama als Custom-Provider hinzu:
{
"provider": {
"ollama": {
"npm": "@ai-sdk/openai-compatible",
"options": {
"baseURL": "http://localhost:11434/v1"
},
"models": {
"gemma4:12b": {}
}
}
}
}
Ollama validiert keine Keys, aber OpenCode erwartet trotzdem einen Auth-Eintrag. Füge einen Platzhalter in ~/.local/share/opencode/auth.json hinzu:
{
"ollama": {
"type": "api",
"key": "ollama"
}
}
Starte OpenCode neu, führe /models aus und wechsle zu ollama/gemma4:12b. Damit hast du einen Coding-Assistenten, der keine Zeile deines Codes von deinem Rechner wegschickt.
Schritt 4: Das Modell warm halten
Standardmäßig entlädt Ollama ein Modell nach etwa fünf Minuten Inaktivität. Das führt bei jeder Rückkehr zum Terminal zu einem Kaltstart. So bleibt es geladen:
launchctl setenv OLLAMA_KEEP_ALIVE "-1"
Starte Ollama neu, damit die Änderung greift. Um sie über Neustarts hinweg beizubehalten, füge dies in ~/.zshrc ein:
export OLLAMA_KEEP_ALIVE="-1"
Über das Ollama-Menüleisten-Symbol kannst du außerdem Launch at Login aktivieren, damit der Server schon bereit ist, bevor du es bist.
Was Gemma 4 12B in OpenCode gut kann
Die zusätzlichen Parameter und die MTP-Drafter machen sich vor allem bei Aufgaben bemerkbar, die sich beim kleineren Modell noch grenzwertig anfühlten:
- Mehrstufige Edits. Es behält einen Plan über mehrere Dateien besser als das 8B, sodass kleine Refactorings öfter beim ersten Anlauf klappen.
- Code-Erklärung und Review. Frag, was ein Modul tut oder wo ein Bug sitzen könnte – die Antworten sind präziser.
- Boilerplate und Scaffolding. Config-Dateien, Test-Stubs, Route-Handler und CRUD-Layer kommen sauber heraus.
- Bild-Eingabe. Da das 12B multimodal ist, kannst du ihm einen Screenshot eines Fehlerdialogs oder ein UI-Mockup geben und nach einem Fix oder einer Komponente fragen, ohne ein separates Vision-Modell aufzusetzen.
Wo es noch Schwächen hat
- Große, übergreifende Refactorings. Koordinierte Änderungen über ein Dutzend Dateien driften immer noch auseinander. Das 12B macht das besser als das 8B, aber gelöst ist das Problem nicht.
- Die schwierigsten Debugging-Fälle. Bugs, die mehrere Abstraktionsebenen übergreifen oder tiefes Domänenwissen erfordern, sind genau die Fälle, in denen ein Frontier-Cloud-Modell weiterhin seine Berechtigung hat.
- Sehr langer Kontext auf 16 GB. Das Modell unterstützt große Kontextfenster, aber unter Speicherdruck auf einem 16-GB-Rechner leidet die Qualität. Halte Eingaben moderat oder wechsle auf 24 GB+.
Die Hybrid-Lösung: lokales Gemma 4 12B plus Cloud-Modelle
Das Setup, für das sich die meisten entscheiden: lokal für die routinemäßigen 70 %, Cloud für die schwierigen 30 %. Hier bekommst du jedes davon:
- haimaker.ai — ein API-Key für Claude Opus, GPT-5, Gemini Pro und Hunderte weitere Modelle, mit einheitlichen Preisen und Benchmarks, damit du vor dem Routing vergleichen kannst.
- Ollama — dein lokales Gemma 4 12B, kostenlos und privat, für alltägliche Edits und Lesezugriffe.
- Provider-APIs direkt — wenn du nur einen einzigen Cloud-Anbieter brauchst und Keys pro Anbieter selbst verwalten willst.
Füge Haimaker neben Ollama in OpenCode hinzu:
{
"provider": {
"ollama": {
"npm": "@ai-sdk/openai-compatible",
"options": {
"baseURL": "http://localhost:11434/v1"
},
"models": {
"gemma4:12b": {}
}
},
"haimaker": {
"npm": "@ai-sdk/openai-compatible",
"options": {
"baseURL": "https://api.haimaker.ai/v1"
},
"models": {
"anthropic/claude-sonnet-4-6": {},
"openai/gpt-5": {},
"google/gemini-2.5-pro": {}
}
}
}
}
Füge deinen Haimaker-Key in auth.json hinzu:
{
"ollama": {
"type": "api",
"key": "ollama"
},
"haimaker": {
"type": "api",
"key": "YOUR_HAIMAKER_API_KEY"
}
}
Nutze Gemma 4 12B für schnelle Aufgaben und wechsle über /models zu Sonnet oder GPT-5, wenn es anspruchsvoll wird. Deine Cloud-Kosten sinken damit auf einen Bruchteil dessen, was der Betrieb ausschließlich auf einem Frontier-Modell kosten würde. Um manuelles Umschalten zu vermeiden, kann der Haimaker Auto-Router die Aufgabenkomplexität erkennen und das Modell für dich auswählen.
Registriere dich auf haimaker.ai und sieh dich im vollständigen Modellkatalog um.
HOL DIR DEINEN HAIMAKER-API-KEY
Troubleshooting
Provider erscheint nicht in /models. Starte OpenCode nach dem Bearbeiten der Konfiguration neu. opencode.jsonc wird während des Betriebs nicht neu geladen.
„Model not found”. Führe ollama list aus und gleiche die Modell-ID exakt ab, in der Regel gemma4:12b. Falls der Tag noch nicht in der Registry ist, siehe den Hinweis in Schritt 2 zum Importieren des Hugging-Face-GGUF.
Authentifizierungsfehler mit Ollama. Der Platzhalter "key": "ollama" in auth.json reicht aus. OpenCode braucht nur einen vorhandenen Eintrag.
Langsame Generierung. Stelle sicher, dass du einen aktuellen Ollama-Build für MLX-Beschleunigung auf Apple Silicon verwendest (ollama --version). Schließe speicherintensive Anwendungen. Auf 16 GB können schon ein paar Browser-Tabs mit Video dafür sorgen, dass das System in den Swap geht.
Qualitätseinbruch bei langen Prompts. Das ist Speicherdruck auf einem 16-GB-Rechner. Halte die Kontexteingaben moderat oder wechsle auf 24 GB+, um mehr Spielraum zu haben.
Nützliche Ollama-Befehle
| Befehl | Beschreibung |
|---|---|
ollama list | Heruntergeladene Modelle auflisten |
ollama ps | Laufende Modelle und Speichernutzung anzeigen |
ollama run gemma4:12b | Interaktiver Chat |
ollama stop gemma4:12b | Aus dem Speicher entladen |
ollama pull gemma4:12b | Auf die neueste Version aktualisieren |
ollama rm gemma4:12b | Modell löschen |
Fazit
Gemma 4 12B ist das lokale Modell, auf das viele gewartet haben: multimodal, Apache-lizenziert und stark genug, um den Großteil der täglichen Coding-Arbeit auf einem 16-GB-Laptop zu bewältigen. Starte es über Ollama, richte OpenCode darauf aus, und du hast einen privaten Assistenten für die Routinearbeit. Für die schwierigen Probleme ist ein Cloud-Modell nur einen /models-Wechsel entfernt – so profitierst du von Geschwindigkeit und Privatsphäre des lokalen Betriebs, ohne an die Grenzen seiner Denkleistung zu stoßen.
Neu bei lokalen Setups? Starte mit dem Gemma 4 + OpenCode Guide für das kleinere Standardmodell oder mit dem Gemma 4 + OpenClaw Setup, falls OpenClaw dein Agent ist. Für Cloud-Preise sieh dir den Modellkatalog an.