---
title: Gemma 4 12B lokal mit Ollama und OpenCode ausführen
description: >-
  Googles neues Gemma 4 12B ist ein multimodales offenes Modell, das auf einem
  16-GB-Laptop läuft. So holst du es mit Ollama und bindest es als lokalen
  Coding-Assistenten in OpenCode ein.
date: 2026-06-04T00:00:00.000Z
location: 'San Francisco, CA – 4. Juni 2026'
image: /images/gemma-4-12b-ollama-opencode-setup-hero.jpg
keywords: >-
  gemma 4 12b, gemma 4 12b ollama, gemma 4 12b opencode, gemma 4 12b lokal
  ausführen, gemma 4 12b setup, gemma 4 12b multimodal
faq:
  - question: Was ist Gemma 4 12B?
    answer: >-
      Gemma 4 12B ist Googles offenes Modell mit 12 Milliarden Parametern,
      veröffentlicht am 3. Juni 2026 unter der Apache-2.0-Lizenz. Es ist nativ
      multimodal (Text, Bild und Audio) mit einem Design ohne Encoder. Laut
      Google nähert sich die Benchmark-Leistung dem 26B-Modell an, benötigt
      dabei aber weniger als die Hälfte des Speichers.
  - question: 'Wie viel Speicher brauche ich, um Gemma 4 12B lokal auszuführen?'
    answer: >-
      Google gibt 16 GB VRAM bzw. Unified Memory als Untergrenze für den Betrieb
      von Gemma 4 12B auf einem Consumer-Laptop an. Bei der standardmäßigen
      4-Bit-Quantisierung sind die Gewichte etwa 8 GB groß, sodass 16 GB Platz
      für Kontext und andere Anwendungen lassen. 24 GB oder mehr sind für lange
      Coding-Sessions komfortabel.
  - question: Kann ich Gemma 4 12B mit OpenCode verwenden?
    answer: >-
      Ja. Führe Gemma 4 12B über Ollama aus und füge Ollama dann als
      Custom-Provider in ~/.config/opencode/opencode.jsonc hinzu, der auf
      http://localhost:11434/v1 zeigt. Starte OpenCode neu und wähle das Modell
      über /models aus. Sobald das Modell heruntergeladen ist, wird weder ein
      API-Key noch eine Internetverbindung benötigt.
locale: de-de
translationKey: gemma-4-12b-ollama-opencode-setup
---
Google hat **Gemma 4 12B** am 3. Juni 2026 veröffentlicht. Der Neuzugang füllt genau die Lücke, die sich viele lokale Entwickler wünschen: groß genug, um gut folgern zu können, und klein genug, um auf einem Laptop zu laufen, den du bereits besitzt.

Das Highlight ist die neue mittlere Größe. Die bisherige Gemma-4-Reihe hatte ein kleines Edge-Modell und ein 26B-Flaggschiff, dazwischen klaffte eine Lücke. Genau die schließt das 12B. Laut Google nähern sich seine Benchmarks dem 26B-Modell an, während es weniger als die Hälfte des Speichers benötigt. Das gesamte Modell bleibt innerhalb der 16-GB-Marke, die die meisten aktuellen Macs und Mittelklasse-GPUs ohnehin erfüllen.

Dieser Guide zeigt, was sich in der 12B-Variante geändert hat, und führt dich danach Schritt für Schritt durch die Einrichtung mit Ollama und die Anbindung an OpenCode als lokalen, privaten Coding-Assistenten.

## Was ist neu in Gemma 4 12B

- **12 Milliarden Parameter**, positioniert zwischen dem E4B-Edge-Modell und dem 26B-Mixture-of-Experts-Flaggschiff.
- **Native multimodale Eingabe.** Text, Bild und Audio werden im selben Modell verarbeitet. Die Architektur kommt ohne Encoder aus: Bilder durchlaufen ein leichtgewichtiges Embedding-Modul, und rohes Audio wird direkt in den Text-Token-Raum projiziert. Das bedeutet weniger Komplexität als bei einem nachträglich montierten Vision-Encoder.
- **Denkleistung, die dem 26B-Modell nahekommt.** Google gibt an, dass die Benchmark-Leistung des 12B an die 26B-Variante heranreicht – bei weniger als der Hälfte des Speicherbedarfs.
- **Multi-Token-Prediction-Drafter (MTP)** für geringere Latenz. Das hilft bei interaktiver Nutzung, wenn du auf jedes Token wartest.
- **Für agentenbasierte Workflows gebaut.** Tool-Calling und mehrstufige Coding-Loops sind damit von Anfang an gut unterstützt und nicht nur nachträglich angebaut.
- **Apache-2.0-Lizenz.** Kommerzielle Nutzung, Fine-Tuning, Weiterverbreitung. Die Gemma-4-Familie hat inzwischen über 150 Millionen Downloads erreicht.

Die Gewichte liegen auf Hugging Face und Kaggle, mit Unterstützung vom ersten Tag an für Transformers, llama.cpp, MLX, SGLang und vLLM. Ollama baut auf llama.cpp und GGUF auf, deshalb läuft das 12B dort genauso wie die früheren Gemma-4-Modelle.

## Gemma 4 12B im Vergleich zum Rest der Familie

| Variante | Am besten geeignet für | Speicher |
|---|---|---|
| E4B (Edge) | Smartphones, Embedded- und On-Device-Apps | Minimal |
| **12B (neu)** | Lokales Coding plus Bild/Audio auf einem Laptop | 16 GB+ |
| 26B MoE (Flaggschiff) | Anspruchsvolleres Reasoning, große Multi-File-Arbeit | 24 GB+ |

Wer auf einem leichteren Rechner arbeitet oder einfach beim kleineren Standardmodell bleiben will: Das ältere [Gemma 4 + Ollama + OpenCode Setup](/de-de/blog/gemma-4-mit-ollama-und-opencode-einrichten/) funktioniert weiterhin. Das 12B ist das Upgrade, zu dem du greifst, wenn du Speicherreserven hast und spürbar besseres Reasoning willst, ohne direkt zum 26B zu wechseln.

## Voraussetzungen

- Ein Mac mit Apple Silicon (M1–M5) und mindestens 16 GB Unified Memory – oder ein PC mit einer GPU ab 16 GB
- Homebrew auf macOS
- OpenCode installiert (siehe [opencode.ai](https://opencode.ai))

Googles angegebenes Minimum sind 16 GB. Damit lässt sich das 12B für die tägliche Arbeit komfortabel betreiben. Mit 24 GB oder mehr sind auch lange Sessions und größere Kontextfenster kein Problem.

## Schritt 1: Ollama installieren

Auf macOS:

```bash
brew install --cask ollama-app
open -a Ollama
```

Auf Linux:

```bash
curl -fsSL https://ollama.com/install.sh | sh
```

Warte, bis das Menüleisten-Symbol (macOS) erscheint oder der Dienst gestartet ist, und prüfe anschließend, ob der Server läuft:

```bash
ollama list
```

Die lokale API läuft unter `http://localhost:11434`.

## Schritt 2: Gemma 4 12B herunterladen

```bash
ollama pull gemma4:12b
```

Bei der standardmäßigen 4-Bit-Quantisierung ist der Download etwa 8 GB groß. Prüfe, ob das Modell angekommen ist:

```bash
ollama list
# NAME             ID              SIZE      MODIFIED
# gemma4:12b       ...             ~8 GB     ...
```

Starte einen kurzen Funktionstest:

```bash
ollama run gemma4:12b "Write a small TypeScript function that debounces a callback"
```

Überprüfe, ob die GPU die Arbeit übernimmt:

```bash
ollama ps
# Should show a CPU/GPU split, e.g. 12%/88% CPU/GPU
```

Auf Apple Silicon verwenden aktuelle Ollama-Builds automatisch Apples MLX-Backend, du musst also für die Beschleunigung nichts konfigurieren.

> **Tag nicht gefunden?** Gemma 4 12B ist brandneu. Falls `gemma4:12b` noch nicht in der Ollama-Registry ist, lade das offizielle GGUF von Hugging Face herunter und importiere es, oder aktualisiere Ollama (`brew upgrade ollama-app`) und versuche es erneut.

## Schritt 3: Gemma 4 12B mit OpenCode verbinden

OpenCode liest seine Konfiguration aus `~/.config/opencode/opencode.jsonc`. Füge Ollama als Custom-Provider hinzu:

```jsonc
{
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "gemma4:12b": {}
      }
    }
  }
}
```

Ollama validiert keine Keys, aber OpenCode erwartet trotzdem einen Auth-Eintrag. Füge einen Platzhalter in `~/.local/share/opencode/auth.json` hinzu:

```json
{
  "ollama": {
    "type": "api",
    "key": "ollama"
  }
}
```

Starte OpenCode neu, führe `/models` aus und wechsle zu `ollama/gemma4:12b`. Damit hast du einen Coding-Assistenten, der keine Zeile deines Codes von deinem Rechner wegschickt.

## Schritt 4: Das Modell warm halten

Standardmäßig entlädt Ollama ein Modell nach etwa fünf Minuten Inaktivität. Das führt bei jeder Rückkehr zum Terminal zu einem Kaltstart. So bleibt es geladen:

```bash
launchctl setenv OLLAMA_KEEP_ALIVE "-1"
```

Starte Ollama neu, damit die Änderung greift. Um sie über Neustarts hinweg beizubehalten, füge dies in `~/.zshrc` ein:

```bash
export OLLAMA_KEEP_ALIVE="-1"
```

Über das Ollama-Menüleisten-Symbol kannst du außerdem **Launch at Login** aktivieren, damit der Server schon bereit ist, bevor du es bist.

## Was Gemma 4 12B in OpenCode gut kann

Die zusätzlichen Parameter und die MTP-Drafter machen sich vor allem bei Aufgaben bemerkbar, die sich beim kleineren Modell noch grenzwertig anfühlten:

- **Mehrstufige Edits.** Es behält einen Plan über mehrere Dateien besser als das 8B, sodass kleine Refactorings öfter beim ersten Anlauf klappen.
- **Code-Erklärung und Review.** Frag, was ein Modul tut oder wo ein Bug sitzen könnte – die Antworten sind präziser.
- **Boilerplate und Scaffolding.** Config-Dateien, Test-Stubs, Route-Handler und CRUD-Layer kommen sauber heraus.
- **Bild-Eingabe.** Da das 12B multimodal ist, kannst du ihm einen Screenshot eines Fehlerdialogs oder ein UI-Mockup geben und nach einem Fix oder einer Komponente fragen, ohne ein separates Vision-Modell aufzusetzen.

## Wo es noch Schwächen hat

- **Große, übergreifende Refactorings.** Koordinierte Änderungen über ein Dutzend Dateien driften immer noch auseinander. Das 12B macht das besser als das 8B, aber gelöst ist das Problem nicht.
- **Die schwierigsten Debugging-Fälle.** Bugs, die mehrere Abstraktionsebenen übergreifen oder tiefes Domänenwissen erfordern, sind genau die Fälle, in denen ein Frontier-Cloud-Modell weiterhin seine Berechtigung hat.
- **Sehr langer Kontext auf 16 GB.** Das Modell unterstützt große Kontextfenster, aber unter Speicherdruck auf einem 16-GB-Rechner leidet die Qualität. Halte Eingaben moderat oder wechsle auf 24 GB+.

## Die Hybrid-Lösung: lokales Gemma 4 12B plus Cloud-Modelle

Das Setup, für das sich die meisten entscheiden: lokal für die routinemäßigen 70 %, Cloud für die schwierigen 30 %. Hier bekommst du jedes davon:

- **[haimaker.ai](https://haimaker.ai)** — ein API-Key für Claude Opus, GPT-5, Gemini Pro und Hunderte weitere Modelle, mit einheitlichen Preisen und Benchmarks, damit du vor dem Routing vergleichen kannst.
- **Ollama** — dein lokales Gemma 4 12B, kostenlos und privat, für alltägliche Edits und Lesezugriffe.
- **Provider-APIs direkt** — wenn du nur einen einzigen Cloud-Anbieter brauchst und Keys pro Anbieter selbst verwalten willst.

Füge Haimaker neben Ollama in OpenCode hinzu:

```jsonc
{
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "gemma4:12b": {}
      }
    },
    "haimaker": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "https://api.haimaker.ai/v1"
      },
      "models": {
        "anthropic/claude-sonnet-4-6": {},
        "openai/gpt-5": {},
        "google/gemini-2.5-pro": {}
      }
    }
  }
}
```

Füge deinen Haimaker-Key in `auth.json` hinzu:

```json
{
  "ollama": {
    "type": "api",
    "key": "ollama"
  },
  "haimaker": {
    "type": "api",
    "key": "YOUR_HAIMAKER_API_KEY"
  }
}
```

Nutze Gemma 4 12B für schnelle Aufgaben und wechsle über `/models` zu Sonnet oder GPT-5, wenn es anspruchsvoll wird. Deine Cloud-Kosten sinken damit auf einen Bruchteil dessen, was der Betrieb ausschließlich auf einem Frontier-Modell kosten würde. Um manuelles Umschalten zu vermeiden, kann der [Haimaker Auto-Router](/blog/openclaw-auto-router-setup/) die Aufgabenkomplexität erkennen und das Modell für dich auswählen.

Registriere dich auf [haimaker.ai](https://haimaker.ai) und sieh dich im vollständigen [Modellkatalog](https://haimaker.ai/models) um.

<a href="https://app.haimaker.ai/sign-up?utm_source=blog&utm_medium=cta&utm_campaign=gemma4-12b-opencode" class="cta-button">HOL DIR DEINEN HAIMAKER-API-KEY</a>

## Troubleshooting

**Provider erscheint nicht in /models.** Starte OpenCode nach dem Bearbeiten der Konfiguration neu. `opencode.jsonc` wird während des Betriebs nicht neu geladen.

**„Model not found".** Führe `ollama list` aus und gleiche die Modell-ID exakt ab, in der Regel `gemma4:12b`. Falls der Tag noch nicht in der Registry ist, siehe den Hinweis in Schritt 2 zum Importieren des Hugging-Face-GGUF.

**Authentifizierungsfehler mit Ollama.** Der Platzhalter `"key": "ollama"` in `auth.json` reicht aus. OpenCode braucht nur einen vorhandenen Eintrag.

**Langsame Generierung.** Stelle sicher, dass du einen aktuellen Ollama-Build für MLX-Beschleunigung auf Apple Silicon verwendest (`ollama --version`). Schließe speicherintensive Anwendungen. Auf 16 GB können schon ein paar Browser-Tabs mit Video dafür sorgen, dass das System in den Swap geht.

**Qualitätseinbruch bei langen Prompts.** Das ist Speicherdruck auf einem 16-GB-Rechner. Halte die Kontexteingaben moderat oder wechsle auf 24 GB+, um mehr Spielraum zu haben.

## Nützliche Ollama-Befehle

| Befehl | Beschreibung |
|---|---|
| `ollama list` | Heruntergeladene Modelle auflisten |
| `ollama ps` | Laufende Modelle und Speichernutzung anzeigen |
| `ollama run gemma4:12b` | Interaktiver Chat |
| `ollama stop gemma4:12b` | Aus dem Speicher entladen |
| `ollama pull gemma4:12b` | Auf die neueste Version aktualisieren |
| `ollama rm gemma4:12b` | Modell löschen |

## Fazit

Gemma 4 12B ist das lokale Modell, auf das viele gewartet haben: multimodal, Apache-lizenziert und stark genug, um den Großteil der täglichen Coding-Arbeit auf einem 16-GB-Laptop zu bewältigen. Starte es über Ollama, richte OpenCode darauf aus, und du hast einen privaten Assistenten für die Routinearbeit. Für die schwierigen Probleme ist ein Cloud-Modell nur einen `/models`-Wechsel entfernt – so profitierst du von Geschwindigkeit und Privatsphäre des lokalen Betriebs, ohne an die Grenzen seiner Denkleistung zu stoßen.

---

*Neu bei lokalen Setups? Starte mit dem [Gemma 4 + OpenCode Guide](/de-de/blog/gemma-4-mit-ollama-und-opencode-einrichten/) für das kleinere Standardmodell oder mit dem [Gemma 4 + OpenClaw Setup](/blog/gemma-4-ollama-openclaw-setup/), falls OpenClaw dein Agent ist. Für Cloud-Preise sieh dir den [Modellkatalog](https://haimaker.ai/models) an.*
