---
title: 如何使用 Ollama 和 OpenCode 在本機執行 Gemma 4 12B
description: >-
  Google 全新推出的 Gemma 4 12B 是一款多模態開放模型，可在 16GB 筆記型電腦上執行。以下介紹如何透過 Ollama
  下載模型，並將它接入 OpenCode 作為你的本機開發助理。
date: 2026-06-04T00:00:00.000Z
location: 美國加州舊金山 – 2026 年 6 月 4 日
image: /images/gemma-4-12b-ollama-opencode-setup-hero.jpg
keywords: >-
  gemma 4 12b, gemma 4 12b ollama, gemma 4 12b opencode, 本機執行 gemma 4 12b, gemma
  4 12b 設定, gemma 4 12b 多模態
faq:
  - question: Gemma 4 12B 是什麼？
    answer: >-
      Gemma 4 12B 是 Google 於 2026 年 6 月 3 日發布的 12B 參數開放模型，採用 Apache 2.0
      授權。它原生支援多模態（文字、視覺與音訊），採用無編碼器設計。Google 表示其基準測試效能接近 26B 模型，但記憶體用量不到一半。
  - question: 在本機執行 Gemma 4 12B 需要多少記憶體？
    answer: >-
      Google 建議的最低規格是 16GB VRAM 或統一記憶體，可在消費級筆記型電腦上執行 Gemma 4 12B。在預設 4-bit
      量化下，權重大約佔 8GB，因此 16GB 仍有空間容納上下文和其他應用程式。24GB 以上則能輕鬆應對長時間的開發工作。
  - question: Gemma 4 12B 可以搭配 OpenCode 使用嗎？
    answer: >-
      可以。透過 Ollama 執行 Gemma 4 12B，然後在 ~/.config/opencode/opencode.jsonc 中將
      Ollama 新增為自訂提供者，指向 http://localhost:11434/v1. 重新啟動 OpenCode 後使用 /models
      選擇模型即可。模型下載完成後，不需要 API 金鑰或網路連線。
locale: zh-tw
translationKey: gemma-4-12b-ollama-opencode-setup
---
Google 於 2026 年 6 月 3 日推出了 **Gemma 4 12B**，它正好落在多數本機開發者最想要的位置：夠大到具備良好推理能力，又小到能在你現有的筆電上跑得起來。

這次的重頭戲是新的中間尺寸。先前的 Gemma 4 系列只有小型邊緣模型和 26B 旗艦模型，中間有一段空缺。12B 剛好補上這個缺口。Google 表示其基準測試效能接近 26B 模型，但記憶體用量不到一半；整個模型可在 16GB 的最低門檻內運作，而近年推出的 Mac 和中階 GPU 大多已符合這個標準。

本指南先介紹 12B 版本有哪些改變，再逐步帶你用 Ollama 執行它，並將它接入 OpenCode，作為本機、私密的開發助理。

## Gemma 4 12B 有什麼新特點

- **120 億參數**，定位介於 E4B 邊緣模型和 26B 混合專家旗艦模型之間。
- **原生多模態輸入。** 文字、視覺和音訊都進入同一個模型。架構採用無編碼器設計：影像透過輕量級嵌入模組處理，原始音訊則直接投射到文字 token 空間。比硬接一個視覺編碼器簡潔得多。
- **推理能力接近 26B 模型。** Google 表示，12B 的基準測試效能接近其 26B 版本，記憶體佔用卻不到一半。
- **Multi-Token Prediction (MTP) 草稿模型**可降低延遲，在互動式使用情境中特別有感——你不必逐 token 乾等。
- **為代理式工作流程打造**，因此工具呼叫和多步驟開發迴圈都是一等公民，而不是事後才補上的功能。
- **Apache 2.0 授權。** 可商用、可微調、可再散佈。Gemma 4 系列下載量已突破 1.5 億次。

模型權重已發布在 Hugging Face 和 Kaggle，首日即支援 Transformers、llama.cpp、MLX、SGLang 與 vLLM。Ollama 以 llama.cpp 和 GGUF 為基礎，所以 12B 的執行方式和先前 Gemma 4 模型一樣。

## Gemma 4 12B 與系列其他模型的比較

| 版本 | 最適合 | 記憶體 |
|---|---|---|
| E4B（邊緣） | 手機、嵌入式及裝置端應用程式 | 極低 |
| **12B（新）** | 筆電上的本機開發，加上視覺/音訊輸入 | 16GB+ |
| 26B MoE（旗艦） | 較重的推理、大型多檔案工作 | 24GB+ |

如果你的機器較輕量，或只想先用較小的預設模型，舊的 [Gemma 4 + Ollama + OpenCode 設定](/zh-tw/blog/使用ollama為opencode設定gemma-4/) 仍然適用。12B 是在你有足夠記憶體空間、想要明顯更強的推理能力，但還不想上到 26B 時的升級選擇。

## 你需要準備

- 搭載 Apple Silicon（M1–M5）且至少 16GB 統一記憶體的 Mac，或配備 16GB+ GPU 的 PC
- macOS 需安裝 Homebrew
- 已安裝 OpenCode（請見 [opencode.ai](https://opencode.ai)）

Google 列出的最低門檻是 16GB。這個規格下，你已經可以流暢地跑 12B 來處理日常工作。如果有 24GB 以上，長時間工作階段和更大的上下文視窗都不再是問題。

## 步驟 1：安裝 Ollama

macOS 上：

```bash
brew install --cask ollama-app
open -a Ollama
```

Linux 上：

```bash
curl -fsSL https://ollama.com/install.sh | sh
```

等選單列圖示出現（macOS）或服務啟動後，確認伺服器已經跑起來：

```bash
ollama list
```

本機 API 會跑在 `http://localhost:11434`。

## 步驟 2：下載 Gemma 4 12B

```bash
ollama pull gemma4:12b
```

在預設的 4-bit 量化下，下載大小約為 8GB。確認模型已下載完成：

```bash
ollama list
# NAME             ID              SIZE      MODIFIED
# gemma4:12b       ...             ~8 GB     ...
```

跑個快速驗證：

```bash
ollama run gemma4:12b "Write a small TypeScript function that debounces a callback"
```

確認 GPU 有在實際運算：

```bash
ollama ps
# Should show a CPU/GPU split, e.g. 12%/88% CPU/GPU
```

在 Apple Silicon 上，近期 Ollama 版本會自動使用 Apple 的 MLX 後端，因此你不需要做任何加速設定。

> **找不到標籤？** Gemma 4 12B 才剛推出，如果 `gemma4:12b` 尚未收錄在 Ollama 模型庫中，可以從 Hugging Face 下載官方 GGUF 並匯入，或先更新 Ollama（`brew upgrade ollama-app`）再重試。

## 步驟 3：將 Gemma 4 12B 接入 OpenCode

OpenCode 會從 `~/.config/opencode/opencode.jsonc` 讀取設定。將 Ollama 新增為自訂提供者：

```jsonc
{
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "gemma4:12b": {}
      }
    }
  }
}
```

Ollama 不會驗證金鑰，但 OpenCode 仍需要一個 auth 條目。在 `~/.local/share/opencode/auth.json` 中放一組佔位值：

```json
{
  "ollama": {
    "type": "api",
    "key": "ollama"
  }
}
```

重新啟動 OpenCode，執行 `/models`，然後切換到 `ollama/gemma4:12b`。你現在就有一個永遠不會把程式碼送出本機的開發助理了。

## 步驟 4：讓模型常讓模型常駐

預設情況下，Ollama 閒置約五分鐘後就會卸載模型，所以你每次回到終端機都會遇到冷啟動。要讓它保持載入，執行：

```bash
launchctl setenv OLLAMA_KEEP_ALIVE "-1"
```

重新啟動 Ollama 讓設定生效。若要在重開機後仍保持生效，把這行加進 `~/.zshrc`：

```bash
export OLLAMA_KEEP_ALIVE="-1"
```

你也可以在 Ollama 選單列圖示中勾選 **登入時啟動**，讓伺服器比你更早準備好。

## Gemma 4 12B 在 OpenCode 中擅長的事

過去在較小模型上表現勉強的工作，在額外參數與 MTP 草稿模型加持下提升最明顯：

- **多步驟編輯。** 它比 8B 更能跨多個檔案維持計畫，因此小幅重構更容易一次到位。
- **程式碼解說與審查。** 問某個模組在做什麼，或 bug 可能藏在哪裡，回答會更犀利。
- **樣板程式碼與鷹架。** 設定檔、測試 stub、路由處理器和 CRUD 層的產出都很乾淨。
- **視覺輸入。** 12B 支援多模態，你可以丟給它錯誤對話框截圖或 UI 原型圖，請它提供修復方式或元件，不必另外架視覺模型。

## 還有哪些地方不足

- **大型跨檔重構。** 橫跨十幾個檔案的協調修改仍會偏掉。12B 比 8B 進步很多，但問題還沒完全解決。
- **最難的除錯。** 跨越數層抽象或需要深厚領域知識的 bug，仍舊是前沿雲端模型的主場。
- **16GB 機器的超長上下文。** 模型支援較大的上下文視窗，但在 16GB 機器上，記憶體壓力會讓品質下降。輸入長度要節制，或直接升級到 24GB+。

## 混搭用：本機 Gemma 4 12B 加上雲端模型

多數人最後會採用這種配置：例行的 70% 工作交給本機，困難的 30% 才用雲端。以下是你需要的東西：

- **[haimaker.ai](https://haimaker.ai)** — 一組 API 金鑰就能用 Claude Opus、GPT-5、Gemini Pro 和數百種其他模型，採統一計價並附基準測試，方便你在分流前先比較。
- **Ollama** — 本機的 Gemma 4 12B，免費又私密，負責日常編輯和查閱。
- **直接使用提供者 API** — 如果你只需要一家雲端供應商，也想自行管理每個供應商的 API 金鑰。

把 Haimaker 和 Ollama 一起加進 OpenCode：

```jsonc
{
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "gemma4:12b": {}
      }
    },
    "haimaker": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "https://api.haimaker.ai/v1"
      },
      "models": {
        "anthropic/claude-sonnet-4-6": {},
        "openai/gpt-5": {},
        "google/gemini-2.5-pro": {}
      }
    }
  }
}
```

把你的 Haimaker 金鑰加到 `auth.json`：

```json
{
  "ollama": {
    "type": "api",
    "key": "ollama"
  },
  "haimaker": {
    "type": "api",
    "key": "YOUR_HAIMAKER_API_KEY"
  }
}
```

簡單的工作用 Gemma 4 12B 處理，遇到困難任務再用 `/models` 切到 Sonnet 或 GPT-5。這樣你的雲端費用會降到全部跑前沿模型的一小部分。如果想省掉手動切換，[Haimaker 的自動路由器](/blog/openclaw-auto-router-setup/) 可以偵測任務複雜度，自動幫你挑模型。

前往 [haimaker.ai](https://haimaker.ai) 註冊，並瀏覽完整的[模型目錄](https://haimaker.ai/models)。

<a href="https://app.haimaker.ai/sign-up?utm_source=blog&utm_medium=cta&utm_campaign=gemma4-12b-opencode" class="cta-button">取得你的 HAIMAKER API 金鑰</a>

## 疑難排解

**提供者沒有出現在 /models 選單。** 編輯設定後請重啟 OpenCode。它在執行期間不會重新載入 `opencode.jsonc`。

**「找不到模型。」** 執行 `ollama list`，確認模型 ID 完全符合，通常是 `gemma4:12b`。如果標籤尚未收錄在模型庫中，請看步驟 2 關於匯入 Hugging Face GGUF 的說明。

**Ollama 認證錯誤。** `"key": "ollama"` 中的佔位值 `auth.json` 就夠了。OpenCode 只需要有這個條目存在。

**生成速度慢。** 確認你用的是近期 Ollama 版本，才能拿到 Apple Silicon 上的 MLX 加速（`ollama --version`）。關掉會吃大量記憶體的應用程式。在 16GB 機器上，幾個播放影片的瀏覽器分頁就可能讓你動用到 swap。

**長提示導致品質下降。** 這是 16GB 機器的記憶體壓力造成的。輸入長度請節制，或升級到 24GB+ 換取餘裕。

## 實用的 Ollama 指令

| 指令 | 說明 |
|---|---|
| `ollama list` | 列出已下載的模型 |
| `ollama ps` | 顯示執行中的模型及記憶體使用量 |
| `ollama run gemma4:12b` | 互動式對話 |
| `ollama stop gemma4:12b` | 從記憶體卸載 |
| `ollama pull gemma4:12b` | 更新到最新版本 |
| `ollama rm gemma4:12b` | 刪除模型 |

## 總結

Gemma 4 12B 是許多人一直在等的本機模型：多模態、Apache 授權，而且強度足以在 16GB 筆電上處理大部分的日常開發工作。用 Ollama 跑它、把 OpenCode 指向它，你就有一個處理例行工作的私密助理。把雲端模型留在一次 `/models` 切換就能叫出的位置，既能保有本機的速度和隱私，又不會撞上推理天花板。

---

*剛接觸本機設定？可以先讀使用較小預設模型的 [Gemma 4 + OpenCode 指南](/zh-tw/blog/使用ollama為opencode設定gemma-4/)；如果你用的是 OpenClaw 代理，則參考 [Gemma 4 + OpenClaw 設定](/blog/gemma-4-ollama-openclaw-setup/)。需要雲端定價資訊，請看[模型目錄](https://haimaker.ai/models)。*
