Google 於 2026 年 6 月 3 日推出了 Gemma 4 12B,它正好落在多數本機開發者最想要的位置:夠大到具備良好推理能力,又小到能在你現有的筆電上跑得起來。

這次的重頭戲是新的中間尺寸。先前的 Gemma 4 系列只有小型邊緣模型和 26B 旗艦模型,中間有一段空缺。12B 剛好補上這個缺口。Google 表示其基準測試效能接近 26B 模型,但記憶體用量不到一半;整個模型可在 16GB 的最低門檻內運作,而近年推出的 Mac 和中階 GPU 大多已符合這個標準。

本指南先介紹 12B 版本有哪些改變,再逐步帶你用 Ollama 執行它,並將它接入 OpenCode,作為本機、私密的開發助理。

Gemma 4 12B 有什麼新特點

  • 120 億參數,定位介於 E4B 邊緣模型和 26B 混合專家旗艦模型之間。
  • 原生多模態輸入。 文字、視覺和音訊都進入同一個模型。架構採用無編碼器設計:影像透過輕量級嵌入模組處理,原始音訊則直接投射到文字 token 空間。比硬接一個視覺編碼器簡潔得多。
  • 推理能力接近 26B 模型。 Google 表示,12B 的基準測試效能接近其 26B 版本,記憶體佔用卻不到一半。
  • Multi-Token Prediction (MTP) 草稿模型可降低延遲,在互動式使用情境中特別有感——你不必逐 token 乾等。
  • 為代理式工作流程打造,因此工具呼叫和多步驟開發迴圈都是一等公民,而不是事後才補上的功能。
  • Apache 2.0 授權。 可商用、可微調、可再散佈。Gemma 4 系列下載量已突破 1.5 億次。

模型權重已發布在 Hugging Face 和 Kaggle,首日即支援 Transformers、llama.cpp、MLX、SGLang 與 vLLM。Ollama 以 llama.cpp 和 GGUF 為基礎,所以 12B 的執行方式和先前 Gemma 4 模型一樣。

Gemma 4 12B 與系列其他模型的比較

版本最適合記憶體
E4B(邊緣)手機、嵌入式及裝置端應用程式極低
12B(新)筆電上的本機開發,加上視覺/音訊輸入16GB+
26B MoE(旗艦)較重的推理、大型多檔案工作24GB+

如果你的機器較輕量,或只想先用較小的預設模型,舊的 Gemma 4 + Ollama + OpenCode 設定 仍然適用。12B 是在你有足夠記憶體空間、想要明顯更強的推理能力,但還不想上到 26B 時的升級選擇。

你需要準備

  • 搭載 Apple Silicon(M1–M5)且至少 16GB 統一記憶體的 Mac,或配備 16GB+ GPU 的 PC
  • macOS 需安裝 Homebrew
  • 已安裝 OpenCode(請見 opencode.ai

Google 列出的最低門檻是 16GB。這個規格下,你已經可以流暢地跑 12B 來處理日常工作。如果有 24GB 以上,長時間工作階段和更大的上下文視窗都不再是問題。

步驟 1:安裝 Ollama

macOS 上:

brew install --cask ollama-app
open -a Ollama

Linux 上:

curl -fsSL https://ollama.com/install.sh | sh

等選單列圖示出現(macOS)或服務啟動後,確認伺服器已經跑起來:

ollama list

本機 API 會跑在 http://localhost:11434

步驟 2:下載 Gemma 4 12B

ollama pull gemma4:12b

在預設的 4-bit 量化下,下載大小約為 8GB。確認模型已下載完成:

ollama list
# NAME             ID              SIZE      MODIFIED
# gemma4:12b       ...             ~8 GB     ...

跑個快速驗證:

ollama run gemma4:12b "Write a small TypeScript function that debounces a callback"

確認 GPU 有在實際運算:

ollama ps
# Should show a CPU/GPU split, e.g. 12%/88% CPU/GPU

在 Apple Silicon 上,近期 Ollama 版本會自動使用 Apple 的 MLX 後端,因此你不需要做任何加速設定。

找不到標籤? Gemma 4 12B 才剛推出,如果 gemma4:12b 尚未收錄在 Ollama 模型庫中,可以從 Hugging Face 下載官方 GGUF 並匯入,或先更新 Ollama(brew upgrade ollama-app)再重試。

步驟 3:將 Gemma 4 12B 接入 OpenCode

OpenCode 會從 ~/.config/opencode/opencode.jsonc 讀取設定。將 Ollama 新增為自訂提供者:

{
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "gemma4:12b": {}
      }
    }
  }
}

Ollama 不會驗證金鑰,但 OpenCode 仍需要一個 auth 條目。在 ~/.local/share/opencode/auth.json 中放一組佔位值:

{
  "ollama": {
    "type": "api",
    "key": "ollama"
  }
}

重新啟動 OpenCode,執行 /models,然後切換到 ollama/gemma4:12b。你現在就有一個永遠不會把程式碼送出本機的開發助理了。

步驟 4:讓模型常讓模型常駐

預設情況下,Ollama 閒置約五分鐘後就會卸載模型,所以你每次回到終端機都會遇到冷啟動。要讓它保持載入,執行:

launchctl setenv OLLAMA_KEEP_ALIVE "-1"

重新啟動 Ollama 讓設定生效。若要在重開機後仍保持生效,把這行加進 ~/.zshrc

export OLLAMA_KEEP_ALIVE="-1"

你也可以在 Ollama 選單列圖示中勾選 登入時啟動,讓伺服器比你更早準備好。

Gemma 4 12B 在 OpenCode 中擅長的事

過去在較小模型上表現勉強的工作,在額外參數與 MTP 草稿模型加持下提升最明顯:

  • 多步驟編輯。 它比 8B 更能跨多個檔案維持計畫,因此小幅重構更容易一次到位。
  • 程式碼解說與審查。 問某個模組在做什麼,或 bug 可能藏在哪裡,回答會更犀利。
  • 樣板程式碼與鷹架。 設定檔、測試 stub、路由處理器和 CRUD 層的產出都很乾淨。
  • 視覺輸入。 12B 支援多模態,你可以丟給它錯誤對話框截圖或 UI 原型圖,請它提供修復方式或元件,不必另外架視覺模型。

還有哪些地方不足

  • 大型跨檔重構。 橫跨十幾個檔案的協調修改仍會偏掉。12B 比 8B 進步很多,但問題還沒完全解決。
  • 最難的除錯。 跨越數層抽象或需要深厚領域知識的 bug,仍舊是前沿雲端模型的主場。
  • 16GB 機器的超長上下文。 模型支援較大的上下文視窗,但在 16GB 機器上,記憶體壓力會讓品質下降。輸入長度要節制,或直接升級到 24GB+。

混搭用:本機 Gemma 4 12B 加上雲端模型

多數人最後會採用這種配置:例行的 70% 工作交給本機,困難的 30% 才用雲端。以下是你需要的東西:

  • haimaker.ai — 一組 API 金鑰就能用 Claude Opus、GPT-5、Gemini Pro 和數百種其他模型,採統一計價並附基準測試,方便你在分流前先比較。
  • Ollama — 本機的 Gemma 4 12B,免費又私密,負責日常編輯和查閱。
  • 直接使用提供者 API — 如果你只需要一家雲端供應商,也想自行管理每個供應商的 API 金鑰。

把 Haimaker 和 Ollama 一起加進 OpenCode:

{
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "gemma4:12b": {}
      }
    },
    "haimaker": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "https://api.haimaker.ai/v1"
      },
      "models": {
        "anthropic/claude-sonnet-4-6": {},
        "openai/gpt-5": {},
        "google/gemini-2.5-pro": {}
      }
    }
  }
}

把你的 Haimaker 金鑰加到 auth.json

{
  "ollama": {
    "type": "api",
    "key": "ollama"
  },
  "haimaker": {
    "type": "api",
    "key": "YOUR_HAIMAKER_API_KEY"
  }
}

簡單的工作用 Gemma 4 12B 處理,遇到困難任務再用 /models 切到 Sonnet 或 GPT-5。這樣你的雲端費用會降到全部跑前沿模型的一小部分。如果想省掉手動切換,Haimaker 的自動路由器 可以偵測任務複雜度,自動幫你挑模型。

前往 haimaker.ai 註冊,並瀏覽完整的模型目錄

取得你的 HAIMAKER API 金鑰

疑難排解

提供者沒有出現在 /models 選單。 編輯設定後請重啟 OpenCode。它在執行期間不會重新載入 opencode.jsonc

「找不到模型。」 執行 ollama list,確認模型 ID 完全符合,通常是 gemma4:12b。如果標籤尚未收錄在模型庫中,請看步驟 2 關於匯入 Hugging Face GGUF 的說明。

Ollama 認證錯誤。 "key": "ollama" 中的佔位值 auth.json 就夠了。OpenCode 只需要有這個條目存在。

生成速度慢。 確認你用的是近期 Ollama 版本,才能拿到 Apple Silicon 上的 MLX 加速(ollama --version)。關掉會吃大量記憶體的應用程式。在 16GB 機器上,幾個播放影片的瀏覽器分頁就可能讓你動用到 swap。

長提示導致品質下降。 這是 16GB 機器的記憶體壓力造成的。輸入長度請節制,或升級到 24GB+ 換取餘裕。

實用的 Ollama 指令

指令說明
ollama list列出已下載的模型
ollama ps顯示執行中的模型及記憶體使用量
ollama run gemma4:12b互動式對話
ollama stop gemma4:12b從記憶體卸載
ollama pull gemma4:12b更新到最新版本
ollama rm gemma4:12b刪除模型

總結

Gemma 4 12B 是許多人一直在等的本機模型:多模態、Apache 授權,而且強度足以在 16GB 筆電上處理大部分的日常開發工作。用 Ollama 跑它、把 OpenCode 指向它,你就有一個處理例行工作的私密助理。把雲端模型留在一次 /models 切換就能叫出的位置,既能保有本機的速度和隱私,又不會撞上推理天花板。


剛接觸本機設定?可以先讀使用較小預設模型的 Gemma 4 + OpenCode 指南;如果你用的是 OpenClaw 代理,則參考 Gemma 4 + OpenClaw 設定。需要雲端定價資訊,請看模型目錄