Google 於 2026 年 6 月 3 日推出了 Gemma 4 12B,它正好落在多數本機開發者最想要的位置:夠大到具備良好推理能力,又小到能在你現有的筆電上跑得起來。
這次的重頭戲是新的中間尺寸。先前的 Gemma 4 系列只有小型邊緣模型和 26B 旗艦模型,中間有一段空缺。12B 剛好補上這個缺口。Google 表示其基準測試效能接近 26B 模型,但記憶體用量不到一半;整個模型可在 16GB 的最低門檻內運作,而近年推出的 Mac 和中階 GPU 大多已符合這個標準。
本指南先介紹 12B 版本有哪些改變,再逐步帶你用 Ollama 執行它,並將它接入 OpenCode,作為本機、私密的開發助理。
Gemma 4 12B 有什麼新特點
- 120 億參數,定位介於 E4B 邊緣模型和 26B 混合專家旗艦模型之間。
- 原生多模態輸入。 文字、視覺和音訊都進入同一個模型。架構採用無編碼器設計:影像透過輕量級嵌入模組處理,原始音訊則直接投射到文字 token 空間。比硬接一個視覺編碼器簡潔得多。
- 推理能力接近 26B 模型。 Google 表示,12B 的基準測試效能接近其 26B 版本,記憶體佔用卻不到一半。
- Multi-Token Prediction (MTP) 草稿模型可降低延遲,在互動式使用情境中特別有感——你不必逐 token 乾等。
- 為代理式工作流程打造,因此工具呼叫和多步驟開發迴圈都是一等公民,而不是事後才補上的功能。
- Apache 2.0 授權。 可商用、可微調、可再散佈。Gemma 4 系列下載量已突破 1.5 億次。
模型權重已發布在 Hugging Face 和 Kaggle,首日即支援 Transformers、llama.cpp、MLX、SGLang 與 vLLM。Ollama 以 llama.cpp 和 GGUF 為基礎,所以 12B 的執行方式和先前 Gemma 4 模型一樣。
Gemma 4 12B 與系列其他模型的比較
| 版本 | 最適合 | 記憶體 |
|---|---|---|
| E4B(邊緣) | 手機、嵌入式及裝置端應用程式 | 極低 |
| 12B(新) | 筆電上的本機開發,加上視覺/音訊輸入 | 16GB+ |
| 26B MoE(旗艦) | 較重的推理、大型多檔案工作 | 24GB+ |
如果你的機器較輕量,或只想先用較小的預設模型,舊的 Gemma 4 + Ollama + OpenCode 設定 仍然適用。12B 是在你有足夠記憶體空間、想要明顯更強的推理能力,但還不想上到 26B 時的升級選擇。
你需要準備
- 搭載 Apple Silicon(M1–M5)且至少 16GB 統一記憶體的 Mac,或配備 16GB+ GPU 的 PC
- macOS 需安裝 Homebrew
- 已安裝 OpenCode(請見 opencode.ai)
Google 列出的最低門檻是 16GB。這個規格下,你已經可以流暢地跑 12B 來處理日常工作。如果有 24GB 以上,長時間工作階段和更大的上下文視窗都不再是問題。
步驟 1:安裝 Ollama
macOS 上:
brew install --cask ollama-app
open -a Ollama
Linux 上:
curl -fsSL https://ollama.com/install.sh | sh
等選單列圖示出現(macOS)或服務啟動後,確認伺服器已經跑起來:
ollama list
本機 API 會跑在 http://localhost:11434。
步驟 2:下載 Gemma 4 12B
ollama pull gemma4:12b
在預設的 4-bit 量化下,下載大小約為 8GB。確認模型已下載完成:
ollama list
# NAME ID SIZE MODIFIED
# gemma4:12b ... ~8 GB ...
跑個快速驗證:
ollama run gemma4:12b "Write a small TypeScript function that debounces a callback"
確認 GPU 有在實際運算:
ollama ps
# Should show a CPU/GPU split, e.g. 12%/88% CPU/GPU
在 Apple Silicon 上,近期 Ollama 版本會自動使用 Apple 的 MLX 後端,因此你不需要做任何加速設定。
找不到標籤? Gemma 4 12B 才剛推出,如果
gemma4:12b尚未收錄在 Ollama 模型庫中,可以從 Hugging Face 下載官方 GGUF 並匯入,或先更新 Ollama(brew upgrade ollama-app)再重試。
步驟 3:將 Gemma 4 12B 接入 OpenCode
OpenCode 會從 ~/.config/opencode/opencode.jsonc 讀取設定。將 Ollama 新增為自訂提供者:
{
"provider": {
"ollama": {
"npm": "@ai-sdk/openai-compatible",
"options": {
"baseURL": "http://localhost:11434/v1"
},
"models": {
"gemma4:12b": {}
}
}
}
}
Ollama 不會驗證金鑰,但 OpenCode 仍需要一個 auth 條目。在 ~/.local/share/opencode/auth.json 中放一組佔位值:
{
"ollama": {
"type": "api",
"key": "ollama"
}
}
重新啟動 OpenCode,執行 /models,然後切換到 ollama/gemma4:12b。你現在就有一個永遠不會把程式碼送出本機的開發助理了。
步驟 4:讓模型常讓模型常駐
預設情況下,Ollama 閒置約五分鐘後就會卸載模型,所以你每次回到終端機都會遇到冷啟動。要讓它保持載入,執行:
launchctl setenv OLLAMA_KEEP_ALIVE "-1"
重新啟動 Ollama 讓設定生效。若要在重開機後仍保持生效,把這行加進 ~/.zshrc:
export OLLAMA_KEEP_ALIVE="-1"
你也可以在 Ollama 選單列圖示中勾選 登入時啟動,讓伺服器比你更早準備好。
Gemma 4 12B 在 OpenCode 中擅長的事
過去在較小模型上表現勉強的工作,在額外參數與 MTP 草稿模型加持下提升最明顯:
- 多步驟編輯。 它比 8B 更能跨多個檔案維持計畫,因此小幅重構更容易一次到位。
- 程式碼解說與審查。 問某個模組在做什麼,或 bug 可能藏在哪裡,回答會更犀利。
- 樣板程式碼與鷹架。 設定檔、測試 stub、路由處理器和 CRUD 層的產出都很乾淨。
- 視覺輸入。 12B 支援多模態,你可以丟給它錯誤對話框截圖或 UI 原型圖,請它提供修復方式或元件,不必另外架視覺模型。
還有哪些地方不足
- 大型跨檔重構。 橫跨十幾個檔案的協調修改仍會偏掉。12B 比 8B 進步很多,但問題還沒完全解決。
- 最難的除錯。 跨越數層抽象或需要深厚領域知識的 bug,仍舊是前沿雲端模型的主場。
- 16GB 機器的超長上下文。 模型支援較大的上下文視窗,但在 16GB 機器上,記憶體壓力會讓品質下降。輸入長度要節制,或直接升級到 24GB+。
混搭用:本機 Gemma 4 12B 加上雲端模型
多數人最後會採用這種配置:例行的 70% 工作交給本機,困難的 30% 才用雲端。以下是你需要的東西:
- haimaker.ai — 一組 API 金鑰就能用 Claude Opus、GPT-5、Gemini Pro 和數百種其他模型,採統一計價並附基準測試,方便你在分流前先比較。
- Ollama — 本機的 Gemma 4 12B,免費又私密,負責日常編輯和查閱。
- 直接使用提供者 API — 如果你只需要一家雲端供應商,也想自行管理每個供應商的 API 金鑰。
把 Haimaker 和 Ollama 一起加進 OpenCode:
{
"provider": {
"ollama": {
"npm": "@ai-sdk/openai-compatible",
"options": {
"baseURL": "http://localhost:11434/v1"
},
"models": {
"gemma4:12b": {}
}
},
"haimaker": {
"npm": "@ai-sdk/openai-compatible",
"options": {
"baseURL": "https://api.haimaker.ai/v1"
},
"models": {
"anthropic/claude-sonnet-4-6": {},
"openai/gpt-5": {},
"google/gemini-2.5-pro": {}
}
}
}
}
把你的 Haimaker 金鑰加到 auth.json:
{
"ollama": {
"type": "api",
"key": "ollama"
},
"haimaker": {
"type": "api",
"key": "YOUR_HAIMAKER_API_KEY"
}
}
簡單的工作用 Gemma 4 12B 處理,遇到困難任務再用 /models 切到 Sonnet 或 GPT-5。這樣你的雲端費用會降到全部跑前沿模型的一小部分。如果想省掉手動切換,Haimaker 的自動路由器 可以偵測任務複雜度,自動幫你挑模型。
前往 haimaker.ai 註冊,並瀏覽完整的模型目錄。
疑難排解
提供者沒有出現在 /models 選單。 編輯設定後請重啟 OpenCode。它在執行期間不會重新載入 opencode.jsonc。
「找不到模型。」 執行 ollama list,確認模型 ID 完全符合,通常是 gemma4:12b。如果標籤尚未收錄在模型庫中,請看步驟 2 關於匯入 Hugging Face GGUF 的說明。
Ollama 認證錯誤。 "key": "ollama" 中的佔位值 auth.json 就夠了。OpenCode 只需要有這個條目存在。
生成速度慢。 確認你用的是近期 Ollama 版本,才能拿到 Apple Silicon 上的 MLX 加速(ollama --version)。關掉會吃大量記憶體的應用程式。在 16GB 機器上,幾個播放影片的瀏覽器分頁就可能讓你動用到 swap。
長提示導致品質下降。 這是 16GB 機器的記憶體壓力造成的。輸入長度請節制,或升級到 24GB+ 換取餘裕。
實用的 Ollama 指令
| 指令 | 說明 |
|---|---|
ollama list | 列出已下載的模型 |
ollama ps | 顯示執行中的模型及記憶體使用量 |
ollama run gemma4:12b | 互動式對話 |
ollama stop gemma4:12b | 從記憶體卸載 |
ollama pull gemma4:12b | 更新到最新版本 |
ollama rm gemma4:12b | 刪除模型 |
總結
Gemma 4 12B 是許多人一直在等的本機模型:多模態、Apache 授權,而且強度足以在 16GB 筆電上處理大部分的日常開發工作。用 Ollama 跑它、把 OpenCode 指向它,你就有一個處理例行工作的私密助理。把雲端模型留在一次 /models 切換就能叫出的位置,既能保有本機的速度和隱私,又不會撞上推理天花板。
剛接觸本機設定?可以先讀使用較小預設模型的 Gemma 4 + OpenCode 指南;如果你用的是 OpenClaw 代理,則參考 Gemma 4 + OpenClaw 設定。需要雲端定價資訊,請看模型目錄。