最適合 coding agent 的 Ollama 模型,不一定是你能下載到的最大模型。Agent 會不斷循環:讀取檔案、呼叫工具、修訂計畫、產生 patch。有些模型在單一提示下看起來很強,但只要每次工具呼叫都得多跑一次緩慢的本機推論,實際用起來就會令人難以忍受。
這份評比可以當作實務起點:該拉取哪個模型、需要什麼硬體,以及何時該停止勉強本機推論、改用雲端備援。
快速評比
| 排名 | 模型 | 拉取指令 | 最適合 | 實務硬體需求 |
|---|---|---|---|---|
| 1 | Qwen3 Coder 30B | ollama pull qwen3-coder:30b | 最佳本機 coding agent 預設選擇 | 24GB+ VRAM 或 32GB+ 統一記憶體 |
| 2 | Qwen3 30B | ollama pull qwen3:30b | 一般 agent 任務、推理、程式碼審查 | 24GB+ VRAM 或 32GB+ 統一記憶體 |
| 3 | Gemma 4 26B MoE | ollama pull gemma4:26b | 在效能充足的工作站上提供快速的本機 coding 輔助 | 24GB+ VRAM 或 32GB+ 統一記憶體 |
| 4 | Kimi K2.7 Code | ollama pull kimi-k2.7-code | 在高階硬體上執行具備前沿模型血統的 coding 模型 | 48GB+ VRAM 或 96GB+ 統一記憶體 |
| 5 | gpt-oss 20B | ollama pull gpt-oss:20b | 16GB 最推薦的選擇,可依任務調整推理強度 | 16GB VRAM 或統一記憶體 |
| 6 | Gemma 4 E4B | ollama pull gemma4:e4b | 輕量級筆電使用 | 16GB 統一記憶體 |
| 7 | Qwen3 8B | ollama pull qwen3:8b | 小幅修改與程式碼解說 | 8-16GB 記憶體 |
如果你只想試一個模型,試試 Qwen3 Coder 30B。Ollama 把它列為 coding 與 agentic 模型,支援 256K 上下文,而且它正是為 coding agent 的工作型態所設計:讀取程式碼、使用工具,並在較長的任務中維持狀態。
依機器規格挑選
8-16GB 記憶體
使用 gpt-oss 20B、Qwen3 8B 或 Gemma 4 E4B。gpt-oss 20B 自發布以來,已成為社群在 16GB 機器上的預設選擇——它在記憶體限制內,還能讓你依任務調整推理強度。
這個層級適合:
- 解說不熟悉的程式碼
- 撰寫小型函式
- 草擬測試
- 產生設定檔
- 摘要日誌
不要期待在這裡進行可靠的跨檔案重構。較小的模型能寫出有用的程式碼,但一旦 agent 開始開啟檔案、修訂 patch、處理工具輸出,它們很快就會跟丟脈絡。
24-32GB 記憶體
使用 Qwen3 Coder 30B、Qwen3 30B 或 Gemma 4 26B MoE。
這是本機 agent 真正實用的層級。模型夠大,能掌握儲存庫上下文;同時又夠小,能在高階桌機 GPU 或記憶體較大的 Mac 上執行。對大多數開發者來說,從這裡開始,Ollama 不再只是嘗鮮玩具,而是真正變成工作流程的一部分。
64GB+ 記憶體
只有在你已經明確知道為何需要時,才去嘗試更大的 Qwen 或 DeepSeek 變體。
很多人會忍不住去追模型庫裡最大的模型,但對 agent 來說,這通常不是正確的方向。大型本機模型也許在技術上令人印象深刻,卻可能讓 coding 迴圈變得太慢。只有當任務真的需要更多推理或上下文時,更大的模型才值得用;如果 agent 只是在讀檔、產生樣板程式碼或草擬測試,那反而是一種負擔。
想要本機優先、雲端備援的設定,又不想為每個供應商管理金鑰?haimaker 會把簡單的 coding agent 工作分派到你的本機模型,並透過單一端點將困難任務轉派給雲端模型。
使用 HAIMAKER 分派本機與雲端模型整體最佳:Qwen3 Coder
Qwen3 Coder 會是我在任何本機 coding agent 設定中第一個測試的模型。
拉取它:
ollama pull qwen3-coder:30b
執行快速檢查:
ollama run qwen3-coder:30b "Explain this repo structure and suggest where tests should live."
為什麼它排名第一:
- 它明確針對 coding 與 agentic 工作流程進行調校。
- Ollama 頁面列出了
ollama launch對 Claude Code、Codex、OpenCode 和 OpenClaw 的支援。 - 30B 變體在本機上比 480B 變體實際可行得多。
- 長上下文支援讓它比舊的本機程式碼模型更適合儲存庫相關工作。
適合用於程式碼審查、測試產生、中型重構,以及重視隱私的本機優先 agent 工作階段。
最佳輕量選擇:Gemma 4
當 Qwen3 Coder 太吃資源時,Gemma 4 是值得嘗試的模型系列。較小的 Gemma 4 變體專為本機與裝置端使用而設計;26B MoE 變體則提供更強的工作站選項,而且不會每個 token 都啟用所有參數。
拉取適合筆電的版本:
ollama pull gemma4:e4b
拉取更強的工作站版本:
ollama pull gemma4:26b
當你需要快速的本機輔助來解說程式碼、進行小幅修改或處理私有程式碼時,Gemma 4 很適合搭配 coding agent 使用。但如果是需要 agent 維持完整遷移計畫的長時間自主工作階段,它就沒那麼合適。
最新加入:Kimi K2.7 Code 和 Laguna XS 2.1
今年夏天有兩個以 coding 為導向的模型加入 Ollama 模型庫,值得關注。
Kimi K2.7 Code 是 Moonshot 以 K2.6 系列為基礎打造的 coding 調校版——同一系列的 K3 版本已在 Arena 排行榜上擊敗閉源前沿模型。它需要高階硬體(48GB+ VRAM 或高記憶體 Mac),但如果你有這類配備,這是目前能在本機執行的最強開放 coding 模型系列。
ollama pull kimi-k2.7-code
Laguna XS 2.1 是 Poolside 的 agentic coding MoE——總參數 33B,每個 token 僅啟用 3B,因此跑起來遠比帳面規模輕量。它專為 coding agent 所處的工具呼叫迴圈而打造。
如果你之前是根據本指南舊版使用 DeepSeek Coder V2,請把它淘汰——它已經落後兩個世代,也完全消失在社群評比中。
在哪裡使用這些模型
- haimaker.ai - 將本機 Ollama 模型與更強的雲端模型搭配使用:把簡單的 coding agent 工作分派到本機,困難任務交給付費模型。
- OpenClaw - 使用 Ollama 作為 coding agent 工作階段的本機 provider。參閱 OpenClaw 本機模型指南。
- OpenCode - 透過 OpenAI 相容的 provider 路徑加入 Ollama。參閱 使用 OpenCode 搭配 Ollama。
- Codex 和 Claude Code - Ollama 的模型頁面包含
ollama launch的 agent 執行環境範例,包括 Codex 和 Claude Code。
OpenAI 相容 agent 的設定
多數 coding agent 都可以透過 Ollama 的本機 OpenAI 相容端點來使用:
http://localhost:11434/v1
如果你的工具要求 API 金鑰,填入一個佔位值即可;Ollama 在本機端不會驗證它。
{
"baseURL": "http://localhost:11434/v1",
"apiKey": "ollama",
"model": "qwen3-coder:30b"
}
OpenCode 的 provider 區塊如下:
{
"$schema": "https://opencode.ai/config.json",
"provider": {
"ollama": {
"npm": "@ai-sdk/openai-compatible",
"name": "Ollama (local)",
"options": {
"baseURL": "http://localhost:11434/v1"
},
"models": {
"qwen3-coder:30b": {
"name": "Qwen3 Coder 30B"
}
}
}
}
}
如果工具呼叫不穩定,先縮小模型,再只把上下文加到硬體能負荷的範圍。一個大到會觸發記憶體置換的上下文視窗,比能保持回應速度的小視窗更糟。
何時不該使用 Ollama
當隱私、成本或離線工作很重要時,本機模型最適合。但不見得每個程式設計任務都更適合用它們。
遇到以下情況,改用雲端模型:
- 任務跨越多個檔案
- bug 難以察覺
- 你需要可靠的工具呼叫
- patch 會影響正式環境
- 你沒有時間逐行審查產生的程式碼
務實的做法是本機優先,而不是只靠本機。用 Qwen3 Coder 或 Gemma 4 處理低成本的私有工作,當任務開始消耗大量注意力而不是 token 時,再升級到更強的雲端模型。
如需 OpenClaw 專用的本機設定,請參閱 OpenClaw 最佳本機模型。如需 OpenCode 設定,請參閱 使用 OpenCode 搭配 Ollama。