在本機跑模型,代表不用 API key、沒有用量帳單,也不用把專有程式碼送到別人的伺服器。代價是回應比較慢,困難問題上的品質也較低。這個取捨值不值得,取決於你實際做的任務。

如果你是因為搜尋「openclaw local model」或「openclaw local llm」才找到這篇,建議先從簡單的開始:16GB 機器用 Gemma 4 8BQwen3.6 9B;24GB 以上 GPU(單張 RTX 5090 或 M5 Pro)用 Qwen3.6 27B;另外保留一個雲端備援,接手本機模型卡住的任務。現在的本機 OpenClaw 已經夠好用,但還不是萬能。

2026 年有兩件事改變了局面。Qwen3.6 在 4 月 22 日發布,推出 27B dense 寫程式模型,在 SWE-bench 上打敗 397B MoE。Apple 的 M5 Max(2026 年 3 月發表)最高配備 128GB 統一記憶體,而且每個 GPU 核心都有 Neural Accelerator——70B 級模型現在可以在筆電上跑。加上 Ollama 成為 OpenClaw 官方 provider,設定流程變得前所未有的簡單。

模型排行

目前本機模型在 OpenClaw 寫程式任務上的排名,依 SWE-bench Verified 分數、工具呼叫可靠性,以及實際 agent 表現排序:

模型參數量啟動參數所需 VRAMSWE-bench速度(RTX 5090)最適合
Qwen3.6 27B27B27B(dense)18GB+77.2%~70 t/s品質/規模比最佳的寫程式模型
Qwen3 Coder Plus72B72B(dense)48GB+70.6%~30 t/s最難的寫程式任務、完整 agent loop
Qwen3.6 35B-A3B35B3B(MoE)16GB+~180 t/s速度優先、高吞吐量
Qwen3.6 9B9B9B(dense)8GB+~186 t/s入門硬體、簡單任務
Llama 3.3 70B70B70B(dense)雙 GPU~27 t/s(2x 5090)通用寫程式、指令遵循佳
gpt-oss 20B21B3.6B(MoE)16GB~160 t/s16GB 首選、推理強度可調
Laguna XS 2.133B3B(MoE)24GB+快速(MoE)代理式 coding、工具呼叫迴圈
Gemma 4 8B8B8B(dense)8GB+~150 t/s隱私優先、輕量配置
Qwen3 32B32B32B(dense)24GB+~60 t/s穩健的全方位選擇、測試案例多

Qwen3.6 27B 是新一代的頭號選擇。 SWE-bench Verified 77.2%、Terminal-Bench 2.0 59.3%(與 Claude Opus 4.5 完全打平),而且只要 18GB VRAM 就能跑。27B dense 模型能在寫程式上打敗 397B MoE,靠的是 3.6 版的架構改動——Gated Delta Networks,再加上針對真實 PR 的定向後訓練。

35B-A3B MoE 是最大的變數。每個前向傳遞只啟動 3B 參數,因此在單張 RTX 5090 可以跑到 ~180 t/s。遇到困難問題,品質不如 27B dense;但在讀檔、產生樣板程式碼、簡單編輯上,體感已經接近雲端 API。

新面孔裡有三個值得認識。gpt-oss 20B 已成為 16GB 機器上的社群共識——一個小型 MoE,推理強度可調。Laguna XS 2.1(Poolside)是 33B/3B 啟動的 MoE,專為代理式(agentic)coding loop 打造。Kimi K2.7 Code 則把 Moonshot 接近前沿的 K2 血統帶進 Ollama,適合 48GB 以上配置;完整的開放權重 Kimi K3 會在七月底推出,瞄準有伺服器級硬體的人。

硬體需求

本機模型的品質隨規模提升,而規模又取決於硬體需求。以下分級以 2026 年硬體為準——NVIDIA 方面是 RTX 50 系列,Apple 方面是 M5。

8–16GB VRAM(入門級)

RTX 5060 / 5070,或 16GB 統一記憶體(M5 基礎款、M5 Pro 入門款)。這樣就能跑 Qwen3.6 9B 和 35B-A3B MoE。9B 在 5090 上以約 186 t/s 處理簡單任務與程式碼摘要;在 5070 上預期約 120 t/s。35B-A3B 實際記憶體佔用遠低於參數量,因為每個前向傳遞只啟動 3B 參數。

適用模型:Qwen3.6 9B、Qwen3.6 35B-A3B、Gemma 4 8B

18–32GB VRAM(建議)

單張 RTX 5090(32GB GDDR7,1,792 GB/s),或 36–64GB 統一記憶體(M5 Pro / M5 Max 基礎款)。到了這個等級,本機模型才真正足以投入實際工作。Qwen3.6 27B 在 18GB 上就能穩定執行,其 SWE-bench 分數(77.2%)足以媲美那些按 token 計費的雲端模型。

RTX 5090 相較 4090 的頻寬提升(1,792 GB/s vs 1,008 GB/s,增加 78%)才是推論的關鍵,不是 raw FLOPS。Token 生成速度受限於記憶體頻寬;單張 5090 在 Qwen 8B 上約可跑到 186 t/s,在 14B 級模型上約 124 t/s。

適用模型:Qwen3.6 27B、Qwen3 32B、Qwen3.6 Plus(若可載入)

48GB+ 有效記憶體(高階)

雙 RTX 5090(合計 64GB),或 96–128GB M5 Max 統一記憶體。Qwen3 Coder Plus 和 Llama 3.3 70B 屬於這個等級。

兩條路線:

  • 雙 5090 主機:在 Llama 70B Q4_K_M 上以 vLLM tensor parallelism 跑出 27 t/s——表現接近 H100,但成本只要零頭。最適合可以裝兩張卡的桌機。
  • M5 Max 128GB MacBook Pro:70B Q4_K_M 模型(磁碟上約 40GB)可以完整載入統一記憶體,而且還有餘裕放 context。Apple 在每個 GPU 核心內建的 Neural Accelerators 讓 prompt 處理速度比 M4 Max 快 3.3–4 倍,穩定生成速度約 18–25 t/s。這套配置的取捨在於可攜性——它是唯一能塞進背包的方案。

適用模型:Qwen3 Coder Plus、Llama 3.3 70B、Qwen3.6 Plus 全精度

搭載 128GB 統一記憶體的 M5 Max,成為在筆電上做重度本機工作的新最佳平衡點。Apple 的 MLX 框架已內建 Neural Accelerator 支援,代表 GPU 和 Neural Engine 在每個前向傳遞中會並行運作,而不是二選一。

沒有符合這些等級的硬體?haimaker 可以為 OpenClaw 提供單一雲端路由端點:本機模型能處理的就用本機,不能處理的則自動改用雲端模型。

試用 HAIMAKER 雲端路由

設定 Ollama

Ollama 是跑本機模型最簡單的方法。安裝好、拉取一個模型,localhost 上就有一個 OpenAI 相容 API。

# Install
curl -fsSL https://ollama.com/install.sh | sh

# Pull a model (pick one based on your hardware)
ollama pull qwen3.6:27b          # Best quality, needs 18GB+ VRAM
ollama pull qwen3.6:35b-a3b      # Fast MoE model, runs on 16GB
ollama pull qwen3.6:9b           # Lightweight, runs on 8GB
ollama pull qwen3-coder-plus     # Premium, needs 48GB+ or 96GB unified

Ollama 預設會在 http://localhost:11434 提供 API 服務。

來自 r/LocalLLaMA 的建議: 多位使用者回報,跑 27B 以上模型時,從 Ollama 改成直接用 llama.cpp 可以獲得更好的效能。Ollama 贏在方便,llama.cpp 則讓你在量化與記憶體配置上有更多控制權。先用 Ollama 入門就好——遇到效能瓶頸再切到 llama.cpp。

OpenClaw 設定

Ollama 現在是官方 provider,設定流程非常直接。執行首次設定精靈:

openclaw onboard --auth-choice ollama

或在 ~/.openclaw/openclaw.json 中手動新增 Ollama:

{
  models: {
    providers: {
      ollama: {
        baseUrl: "http://localhost:11434/v1",
        api: "openai-completions",
        models: [
          {
            id: "qwen3.6:27b",
            name: "Qwen3.6 27B",
            reasoning: false,
            contextWindow: 131072,
            maxTokens: 8192
          }
        ]
      }
    }
  },
  agents: {
    defaults: {
      model: { primary: "ollama/qwen3.6:27b" },
      models: {
        "ollama/qwen3.6:27b": { alias: "qwen-local" }
      }
    }
  }
}

切換到你的本機模型:

/model qwen-local

本機模型擅長的部分

在本機跑 Qwen3.6 27B 幾個星期後,有幾件事確實做得不錯:

  • 閱讀與摘要程式碼。 叫它解釋某個函式在做什麼,它會給你可靠的答案。雖然不如 Sonnet 4.6 那麼細膩,但拿來摸索陌生 codebase 已經夠用。
  • 常見模式的程式碼生成。 樣板程式碼、CRUD、設定檔、測試骨架。多數時候第一次就能寫出能跑的程式。3.6 版是拿真實已合併 PR 做後訓練的,從 diff 品質就看得出來。
  • 檔案操作與簡單重構。 列出檔案、搜尋模式、跨檔案重新命名變數。這類不需要深度推理的機械性工作很穩。
  • 代理式工具呼叫。 Qwen3.6 把 function calling 的可靠性拉高一截——Terminal-Bench 2.0 的 59.3% 與 Claude Opus 4.5 打平。對 OpenClaw 的工具迴圈來說,這代表「模型呼叫錯函式或參數不正確」的狀況變少了。

本機模型的不足之處

  • 跨檔案重構。 只要是需要同時掌握 5 個以上檔案的任務,就會變得不穩;模型不是搞丟上下文,就是前後改法不一致。200K+ context window 的雲端模型在這裡仍有優勢,不過 Qwen3.6 已把差距縮小。
  • 複雜除錯。 如果 bug 需要跨多層抽象去推理,本機模型常會給你表面修法,但問題其實更深。Claude Opus 4.8 在 SWE-bench Verified 上仍比 Qwen3.6 27B 高約 11 分,Claude Fable 5 則高約 18 分。
  • 舊硬體上的 dense 模型速度。 27B 模型在單張 RTX 5090 上約 70 tokens/s,在 M5 Max 上約 22 t/s。如果你還在用 3090 或 4090,預期大概 30–40 t/s。(35B-A3B MoE 的 180+ t/s 是例外。)
  • 超長 context。 Qwen3.6 理論上支援到 256K tokens,但在消費級硬體上超過 32K 之後,推論品質會下滑。請在設定中把 contextWindow 設成實際可用的值。

混合方案

多數嘗試本機模型的人,最後都會走向混合配置:瑣碎任務交給本機,難題交給雲端。

{
  agents: {
    defaults: {
      model: {
        primary: "ollama/qwen3.6:27b",
        thinking: "anthropic/claude-sonnet-4-6-20260514"
      }
    }
  }
}

本機模型負責讀檔、簡單編輯和樣板——大約佔一般寫程式 session 的 60–70%。Sonnet 負責除錯、架構決策與跨檔案工作。這樣你的 API 費用會從每天 $20–50 降到幾美元。

當你明確知道某個任務需要更強能力時,手動切換:

/model sonnet

或使用 Haimaker 的自動路由器 自動處理。自動路由器會判斷任務複雜度,把難題自動轉送雲端模型,你就不必一直想何時該切。

疑難排解

模型載入慢或崩潰。 多半是記憶體不足。試試較小的量化版本:ollama pull qwen3.6:27b-q4_K_M 能在些微品質犧牲下大幅減少記憶體用量。Q4_K_M 對多數人來說是最佳平衡點——品質幾乎沒差,記憶體省很多。

Tool calls 失敗。 在模型設定中把 "reasoning": false 設為 false,並優先使用 Qwen3.6 系列——它們處理 OpenClaw 的 tool-calling 格式比 Mistral 或舊 Llama 更可靠。若仍失敗,請更新 Ollama 到最新版;官方 provider 整合修掉了幾個邊界案例。

Context window 錯誤。 在設定中給出正確的 contextWindow。Qwen3.6 系列在 24GB+ VRAM 硬體上(單張 RTX 5090 很輕鬆),用 131072(128K)是安全預設;16GB 建議用 32768,避免品質下滑。

生成速度太慢。 如果你在 5090 上跑 27B 低於 40 t/s,或在 M5 Max 上低於 18 t/s,先檢查是不是有其他程序搶 GPU。關掉跑 WebGL 或影片的瀏覽器分頁。在 Mac 上,打開「活動監視器」→「GPU 歷史記錄」看誰在搶統一記憶體。M5 使用者也要確認 Ollama 使用 MLX 後端(v0.21+)——純 Metal 和 MLX 路徑在 prompt 處理上的速度差異大約是 2 倍。

試用 HAIMAKER 進行雲端路由


需要模型價格比較,請看 OpenClaw 最便宜的模型。想降低雲端模型 token 成本,請看 用 QMD 把成本砍掉 96%