在本地跑模型的好处是:不需要 API 密钥,没有用量账单,也不必将私有代码发到别人的服务器上。但代价是响应更慢,遇到难题时效果也会打折扣。这个取舍是否划算,要看你的具体用途。

如果你搜”openclaw local model”或”openclaw local llm”找到这篇文章,建议从简单方案开始:16GB 内存的机器选 Gemma 4 8BQwen3.6 9B;24GB 以上显存的 GPU(单张 RTX 5090 或 M5 Pro)选 Qwen3.6 27B;同时保留一个云端回退,处理本地模型卡住的任务。本地 OpenClaw 现在已经很好用,但并非万能。

2026 年有两件事改变了这一局面。4 月 22 日发布的 Qwen3.6 带来了 27B 稠密编程模型,在 SWE-bench 上超过了 397B 的 MoE;Apple M5 Max(2026 年 3 月发布)则提供 128GB 统一内存,并在每个 GPU 核心中集成 Neural Accelerator,使 70B 级模型如今也能在笔记本上运行。再加上 Ollama 成为 OpenClaw 官方提供商,配置流程比以往任何时候都简单。

模型排名

以下是当前本地模型在 OpenClaw 编码工作中的排名,依据 SWE-bench Verified 得分、工具调用可靠性和真实智能体表现:

模型参数量激活参数所需显存SWE-bench速度(RTX 5090)最适合场景
Qwen3.6 27B27B27B(稠密)18GB+77.2%~70 t/s编程任务中性能与规模的最佳平衡
Qwen3 Coder Plus72B72B(稠密)48GB+70.6%~30 t/s最难的编程任务、完整智能体循环
Qwen3.6 35B-A3B35B3B(MoE)16GB+~180 t/s对速度敏感的工作、高吞吐场景
Qwen3.6 9B9B9B(稠密)8GB+~186 t/s入门级硬件、简单任务
Llama 3.3 70B70B70B(稠密)双卡~27 t/s(2x 5090)通用编程,指令遵循能力好
gpt-oss 20B21B3.6B(MoE)16GB~160 t/s16GB 显存首选,可调推理强度
Laguna XS 2.133B3B(MoE)24GB+快(MoE)智能体式编程,工具调用循环
Gemma 4 8B8B8B(稠密)8GB+~150 t/s隐私优先,轻量部署
Qwen3 32B32B32B(稠密)24GB+~60 t/s稳健的全能选手,经过广泛测试

Qwen3.6 27B 是新的主角。 SWE-bench Verified 77.2%,Terminal-Bench 2.0 59.3%(与 Claude Opus 4.5 完全持平),而且只需 18GB 显存就能运行。一个 27B 的稠密模型能在编程任务上击败 397B MoE,靠的是 3.6 版本中的架构变化——Gated Delta Networks,加上基于真实 PR 的定向后训练。

35B-A3B MoE 更像一个变数。它每次前向传播只激活 3B 参数,所以在单张 RTX 5090 上可以达到约 180 t/s。在难题上质量不如 27B 稠密模型,但在读文件、生成样板代码和简单改动上,体验接近云端 API。

还有三款新模型值得留意。gpt-oss 20B 已成为社区公认的 16GB 机器首选,一款支持可调推理强度的小型 MoE。Laguna XS 2.1(Poolside 出品)是 33B/3B 激活的 MoE,专为智能体编码循环而设计。Kimi K2.7 Code 则把 Moonshot 接近前沿水平的 K2 系列带到 Ollama,适合 48GB 以上显存的用户;若运行服务器级硬件,完整开源权重的 Kimi K3 将于七月底发布。

硬件需求

本地模型的质量随模型规模提升,而模型规模又取决于硬件条件。以下分级基于 2026 年硬件:NVIDIA 侧为 RTX 50 系列,Apple 侧为 M5。

8–16GB 显存(入门级)

RTX 5060 / 5070,或 16GB 统一内存(M5 基础版、M5 Pro 入门版)。足以运行 Qwen3.6 9B 和 35B-A3B MoE。9B 在 5090 上处理简单任务和代码摘要时可达约 186 t/s;在 5070 上预计约 120 t/s。35B-A3B 的实际内存占用远低于按参数量推算的水平,因为每次前向传播只激活 3B 参数。

适用模型:Qwen3.6 9B、Qwen3.6 35B-A3B、Gemma 4 8B

18–32GB 显存(推荐)

单张 RTX 5090(32GB GDDR7,1,792 GB/s),或 36–64GB 统一内存(M5 Pro / M5 Max 基础版)。到了这一级,本地模型才真正可用于实际工作。Qwen3.6 27B 在 18GB 显存上运行得很从容,其 SWE-bench 得分(77.2%)能匹敌那些按 token 收费的云端模型。

RTX 5090 相比 4090 的带宽提升(1,792 GB/s 对 1,008 GB/s,提高 78%)对推理才是关键,而非原始 FLOPS。Token 生成受内存带宽约束,单张 5090 在 Qwen 8B 上约能生成 186 t/s,在 14B 级模型上约 124 t/s。

适用模型:Qwen3.6 27B、Qwen3 32B、Qwen3.6 Plus(内存充足时)

48GB+ 可用内存(高端)

双 RTX 5090(合计 64GB),或 96–128GB M5 Max 统一内存。Qwen3 Coder Plus 和 Llama 3.3 70B 属于这一档。

两条路线:

  • 双 5090 主机:在 Llama 70B Q4_K_M 上使用 vLLM 张量并行可达 27 t/s,接近 H100 的水平,成本仅为 H100 的零头。适合能装下两张卡的台式机。
  • M5 Max 128GB MacBook Pro:70B Q4_K_M 模型(磁盘上约 40GB)可完全载入统一内存,还有充足空间留给上下文。Apple 嵌入每个 GPU 核心的 Neural Accelerator 让 prompt 处理速度比 M4 Max 快 3.3–4 倍,稳态生成速度约 18–25 t/s。它换来的则是便携性:这是唯一能装进背包的方案。

适用模型:Qwen3 Coder Plus、Llama 3.3 70B、Qwen3.6 Plus 全精度

配备 128GB 统一内存的 M5 Max,是在笔记本上认真做本地开发的新一代最佳平衡点。Apple 的 MLX 框架现已原生支持 Neural Accelerator,这意味着 GPU 和 Neural Engine 会在每次前向传播中协同工作,而非二选一。

手头的硬件达不到这些档位?haimaker 为 OpenClaw 提供一个统一的云端路由端点,让本地模型胜任的任务在本地跑,处理不了的场景自动回退到云端。

试用 HAIMAKER 云端路由

配置 Ollama

Ollama 是运行本地模型最简单的方式。安装后拉取一个模型,就能在 localhost 上获得一个 OpenAI 兼容 API。

# Install
curl -fsSL https://ollama.com/install.sh | sh

# Pull a model (pick one based on your hardware)
ollama pull qwen3.6:27b          # Best quality, needs 18GB+ VRAM
ollama pull qwen3.6:35b-a3b      # Fast MoE model, runs on 16GB
ollama pull qwen3.6:9b           # Lightweight, runs on 8GB
ollama pull qwen3-coder-plus     # Premium, needs 48GB+ or 96GB unified

Ollama 默认通过 http://localhost:11434 提供 API 服务。

来自 r/LocalLLaMA 的建议: 多位用户反馈,对于 27B 及更大的模型,从 Ollama 换到 llama.cpp 可以获得更好性能。Ollama 胜在方便,但 llama.cpp 在量化和内存分配上提供了更多控制权。建议先以 Ollama 起步,遇到性能瓶颈再切换到 llama.cpp。

OpenClaw 配置

既然 Ollama 已是官方提供商,配置就很简单。运行配置引导向导:

openclaw onboard --auth-choice ollama

或者手动在 ~/.openclaw/openclaw.json 中添加 Ollama:

{
  models: {
    providers: {
      ollama: {
        baseUrl: "http://localhost:11434/v1",
        api: "openai-completions",
        models: [
          {
            id: "qwen3.6:27b",
            name: "Qwen3.6 27B",
            reasoning: false,
            contextWindow: 131072,
            maxTokens: 8192
          }
        ]
      }
    }
  },
  agents: {
    defaults: {
      model: { primary: "ollama/qwen3.6:27b" },
      models: {
        "ollama/qwen3.6:27b": { alias: "qwen-local" }
      }
    }
  }
}

切换到本地模型:

/model qwen-local

本地模型擅长什么

本地运行 Qwen3.6 27B 几周后,这些表现比较稳:

  • 阅读和总结代码。 问它某函数做了什么,它会给出靠谱的回答。虽然不如 Sonnet 4.6 那么细致,但应对不熟悉的代码库已经足够。
  • 常见代码模式的生成。 样板代码、CRUD 操作、配置文件、测试脚手架,大多数情况下第一次就能写出能用的代码。3.6 版本基于真实合并的 PR 做了后训练,这一点在 diff 质量上体现得很明显。
  • 文件操作和简单重构。 列文件、搜索模式、在单个文件内重命名变量。这些机械任务不需要深度推理。
  • 智能体工具调用。 Qwen3.6 将函数调用可靠性提升到新高度——Terminal-Bench 2.0 的 59.3% 与 Claude Opus 4.5 完全持平。对 OpenClaw 的工具循环来说,这意味着”模型用错误参数调用了错误函数”这类错误更少出现。

本地模型的短板

  • 多文件重构。 任何需要跨 5 个以上文件维护上下文的工作都会变得不稳定;模型要么丢失上下文,要么改动不一致。拥有 200K+ 上下文窗口的云端模型仍有优势,不过 Qwen3.6 已缩小差距。
  • 复杂调试。 如果 bug 需要跨多个抽象层进行推理,本地模型通常只给出表面修复,而问题其实在更深处。Claude Opus 4.8 在 SWE-bench Verified 上仍领先 Qwen3.6 27B 约 11 分,Claude Fable 5 领先约 18 分。
  • 旧硬件上稠密模型的速度。 27B 模型在单张 RTX 5090 上约 70 token/秒,在 M5 Max 上约 22 t/s;若你还在用 3090 或 4090,预期大致是 30-40 t/s。(例外是 35B-A3B MoE,可达 180+ t/s。)
  • 超长上下文。 Qwen3.6 理论上最高支持 256K token,但在消费级硬件上超过 32K 后推理质量会下降。配置中请给 contextWindow 设置一个符合实际的值。

混合方案

大多数尝试本地模型的人最终都会走向混合方案:便宜的活儿交给本地,难题交给云端。

{
  agents: {
    defaults: {
      model: {
        primary: "ollama/qwen3.6:27b",
        thinking: "anthropic/claude-sonnet-4-6-20260514"
      }
    }
  }
}

本地模型负责读文件、简单编辑和样板代码,大约占一次典型编码会话的 60-70%。Sonnet 负责调试、架构决策和多文件工作。这样每天 API 费用会从 20-50 美元降到几美元。

当你明确知道某任务需要更强能力时,手动切换:

/model sonnet

或者使用 Haimaker 的自动路由 帮你处理路由。自动路由会识别任务复杂度,把难题自动交给云端模型,你无需考虑何时切换。

故障排除

模型加载慢或崩溃。 很可能是内存不足。试试更小的量化版本:ollama pull qwen3.6:27b-q4_K_M,以少量质量损失换更低的内存占用。Q4_K_M 对多数人都是最佳平衡点——质量损失很小,内存节省明显。

工具调用失败。 在模型配置中设置 "reasoning": false,并坚持使用 Qwen3.6 系列模型;它们对 OpenClaw 工具调用格式的处理比 Mistral 或旧版 Llama 更可靠。如果仍然出错,请将 Ollama 更新到最新版本。官方提供商集成修复了不少边界情况。

上下文窗口错误。 在配置中准确设置 contextWindow。对于 Qwen3.6 系列,在 24GB 以上显存硬件(单张 RTX 5090 足够)上,131072(128K)是安全默认值;16GB 显存建议设为 32768,以避免质量下降。

生成速度慢。 如果在 5090 上跑 27B 模型低于 40 t/s,或在 M5 Max 上低于 18 t/s,请检查是否有其他进程占用 GPU。关闭运行 WebGL 或视频的浏览器标签页。在 Mac 上可打开”活动监视器 → GPU 历史记录”,查看谁在抢占统一内存。M5 用户还应确认 Ollama 使用的是 MLX 后端(v0.21+);纯 Metal 路径与 MLX 路径在 prompt 处理上的速度差距约为 2 倍。

试用 HAIMAKER 云端路由


关于模型价格对比,请参阅 OpenClaw 最便宜的模型;关于降低云端模型 token 成本,请参阅 用 QMD 削减 96% 成本