“免费”这个词在 AI 模型领域被用得太滥了。对 OpenClaw 用户来说,“免费”到底意味着什么?我来具体说明一下。

大致分三类:真正零成本的模型(本地运行)、有免费额度但终会用完的模型,以及便宜到在大多数账单上几乎看不到的模型。下面逐一介绍。

真正免费:本地模型

真正不产生 token 费用的模型,只有跑在自己机器上的那些。用 Ollama 就能轻松搞定。

装好之后拉一个模型,把 OpenClaw 指向它就行:

# Install Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Pull a coding model
ollama pull qwen3.6:27b

然后在 ~/.openclaw/openclaw.json 中将 Ollama 添加为 provider:

{
  models: {
    providers: {
      ollama: {
        baseUrl: "http://localhost:11434/v1",
        api: "openai-completions",
        models: [
          { id: "qwen3.6:27b", name: "Qwen3.6 27B" }
        ]
      }
    }
  },
  agents: {
    defaults: {
      model: { primary: "ollama/qwen3.6:27b" }
    }
  }
}

哪些本地模型效果好

Qwen3.6 27B 是目前的最佳选择——社区仍然称它为本地编程的”天花板”。它在 SWE-bench Verified 上得分 77.2%,日常的代码生成、调试和多文件编辑都能胜任,而且只需要约 18GB 显存(RTX 5090,或配备 32GB 以上统一内存的 M 系列 Mac)。

Qwen3 Coder 30B 是针对 Agent 场景优化的选择——256K 上下文加上可靠的工具调用能力,这对 OpenClaw 的工具循环至关重要。

gpt-oss 20BGemma 4 可以在 16GB 显存的机器上运行。gpt-oss 20B 自发布以来已成为小参数模型中的默认选择——它每个 token 只激活约 3.6B 参数,而且允许你调整推理力度。不过在复杂任务上质量仍会下降;多文件重构这种活儿,这两个模型我都不太放心。

不得不面对的取舍

本地模型免费但不快。响应时间比云端 API 慢 3–10 倍,具体取决于你的硬件。即便是消费级硬件上能跑的最好的开源模型,面对最难的调试和多文件工作,也仍然比不上前沿的 Claude 模型。

如果你的工作主要是读取文件、生成样板代码和简单编辑,本地模型完全够用。如果你在做复杂的调试或架构设计,那些任务还是得靠云端模型。

云端服务商的免费额度

有几家服务商确实提供免费额度,只是有上限。

Gemini Flash 是云端推理的最佳免费选项。Google 的免费额度提供每分钟 15 次请求,上下文窗口最高可达 100 万 token。日常写代码完全够用。

// Add to ~/.openclaw/openclaw.json
{
  models: {
    providers: {
      google: {
        models: [
          { id: "gemini-3-flash", name: "Gemini 3 Flash" }
        ]
      }
    }
  }
}

不过要注意:免费额度有更严格的速率限制,你的数据可能会被用于训练。个人项目和学习用途的话,问题不大。涉及专有代码的话,建议走付费 API 或者跑本地模型。

几乎免费:单日成本不到 1 美元的模型

有些模型每 token 的成本极低,即使一整天高强度使用 OpenClaw,花费也不到 1 美元。

模型输入成本输出成本每日成本估算
DeepSeek V4 Flash~$0.10/M~$0.28/M~$0.15
GLM-4.7 Flash$0.07/M$0.28/M~$0.15
GPT-4o-mini$0.15/M$0.60/M~$0.50
MiniMax M3$0.30/M~$0.50

每日估算基于约 50 万输入 + 20 万输出 token,相当于一个高强度的编程日。

MiniMax M3 值得特别说明:每百万输入 token 仅 $0.30,配合 100 万 token 的上下文窗口,它是当前预算档的性价比之选——全天候运行 Agent 每月大约花费 $7–15。DeepSeek V4 Flash 是绝对的价格底线:便宜到 7×24 小时运行 Agent 每月也不到 $5。

写代码时那些枯燥的活儿——文件读取、简单编辑、文档编写、测试运行——这些模型都能胜任。把 20% 的难题交给更好的模型,总账单就能控制在每天 $5 以内。

你可以通过 Haimaker 用一个 API key 访问所有这些模型,也可以分别在各服务商处单独配置。

将 Haimaker key 写入 HAIMAKER_API_KEY 后,connect CLInpx -y @haimaker/connect --openclaw)会自动把 provider 配置写入 OpenClaw,这样你无需手动编辑 JSON 就能使用这些低成本模型。

实用方案:免费 + 低成本混合

在意成本的人,最后基本都会走到这一步:

  1. 本地模型处理简单任务(通过 Ollama 使用 Qwen3.6 27B,免费)
  2. 低成本云端模型处理中等任务(DeepSeek V4 Flash 或 MiniMax M3,几分钱)
  3. 高端模型处理难题(Claude Sonnet 或 Opus,按量付费)
{
  agents: {
    defaults: {
      model: {
        primary: "ollama/qwen3.6:27b",
        thinking: "anthropic/claude-sonnet-4-6"
      }
    }
  }
}

本地模型处理 60–70% 的请求(读取文件、简单代码),Sonnet 处理剩下的部分。每天 API 开销从 $30–50 降到 $2–5。

想了解更多模型路由的玩法,可以看看我们的多 Agent 工作流指南。

领取 HAIMAKER $10 免费额度


完整的模型对比,见 OpenClaw 最佳模型。成本优化策略,见降低 96% 的 token 成本