“免费”这个词在 AI 模型领域被用得太滥了。对 OpenClaw 用户来说,“免费”到底意味着什么?我来具体说明一下。
大致分三类:真正零成本的模型(本地运行)、有免费额度但终会用完的模型,以及便宜到在大多数账单上几乎看不到的模型。下面逐一介绍。
真正免费:本地模型
真正不产生 token 费用的模型,只有跑在自己机器上的那些。用 Ollama 就能轻松搞定。
装好之后拉一个模型,把 OpenClaw 指向它就行:
# Install Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Pull a coding model
ollama pull qwen3.6:27b
然后在 ~/.openclaw/openclaw.json 中将 Ollama 添加为 provider:
{
models: {
providers: {
ollama: {
baseUrl: "http://localhost:11434/v1",
api: "openai-completions",
models: [
{ id: "qwen3.6:27b", name: "Qwen3.6 27B" }
]
}
}
},
agents: {
defaults: {
model: { primary: "ollama/qwen3.6:27b" }
}
}
}
哪些本地模型效果好
Qwen3.6 27B 是目前的最佳选择——社区仍然称它为本地编程的”天花板”。它在 SWE-bench Verified 上得分 77.2%,日常的代码生成、调试和多文件编辑都能胜任,而且只需要约 18GB 显存(RTX 5090,或配备 32GB 以上统一内存的 M 系列 Mac)。
Qwen3 Coder 30B 是针对 Agent 场景优化的选择——256K 上下文加上可靠的工具调用能力,这对 OpenClaw 的工具循环至关重要。
gpt-oss 20B 和 Gemma 4 可以在 16GB 显存的机器上运行。gpt-oss 20B 自发布以来已成为小参数模型中的默认选择——它每个 token 只激活约 3.6B 参数,而且允许你调整推理力度。不过在复杂任务上质量仍会下降;多文件重构这种活儿,这两个模型我都不太放心。
不得不面对的取舍
本地模型免费但不快。响应时间比云端 API 慢 3–10 倍,具体取决于你的硬件。即便是消费级硬件上能跑的最好的开源模型,面对最难的调试和多文件工作,也仍然比不上前沿的 Claude 模型。
如果你的工作主要是读取文件、生成样板代码和简单编辑,本地模型完全够用。如果你在做复杂的调试或架构设计,那些任务还是得靠云端模型。
云端服务商的免费额度
有几家服务商确实提供免费额度,只是有上限。
Gemini Flash 是云端推理的最佳免费选项。Google 的免费额度提供每分钟 15 次请求,上下文窗口最高可达 100 万 token。日常写代码完全够用。
// Add to ~/.openclaw/openclaw.json
{
models: {
providers: {
google: {
models: [
{ id: "gemini-3-flash", name: "Gemini 3 Flash" }
]
}
}
}
}
不过要注意:免费额度有更严格的速率限制,你的数据可能会被用于训练。个人项目和学习用途的话,问题不大。涉及专有代码的话,建议走付费 API 或者跑本地模型。
几乎免费:单日成本不到 1 美元的模型
有些模型每 token 的成本极低,即使一整天高强度使用 OpenClaw,花费也不到 1 美元。
| 模型 | 输入成本 | 输出成本 | 每日成本估算 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.10/M | ~$0.28/M | ~$0.15 |
| GLM-4.7 Flash | $0.07/M | $0.28/M | ~$0.15 |
| GPT-4o-mini | $0.15/M | $0.60/M | ~$0.50 |
| MiniMax M3 | $0.30/M | — | ~$0.50 |
每日估算基于约 50 万输入 + 20 万输出 token,相当于一个高强度的编程日。
MiniMax M3 值得特别说明:每百万输入 token 仅 $0.30,配合 100 万 token 的上下文窗口,它是当前预算档的性价比之选——全天候运行 Agent 每月大约花费 $7–15。DeepSeek V4 Flash 是绝对的价格底线:便宜到 7×24 小时运行 Agent 每月也不到 $5。
写代码时那些枯燥的活儿——文件读取、简单编辑、文档编写、测试运行——这些模型都能胜任。把 20% 的难题交给更好的模型,总账单就能控制在每天 $5 以内。
你可以通过 Haimaker 用一个 API key 访问所有这些模型,也可以分别在各服务商处单独配置。
将 Haimaker key 写入 HAIMAKER_API_KEY 后,connect CLI(npx -y @haimaker/connect --openclaw)会自动把 provider 配置写入 OpenClaw,这样你无需手动编辑 JSON 就能使用这些低成本模型。
实用方案:免费 + 低成本混合
在意成本的人,最后基本都会走到这一步:
- 本地模型处理简单任务(通过 Ollama 使用 Qwen3.6 27B,免费)
- 低成本云端模型处理中等任务(DeepSeek V4 Flash 或 MiniMax M3,几分钱)
- 高端模型处理难题(Claude Sonnet 或 Opus,按量付费)
{
agents: {
defaults: {
model: {
primary: "ollama/qwen3.6:27b",
thinking: "anthropic/claude-sonnet-4-6"
}
}
}
}
本地模型处理 60–70% 的请求(读取文件、简单代码),Sonnet 处理剩下的部分。每天 API 开销从 $30–50 降到 $2–5。
想了解更多模型路由的玩法,可以看看我们的多 Agent 工作流指南。
完整的模型对比,见 OpenClaw 最佳模型。成本优化策略,见降低 96% 的 token 成本。