2026 年 7 月,对大多数人来说,Hermes Agent 的最佳模型是 Claude Sonnet 4.6;当代码容不得出错时,选 Claude Opus 4.8;当 Agent 需要全天候运行、比起极致性能更在意账单时,选 MiniMax M3。Hermes 本身不绑定任何特定模型:每一步都通过同一个 OpenAI 兼容端点发出,因此背后的模型只是一个配置项,一分钟内就能切换。
这种灵活性正是设计初衷。模型阵容在上个季度几乎完全换代,春天就设好模型的 Hermes 用户,现在跑的很可能已经不是最优解。以下是最新排名和可直接填入的配置值。
当前 Hermes Agent 最佳模型是什么?
默认选 Claude Sonnet 4.6:工具调用可靠、成本适中、长 Agent 循环中表现稳定不翻车。Anthropic 目前对编码智能体的统治力非常明显:Polymarket 上”最佳编码 AI”市场给 Anthropic 的隐含概率达到 98%;Claude Opus 4.8 在 SWE-bench Verified 上得分 88.6%,前沿模型 Claude Fable 5 更高达 95.0%。
| 排名 | 模型 | 定位 | 在 Hermes 中的最佳用途 |
|---|---|---|---|
| 1 | Claude Sonnet 4.6 | 中端 | 日常主力,成本与能力均衡 |
| 2 | Claude Opus 4.8 | 高端 | 生产级编码、高难度多步调试 |
| 3 | Gemini 3.1 Pro | 中端 | 研究与仓库级上下文(100 万+ token) |
| 4 | Kimi K2.7 / K3 | 中端 | 开放权重前沿编码、多智能体集群 |
| 5 | MiniMax M3 | 低成本 | 全天候 Agent,100 万上下文,输入 $0.30/M |
| 6 | DeepSeek V4 Flash | 低成本 | 最便宜的 24/7 运行方案,月费低于 $5 |
| 7 | GLM-5.2 | 低成本 | SWE-bench Pro 上最强的开放模型(62.1%) |
关于高端定位多说一句:Claude Opus 4.8 发布价格大约是早期 Opus 系列的三分之一。过去”把 Opus 留给特殊场合”的建议已经过时;对于编码密集型的 Hermes 工作,它现在完全可以作为日常主力。
如何在 Hermes Agent 中切换模型?
Hermes Agent 通过 hermes model 命令选择模型:选择 Custom endpoint,然后输入以 /v1 结尾的 base URL、API key 和模型 ID。任何 OpenAI 兼容服务商都能接入。想访问本文涉及的所有模型,最快的方式是通过一个端点统一搞定:
export HAIMAKER_API_KEY=your-haimaker-key
npx -y @haimaker/connect --hermes
@haimaker/connect 会自动帮你写入 Hermes 自定义端点配置并验证密钥。之后从 Sonnet 切到 MiniMax 再切到 Kimi,只需改一个模型字符串,不用另外注册服务商账号:
- Base URL:
https://api.haimaker.ai/v1 - 模型示例:
anthropic/claude-sonnet-4-6、google/gemini-3-1-pro、minimax/minimax-m3、deepseek/deepseek-v4-flash、moonshot/kimi-k2-7
完整教程(包括各服务商 base URL 和超时排查)请看我们的 Hermes 自定义服务商配置指南。
每种使用场景该选哪个模型?
根据 Agent 最常做的事来选模型,别只盯着排行榜。Hermes 跑的是长时间工具调用循环,工具调用可靠性和上下文大小远比裸分数重要。以下四种场景覆盖大多数 Hermes 用法。
日常助手与自动化任务
Claude Sonnet 4.6。 日历任务、研究任务、文件整理、中等规模编码都能交给它。它能严格按照 Hermes 的工具调用 schema 执行而不跑偏,这正是 40 步任务不会在第 23 步中断的关键。
生产级编码
Claude Opus 4.8,SWE-bench Verified 得分 88.6%。当 Hermes 的一次运行最终产出你要合并的 Pull Request 时,高端模型多花的钱靠减少返工就能省回来。GPT-5.6 于 7 月 9 日正式发布,是这里最强的非 Anthropic 替代方案。
研究与长文档
Gemini 3.1 Pro。 100 万+ token 的上下文窗口意味着 Hermes 可以在一个会话中装下整个代码仓库或一摞 PDF,而不必频繁截断。
全天候低成本 Agent
MiniMax M3 或 DeepSeek V4 Flash。全天候轮询、摘要、归档的 Hermes Agent 没必要用高端 token 来跑。M3 输入价格为 $0.30/M,并提供 100 万上下文窗口,24/7 运行月费约 $7-15。V4 Flash 是价格底线:相同负载下月费不到 $5。
本排名中的每个模型都能通过一个 haimaker.ai 密钥访问,价格比市场价低约 5%。把 Hermes 指向同一个端点,改一个字符串即可切换层级。
一个密钥访问所有 Hermes 模型开放权重这一档现在怎么样了?
开放权重这一档在 2026 年夏天不再是妥协选项。Moonshot 的 Kimi K3 于 7 月 16 日发布,在 LMArena 排行榜上击败了 Claude Fable 和 GPT-5.6 Sol;其面向编码调优的兄弟模型 Kimi K2.7 已经能在 Hermes 中实际使用。GLM-5.2 以 62.1% 的 SWE-bench Pro 得分领跑开放权重阵营,领先 MiniMax M3(59.0%)和 Kimi K2.6(58.6%)。
对 Hermes 用户有两个实际影响:
- Kimi K2.6 及后续版本支持多智能体集群协同 —— 可以生成多个专业化子 Agent 协作。如果你把 Hermes 用于多智能体模式,Kimi 系列正是为这种工作形态设计的。
- 开放权重的价格压力是实打实的。 在智能体基准上,“开放权重低成本模型”与”闭源中端模型”的差距现在只有几个百分点,而价格差距仍然很大。对于大多数非关键 Hermes 工作负载,开放权重档位才是理性的默认选择。
Hermes Agent 能跑本地模型吗?
可以。Hermes 把本地 Ollama 服务器当作普通自定义端点:base URL 填 http://localhost:11434/v1,API key 随便填个占位符,模型填你已拉取的任意模型即可。社区公认的本地首选是 Qwen3.6 27B(单张 24GB GPU,SWE-bench Verified 得分 77.2%);gpt-oss 20B 是 16GB 显存下的备选。
不过说句实话:本地模型在最高难度的多文件任务上仍落后于云端模型,所以实践中更靠谱的混合方案是——本地处理低成本、涉及隐私的步骤,遇到硬骨头再升级到云端模型。我们的 Ollama 编码模型指南 覆盖了硬件分级,编码 Agent 最便宜的 API 覆盖了云端那部分。
总结
Hermes Agent 没有唯一的最佳模型,但 2026 年 7 月有一套清晰的默认组合:
- 起步: Claude Sonnet 4.6 当日常主力
- 升级: Claude Opus 4.8 处理生产级代码
- 省成本: MiniMax M3 或 DeepSeek V4 Flash 用于全天候后台 Agent
- 尝鲜: Kimi K2.7 和 GLM-5.2,用开放权重价格获得接近前沿的效果
由于 Hermes 不绑定端点,这些选择都不会把你锁死。设好一个密钥,等下一个版本发布时再重新评估组合。以目前的迭代节奏,每隔几周就可能需要重新排一次。
想比较的是 Agent 而非模型?参见 Hermes vs Codex。正在配置端点本身?参见 Hermes 自定义服务商指南。