2026 年 7 月,Hermes Agent 的最佳模型對大多數人來說是 Claude Sonnet 4.6;程式碼不能出錯時選 Claude Opus 4.8;agent 全天候運作、費用比頂尖表現更重要時選 MiniMax M3。Hermes 本身不綁定特定模型:它透過單一 OpenAI 相容端點送出每個步驟,因此背後的模型只是一個設定值,不到一分鐘就能更換。
重點就在於這種彈性。模型陣容在上一季幾乎全面汰換,春季設定好模型的 Hermes 使用者,現在執行的多半已經不是最佳選擇。以下是目前的排名,以及可以直接貼上的設定值。
目前 Hermes Agent 的最佳模型是什麼?
預設選擇 Claude Sonnet 4.6:工具呼叫穩定、成本中等、長時間 agent 迴圈不會出狀況。Anthropic 目前在程式開發 agent 領域處於壓倒性領先:Polymarket 的「最佳程式開發 AI」市場中 Anthropic 佔 98%,Claude Opus 4.8 在 SWE-bench Verified 上達到 88.6%,前沿的 Claude Fable 5 更達到 95.0%。
| 排名 | 模型 | 等級 | 在 Hermes 中的最佳用途 |
|---|---|---|---|
| 1 | Claude Sonnet 4.6 | 中階 | 預設日常主力,成本與能力兼顧 |
| 2 | Claude Opus 4.8 | 高階 | 正式環境程式開發、高難度多步驟除錯 |
| 3 | Gemini 3.1 Pro | 中階 | 研究與 repo 級上下文(100 萬+ token) |
| 4 | Kimi K2.7 / K3 | 中階 | 開放權重前沿程式開發、agent 群集協作 |
| 5 | MiniMax M3 | 預算 | 全天候 agent,100 萬 token 上下文,$0.30/M 輸入 |
| 6 | DeepSeek V4 Flash | 預算 | 最便宜的 24/7 運作,每月不到 $5 |
| 7 | GLM-5.2 | 預算 | SWE-bench Pro 上最強的開放模型(62.1%) |
關於高階等級的一點補充:Claude Opus 4.8 的定價大約只有早期 Opus 世代的三分之一。過去「把 Opus 留給特殊場合」的建議已經過時;對於以程式開發為主的 Hermes 工作,它現在是合理的日常選擇。
如何在 Hermes Agent 中切換模型?
Hermes Agent 透過 hermes model 指令選擇模型:選擇 Custom endpoint,然後輸入以 /v1 結尾的 base URL、API 金鑰和模型 ID。任何 OpenAI 相容的供應商都能使用。要使用本文提到的所有模型,最快的方式是單一端點:
export HAIMAKER_API_KEY=your-haimaker-key
npx -y @haimaker/connect --hermes
@haimaker/connect 會幫你寫好 Hermes 的自訂端點設定並驗證金鑰。之後,從 Sonnet 切換到 MiniMax 再到 Kimi,只需要編輯一個模型字串,不必再建立另一個供應商帳號:
- Base URL:
https://api.haimaker.ai/v1 - 模型範例:
anthropic/claude-sonnet-4-6、google/gemini-3-1-pro、minimax/minimax-m3、deepseek/deepseek-v4-flash、moonshot/kimi-k2-7
完整的操作指南,包括各供應商的 base URL 和逾時修復方法,請參閱我們的 Hermes 自訂供應商設定指南。
各使用場景該選哪個模型?
根據 agent 最常做的工作來選模型,而不是看排行榜。Hermes 會執行長時間的工具迴圈,因此工具呼叫的可靠性和上下文大小比原始基準分數更重要。以下四種情境涵蓋了大多數 Hermes 的使用方式。
日常助理與自動化工作
Claude Sonnet 4.6。 行事曆任務、研究任務、檔案整理和中等規模的程式開發都可以交給它。它能穩定遵循 Hermes 的工具 schema 而不會偏離正軌,這正是讓 40 步的執行不會在第 23 步掛掉的關鍵。
正式環境程式開發
Claude Opus 4.8,在 SWE-bench Verified 上達到 88.6%。當 Hermes 跑完的結果是你打算合併的 pull request 時,高階等級就能藉由減少重做迴圈來回本。GPT-5.6 於 7 月 9 日正式推出(GA),是這裡最強的非 Anthropic 替代方案。
研究與長文件
Gemini 3.1 Pro。 100 萬+ token 的上下文視窗意味著 Hermes 可以在一個工作階段中容納整個 repo 或一疊 PDF,而不需要大幅截斷。
全天候低預算 agent
MiniMax M3 或 DeepSeek V4 Flash。 一個整天輪詢、摘要和歸檔的 Hermes agent 不應該用昂貴的 token 來運作。M3 提供 100 萬 token 上下文視窗、$0.30/M 輸入,24/7 運作大約每月 $7-15。V4 Flash 是價格底線:同樣的工作量每月不到 $5。
本排名中的所有模型都可以透過一個 haimaker.ai 金鑰存取,價格約比市場行情低 5%。將 Hermes 指向一個端點,編輯一個字串即可切換等級。
一把金鑰存取所有 HERMES 模型開放權重等級怎麼了?
開放權重等級在今年夏天不再只是妥協選項。Moonshot 的 Kimi K3 於 7 月 16 日發布,在 Arena 排行榜上擊敗了 Claude Fable 和 GPT-5.6 Sol,其針對程式開發調校的版本 Kimi K2.7 已經可以在 Hermes 背後使用。GLM-5.2 在 SWE-bench Pro 上以 62.1% 領先開放陣營,超越 MiniMax M3(59.0%)和 Kimi K2.6(58.6%)。
對 Hermes 使用者的兩個實際影響:
- Kimi K2.6 及之後版本支援 agent 群集協作——生成專門的子 agent 來協作。如果你將 Hermes 推向多 agent 模式,Kimi 系列正是為這種工作模式打造的。
- 開放權重帶來的價格壓力確實存在。「開放預算模型」和「封閉中階模型」在 agentic 基準上的差距現在只有幾個百分點,而價格差距仍然很大。對於大多數非關鍵的 Hermes 工作負載,開放等級是理性的預設選擇。
Hermes Agent 能跑本地模型嗎?
可以。Hermes 把本地 Ollama 伺服器視為另一個自訂端點:base URL 為 http://localhost:11434/v1,API 金鑰填任意佔位值,模型填你已下載的任何模型。社群公認的本地首選是 Qwen3.6 27B(單張 24GB GPU 即可在 SWE-bench Verified 上達到 77.2%),gpt-oss 20B 則是 16GB GPU 的備選。
老實說,本地模型在最困難的多檔案工作上仍然落後雲端模型,因此實務上可行的配置是:用本地模型處理便宜且需要保密的步驟,遇到需要更強能力時再呼叫雲端模型。我們的 Ollama 程式開發模型指南 涵蓋硬體等級,最便宜的程式開發 agent API 則涵蓋混合方案的雲端部分。
總結
Hermes Agent 沒有單一最佳模型,但 2026 年 7 月有一個明確的預設組合:
- 起步: Claude Sonnet 4.6 作為日常主力
- 升級: Claude Opus 4.8 處理正式環境程式碼
- 省錢: MiniMax M3 或 DeepSeek V4 Flash 用於全天候背景 agent
- 實驗: Kimi K2.7 和 GLM-5.2,想要用開放權重的價格取得接近前沿的成果
因為 Hermes 不綁定特定端點,這些選擇都不會把你綁死。設定好一把金鑰,等下一個版本發布時重新調整你的模型組合。以目前的節奏,這每隔幾週就會發生一次。
想比較的是 agent 而非模型?請參閱 Hermes vs Codex。要設定端點本身?請參閱 Hermes 自訂供應商指南。