Mô hình tốt nhất cho Hermes Agent vào tháng 7/2026 là Claude Sonnet 4.6 cho đa số người dùng, Claude Opus 4.8 khi bạn cần code phải chính xác, và MiniMax M3 khi agent chạy liên tục và chi phí quan trọng hơn sự xuất sắc. Bản thân Hermes không phụ thuộc vào mô hình: nó gửi mọi bước qua một endpoint tương thích OpenAI, nên mô hình mà nó sử dụng chỉ là một giá trị cấu hình bạn có thể đổi trong chưa đầy một phút.

Sự linh hoạt đó chính là điểm mấu chốt. Danh sách mô hình đã gần như thay đổi hoàn toàn trong quý vừa qua, và người dùng Hermes đã đặt mô hình từ mùa xuân rất có thể đang chạy một lựa chọn không còn phù hợp. Dưới đây là bảng xếp hạng hiện tại và các giá trị chính xác để bạn cấu hình.

Mô hình nào tốt nhất cho Hermes Agent lúc này?

Với lựa chọn mặc định, hãy dùng Claude Sonnet 4.6: khả năng gọi công cụ đáng tin cậy, chi phí tầm trung và ít phát sinh sự cố trong các vòng lặp agent dài. Anthropic hiện đang thống trị mảng coding-agent một cách áp đảo đến mức thị trường “AI lập trình tốt nhất” trên Polymarket đang ở mức 98% cho Anthropic, với Claude Opus 4.8 đạt 88,6% trên SWE-bench Verified và Claude Fable 5 thuộc nhóm frontier đạt 95,0%.

HạngMô hìnhPhân khúcPhù hợp nhất khi dùng với Hermes
1Claude Sonnet 4.6tầm trungMô hình dùng hằng ngày, cân bằng giữa chi phí và năng lực
2Claude Opus 4.8cao cấpLập trình production, debug đa bước phức tạp
3Gemini 3.1 Protầm trungNghiên cứu và ngữ cảnh quy mô repo (1M+ token)
4Kimi K2.7 / K3tầm trungLập trình chất lượng frontier cho mô hình mở, các swarm agent
5MiniMax M3giá rẻAgent chạy liên tục, ngữ cảnh 1M với $0,30/M input
6DeepSeek V4 Flashgiá rẻVận hành 24/7 rẻ nhất, dưới $5 mỗi tháng
7GLM-5.2giá rẻMô hình mở mạnh nhất trên SWE-bench Pro (62,1%)

Một lưu ý về phân khúc cao cấp: Claude Opus 4.8 ra mắt với giá chỉ bằng khoảng một phần ba so với các thế hệ Opus trước. Lời khuyên cũ rằng chỉ nên dùng Opus vào dịp đặc biệt đã lỗi thời; với công việc Hermes nặng về lập trình, đây giờ là lựa chọn dùng hằng ngày hoàn toàn hợp lý.

Làm thế nào để đổi mô hình trong Hermes Agent?

Hermes Agent chọn mô hình thông qua lệnh hermes model: chọn Custom endpoint, rồi nhập base URL kết thúc bằng /v1, một API key và một model ID. Bất kỳ nhà cung cấp nào tương thích OpenAI đều hoạt động. Cách nhanh nhất để dùng tất cả mô hình trong bài viết này là dùng một endpoint duy nhất:

export HAIMAKER_API_KEY=your-haimaker-key
npx -y @haimaker/connect --hermes

@haimaker/connect sẽ tự động ghi cấu hình custom-endpoint cho Hermes và xác minh key. Từ đó, việc chuyển giữa Sonnet, MiniMax và Kimi chỉ cần sửa một chuỗi model, không cần tạo thêm tài khoản nhà cung cấp:

  • Base URL: https://api.haimaker.ai/v1
  • Một số model mẫu: anthropic/claude-sonnet-4-6, google/gemini-3-1-pro, minimax/minimax-m3, deepseek/deepseek-v4-flash, moonshot/kimi-k2-7

Xem hướng dẫn đầy đủ, gồm cả base URL theo từng nhà cung cấp và cách xử lý timeout, trong hướng dẫn thiết lập custom provider cho Hermes của chúng tôi.

Nên chọn mô hình nào cho từng nhu cầu sử dụng?

Hãy chọn mô hình theo công việc chính mà agent thực hiện, đừng chọn theo bảng xếp hạng. Hermes chạy các vòng lặp gọi công cụ dài, nên độ tin cậy của lời gọi công cụ và kích thước ngữ cảnh quan trọng hơn điểm benchmark thô. Bốn nhóm dưới đây bao quát hầu hết các thiết lập Hermes.

Trợ lý hằng ngày và tự động hóa

Claude Sonnet 4.6. Các tác vụ lịch, tác vụ nghiên cứu, xử lý file và lập trình cỡ trung đều thuộc nhóm này. Mô hình tuân theo tool schema của Hermes mà không bị lệch, điều giúp một phiên chạy 40 bước không chết ở bước 23.

Lập trình production

Claude Opus 4.8, đạt 88,6% trên SWE-bench Verified. Khi một phiên chạy Hermes kết thúc bằng một pull request mà bạn định merge, phân khúc cao cấp sẽ tự hoàn vốn nhờ giảm số vòng làm lại. GPT-5.6, đã ra mắt chính thức (GA) vào ngày 9 tháng 7, là lựa chọn thay thế mạnh nhất ngoài Anthropic ở đây.

Nghiên cứu và tài liệu dài

Gemini 3.1 Pro. Cửa sổ ngữ cảnh 1M+ token có nghĩa là Hermes có thể giữ toàn bộ repository hoặc một chồng PDF trong một phiên làm việc mà không phải cắt bớt quá mạnh tay.

Agent chạy liên tục với ngân sách thấp

MiniMax M3 hoặc DeepSeek V4 Flash. Một Hermes agent làm nhiệm vụ theo dõi định kỳ, tóm tắt và lưu trữ cả ngày không nên chạy trên token cao cấp. M3 cho bạn cửa sổ ngữ cảnh 1M với giá $0,30/M input, khoảng $7–15 mỗi tháng cho vận hành 24/7. V4 Flash là mức giá sàn: dưới $5 mỗi tháng cho cùng chu kỳ hoạt động.

Mọi mô hình trong bảng xếp hạng này đều có sẵn qua một key haimaker.ai duy nhất, với giá thấp hơn thị trường khoảng 5%. Hãy trỏ Hermes về một endpoint và chuyển phân khúc chỉ bằng cách sửa một chuỗi duy nhất.

LẤY MỘT KEY CHO MỌI MÔ HÌNH HERMES

Còn phân khúc open-weight thì sao?

Phân khúc open-weight không còn là lựa chọn phải đánh đổi từ mùa hè này. Kimi K3 của Moonshot, công bố ngày 16 tháng 7, đã vượt cả Claude Fable và GPT-5.6 Sol trên các bảng xếp hạng arena, và phiên bản tối ưu cho lập trình Kimi K2.7 hiện đã dùng được với Hermes. GLM-5.2 dẫn đầu nhóm mở trên SWE-bench Pro với 62,1%, xếp trên MiniMax M3 (59,0%) và Kimi K2.6 (58,6%).

Hai hệ quả thực tế cho người dùng Hermes:

  • Kimi K2.6 trở lên hỗ trợ điều phối agent swarm — sinh ra các sub-agent chuyên biệt phối hợp với nhau. Nếu bạn đưa Hermes sang hướng multi-agent, dòng Kimi được thiết kế chính xác cho dạng công việc này.
  • Áp lực giá từ open-weight là điều không thể phủ nhận. Khoảng cách giữa “mô hình mở giá rẻ” và “mô hình đóng tầm trung” trên các benchmark agentic giờ chỉ còn vài điểm, trong khi chênh lệch giá vẫn rất lớn. Với hầu hết tác vụ Hermes không quá quan trọng, phân khúc mở là lựa chọn mặc định hợp lý.

Hermes Agent có chạy được mô hình local không?

Có. Hermes coi một server Ollama local như một custom endpoint bình thường: base URL http://localhost:11434/v1, một API key bất kỳ (chỉ để lấp chỗ trống), và mô hình bạn đã tải về. Lựa chọn local được cộng đồng đồng thuận là Qwen3.6 27B (77,2% trên SWE-bench Verified chỉ với một GPU 24GB duy nhất), còn gpt-oss 20B là phương án dự phòng cho cấu hình 16GB.

Nói thẳng: mô hình local vẫn thua mô hình cloud ở những tác vụ đa file khó nhất, nên thiết lập bền vững trong thực tế là dùng local cho các bước riêng tư giá rẻ và mô hình cloud để xử lý phần khó. Hướng dẫn mô hình lập trình Ollama của chúng tôi bao quát các phân khúc phần cứng, còn API rẻ nhất cho coding agent bao quát phía cloud của mô hình hybrid đó.

Kết luận

Không có một mô hình duy nhất tốt nhất cho Hermes Agent, nhưng có một stack mặc định rõ ràng vào tháng 7/2026:

  • Bắt đầu: Claude Sonnet 4.6 làm mô hình dùng hằng ngày
  • Nâng cấp: Claude Opus 4.8 cho code production
  • Tiết kiệm: MiniMax M3 hoặc DeepSeek V4 Flash cho agent nền chạy liên tục
  • Thử nghiệm: Kimi K2.7 và GLM-5.2 nếu bạn muốn kết quả tiệm cận frontier với giá open-weight

Vì Hermes không bị ràng buộc vào endpoint nào, không lựa chọn nào trong số này bó buộc bạn. Hãy thiết lập một key, rồi xếp lại stack khi bản phát hành tiếp theo ra mắt. Với tốc độ hiện tại, điều đó xảy ra cứ vài tuần một lần.

CHẠY HERMES TRÊN HAIMAKER


So sánh các agent thay vì mô hình? Xem Hermes vs Codex. Đang thiết lập endpoint? Xem hướng dẫn custom provider cho Hermes.