Mô hình Ollama tốt nhất cho một coding agent không phải lúc nào cũng là mô hình lớn nhất mà bạn có thể tải về. Agent chạy theo vòng lặp: đọc file, gọi tool, cập nhật kế hoạch và tạo patch. Một model trông ổn khi chạy một prompt đơn lẻ vẫn có thể khiến bạn thấy không thể dùng nổi khi mỗi lần gọi tool đều phải chờ thêm một lượt inference local chậm.

Hãy coi bảng xếp hạng này như một điểm xuất phát thực tế: nên pull model nào, cần phần cứng ra sao, và khi nào nên dừng cố chạy inference local để chuyển sang một model cloud dự phòng.

Xếp hạng nhanh

HạngMô hìnhLệnh pullPhù hợp nhất choPhần cứng thực tế
1Qwen3 Coder 30Bollama pull qwen3-coder:30bLựa chọn local mặc định tốt nhất cho coding agentVRAM 24GB+ hoặc bộ nhớ hợp nhất 32GB+
2Qwen3 30Bollama pull qwen3:30bTác vụ agent tổng quát, suy luận, review codeVRAM 24GB+ hoặc bộ nhớ hợp nhất 32GB+
3Gemma 4 26B MoEollama pull gemma4:26bHỗ trợ code local nhanh trên workstation mạnhVRAM 24GB+ hoặc bộ nhớ hợp nhất 32GB+
4Kimi K2.7 Codeollama pull kimi-k2.7-codeCoding dòng frontier trên phần cứng xịnVRAM 48GB+ hoặc bộ nhớ hợp nhất 96GB+
5gpt-oss 20Bollama pull gpt-oss:20bLựa chọn tốt nhất cho máy 16GB, điều chỉnh được mức suy luậnVRAM 16GB hoặc bộ nhớ hợp nhất
6Gemma 4 E4Bollama pull gemma4:e4bDùng nhẹ trên laptopBộ nhớ hợp nhất 16GB
7Qwen3 8Bollama pull qwen3:8bSửa nhỏ và giải thích codeBộ nhớ 8–16GB

Nếu bạn chỉ thử một model, hãy thử Qwen3 Coder 30B. Ollama liệt kê đây là model coding và agentic với hỗ trợ ngữ cảnh 256K, và được xây dựng đúng cho loại công việc mà coding agent vẫn làm hằng ngày: đọc code, gọi tool và duy trì trạng thái qua các tác vụ dài.

Chọn model theo cấu hình máy

RAM 8–16GB

Hãy dùng gpt-oss 20B, Qwen3 8B hoặc Gemma 4 E4B. gpt-oss 20B đã trở thành lựa chọn mặc định của cộng đồng cho máy 16GB kể từ khi ra mắt — model này nằm gọn trong ngân sách bộ nhớ và cho phép bạn tăng/giảm mức suy luận theo từng tác vụ.

Tầm này phù hợp để:

  • Giải thích code chưa quen
  • Viết các hàm nhỏ
  • Viết nháp test
  • Tạo file cấu hình
  • Tóm tắt log

Đừng kỳ vọng việc refactor đa file đáng tin cậy ở tầm này. Các model nhỏ hơn vẫn có thể viết code hữu ích, nhưng chúng rất nhanh rối ngữ cảnh khi agent bắt đầu mở file, sửa patch và xử lý kết quả từ tool.

RAM 24–32GB

Hãy dùng Qwen3 Coder 30B, Qwen3 30B hoặc Gemma 4 26B MoE.

Đây là tầm local-agent thực sự hữu ích. Model đủ lớn để nắm được ngữ cảnh repository, nhưng vẫn đủ nhỏ để chạy trên một GPU desktop mạnh hoặc một máy Mac nhiều RAM. Với hầu hết lập trình viên, đây là lúc Ollama không còn là món đồ để thử nghiệm nữa, mà bắt đầu trở thành một phần của quy trình làm việc hằng ngày.

RAM 64GB+

Chỉ thử các biến thể Qwen hoặc DeepSeek lớn hơn khi bạn đã thực sự hiểu vì sao mình cần chúng.

Cám dỗ là đuổi theo model lớn nhất trong thư viện, nhưng với agent, đó thường là quyết định sai. Một model local khổng lồ có thể gây ấn tượng về mặt kỹ thuật nhưng vẫn khiến vòng lặp code trở nên quá chậm. Model lớn hơn chỉ có lợi khi tác vụ thực sự cần thêm khả năng suy luận hoặc ngữ cảnh. Nếu agent chỉ đọc file, viết boilerplate hoặc nháp test, thì đó chỉ là gánh nặng.

Muốn có một thiết lập ưu tiên chạy local, có cloud dự phòng mà không phải quản lý key cho từng nhà cung cấp? haimaker định tuyến các tác vụ coding-agent đơn giản về model local của bạn, và chuyển các tác vụ khó lên model cloud qua một endpoint duy nhất.

ĐỊNH TUYẾN MÔ HÌNH LOCAL VÀ CLOUD VỚI HAIMAKER

Tổng thể tốt nhất: Qwen3 Coder

Qwen3 Coder là model đầu tiên tôi sẽ thử cho bất kỳ thiết lập coding agent local nào.

Lệnh pull model:

ollama pull qwen3-coder:30b

Chạy kiểm tra nhanh:

ollama run qwen3-coder:30b "Explain this repo structure and suggest where tests should live."

Vì sao model này xếp hạng nhất:

  • Được tinh chỉnh rõ ràng cho các tác vụ coding và agentic.
  • Trang Ollama liệt kê hỗ trợ ollama launch cho Claude Code, Codex, OpenCode và OpenClaw.
  • Bản 30B chạy local thực tế hơn nhiều so với bản 480B.
  • Khả năng ngữ cảnh dài giúp nó phù hợp cho công việc repository hơn các model code local đời cũ.

Hãy dùng model này để review code, tạo test, refactor ở mức vừa phải và cho các phiên agent ưu tiên local khi quyền riêng tư là yếu tố quan trọng.

Lựa chọn nhẹ tốt nhất: Gemma 4

Gemma 4 là dòng model nên thử khi Qwen3 Coder quá nặng. Các biến thể Gemma 4 nhỏ hơn được thiết kế để chạy local và trên thiết bị, trong khi biến thể 26B MoE mang lại lựa chọn workstation mạnh hơn mà không cần kích hoạt toàn bộ tham số cho từng token.

Lệnh pull bản nhẹ cho laptop:

ollama pull gemma4:e4b

Lệnh pull bản mạnh hơn cho workstation:

ollama pull gemma4:26b

Gemma 4 phù hợp với coding agent khi bạn cần trợ giúp local nhanh về giải thích, sửa nhỏ và code riêng tư. Nó kém hấp dẫn hơn với những phiên tự hành dài, khi agent cần giữ trọn một kế hoạch migration nhất quán từ đầu đến cuối.

Các model mới nhất: Kimi K2.7 Code và Laguna XS 2.1

Hai model tập trung vào coding đã xuất hiện trong thư viện Ollama trong mùa hè này và rất đáng theo dõi.

Kimi K2.7 Code là bản build tinh chỉnh cho coding của Moonshot trên nền dòng K2.6 — cùng dòng model có bản K3 đang vượt qua các model frontier đóng trên các bảng xếp hạng arena. Model này cần phần cứng thực sự mạnh (khoảng VRAM 48GB+ hoặc một máy Mac nhiều RAM), nhưng nếu bạn có đủ, thì đây là dòng model coding mở mạnh nhất mà bạn có thể chạy local hiện nay.

ollama pull kimi-k2.7-code

Laguna XS 2.1 là MoE coding agentic của Poolside — tổng 33B tham số nhưng chỉ 3B hoạt động mỗi token, nên chạy nhẹ hơn nhiều so với kích thước. Nó được xây dựng riêng cho vòng lặp gọi tool mà coding agent luôn phải hoạt động bên trong.

Nếu trước đây bạn chạy DeepSeek Coder V2 theo phiên bản cũ của hướng dẫn này, hãy ngừng dùng nó — model đó đã tụt hậu hai thế hệ so với các lựa chọn hiện tại và đã biến mất khỏi các bảng xếp hạng cộng đồng.

Nên sử dụng các model này ở đâu

  • haimaker.ai – dùng các model Ollama local cùng với các model cloud mạnh hơn, định tuyến tác vụ coding-agent đơn giản chạy local và chuyển tác vụ khó sang model trả phí.
  • OpenClaw – dùng Ollama làm provider local cho các phiên coding agent. Xem hướng dẫn chọn model local cho OpenClaw.
  • OpenCode – thêm Ollama qua đường dẫn provider tương thích OpenAI. Xem dùng Ollama với OpenCode.
  • Codex và Claude Code – trang model của Ollama có kèm các ví dụ ollama launch cho agent runtime, bao gồm Codex và Claude Code.

Thiết lập cho các agent tương thích OpenAI

Hầu hết coding agent đều có thể dùng Ollama thông qua endpoint local tương thích OpenAI:

http://localhost:11434/v1

Hãy dùng một API key bất kỳ nếu công cụ của bạn yêu cầu. Ollama không xác thực key khi chạy local.

{
  "baseURL": "http://localhost:11434/v1",
  "apiKey": "ollama",
  "model": "qwen3-coder:30b"
}

Với OpenCode, khối provider trông như sau:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Ollama (local)",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "qwen3-coder:30b": {
          "name": "Qwen3 Coder 30B"
        }
      }
    }
  }
}

Nếu việc gọi tool không đáng tin cậy, hãy giảm kích thước model trước, sau đó chỉ tăng ngữ cảnh đến mức phần cứng có thể xử lý được. Một cửa sổ ngữ cảnh khổng lồ bị swap bộ nhớ còn tệ hơn một cửa sổ nhỏ hơn nhưng vẫn phản hồi nhanh.

Khi nào không nên dùng Ollama

Model local phát huy tốt nhất khi quyền riêng tư, chi phí hoặc làm việc offline là yếu tố quan trọng. Chúng không tự động tốt hơn cho mọi tác vụ coding.

Hãy dùng model cloud khi:

  • Tác vụ trải rộng nhiều file
  • Bug khó phát hiện
  • Bạn cần gọi tool đáng tin cậy
  • Patch sẽ chạm tới hệ thống production
  • Bạn không có thời gian review từng dòng code được tạo ra

Cấu hình thực tế nên là ưu tiên local, chứ không phải chỉ chạy local. Hãy dùng Qwen3 Coder hoặc Gemma 4 cho các công việc riêng tư chi phí thấp, rồi chuyển lên model cloud mạnh hơn khi tác vụ trở nên tốn chất xám thay vì chỉ tốn token.

ĐỊNH TUYẾN MÔ HÌNH LOCAL VÀ CLOUD VỚI HAIMAKER


Để thiết lập local riêng cho OpenClaw, hãy xem mô hình local tốt nhất cho OpenClaw. Để thiết lập OpenCode, hãy xem sử dụng Ollama với OpenCode.