Chạy mô hình cục bộ nghĩa là không cần API key, không tốn phí sử dụng, và không phải gửi mã nguồn độc quyền lên máy chủ của người khác. Đổi lại, phản hồi chậm hơn và chất lượng thấp hơn ở những bài toán khó. Có đáng đánh đổi hay không còn tùy vào mục đích sử dụng của bạn.

Nếu bạn tìm đến đây qua từ khóa “openclaw local model” hoặc “openclaw local llm,” hãy bắt đầu đơn giản: dùng Gemma 4 8B hoặc Qwen3.6 9B trên máy 16GB, Qwen3.6 27B trên GPU 24GB+ (một RTX 5090 hoặc M5 Pro), và giữ một phương án dự phòng cloud cho những tác vụ mà mô hình cục bộ xử lý không nổi. OpenClaw cục bộ hiện đã đủ tốt. Nhưng đừng kỳ vọng phép màu.

Hai yếu tố đã làm thay đổi cục diện trong năm 2026. Bản phát hành Qwen3.6 ngày 22 tháng 4 tung ra mô hình dense 27B chuyên coding, vượt cả mô hình MoE 397B trên SWE-bench. Và Apple M5 Max (công bố tháng 3 năm 2026) đưa 128GB bộ nhớ thống nhất cùng Neural Accelerator vào mỗi nhân GPU — các mô hình cấp 70B giờ chạy được trên laptop. Kết hợp với việc Ollama trở thành nhà cung cấp chính thức của OpenClaw, việc thiết lập giờ đơn giản hơn bao giờ hết.

Xếp hạng mô hình

Các mô hình cục bộ hiện tại được xếp hạng cho công việc coding trong OpenClaw, dựa trên điểm SWE-bench Verified, độ tin cậy khi gọi công cụ và hiệu năng agent thực tế:

Mô hìnhTham sốKích hoạtVRAM cần thiếtSWE-benchTốc độ (RTX 5090)Phù hợp nhất cho
Qwen3.6 27B27B27B (dense)18GB+77.2%~70 t/sCân bằng tốt nhất giữa chất lượng và kích thước cho coding
Qwen3 Coder Plus72B72B (dense)48GB+70.6%~30 t/sTác vụ coding khó nhất, vòng lặp agent đầy đủ
Qwen3.6 35B-A3B35B3B (MoE)16GB+~180 t/sCông việc cần tốc độ cao, thông lượng lớn
Qwen3.6 9B9B9B (dense)8GB+~186 t/sPhần cứng phổ thông, tác vụ đơn giản
Llama 3.3 70B70B70B (dense)GPU kép~27 t/s (2x 5090)Coding tổng quát, bám chỉ dẫn tốt
gpt-oss 20B21B3.6B (MoE)16GB~160 t/sLựa chọn tốt nhất cho 16GB, điều chỉnh được mức độ suy luận
Laguna XS 2.133B3B (MoE)24GB+nhanh (MoE)Coding agentic, vòng lặp gọi công cụ
Gemma 4 8B8B8B (dense)8GB+~150 t/sƯu tiên quyền riêng tư, thiết lập nhẹ
Qwen3 32B32B32B (dense)24GB+~60 t/sĐa năng ổn định, được kiểm thử rộng rãi

Qwen3.6 27B là điểm nhấn mới đáng chú ý nhất. 77.2% trên SWE-bench Verified, 59.3% trên Terminal-Bench 2.0 (ngang bằng Claude Opus 4.5), và chạy được trên 18GB VRAM. Một mô hình dense 27B vượt MoE 397B về coding — đây là kết quả từ những thay đổi kiến trúc trong bản 3.6: Gated Delta Networks kết hợp với post-training có chủ đích trên các PR thực tế.

35B-A3B MoE là biến số bất ngờ. Chỉ 3B tham số được kích hoạt mỗi lượt forward pass, nên nó chạy ở ~180 t/s trên một RTX 5090 đơn. Chất lượng thấp hơn 27B dense ở các bài toán khó, nhưng với việc đọc file, tạo boilerplate và chỉnh sửa đơn giản, cảm giác như đang dùng API cloud.

Ba mô hình mới đáng chú ý. gpt-oss 20B đã trở thành lựa chọn được cộng đồng ưa chuộng cho máy 16GB — một MoE nhỏ với mức độ suy luận có thể điều chỉnh. Laguna XS 2.1 (Poolside) là MoE 33B/3B-active được xây dựng riêng cho vòng lặp coding agentic. Và Kimi K2.7 Code mang dòng K2 tiệm cận nhóm mô hình đầu bảng của Moonshot lên Ollama cho những ai có thiết lập 48GB+ — bản open-weight đầy đủ Kimi K3 sẽ ra mắt cuối tháng 7 cho những người chạy phần cứng cấp server.

Yêu cầu phần cứng

Chất lượng mô hình cục bộ tăng theo quy mô mô hình, và quy mô mô hình tăng theo yêu cầu phần cứng. Các phân cấp dưới đây giả định phần cứng năm 2026 — RTX 50-series phía NVIDIA, M5 phía Apple.

8–16GB VRAM (phổ thông)

RTX 5060 / 5070 hoặc 16GB bộ nhớ thống nhất (M5 bản tiêu chuẩn, M5 Pro bản khởi điểm). Đủ cho Qwen3.6 9B và 35B-A3B MoE. Bản 9B xử lý tác vụ đơn giản và tóm tắt code ở ~186 t/s trên 5090; kỳ vọng ~120 t/s trên 5070. Bản 35B-A3B dùng ít bộ nhớ hơn nhiều so với số tham số của nó, vì chỉ 3B tham số kích hoạt mỗi lượt.

Mô hình: Qwen3.6 9B, Qwen3.6 35B-A3B, Gemma 4 8B

18–32GB VRAM (khuyến nghị)

Một RTX 5090 (32GB GDDR7, 1.792 GB/s) hoặc 36–64GB bộ nhớ thống nhất (M5 Pro / M5 Max bản khởi điểm). Đây là ngưỡng mà mô hình cục bộ bắt đầu dùng được cho công việc thực tế. Qwen3.6 27B chạy thoải mái trên 18GB và điểm SWE-bench (77.2%) sánh ngang các mô hình cloud mà bạn phải trả phí theo token.

Mức tăng băng thông của RTX 5090 so với 4090 (1.792 GB/s so với 1.008 GB/s — tăng 78%) mới là con số quan trọng cho inference, không phải FLOPS thô. Việc sinh token bị giới hạn bởi băng thông bộ nhớ, và một 5090 đơn sinh khoảng 186 t/s trên Qwen 8B và 124 t/s trên các mô hình cấp 14B.

Mô hình: Qwen3.6 27B, Qwen3 32B, Qwen3.6 Plus (khi vừa với bộ nhớ)

48GB+ bộ nhớ hiệu dụng (cao cấp)

RTX 5090 kép (tổng 64GB) hoặc 96–128GB bộ nhớ thống nhất M5 Max. Qwen3 Coder Plus và Llama 3.3 70B nằm ở phân khúc này.

Hai hướng:

  • Dàn máy tính bàn 2× 5090: 27 t/s trên Llama 70B Q4_K_M với tensor parallelism của vLLM — tiệm cận H100 mà chi phí chỉ bằng một phần nhỏ. Phù hợp nhất cho máy bàn lắp được hai card.
  • MacBook Pro M5 Max 128GB: Mô hình 70B Q4_K_M (~40GB trên đĩa) nạp toàn bộ vào bộ nhớ thống nhất và vẫn còn dư chỗ cho context. Neural Accelerator của Apple tích hợp trong mỗi nhân GPU đẩy tốc độ xử lý prompt nhanh hơn 3,3–4 lần so với M4 Max, và tốc độ sinh ổn định đạt khoảng 18–25 t/s. Điểm được là tính di động: đây là thiết lập duy nhất nhét vừa ba lô.

Mô hình: Qwen3 Coder Plus, Llama 3.3 70B, Qwen3.6 Plus full precision

M5 Max với 128GB bộ nhớ thống nhất là điểm tối ưu mới cho công việc cục bộ nghiêm túc trên laptop. Framework MLX của Apple giờ đã hỗ trợ Neural Accelerator, nghĩa là GPU và Neural Engine cùng hoạt động song song trên mỗi lượt forward pass thay vì chỉ một trong hai.

Không có phần cứng phù hợp với các phân cấp trên? haimaker cung cấp cho OpenClaw một endpoint duy nhất để định tuyến cloud, giúp bạn chạy mô hình cục bộ ở nơi chúng hoạt động tốt và tự động chuyển sang mô hình cloud cho những tác vụ chúng không xử lý được.

DÙNG THỬ HAIMAKER CHO ĐỊNH TUYẾN CLOUD

Cài đặt Ollama

Ollama là cách đơn giản nhất để chạy mô hình cục bộ. Cài đặt, tải model về, và bạn có ngay một API tương thích OpenAI chạy trên localhost.

# Install
curl -fsSL https://ollama.com/install.sh | sh

# Pull a model (pick one based on your hardware)
ollama pull qwen3.6:27b          # Best quality, needs 18GB+ VRAM
ollama pull qwen3.6:35b-a3b      # Fast MoE model, runs on 16GB
ollama pull qwen3.6:9b           # Lightweight, runs on 8GB
ollama pull qwen3-coder-plus     # Premium, needs 48GB+ or 96GB unified

Ollama cung cấp API tại http://localhost:11434 theo mặc định.

Mẹo từ r/LocalLLaMA: Nhiều người dùng cho biết hiệu năng tốt hơn khi chuyển từ Ollama sang llama.cpp trực tiếp cho các mô hình 27B trở lên. Ollama tiện lợi hơn, nhưng llama.cpp cho bạn nhiều quyền kiểm soát hơn về lượng tử hóa và phân bổ bộ nhớ. Hãy bắt đầu với Ollama — chuyển sang llama.cpp nếu bạn chạm trần hiệu năng.

Cấu hình OpenClaw

Vì Ollama giờ đã là nhà cung cấp chính thức, việc thiết lập rất đơn giản. Chạy trình hướng dẫn onboarding:

openclaw onboard --auth-choice ollama

Hoặc thêm Ollama thủ công trong ~/.openclaw/openclaw.json:

{
  models: {
    providers: {
      ollama: {
        baseUrl: "http://localhost:11434/v1",
        api: "openai-completions",
        models: [
          {
            id: "qwen3.6:27b",
            name: "Qwen3.6 27B",
            reasoning: false,
            contextWindow: 131072,
            maxTokens: 8192
          }
        ]
      }
    }
  },
  agents: {
    defaults: {
      model: { primary: "ollama/qwen3.6:27b" },
      models: {
        "ollama/qwen3.6:27b": { alias: "qwen-local" }
      }
    }
  }
}

Chuyển sang mô hình cục bộ của bạn:

/model qwen-local

Những gì mô hình cục bộ xử lý tốt

Sau vài tuần chạy Qwen3.6 27B cục bộ, một số việc sau hoạt động ổn định:

  • Đọc và tóm tắt code. Hỏi nó một hàm làm gì và nó sẽ cho câu trả lời khá tốt. Không tinh tế bằng Sonnet 4.6, nhưng đủ tốt để làm quen với codebase lạ.
  • Sinh code cho các pattern phổ biến. Boilerplate, thao tác CRUD, file cấu hình, scaffolding test. Nó viết code chạy được ngay lần đầu trong hầu hết trường hợp. Bản 3.6 được post-training trên các PR đã merge thực tế, và điều đó thể hiện rõ ở chất lượng diff.
  • Thao tác file và refactoring đơn giản. Liệt kê file, tìm kiếm pattern, đổi tên biến trong một file. Các tác vụ mang tính cơ học, không cần suy luận sâu.
  • Gọi công cụ agentic. Qwen3.6 nâng chuẩn về độ tin cậy khi gọi hàm — Terminal-Bench 2.0 đạt 59.3%, ngang bằng Claude Opus 4.5. Với vòng lặp công cụ của OpenClaw, điều này đồng nghĩa với ít lỗi “mô hình gọi sai hàm với sai tham số” hơn.

Những điểm mô hình cục bộ còn hạn chế

  • Refactoring đa file. Mọi thao tác cần giữ ngữ cảnh xuyên suốt 5+ file đều trở nên kém tin cậy. Mô hình hoặc mất dấu, hoặc tạo ra các thay đổi không nhất quán. Mô hình cloud với cửa sổ ngữ cảnh 200K+ vẫn có lợi thế ở đây, dù khoảng cách đã thu hẹp với Qwen3.6.
  • Debug phức tạp. Nếu bug đòi hỏi suy luận qua nhiều tầng trừu tượng, mô hình cục bộ thường đề xuất sửa ở bề mặt trong khi vấn đề nằm sâu hơn. Claude Opus 4.8 vẫn vượt Qwen3.6 27B khoảng 11 điểm trên SWE-bench Verified, và Claude Fable 5 vượt khoảng 18 điểm.
  • Tốc độ trên mô hình dense với phần cứng cũ. Mô hình 27B chạy khoảng 70 t/s trên một RTX 5090 và ~22 t/s trên M5 Max. Nếu bạn vẫn dùng 3090 hoặc 4090, kỳ vọng khoảng 30–40 t/s. (Bản 35B-A3B MoE ở 180+ t/s là ngoại lệ.)
  • Ngữ cảnh rất dài. Qwen3.6 hỗ trợ tối đa 256K token về lý thuyết, nhưng chất lượng suy luận giảm trên phần cứng tiêu dùng khi vượt 32K. Đặt contextWindow ở mức thực tế trong cấu hình của bạn.

Phương pháp hybrid

Hầu hết những người thử mô hình cục bộ cuối cùng đều chuyển sang thiết lập hybrid: cục bộ cho phần dễ, cloud cho phần khó.

{
  agents: {
    defaults: {
      model: {
        primary: "ollama/qwen3.6:27b",
        thinking: "anthropic/claude-sonnet-4-6-20260514"
      }
    }
  }
}

Mô hình cục bộ xử lý việc đọc file, chỉnh sửa đơn giản và boilerplate — khoảng 60–70% một phiên coding điển hình. Sonnet xử lý debug, quyết định kiến trúc và công việc đa file. Hóa đơn API giảm xuống còn vài đô mỗi ngày thay vì $20–50.

Chuyển thủ công khi bạn biết một tác vụ cần nhiều năng lực hơn:

/model sonnet

Hoặc dùng auto-router của Haimaker để tự động xử lý định tuyến. Auto-router phát hiện độ phức tạp của tác vụ và tự động gửi bài toán khó đến mô hình cloud, nên bạn không cần phải tự hỏi khi nào nên chuyển.

Khắc phục sự cố

Mô hình nạp chậm hoặc crash. Có thể bạn đã hết bộ nhớ. Thử mức lượng tử hóa nhỏ hơn: ollama pull qwen3.6:27b-q4_K_M dùng ít bộ nhớ hơn, chỉ chấp nhận giảm nhẹ chất lượng. Q4_K_M là điểm tối ưu cho hầu hết mọi người — mất chất lượng tối thiểu, tiết kiệm bộ nhớ đáng kể.

Gọi công cụ thất bại. Đặt "reasoning": false trong cấu hình mô hình và hãy dùng các mô hình Qwen3.6 — chúng xử lý định dạng gọi công cụ của OpenClaw tin cậy hơn Mistral hoặc các mô hình Llama cũ. Nếu gọi công cụ vẫn lỗi, cập nhật Ollama lên phiên bản mới nhất. Tích hợp nhà cung cấp chính thức đã sửa một số trường hợp biên.

Lỗi cửa sổ ngữ cảnh. Đặt contextWindow chính xác trong cấu hình. Với các mô hình Qwen3.6, 131072 (128K) là mặc định an toàn trên phần cứng 24GB+ VRAM (một RTX 5090 chạy thoải mái). Trên 16GB, giữ ở 32768 để tránh giảm chất lượng.

Tốc độ sinh chậm. Nếu bạn đạt dưới 40 t/s trên mô hình 27B với 5090 hoặc dưới 18 t/s trên M5 Max, hãy kiểm tra xem có tiến trình nào khác đang dùng GPU không. Đóng các tab trình duyệt đang chạy WebGL hoặc video. Trên Mac, Activity Monitor → GPU History sẽ hiển thị những gì đang tranh giành bộ nhớ thống nhất. Người dùng M5 cũng nên xác nhận Ollama đang dùng backend MLX (v0.21+) — chênh lệch tốc độ giữa luồng chỉ dùng Metal và MLX là khoảng 2 lần ở khâu xử lý prompt.

DÙNG THỬ HAIMAKER CHO ĐỊNH TUYẾN CLOUD


Để so sánh giá mô hình, xem mô hình rẻ nhất cho OpenClaw. Để giảm chi phí token trên mô hình cloud, xem cắt giảm 96% chi phí với QMD.