---
title: 'Mô hình miễn phí cho OpenClaw: Đâu là lựa chọn thực sự không tốn phí (2026)'
description: >-
  Chạy OpenClaw mà không phát sinh chi phí API. Mô hình cục bộ qua Ollama hoàn
  toàn miễn phí. Gemini Flash và GPT-4o-mini chỉ tốn vài xu. Đây là cách thiết
  lập.
date: 2026-03-12T00:00:00.000Z
updatedDate: 2026-07-23T00:00:00.000Z
location: 'San Francisco, CA – 12 tháng 3, 2026'
image: /images/best-free-models-for-openclaw-hero.jpg
keywords: >-
  mô hình openclaw miễn phí, openclaw free tier, ai coding agent miễn phí,
  openclaw ollama miễn phí, mô hình llm giá rẻ
faq:
  - question: Tôi có thể dùng OpenClaw miễn phí không?
    answer: >-
      Có, với các mô hình cục bộ qua Ollama. Cài đặt Ollama, tải một mô hình như
      Qwen3.6 27B, rồi trỏ OpenClaw tới localhost:11434. Chi phí API bằng 0. Bạn
      cũng có thể dùng gói miễn phí của Gemini Flash (15 yêu cầu/phút) hoặc một
      mô hình dưới 1 USD như DeepSeek V4 Flash với chi phí chỉ vài xu cho mỗi
      triệu token.
  - question: Mô hình miễn phí nào tốt nhất cho tác vụ lập trình với OpenClaw?
    answer: >-
      Với mô hình cục bộ/miễn phí, Qwen3.6 27B xử lý tốt việc tạo code và gỡ lỗi
      trên phần cứng có VRAM từ 18GB trở lên — đạt 77.2% trên SWE-bench
      Verified, ngang ngửa các mô hình cloud trả phí. Với gói miễn phí trên
      cloud, Gemini Flash cho phép dùng miễn phí ở mức 15 RPM với context window
      hơn 1M token.
  - question: Làm sao để thiết lập mô hình cục bộ miễn phí với OpenClaw?
    answer: >-
      Cài đặt Ollama (ollama.com), chạy 'ollama pull qwen3.6:27b', sau đó thêm
      Ollama làm provider trong ~/.openclaw/openclaw.json với baseUrl
      'http://localhost:11434/v1'. Đặt mô hình này làm mô hình chính trong
      agents.defaults.model.
locale: vi-vn
translationKey: best-free-models-for-openclaw
---
Từ "miễn phí" bị lạm dụng khá nhiều trong lĩnh vực mô hình AI. Tôi sẽ nói rõ "miễn phí" thực chất có nghĩa là gì đối với người dùng OpenClaw.

Có ba nhóm: mô hình hoàn toàn không tốn chi phí (chạy cục bộ), mô hình có gói miễn phí nhưng dùng hết hạn mức, và mô hình rẻ đến mức làm tròn về 0 trên hầu hết hóa đơn. Tôi sẽ bàn về cả ba nhóm.

## Thực sự miễn phí: mô hình cục bộ

Các mô hình duy nhất không tốn phí theo token là những mô hình chạy trên phần cứng của bạn. Ollama khiến việc này trở nên đơn giản.

Cài đặt, tải một mô hình rồi trỏ OpenClaw tới nó:

```bash
# Install Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Pull a coding model
ollama pull qwen3.6:27b
```

Sau đó thêm Ollama làm provider trong `~/.openclaw/openclaw.json`:

```json5
{
  models: {
    providers: {
      ollama: {
        baseUrl: "http://localhost:11434/v1",
        api: "openai-completions",
        models: [
          { id: "qwen3.6:27b", name: "Qwen3.6 27B" }
        ]
      }
    }
  },
  agents: {
    defaults: {
      model: { primary: "ollama/qwen3.6:27b" }
    }
  }
}
```

#### Mô hình cục bộ nào hoạt động tốt

**Qwen3.6 27B** là lựa chọn tối ưu nhất hiện tại — cộng đồng vẫn gọi đây là "đỉnh cao" cho lập trình cục bộ. Mô hình đạt 77.2% trên SWE-bench Verified, xử lý tốt việc tạo code, gỡ lỗi và chỉnh sửa nhiều tệp cho công việc hằng ngày, và chỉ cần khoảng 18GB VRAM (RTX 5090, hoặc Mac dòng M với unified memory từ 32GB trở lên).

**Qwen3 Coder 30B** là phiên bản thay thế được tinh chỉnh cho agent — context 256K và khả năng gọi công cụ đáng tin cậy, yếu tố quan trọng với tool loop của OpenClaw.

**gpt-oss 20B** và **Gemma 4** chạy được trên máy 16GB. gpt-oss 20B đã trở thành lựa chọn mặc định trong nhóm mô hình nhỏ kể từ khi ra mắt — mỗi token nó chỉ kích hoạt khoảng 3.6B tham số và cho phép điều chỉnh mức độ suy luận. Chất lượng vẫn giảm với những tác vụ phức tạp; tôi không tin cậy hai mô hình này cho việc tái cấu trúc nhiều tệp.

#### Đánh đổi thực tế

Mô hình cục bộ miễn phí, nhưng cái giá phải trả là tốc độ. Thời gian phản hồi chậm gấp 3–10 lần so với API cloud, tùy phần cứng. Và ngay cả các mô hình mã nguồn mở chạy trên phần cứng phổ thông tốt nhất vẫn chưa bằng các mô hình Claude tiên tiến ở những tác vụ gỡ lỗi khó và công việc nhiều tệp.

Nếu công việc của bạn chủ yếu là đọc tệp, tạo boilerplate và chỉnh sửa đơn giản, mô hình cục bộ hoạt động tốt. Nếu bạn đang gỡ lỗi phức tạp hoặc làm công việc liên quan đến kiến trúc, bạn sẽ cần mô hình cloud cho những tác vụ đó.

## Gói miễn phí từ các nhà cung cấp cloud

Một số nhà cung cấp thực sự cho dùng miễn phí trong một hạn mức nhất định.

**Gemini Flash** là lựa chọn miễn phí tốt nhất cho inference trên cloud. Gói miễn phí của Google cho phép 15 yêu cầu mỗi phút với context tối đa 1M token. Mức đó đủ cho các phiên lập trình thông thường.

```json5
// Add to ~/.openclaw/openclaw.json
{
  models: {
    providers: {
      google: {
        models: [
          { id: "gemini-3-flash", name: "Gemini 3 Flash" }
        ]
      }
    }
  }
}
```

Lưu ý: gói miễn phí có giới hạn tốc độ chặt hơn và dữ liệu của bạn có thể được dùng để huấn luyện. Với dự án cá nhân và mục đích học tập thì có thể chấp nhận được. Với mã nguồn độc quyền, hãy dùng API trả phí hoặc chạy cục bộ.

## Gần như miễn phí: mô hình dưới 1 USD

Một số mô hình có chi phí token thấp đến mức một ngày dùng OpenClaw cường độ cao vẫn chỉ tốn dưới $1.

| Mô hình | Chi phí đầu vào | Chi phí đầu ra | Ước tính chi phí hằng ngày |
|-------|-----------|-------------|-------------------|
| DeepSeek V4 Flash | ~$0.10/M | ~$0.28/M | ~$0.15 |
| GLM-4.7 Flash | $0.07/M | $0.28/M | ~$0.15 |
| GPT-4o-mini | $0.15/M | $0.60/M | ~$0.50 |
| MiniMax M3 | $0.30/M | — | ~$0.50 |

*Ước tính hằng ngày dựa trên khoảng 500K token đầu vào + 200K token đầu ra, tương đương một ngày lập trình bận rộn.*

**MiniMax M3** đáng được nhắc đến riêng: với mức $0.30/M cho token đầu vào và context window 1M token, đây là lựa chọn đáng giá nhất hiện tại trong phân khúc giá rẻ — chạy liên tục cho agent tốn khoảng $7–15 mỗi tháng. **DeepSeek V4 Flash** là mức sàn tuyệt đối: rẻ đến mức dùng agent 24/7 vẫn dưới $5 mỗi tháng.

Bạn có thể dùng tất cả các mô hình này qua [Haimaker](https://app.haimaker.ai/sign-up?utm_source=openclaw_blog&utm_medium=cta&utm_campaign=best-free-models) chỉ với một API key, hoặc thiết lập riêng lẻ với từng nhà cung cấp.

Khi key Haimaker đã nằm trong `HAIMAKER_API_KEY`, [CLI connect](/connect) (`npx -y @haimaker/connect --openclaw`) sẽ tự đưa cấu hình provider vào OpenClaw, để bạn có thể route các mô hình dưới 1 USD mà không cần đụng tới JSON.

## Thiết lập thực tế: kết hợp miễn phí + giá rẻ

Hầu hết người quan tâm đến chi phí rồi cũng sẽ chọn phương án này:

1. **Mô hình cục bộ cho tác vụ đơn giản** (Qwen3.6 27B qua Ollama, miễn phí)
2. **Mô hình cloud giá rẻ cho tác vụ trung bình** (DeepSeek V4 Flash hoặc MiniMax M3, vài xu)
3. **Mô hình cao cấp cho bài toán khó** (Claude Sonnet hoặc Opus, trả theo mức sử dụng)

```json5
{
  agents: {
    defaults: {
      model: {
        primary: "ollama/qwen3.6:27b",
        thinking: "anthropic/claude-sonnet-4-6"
      }
    }
  }
}
```

Mô hình cục bộ xử lý 60–70% yêu cầu (đọc tệp, code đơn giản). Sonnet đảm nhận phần còn lại. Hóa đơn API mỗi ngày giảm còn $2–5 thay vì $30–50.

Để biết thêm về routing mô hình, hãy xem hướng dẫn của chúng tôi về [quy trình multi-agent](/blog/multi-agent-workflows-openclaw).

<a href="https://app.haimaker.ai/sign-up?utm_source=openclaw_blog&utm_medium=cta&utm_campaign=best-free-models" class="cta-button">NHẬN $10 CREDIT MIỄN PHÍ TRÊN HAIMAKER</a>

---

*Nếu muốn xem bảng so sánh đầy đủ các mô hình, hãy đọc [mô hình tốt nhất cho OpenClaw](/vi-vn/blog/mô-hình-tốt-nhất-cho-openclaw). Nếu muốn biết chiến lược tối ưu chi phí, hãy đọc [cắt giảm 96% chi phí token](/blog/cutting-ai-agent-token-costs-qmd).*
