AI 모델 업계에는 “무료”라는 말이 참 많이 돌아다닙니다. OpenClaw 사용자에게 “무료”가 실제로 어떤 의미인지 구체적으로 정리해 보겠습니다.
크게 세 가지로 나눌 수 있습니다. 말 그대로 비용이 전혀 들지 않는 모델(로컬), 일정 한도까지 무료인 모델, 청구서에서 반올림하면 0이 될 정도로 저렴한 모델이 있습니다. 세 가지를 모두 살펴보겠습니다.
진짜 무료: 로컬 모델
토큰당 비용이 전혀 들지 않는 유일한 모델은 내 하드웨어에서 직접 돌리는 모델입니다. Ollama를 쓰면 이 과정이 간단합니다.
설치하고, 모델을 pull하고, OpenClaw를 연결하면 됩니다:
# Install Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Pull a coding model
ollama pull qwen3.6:27b
그런 다음 ~/.openclaw/openclaw.json에 Ollama를 프로바이더로 추가합니다:
{
models: {
providers: {
ollama: {
baseUrl: "http://localhost:11434/v1",
api: "openai-completions",
models: [
{ id: "qwen3.6:27b", name: "Qwen3.6 27B" }
]
}
}
},
agents: {
defaults: {
model: { primary: "ollama/qwen3.6:27b" }
}
}
}
어떤 로컬 모델이 쓸 만한가
Qwen3.6 27B는 현재 가장 균형 잡힌 선택지입니다. 커뮤니티에서는 여전히 로컬 코딩의 “정점”이라고 부릅니다. SWE-bench Verified에서 77.2%를 기록하고, 일상적인 코드 생성·디버깅·멀티파일 편집을 무난하게 처리하며, VRAM은 약 18GB면 충분합니다(RTX 5090 또는 32GB 이상 통합 메모리를 갖춘 M 시리즈 Mac).
Qwen3 Coder 30B는 에이전트용으로 튜닝된 대안입니다. 256K 컨텍스트와 안정적인 툴 콜링을 지원하는데, 이는 OpenClaw의 툴 루프에서 중요합니다.
gpt-oss 20B와 Gemma 4는 16GB 머신에서 돌아갑니다. gpt-oss 20B는 출시 이후 소형 모델의 기본 선택지가 되었습니다. 토큰당 약 3.6B 파라미터만 활성화하고 추론 강도를 조절할 수 있습니다. 다만 복잡한 작업에서는 품질이 떨어지므로, 멀티파일 리팩토링은 둘 모두에게 맡기기 어렵습니다.
로컬 모델의 현실적인 한계
로컬 모델은 무료지만 빠르지는 않습니다. 하드웨어에 따라 응답 시간이 클라우드 API보다 3~10배 느립니다. 그리고 최고 성능의 소비자용 오픈 모델조차 가장 어려운 디버깅과 멀티파일 작업에서는 최상위 Claude 모델에는 못 미칩니다.
작업이 주로 파일 읽기, 보일러플레이트 생성, 간단한 편집 위주라면 로컬 모델로 충분합니다. 복잡한 디버깅이나 아키텍처 작업을 한다면 그 작업에는 클라우드 모델을 쓰는 편이 좋습니다.
클라우드 프로바이더의 무료 티어
일정 한도까지는 완전히 무료로 쓸 수 있는 프로바이더도 있습니다.
Gemini Flash는 클라우드 추론용 무료 옵션으로는 가장 좋습니다. Google 무료 티어는 분당 15회 요청과 최대 1M 토큰 컨텍스트를 제공합니다. 가벼운 코딩 작업에는 충분합니다.
// Add to ~/.openclaw/openclaw.json
{
models: {
providers: {
google: {
models: [
{ id: "gemini-3-flash", name: "Gemini 3 Flash" }
]
}
}
}
}
주의할 점: 무료 티어는 요청 제한이 더 엄격하고, 데이터가 학습에 사용될 수 있습니다. 사이드 프로젝트나 학습 목적이라면 괜찮을 수 있습니다. 사내 코드에는 유료 API를 쓰거나 로컬로 돌리세요.
거의 무료: 1달러 미만 모델
토큰당 비용이 워낙 저렴해서 하루 종일 OpenClaw를 집중적으로 사용해도 1달러가 넘지 않는 모델들이 있습니다.
| 모델 | 입력 비용 | 출력 비용 | 일일 비용 추정 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.10/M | ~$0.28/M | ~$0.15 |
| GLM-4.7 Flash | $0.07/M | $0.28/M | ~$0.15 |
| GPT-4o-mini | $0.15/M | $0.60/M | ~$0.50 |
| MiniMax M3 | $0.30/M | — | ~$0.50 |
일일 추정치는 입력 약 500K + 출력 200K 토큰 기준이며, 코딩 작업이 빽빽하게 들어찬 하루 기준입니다.
MiniMax M3는 따로 짚고 넘어갈 만합니다. 1M 토큰 컨텍스트 윈도우에 입력 $0.30/M으로, 현재 저가 티어에서 가성비가 가장 좋습니다. 에이전트로 24시간 돌려도 월 약 $7~15 수준입니다. DeepSeek V4 Flash는 가격 하한선입니다. 24/7 에이전트 사용에도 월 $5 미만을 유지할 만큼 저렴합니다.
이 모델들은 코딩 세션에서 단순 반복 작업을 잘 처리합니다. 파일 읽기, 간단한 편집, 문서 작업, 테스트 실행 같은 일이죠. 어려운 문제 20%는 더 좋은 모델로 라우팅하면 하루 총비용을 $5 미만으로 유지할 수 있습니다.
이 모든 모델은 Haimaker에서 단일 API 키로 접근할 수 있고, 각 프로바이더에서 개별적으로 설정할 수도 있습니다.
Haimaker 키를 HAIMAKER_API_KEY에 넣으면, connect CLI(npx -y @haimaker/connect --openclaw)가 프로바이더 설정을 OpenClaw에 자동으로 넣어주므로, JSON을 건드리지 않고도 저가 모델을 라우팅할 수 있습니다.
실용적인 설정: 무료 + 저가 하이브리드
비용을 신경 쓰는 대부분의 개발자는 결국 이렇게 구성하게 됩니다.
- 간단한 작업용 로컬 모델 (Ollama를 통한 Qwen3.6 27B, 무료)
- 중간 난이도 작업용 저가 클라우드 모델 (DeepSeek V4 Flash 또는 MiniMax M3, 몇 원)
- 어려운 문제용 프리미엄 모델 (Claude Sonnet 또는 Opus, 종량제)
{
agents: {
defaults: {
model: {
primary: "ollama/qwen3.6:27b",
thinking: "anthropic/claude-sonnet-4-6"
}
}
}
}
로컬 모델이 요청의 6070%를 처리합니다(파일 읽기, 간단한 코드). 나머지는 Sonnet이 담당합니다. 일일 API 요금이 $3050에서 $2~5로 줄어듭니다.
모델 라우팅에 대한 자세한 내용은 멀티 에이전트 워크플로우 가이드를 참고하세요.
전체 모델 비교는 OpenClaw용 최고의 모델을 참고하세요. 비용 최적화 전략은 토큰 비용 96% 절감하기를 참고하세요.