AI 모델 업계에는 “무료”라는 말이 참 많이 돌아다닙니다. OpenClaw 사용자에게 “무료”가 실제로 어떤 의미인지 구체적으로 정리해 보겠습니다.

크게 세 가지로 나눌 수 있습니다. 말 그대로 비용이 전혀 들지 않는 모델(로컬), 일정 한도까지 무료인 모델, 청구서에서 반올림하면 0이 될 정도로 저렴한 모델이 있습니다. 세 가지를 모두 살펴보겠습니다.

진짜 무료: 로컬 모델

토큰당 비용이 전혀 들지 않는 유일한 모델은 내 하드웨어에서 직접 돌리는 모델입니다. Ollama를 쓰면 이 과정이 간단합니다.

설치하고, 모델을 pull하고, OpenClaw를 연결하면 됩니다:

# Install Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Pull a coding model
ollama pull qwen3.6:27b

그런 다음 ~/.openclaw/openclaw.json에 Ollama를 프로바이더로 추가합니다:

{
  models: {
    providers: {
      ollama: {
        baseUrl: "http://localhost:11434/v1",
        api: "openai-completions",
        models: [
          { id: "qwen3.6:27b", name: "Qwen3.6 27B" }
        ]
      }
    }
  },
  agents: {
    defaults: {
      model: { primary: "ollama/qwen3.6:27b" }
    }
  }
}

어떤 로컬 모델이 쓸 만한가

Qwen3.6 27B는 현재 가장 균형 잡힌 선택지입니다. 커뮤니티에서는 여전히 로컬 코딩의 “정점”이라고 부릅니다. SWE-bench Verified에서 77.2%를 기록하고, 일상적인 코드 생성·디버깅·멀티파일 편집을 무난하게 처리하며, VRAM은 약 18GB면 충분합니다(RTX 5090 또는 32GB 이상 통합 메모리를 갖춘 M 시리즈 Mac).

Qwen3 Coder 30B는 에이전트용으로 튜닝된 대안입니다. 256K 컨텍스트와 안정적인 툴 콜링을 지원하는데, 이는 OpenClaw의 툴 루프에서 중요합니다.

gpt-oss 20BGemma 4는 16GB 머신에서 돌아갑니다. gpt-oss 20B는 출시 이후 소형 모델의 기본 선택지가 되었습니다. 토큰당 약 3.6B 파라미터만 활성화하고 추론 강도를 조절할 수 있습니다. 다만 복잡한 작업에서는 품질이 떨어지므로, 멀티파일 리팩토링은 둘 모두에게 맡기기 어렵습니다.

로컬 모델의 현실적인 한계

로컬 모델은 무료지만 빠르지는 않습니다. 하드웨어에 따라 응답 시간이 클라우드 API보다 3~10배 느립니다. 그리고 최고 성능의 소비자용 오픈 모델조차 가장 어려운 디버깅과 멀티파일 작업에서는 최상위 Claude 모델에는 못 미칩니다.

작업이 주로 파일 읽기, 보일러플레이트 생성, 간단한 편집 위주라면 로컬 모델로 충분합니다. 복잡한 디버깅이나 아키텍처 작업을 한다면 그 작업에는 클라우드 모델을 쓰는 편이 좋습니다.

클라우드 프로바이더의 무료 티어

일정 한도까지는 완전히 무료로 쓸 수 있는 프로바이더도 있습니다.

Gemini Flash는 클라우드 추론용 무료 옵션으로는 가장 좋습니다. Google 무료 티어는 분당 15회 요청과 최대 1M 토큰 컨텍스트를 제공합니다. 가벼운 코딩 작업에는 충분합니다.

// Add to ~/.openclaw/openclaw.json
{
  models: {
    providers: {
      google: {
        models: [
          { id: "gemini-3-flash", name: "Gemini 3 Flash" }
        ]
      }
    }
  }
}

주의할 점: 무료 티어는 요청 제한이 더 엄격하고, 데이터가 학습에 사용될 수 있습니다. 사이드 프로젝트나 학습 목적이라면 괜찮을 수 있습니다. 사내 코드에는 유료 API를 쓰거나 로컬로 돌리세요.

거의 무료: 1달러 미만 모델

토큰당 비용이 워낙 저렴해서 하루 종일 OpenClaw를 집중적으로 사용해도 1달러가 넘지 않는 모델들이 있습니다.

모델입력 비용출력 비용일일 비용 추정
DeepSeek V4 Flash~$0.10/M~$0.28/M~$0.15
GLM-4.7 Flash$0.07/M$0.28/M~$0.15
GPT-4o-mini$0.15/M$0.60/M~$0.50
MiniMax M3$0.30/M~$0.50

일일 추정치는 입력 약 500K + 출력 200K 토큰 기준이며, 코딩 작업이 빽빽하게 들어찬 하루 기준입니다.

MiniMax M3는 따로 짚고 넘어갈 만합니다. 1M 토큰 컨텍스트 윈도우에 입력 $0.30/M으로, 현재 저가 티어에서 가성비가 가장 좋습니다. 에이전트로 24시간 돌려도 월 약 $7~15 수준입니다. DeepSeek V4 Flash는 가격 하한선입니다. 24/7 에이전트 사용에도 월 $5 미만을 유지할 만큼 저렴합니다.

이 모델들은 코딩 세션에서 단순 반복 작업을 잘 처리합니다. 파일 읽기, 간단한 편집, 문서 작업, 테스트 실행 같은 일이죠. 어려운 문제 20%는 더 좋은 모델로 라우팅하면 하루 총비용을 $5 미만으로 유지할 수 있습니다.

이 모든 모델은 Haimaker에서 단일 API 키로 접근할 수 있고, 각 프로바이더에서 개별적으로 설정할 수도 있습니다.

Haimaker 키를 HAIMAKER_API_KEY에 넣으면, connect CLI(npx -y @haimaker/connect --openclaw)가 프로바이더 설정을 OpenClaw에 자동으로 넣어주므로, JSON을 건드리지 않고도 저가 모델을 라우팅할 수 있습니다.

실용적인 설정: 무료 + 저가 하이브리드

비용을 신경 쓰는 대부분의 개발자는 결국 이렇게 구성하게 됩니다.

  1. 간단한 작업용 로컬 모델 (Ollama를 통한 Qwen3.6 27B, 무료)
  2. 중간 난이도 작업용 저가 클라우드 모델 (DeepSeek V4 Flash 또는 MiniMax M3, 몇 원)
  3. 어려운 문제용 프리미엄 모델 (Claude Sonnet 또는 Opus, 종량제)
{
  agents: {
    defaults: {
      model: {
        primary: "ollama/qwen3.6:27b",
        thinking: "anthropic/claude-sonnet-4-6"
      }
    }
  }
}

로컬 모델이 요청의 6070%를 처리합니다(파일 읽기, 간단한 코드). 나머지는 Sonnet이 담당합니다. 일일 API 요금이 $3050에서 $2~5로 줄어듭니다.

모델 라우팅에 대한 자세한 내용은 멀티 에이전트 워크플로우 가이드를 참고하세요.

HAIMAKER에서 $10 무료 크레딧 받기


전체 모델 비교는 OpenClaw용 최고의 모델을 참고하세요. 비용 최적화 전략은 토큰 비용 96% 절감하기를 참고하세요.