로컬에서 모델을 실행하면 API 키가 필요 없고, 사용량 요금도 없고, 자체 코드를 외부 서버로 보낼 일도 없습니다. 대신 응답 속도가 느려지고 어려운 문제에서는 품질이 떨어질 수 있습니다. 이 트레이드오프가 의미가 있는지는 어떤 작업을 하느냐에 따라 다릅니다.
“openclaw local model”이나 “openclaw local llm”으로 검색해 들어왔다면, 간단하게 시작하세요. 16GB 머신에서는 Gemma 4 8B나 Qwen3.6 9B를, 24GB 이상 GPU(단일 RTX 5090 또는 M5 Pro)에서는 Qwen3.6 27B를 사용하고, 로컬 모델이 막히는 작업을 위한 클라우드 폴백도 하나 남겨 두세요. 이제 로컬 OpenClaw는 충분히 쓸 만합니다. 다만 만능은 아닙니다.
2026년에는 두 가지 변화가 큰 변수였습니다. 4월 22일 Qwen3.6 출시에서 27B dense 코딩 모델이 SWE-bench에서 397B MoE를 이겼습니다. 그리고 Apple M5 Max(2026년 3월 발표)는 128GB 통합 메모리를 지원하고 모든 GPU 코어에 Neural Accelerator를 내장했습니다. 이제 70B급 모델이 노트북에서도 돌아갑니다. Ollama가 공식 OpenClaw 프로바이더가 되면서 설정도 그 어느 때보다 간단해졌습니다.
모델 순위
SWE-bench Verified 점수, 툴 콜링 신뢰성, 실제 에이전트 성능을 기준으로 OpenClaw 코딩 작업용 로컬 모델을 정리했습니다.
| 모델 | 파라미터 | 활성화 | 필요 VRAM | SWE-bench | 속도 (RTX 5090) | 최적 용도 |
|---|---|---|---|---|---|---|
| Qwen3.6 27B | 27B | 27B (dense) | 18GB+ | 77.2% | ~70 t/s | 코딩에서 크기 대비 품질 최고 |
| Qwen3 Coder Plus | 72B | 72B (dense) | 48GB+ | 70.6% | ~30 t/s | 가장 어려운 코딩 작업, 전체 에이전트 루프 |
| Qwen3.6 35B-A3B | 35B | 3B (MoE) | 16GB+ | — | ~180 t/s | 속도 중요 작업, 높은 처리량 |
| Qwen3.6 9B | 9B | 9B (dense) | 8GB+ | — | ~186 t/s | 보급형 하드웨어, 간단한 작업 |
| Llama 3.3 70B | 70B | 70B (dense) | 듀얼 GPU | — | ~27 t/s (5090 2장) | 일반 코딩, 명령 수행 능력 우수 |
| gpt-oss 20B | 21B | 3.6B (MoE) | 16GB | — | ~160 t/s | 16GB 최적, 추론 강도 조절 가능 |
| Laguna XS 2.1 | 33B | 3B (MoE) | 24GB+ | — | 빠름 (MoE) | 에이전틱 코딩, 툴 콜링 루프 |
| Gemma 4 8B | 8B | 8B (dense) | 8GB+ | — | ~150 t/s | 개인정보 보호 우선, 가벼운 구성 |
| Qwen3 32B | 32B | 32B (dense) | 24GB+ | — | ~60 t/s | 안정적인 올라운더, 검증 사례 많음 |
Qwen3.6 27B가 새로운 1위입니다. SWE-bench Verified 77.2%, Terminal-Bench 2.0에서 59.3%(Claude Opus 4.5와 정확히 동일)를 기록했고, VRAM 18GB에서 실행됩니다. 27B dense 모델이 코딩에서 397B MoE를 이긴 것은 3.6 버전의 구조적 변화 덕분입니다. Gated Delta Networks와 실제 PR을 활용한 타깃형 사후 학습이 적용됐습니다.
35B-A3B MoE는 와일드카드입니다. 포워드 패스당 3B 파라미터만 활성화되므로 단일 RTX 5090에서 ~180 t/s로 실행됩니다. 어려운 문제에서는 27B dense보다 품질이 낮지만, 파일 읽기, 보일러플레이트 생성, 간단한 편집에서는 클라우드 API처럼 느껴집니다.
알아둘 만한 새로운 모델이 세 가지 더 있습니다. gpt-oss 20B는 16GB 머신을 위한 사실상 표준으로 자리 잡았습니다. 추론 강도를 조절할 수 있는 소형 MoE입니다. Laguna XS 2.1(Poolside)은 에이전틱 코딩 루프에 특화된 33B/3B 활성 MoE입니다. 그리고 Kimi K2.7 Code는 Moonshot의 프런티어에 가까운 K2 계열을 Ollama로 가져왔습니다. 48GB 이상 환경용이며, 완전한 오픈 웨이트 Kimi K3는 7월 말에 서버급 하드웨어 사용자를 위해 출시됩니다.
하드웨어 요구사항
로컬 모델의 품질은 모델 크기에 비례하고, 모델이 커질수록 하드웨어 요구 사항도 높아집니다. 아래 등급은 2026년 하드웨어를 기준으로 합니다. NVIDIA는 RTX 50 시리즈, Apple은 M5입니다.
VRAM 8~16GB(보급형)
RTX 5060 / 5070 또는 통합 메모리 16GB(M5 기본형, M5 Pro 엔트리). Qwen3.6 9B와 35B-A3B MoE를 돌리기에 충분합니다. 9B는 5090에서 ~186 t/s로 간단한 작업과 코드 요약을 처리하며, 5070에서는 ~120 t/s를 기대할 수 있습니다. 35B-A3B는 패스당 3B 파라미터만 활성화되기 때문에 파라미터 수에 비해 메모리를 훨씬 적게 사용합니다.
모델: Qwen3.6 9B, Qwen3.6 35B-A3B, Gemma 4 8B
VRAM 18~32GB(권장)
단일 RTX 5090(32GB GDDR7, 1,792 GB/s) 또는 통합 메모리 36~64GB(M5 Pro / M5 Max 기본형). 로컬 모델이 실제 작업에 쓸 만해지는 구간입니다. Qwen3.6 27B는 18GB에서 여유 있게 실행되고, SWE-bench 점수(77.2%)는 토큰당 비용을 내야 하는 클라우드 모델과 맞먹습니다.
원시 FLOPS가 아니라 RTX 5090의 대역폭 향상(1,792 GB/s vs 1,008 GB/s, 78% 증가)이 추론 성능에서 중요한 수치입니다. 토큰 생성은 메모리 대역폭에 좌우되며, 단일 5090은 Qwen 8B에서 약 186 t/s, 14B급 모델에서 124 t/s를 생성합니다.
모델: Qwen3.6 27B, Qwen3 32B, Qwen3.6 Plus(구동 가능 시)
가용 메모리 48GB 이상(프리미엄)
RTX 5090 듀얼(합산 64GB) 또는 통합 메모리 96~128GB M5 Max. Qwen3 Coder Plus와 Llama 3.3 70B가 이 구간에 해당합니다.
두 가지 경로가 있습니다.
- RTX 5090 듀얼 구성: vLLM 텐서 병렬 처리로 Llama 70B Q4_K_M에서 27 t/s. H100에 근접한 성능을 훨씬 낮은 비용으로 얻을 수 있습니다. 카드 두 장을 장착할 수 있는 데스크톱에 가장 적합합니다.
- M5 Max 128GB MacBook Pro: 70B Q4_K_M 모델(디스크에서 약 40GB)이 통합 메모리에 전부 로드되고 컨텍스트에 쓸 공간도 남습니다. 모든 GPU 코어에 내장된 Apple의 Neural Accelerator는 프롬프트 처리를 M4 Max보다 3.3
4배 빠르게 만들어 주고, 안정적인 생성 속도는 약 1825 t/s입니다. 대신 휴대성이라는 장점이 있습니다. 백팩에 들어가는 유일한 구성이기 때문입니다.
모델: Qwen3 Coder Plus, Llama 3.3 70B, Qwen3.6 Plus 전체 정밀도
128GB 통합 메모리를 갖춘 M5 Max는 노트북에서 본격적인 로컬 작업을 위한 새로운 최적 지점입니다. Apple의 MLX 프레임워크는 이제 Neural Accelerator 지원을 기본 제공하며, GPU와 Neural Engine이 매 포워드 패스에서 병렬로 동작합니다.
이 기준에 맞는 하드웨어가 없으신가요? haimaker는 OpenClaw에 클라우드 라우팅용 단일 엔드포인트를 제공합니다. 로컬 모델이 잘하는 작업은 로컬로 처리하고, 로컬 모델이 감당하기 어려운 작업은 클라우드 모델로 폴백할 수 있습니다.
클라우드 라우팅에 HAIMAKER 사용해 보기Ollama 설정
Ollama는 로컬 모델을 실행하는 가장 간단한 방법입니다. 설치하고 모델을 pull하면 localhost에서 OpenAI 호환 API가 실행됩니다.
# Install
curl -fsSL https://ollama.com/install.sh | sh
# Pull a model (pick one based on your hardware)
ollama pull qwen3.6:27b # Best quality, needs 18GB+ VRAM
ollama pull qwen3.6:35b-a3b # Fast MoE model, runs on 16GB
ollama pull qwen3.6:9b # Lightweight, runs on 8GB
ollama pull qwen3-coder-plus # Premium, needs 48GB+ or 96GB unified
Ollama는 기본적으로 http://localhost:11434에서 API를 제공합니다.
r/LocalLLaMA 팁: 27B 이상 모델에서는 Ollama 대신 llama.cpp를 직접 사용했을 때 성능이 더 좋다는 사용자 보고가 여러 건 있습니다. Ollama는 편리하지만 llama.cpp는 양자화와 메모리 할당을 더 세밀하게 제어할 수 있습니다. 처음에는 Ollama로 시작하고, 성능 한계에 부딪히면 llama.cpp로 전환하세요.
OpenClaw 설정
Ollama가 이제 공식 프로바이더이므로 설정은 간단합니다. 온보딩 마법사를 실행하세요.
openclaw onboard --auth-choice ollama
또는 ~/.openclaw/openclaw.json에 Ollama를 수동으로 추가하세요.
{
models: {
providers: {
ollama: {
baseUrl: "http://localhost:11434/v1",
api: "openai-completions",
models: [
{
id: "qwen3.6:27b",
name: "Qwen3.6 27B",
reasoning: false,
contextWindow: 131072,
maxTokens: 8192
}
]
}
}
},
agents: {
defaults: {
model: { primary: "ollama/qwen3.6:27b" },
models: {
"ollama/qwen3.6:27b": { alias: "qwen-local" }
}
}
}
}
로컬 모델로 전환하세요.
/model qwen-local
로컬 모델이 잘 처리하는 작업
Qwen3.6 27B를 몇 주간 로컬에서 돌려본 결과, 다음 작업에서는 안정적이었습니다.
- 코드 읽기와 요약. 함수가 무슨 일을 하는지 물어보면 꽤 정확한 답을 줍니다. Sonnet 4.6만큼 섬세하지는 않지만, 처음 보는 코드베이스를 파악하기에는 충분합니다.
- 흔한 패턴의 코드 생성. 보일러플레이트, CRUD 작업, 설정 파일, 테스트 스캐폴딩. 대부분 첫 시도에 동작하는 코드를 써 냅니다. 3.6 버전은 실제 병합된 PR로 사후 학습되었고, diff 품질에서 그 차이가 드러납니다.
- 파일 작업과 간단한 리팩터링. 파일 목록 조회, 패턴 검색, 파일 전체에서 변수 이름 변경. 깊은 추론이 필요 없는 기계적 작업입니다.
- 에이전틱 툴 콜링. Qwen3.6은 함수 호출 신뢰성을 한 단계 끌어올렸습니다. Terminal-Bench 2.0 59.3%는 Claude Opus 4.5와 정확히 동일합니다. OpenClaw 툴 루프에서는 ‘모델이 잘못된 함수를 잘못된 인수로 호출하는’ 오류가 줄어든다는 의미입니다.
로컬 모델의 한계
- 여러 파일 리팩터링. 5개 이상 파일에 걸쳐 컨텍스트를 유지해야 하는 작업은 불안정해집니다. 모델이 흐름을 놓치거나 일관성 없는 수정을 만들기 쉽습니다. 200K 이상 컨텍스트 윈도우를 갖춘 클라우드 모델이 여전히 이 영역에서 유리하지만, Qwen3.6 이후 격차는 좁아졌습니다.
- 복잡한 디버깅. 여러 추상화 계층을 넘나드는 추론이 필요한 버그라면, 로컬 모델은 문제가 더 깊은 곳에 있어도 표면적인 수정만 제안하는 경향이 있습니다. Claude Opus 4.8은 여전히 SWE-bench Verified에서 Qwen3.6 27B를 약 11점 앞서고, Claude Fable 5는 약 18점 앞섭니다.
- 구형 하드웨어에서 dense 모델 속도. 27B 모델은 단일 RTX 5090에서 약 70토큰/초, M5 Max에서 약 22 t/s로 실행됩니다. 아직 3090이나 4090을 쓰고 있다면 30~40 t/s를 예상하세요. (35B-A3B MoE의 180+ t/s는 예외입니다.)
- 매우 긴 컨텍스트. Qwen3.6은 이론적으로 최대 256K 토큰까지 지원하지만, 소비자용 하드웨어에서는 32K를 넘어가면 추론 품질이 떨어집니다. 설정에서
contextWindow를 현실적인 값으로 설정하세요.
하이브리드 접근법
로컬 모델을 써 본 사람은 대부분 하이브리드 구성으로 정착합니다. 저렴한 작업은 로컬로, 어려운 작업은 클라우드로 처리하는 식입니다.
{
agents: {
defaults: {
model: {
primary: "ollama/qwen3.6:27b",
thinking: "anthropic/claude-sonnet-4-6-20260514"
}
}
}
}
로컬 모델이 파일 읽기, 간단한 편집, 보일러플레이트를 처리합니다. 일반적인 코딩 세션의 약 6070%에 해당합니다. Sonnet이 디버깅, 아키텍처 결정, 여러 파일 작업을 처리합니다. API 요금은 하루 $2050 대신 몇 달러로 줄어듭니다.
작업에 더 높은 성능이 필요하다고 생각되면 수동으로 전환하세요.
/model sonnet
또는 Haimaker의 자동 라우터를 사용하면 라우팅을 자동으로 처리할 수 있습니다. 자동 라우터가 작업 복잡도를 감지해 어려운 문제는 자동으로 클라우드 모델로 넘겨주므로, 언제 전환할지 고민할 필요가 없습니다.
문제 해결
모델 로딩이 느리거나 크래시가 발생합니다. 메모리 부족일 가능성이 높습니다. 더 작은 양자화를 시도하세요. ollama pull qwen3.6:27b-q4_K_M는 품질 저하를 최소화하면서 메모리를 덜 사용합니다. Q4_K_M이 대부분의 사용자에게 가장 균형 잡힌 선택입니다. 품질 손실은 최소화하고 메모리 절약 효과는 큽니다.
툴 콜이 실패합니다. 모델 설정에서 "reasoning": false를 설정하고 Qwen3.6 모델을 사용하세요. Qwen3.6 모델은 Mistral이나 구형 Llama 모델보다 OpenClaw의 툴 콜링 형식을 더 안정적으로 처리합니다. 그래도 실패하면 Ollama를 최신 버전으로 업데이트하세요. 공식 프로바이더 통합으로 여러 엣지 케이스가 수정되었습니다.
컨텍스트 윈도우 오류. 설정에서 contextWindow를 정확하게 지정하세요. Qwen3.6 모델은 VRAM 24GB 이상 하드웨어(단일 RTX 5090로 충분)에서 131072(128K)가 안전한 기본값입니다. 16GB에서는 품질 저하를 막으려면 32768로 유지하세요.
생성 속도가 느립니다. 5090에서 27B 모델이 40 t/s 미만이거나 M5 Max에서 18 t/s 미만이라면 다른 프로세스가 GPU를 사용 중인지 확인하세요. WebGL이나 비디오를 실행하는 브라우저 탭을 닫으세요. Mac에서는 활동 모니터 → GPU 기록에서 통합 메모리를 차지하는 프로세스를 확인할 수 있습니다. M5 사용자는 Ollama가 MLX 백엔드(v0.21+)를 사용하고 있는지도 확인하세요. Metal 전용 경로와 MLX 경로의 속도 차이는 프롬프트 처리에서 약 2배입니다.
모델 가격 비교는 OpenClaw에서 가장 저렴한 모델을 참고하세요. 클라우드 모델의 토큰 비용 절감은 QMD로 비용 96% 절감하기를 참고하세요.