适合编程智能体的最佳 Ollama 模型,并不一定是你能下载到的最大模型。智能体的工作方式是循环迭代:读取文件、调用工具、修订计划、生成补丁。有些模型在一次提示中表现不错,但当智能体每次调用工具都要再跑一轮本地推理时,速度拖慢,体验便难以忍受。
以下排名可作为实操参考:该拉取哪个模型、需要什么硬件,以及什么时候该停止硬撑本地推理、改用云端兜底。
快速排名
| 排名 | 模型 | 拉取命令 | 适用场景 | 实际硬件要求 |
|---|---|---|---|---|
| 1 | Qwen3 Coder 30B | ollama pull qwen3-coder:30b | 本地编程智能体的最佳默认选择 | 24GB+ 显存或 32GB+ 统一内存 |
| 2 | Qwen3 30B | ollama pull qwen3:30b | 通用智能体任务、推理、代码审查 | 24GB+ 显存或 32GB+ 统一内存 |
| 3 | Gemma 4 26B MoE | ollama pull gemma4:26b | 高性能工作站上的快速本地编程辅助 | 24GB+ 显存或 32GB+ 统一内存 |
| 4 | Kimi K2.7 Code | ollama pull kimi-k2.7-code | 高端硬件上的前沿系列编程模型 | 48GB+ 显存或 96GB+ 统一内存 |
| 5 | gpt-oss 20B | ollama pull gpt-oss:20b | 16GB 配置最佳选择,可调节推理强度 | 16GB 显存或统一内存 |
| 6 | Gemma 4 E4B | ollama pull gemma4:e4b | 轻量级笔记本使用 | 16GB 统一内存 |
| 7 | Qwen3 8B | ollama pull qwen3:8b | 小规模编辑和代码解释 | 8-16GB 内存 |
如果你只想试一个模型,那就试 Qwen3 Coder 30B。Ollama 将其列为支持 256K 上下文的编程和智能体类模型,它专为编程智能体的核心工作形态而设计:阅读代码、使用工具,并在较长的任务中保持状态。
按机器配置选择
8-16GB 内存
推荐使用 gpt-oss 20B、Qwen3 8B 或 Gemma 4 E4B。gpt-oss 20B 自发布以来已成为社区在 16GB 配置下的默认选择——既符合内存预算,又能按任务调节推理强度。
这个级别适合:
- 解释不熟悉的代码
- 编写小型函数
- 起草测试
- 生成配置文件
- 总结日志
别指望在这个级别做可靠的多文件重构。小模型能写出有用的代码,但智能体一开始打开文件、修改补丁、处理工具输出,它们就很容易跟丢主线。
24-32GB 内存
推荐 Qwen3 Coder 30B、Qwen3 30B 或 Gemma 4 26B MoE。
这是真正实用的本地智能体档位。模型足够大,能跟踪仓库上下文;又足够小,能在高端桌面 GPU 或大内存 Mac 上流畅运行。对大多数开发者来说,到这个档位,Ollama 才不再只是尝鲜工具,而是真正融入日常工作流。
64GB+ 内存
只有在你已经明确知道为什么需要时,才去尝试更大的 Qwen 或 DeepSeek 变体。
诱惑在于想跑模型库里最大的模型,但对智能体场景来说,这通常不是正确的方向。一个巨大的本地模型可能技术很强,却会让编码循环变得太慢。当任务确实需要更多推理能力或更长上下文时,大模型才有价值;如果智能体只是在读文件、写样板代码、起草测试,那大模型反而是一种负担。
想要本地优先、云端兜底的配置,又不想为每个提供商单独管理密钥?haimaker 能将简单的编程智能体任务路由到本地模型,并通过一个端点将困难任务转交云端模型处理。
使用 HAIMAKER 路由本地和云端模型综合最佳:Qwen3 Coder
Qwen3 Coder 是我在任何本地编程智能体配置中会优先测试的第一个模型。
拉取:
ollama pull qwen3-coder:30b
快速验证:
ollama run qwen3-coder:30b "Explain this repo structure and suggest where tests should live."
它排名第一的原因:
- 明确针对编程和智能体工作流做了调优。
- Ollama 页面列出了支持 Claude Code、Codex、OpenCode 和 OpenClaw 的
ollama launch功能。 - 30B 变体在本地运行比 480B 变体现实得多。
- 长上下文支持使其比旧版本地代码模型更适合仓库级工作。
适合用来做代码审查、测试生成、中等规模重构,以及注重隐私的本地优先智能体会话。
最佳轻量选择:Gemma 4
当 Qwen3 Coder 太重时,Gemma 4 系列是值得尝试的选择。较小的 Gemma 4 变体专为本地和端侧使用而设计,26B MoE 变体则提供更强的工作站选项,而且不需要在每个 token 上激活所有参数。
拉取适合笔记本的版本:
ollama pull gemma4:e4b
拉取更强的工作站版本:
ollama pull gemma4:26b
当你需要快速的本地辅助来解释代码、做小规模编辑和处理私有代码时,Gemma 4 是编程智能体的好选择。但如果需要智能体在长时间自主会话中保持完整的迁移计划,它就不太够用了。
新晋模型:Kimi K2.7 Code 和 Laguna XS 2.1
今年夏天有两个专注编程的模型登陆了 Ollama 模型库,值得关注。
Kimi K2.7 Code 是 Moonshot 基于 K2.6 系列构建的编程调优版本——同系列的 K3 已经在大模型竞技场排行榜上击败了闭源前沿模型。它需要较高硬件配置(48GB+ 显存或大内存 Mac),但如果你具备条件,这是目前本地可运行的最强开源编程模型。
ollama pull kimi-k2.7-code
Laguna XS 2.1 是 Poolside 的智能体编程 MoE——总参数 33B,但每个 token 仅激活 3B,因此实际运行负担远小于它的体量。它专为编程智能体高频使用的工具调用循环而设计。
如果你之前按本指南旧版在跑 DeepSeek Coder V2,可以退役了——它已经落后当前主流选择两代,在社区排名中也已完全消失。
在哪里使用这些模型
- haimaker.ai - 将本地 Ollama 模型与更强的云端模型配合使用,简单的编程智能体任务路由到本地,困难任务路由到付费模型。
- OpenClaw - 将 Ollama 作为编程智能体会话的本地提供商。参见 OpenClaw 本地模型指南。
- OpenCode - 通过 OpenAI 兼容的提供商路径添加 Ollama。参见 Ollama 与 OpenCode 配合使用。
- Codex 和 Claude Code - Ollama 的模型页面包含
ollama launch示例,覆盖 Codex 和 Claude Code 等智能体运行时。
面向 OpenAI 兼容智能体的配置
大多数编程智能体都可以通过 Ollama 的本地 OpenAI 兼容端点来使用:
http://localhost:11434/v1
如果你的工具要求填写 API 密钥,填入一个占位符即可,Ollama 本地不会校验。
{
"baseURL": "http://localhost:11434/v1",
"apiKey": "ollama",
"model": "qwen3-coder:30b"
}
对于 OpenCode,提供商配置块如下:
{
"$schema": "https://opencode.ai/config.json",
"provider": {
"ollama": {
"npm": "@ai-sdk/openai-compatible",
"name": "Ollama (local)",
"options": {
"baseURL": "http://localhost:11434/v1"
},
"models": {
"qwen3-coder:30b": {
"name": "Qwen3 Coder 30B"
}
}
}
}
}
如果工具调用不稳定,先减小模型规模,再在硬件承受范围内逐步增加上下文。一个导致内存交换的巨大上下文窗口,还不如一个保持响应速度的小窗口。
何时不该用 Ollama
当隐私、成本或离线工作很重要时,本地模型是最佳选择。但它们并不是在所有编程任务上都自动更好。
以下情况应使用云端模型:
- 任务涉及多个文件
- Bug 很隐蔽
- 需要可靠的工具调用
- 补丁将触及生产系统
- 没时间逐行审查生成的代码
实用的配置策略是本地优先,而非仅限本地。用 Qwen3 Coder 或 Gemma 4 处理低成本的私有工作,当任务的主要成本从 token 消耗变成你自己的注意力时,就该升级到更强的云端模型。
关于 OpenClaw 专属的本地配置,参见 OpenClaw 最佳本地模型。关于 OpenCode 配置,参见 Ollama 与 OpenCode 配合使用。