适合编程智能体的最佳 Ollama 模型,并不一定是你能下载到的最大模型。智能体的工作方式是循环迭代:读取文件、调用工具、修订计划、生成补丁。有些模型在一次提示中表现不错,但当智能体每次调用工具都要再跑一轮本地推理时,速度拖慢,体验便难以忍受。

以下排名可作为实操参考:该拉取哪个模型、需要什么硬件,以及什么时候该停止硬撑本地推理、改用云端兜底。

快速排名

排名模型拉取命令适用场景实际硬件要求
1Qwen3 Coder 30Bollama pull qwen3-coder:30b本地编程智能体的最佳默认选择24GB+ 显存或 32GB+ 统一内存
2Qwen3 30Bollama pull qwen3:30b通用智能体任务、推理、代码审查24GB+ 显存或 32GB+ 统一内存
3Gemma 4 26B MoEollama pull gemma4:26b高性能工作站上的快速本地编程辅助24GB+ 显存或 32GB+ 统一内存
4Kimi K2.7 Codeollama pull kimi-k2.7-code高端硬件上的前沿系列编程模型48GB+ 显存或 96GB+ 统一内存
5gpt-oss 20Bollama pull gpt-oss:20b16GB 配置最佳选择,可调节推理强度16GB 显存或统一内存
6Gemma 4 E4Bollama pull gemma4:e4b轻量级笔记本使用16GB 统一内存
7Qwen3 8Bollama pull qwen3:8b小规模编辑和代码解释8-16GB 内存

如果你只想试一个模型,那就试 Qwen3 Coder 30B。Ollama 将其列为支持 256K 上下文的编程和智能体类模型,它专为编程智能体的核心工作形态而设计:阅读代码、使用工具,并在较长的任务中保持状态。

按机器配置选择

8-16GB 内存

推荐使用 gpt-oss 20BQwen3 8BGemma 4 E4B。gpt-oss 20B 自发布以来已成为社区在 16GB 配置下的默认选择——既符合内存预算,又能按任务调节推理强度。

这个级别适合:

  • 解释不熟悉的代码
  • 编写小型函数
  • 起草测试
  • 生成配置文件
  • 总结日志

别指望在这个级别做可靠的多文件重构。小模型能写出有用的代码,但智能体一开始打开文件、修改补丁、处理工具输出,它们就很容易跟丢主线。

24-32GB 内存

推荐 Qwen3 Coder 30BQwen3 30BGemma 4 26B MoE

这是真正实用的本地智能体档位。模型足够大,能跟踪仓库上下文;又足够小,能在高端桌面 GPU 或大内存 Mac 上流畅运行。对大多数开发者来说,到这个档位,Ollama 才不再只是尝鲜工具,而是真正融入日常工作流。

64GB+ 内存

只有在你已经明确知道为什么需要时,才去尝试更大的 Qwen 或 DeepSeek 变体。

诱惑在于想跑模型库里最大的模型,但对智能体场景来说,这通常不是正确的方向。一个巨大的本地模型可能技术很强,却会让编码循环变得太慢。当任务确实需要更多推理能力或更长上下文时,大模型才有价值;如果智能体只是在读文件、写样板代码、起草测试,那大模型反而是一种负担。

想要本地优先、云端兜底的配置,又不想为每个提供商单独管理密钥?haimaker 能将简单的编程智能体任务路由到本地模型,并通过一个端点将困难任务转交云端模型处理。

使用 HAIMAKER 路由本地和云端模型

综合最佳:Qwen3 Coder

Qwen3 Coder 是我在任何本地编程智能体配置中会优先测试的第一个模型。

拉取:

ollama pull qwen3-coder:30b

快速验证:

ollama run qwen3-coder:30b "Explain this repo structure and suggest where tests should live."

它排名第一的原因:

  • 明确针对编程和智能体工作流做了调优。
  • Ollama 页面列出了支持 Claude Code、Codex、OpenCode 和 OpenClaw 的 ollama launch 功能。
  • 30B 变体在本地运行比 480B 变体现实得多。
  • 长上下文支持使其比旧版本地代码模型更适合仓库级工作。

适合用来做代码审查、测试生成、中等规模重构,以及注重隐私的本地优先智能体会话。

最佳轻量选择:Gemma 4

当 Qwen3 Coder 太重时,Gemma 4 系列是值得尝试的选择。较小的 Gemma 4 变体专为本地和端侧使用而设计,26B MoE 变体则提供更强的工作站选项,而且不需要在每个 token 上激活所有参数。

拉取适合笔记本的版本:

ollama pull gemma4:e4b

拉取更强的工作站版本:

ollama pull gemma4:26b

当你需要快速的本地辅助来解释代码、做小规模编辑和处理私有代码时,Gemma 4 是编程智能体的好选择。但如果需要智能体在长时间自主会话中保持完整的迁移计划,它就不太够用了。

新晋模型:Kimi K2.7 Code 和 Laguna XS 2.1

今年夏天有两个专注编程的模型登陆了 Ollama 模型库,值得关注。

Kimi K2.7 Code 是 Moonshot 基于 K2.6 系列构建的编程调优版本——同系列的 K3 已经在大模型竞技场排行榜上击败了闭源前沿模型。它需要较高硬件配置(48GB+ 显存或大内存 Mac),但如果你具备条件,这是目前本地可运行的最强开源编程模型。

ollama pull kimi-k2.7-code

Laguna XS 2.1 是 Poolside 的智能体编程 MoE——总参数 33B,但每个 token 仅激活 3B,因此实际运行负担远小于它的体量。它专为编程智能体高频使用的工具调用循环而设计。

如果你之前按本指南旧版在跑 DeepSeek Coder V2,可以退役了——它已经落后当前主流选择两代,在社区排名中也已完全消失。

在哪里使用这些模型

  • haimaker.ai - 将本地 Ollama 模型与更强的云端模型配合使用,简单的编程智能体任务路由到本地,困难任务路由到付费模型。
  • OpenClaw - 将 Ollama 作为编程智能体会话的本地提供商。参见 OpenClaw 本地模型指南
  • OpenCode - 通过 OpenAI 兼容的提供商路径添加 Ollama。参见 Ollama 与 OpenCode 配合使用
  • Codex 和 Claude Code - Ollama 的模型页面包含 ollama launch 示例,覆盖 Codex 和 Claude Code 等智能体运行时。

面向 OpenAI 兼容智能体的配置

大多数编程智能体都可以通过 Ollama 的本地 OpenAI 兼容端点来使用:

http://localhost:11434/v1

如果你的工具要求填写 API 密钥,填入一个占位符即可,Ollama 本地不会校验。

{
  "baseURL": "http://localhost:11434/v1",
  "apiKey": "ollama",
  "model": "qwen3-coder:30b"
}

对于 OpenCode,提供商配置块如下:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Ollama (local)",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "qwen3-coder:30b": {
          "name": "Qwen3 Coder 30B"
        }
      }
    }
  }
}

如果工具调用不稳定,先减小模型规模,再在硬件承受范围内逐步增加上下文。一个导致内存交换的巨大上下文窗口,还不如一个保持响应速度的小窗口。

何时不该用 Ollama

当隐私、成本或离线工作很重要时,本地模型是最佳选择。但它们并不是在所有编程任务上都自动更好。

以下情况应使用云端模型:

  • 任务涉及多个文件
  • Bug 很隐蔽
  • 需要可靠的工具调用
  • 补丁将触及生产系统
  • 没时间逐行审查生成的代码

实用的配置策略是本地优先,而非仅限本地。用 Qwen3 Coder 或 Gemma 4 处理低成本的私有工作,当任务的主要成本从 token 消耗变成你自己的注意力时,就该升级到更强的云端模型。

使用 HAIMAKER 路由本地和云端模型


关于 OpenClaw 专属的本地配置,参见 OpenClaw 最佳本地模型。关于 OpenCode 配置,参见 Ollama 与 OpenCode 配合使用