Ollama + Codex 本地大模型自动编程完全指南
过去很长一段时间里,像 OpenAI Codex、Claude Code、Cursor Agent 这类 AI 编程工具,都给人一个印象:必须依赖云端。它们需要强大的模型推理能力,所以几乎都离不开 OpenAI API、Claude API 或者 Gemini API。AI 编程虽然强,但成本一直不低——尤其是大型项目,一次完整的代码分析、项目扫描、Agent 推理,往往消耗大量 Token,测试几个小时费用就可能涨起来。
但现在,这件事开始发生变化了。最新版的 Ollama 已经正式支持接入 Codex App,也就是说,你本地运行的大模型,现在已经可以直接变成 AI 自动编程 Agent,而且整个过程可以完全不需要联网。
本地 AI Agent 和普通聊天机器人的区别
以前很多人对本地大模型的印象,还停留在”聊天机器人”阶段——本地跑一个 Qwen、DeepSeek、Gemma,然后进行简单对话、文本生成、代码补全。
但现在已经完全不同了。AI Agent 和普通聊天机器人,本质上是两回事。 聊天机器人只能回答问题,但 Agent 已经开始”执行任务”了:
- 自动分析项目结构
- 自动扫描代码
- 自动寻找 Bug
- 自动修改文件
- 自动创建项目
- 甚至自动操作浏览器
这意味着,本地 AI 已经开始真正具备”干活”的能力。
实测体验:让 AI 自动修复一个崩掉的项目
我这次测试的时候,最让我震惊的不是 AI 能聊天,而是它真的开始接管电脑了。
比如我故意准备了一个已经崩掉的空战游戏项目——原本已经报错,甚至无法正常运行。正常情况下,如果是人工修复,我们需要:先查看控制台报错,再检查代码逻辑,然后逐步定位问题,最后再尝试修复。
但这次,我把整个项目直接丢给了 AI Agent。结果它自动开始:扫描项目文件 → 分析代码结构 → 定位错误逻辑 → 自动修改代码 → 修复 Bug → 最后重新运行整个游戏。修复完成之后,游戏居然真的恢复正常运行了。 整个过程几乎不需要人工干预。
更离谱的是:哪怕断网,它依然可以继续工作。因为它调用的是本地 GPU 上的大模型,整个 AI 推理过程全部在本地完成,没有任何 OpenAI API,也没有任何 Token 消耗。以前很多 AI 工具一旦断网直接就废了,但现在本地 AI Agent 已经开始具备真正的离线能力。
本地部署步骤
1. 安装 OpenAI Codex
下载地址:https://openai.com/zh-Hans-CN/codex/
如果是 macOS 版,注意根据芯片类型选择 Intel 或 M 系列版本。
2. 安装最新版 Ollama(0.24+)
目前只有最新版 Ollama 0.24 版本才完全适配 Codex,旧版需要升级。
下载地址:https://ollama.com/
3. 下载模型
4B~40B 范围内,消费级显卡能跑的开源模型,首推 Qwen 3.6 和谷歌的 Gemma 4。这两款模型在代码编写、逻辑推理、中文理解等方面的综合评分都是数一数二的。
Qwen 3.6 安装命令:
ollama run qwen3.6
ollama run qwen3.6:27b
# macOS MLX 适配版
ollama run qwen3.6:27b-mlx
ollama run qwen3.6:35b-mlx
模型列表:https://ollama.com/library/qwen3.6
Gemma 4 安装命令:
ollama run gemma4
ollama run gemma4:26b
ollama run gemma4:31b
# macOS 可选模型
ollama run gemma4:e2b-mlx
ollama run gemma4:e4b-mlx
ollama run gemma4:26b-mlx
4. 对接命令
ollama launch codex-app
如需恢复之前使用的模型:
ollama launch codex-app --restore
进阶玩法:通过 llama.cpp 加载自定义模型
修改 Codex 配置文件
在配置中指定 llama.cpp 作为模型提供方:
model = "Qwen3.6-27B-UD-Q5_K_XL.gguf"
model_reasoning_effort = "low"
profile = "llamacpp-codex"
model_provider = "llamacpp"
[profiles.llamacpp-codex]
model = "Qwen3.6-27B-UD-Q5_K_XL.gguf"
model_provider = "llamacpp"
model_reasoning_effort = "low"
[model_providers.llamacpp]
name = "llama.cpp"
base_url = "http://127.0.0.1:8080/v1/"
wire_api = "responses"
llama.cpp 启动命令
llama-server.exe \
-m "models/Qwen3.6-27B-UD-Q5_K_XL.gguf" \
-ngl 999 \
-c 16384 \
-n 2048 \
-fa on \
--jinja \
--host 127.0.0.1 \
--port 8080
把模型路径换成你自己的即可。llama.cpp 的部署教程可以参考:https://www.freedidi.com/24284.html
硬件门槛其实没那么高
这一点让我感触很深。很多人一提到 AI Agent,第一反应还是:
- 必须 RTX 4090
- 必须 80G 显存
- 必须企业级 GPU
但实际上,现在很多小模型已经完全胜任基础 AI 编程任务。比如 Qwen 系列、DeepSeek Coder、Gemma,甚至是 7B、14B 的模型,最低 6G、8G 显存就能跑起来。虽然速度肯定比不上 4090,但对于普通用户来说,已经足够体验”本地 AI 自动编程”这件事情了。
更多有意思的玩法
除了修 Bug,我还测试了让 AI 自动开发小游戏——直接告诉它”帮我做一个打地鼠小游戏”,结果它自动创建 HTML、CSS、JavaScript 文件,连 UI 界面和游戏逻辑一起完成,几分钟就跑起来了。
还让它创建了一个苹果官网风格的 AI 产品首页——自动完成页面布局、动画、响应式设计、UI 风格,最终效果已经接近商业级网页设计了。以前这需要 UI 设计师、前端工程师、动画设计、CSS 工程师团队协作,现在一个 AI Agent 就能独立完成整个流程。
结语:AI 的真正方向是 Agent
现在很多 Agent 已经不局限于代码开发,甚至能自动打开浏览器、自行搜索、浏览网页、下载文件,完成整个操作流程。这越来越像真正的 AI 助手。
很多人现在开始意识到:AI 的真正方向可能根本不是聊天,而是 Agent——真正帮你执行任务的 AI。
而 Ollama,正在成为整个本地 AI 生态里非常核心的一环。以前很多人觉得 Ollama 只是一个简单的本地模型启动工具,但现在它已经开始连接越来越多的 AI Agent 工具:Codex App、Continue、OpenHands、RooCode、Aider、Open WebUI……本地 AI 正在进入真正的 Agent 时代。