
如何让 Grok Build 使用本地模型
学习如何用 config.toml 将 Grok Build 连接到 Ollama 和 OpenAI 兼容接口,验证请求确实留在本地,并理解隐私边界。
Grok Build 现在可以连接你自己的推理接口。对于希望控制代码、提示词和模型成本的开发者来说,这是开源版本最有价值的部分。
但要先分清一件事:在电脑上运行 Grok Build CLI,不等于在本地运行模型推理。xAI 开源了 coding agent harness 和终端界面,并没有发布 Grok 4.5 的模型权重。
先说结论: 在 ~/.grok/config.toml 中添加自定义模型,把 base_url 指向本地 OpenAI 兼容服务器,在 Grok Build 中选中该模型,再通过本地服务器日志验证请求。Ollama 是目前最清晰的官方示例路径。
“Grok Build 本地推理”到底指什么
这里有三个独立部分:
- Grok Build 是 agent harness,负责读取上下文、调用工具、修改文件并显示终端界面。
- 推理接口 接收模型请求,可以是 xAI、其他云服务,也可以是
localhost上的服务器。 - 模型权重 生成回答。使用 Ollama、LM Studio 或 vLLM 时,权重可以运行在你控制的硬件上。
所谓本地推理,是第二和第三部分留在你的电脑或私有网络中。仅仅安装 CLI,并不能保证请求会留在本地。

xAI 开源了什么,没有开源什么
官方公告说明,发布内容包括 agent loop、工具、终端 UI,以及 skills、plugins、hooks、MCP servers 和 subagents 等扩展系统。GitHub 仓库包含 CLI/TUI 和 agent runtime 的 Rust 源码。
这让开发者可以检查上下文如何组装、工具调用如何分发,也让自定义本地模型接口成为可能。
但你没有获得可下载的 Grok 4.5。这里接入的本地模型是由 Ollama 或其他兼容运行时提供的独立模型。
安装前准备
你需要:
- macOS、Linux 或 Windows;
- 已安装的 Grok Build;
- Ollama 或其他 OpenAI 兼容服务器;
- 与 RAM 或 VRAM 匹配的模型;
- 一个容易撤销改动的测试仓库。
本地模型的编程能力差异很大。有些模型可以正常聊天,却无法在 agent 需要时输出结构化工具调用。第一次测试建议只读取一个文件并提出修改建议。
安装 Grok Build
当前仓库列出的官方安装命令如下。
macOS、Linux 或 Git Bash:
curl -fsSL https://x.ai/cli/install.sh | bash
grok --versionWindows PowerShell:
irm https://x.ai/cli/install.ps1 | iex
grok --version三种平台都有预编译二进制文件。macOS 和 Linux 支持从源码构建;仓库对 Windows 源码构建标记为 best effort。
理解 ~/.grok/config.toml
自定义模型放在 [model.*] 下。官方指南支持 OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages 三种后端。
[model.local-coder]
model = "your-model-id"
base_url = "http://localhost:8080/v1"
name = "Local Coder"
api_backend = "chat_completions"
context_window = 32768
[models]
default = "local-coder"字段含义:
model是发送给服务器的准确模型 ID;base_url是本地或自托管 API 根地址;name是模型选择器里的显示名称;api_backend选择请求协议,默认是 Chat Completions;context_window告诉 Grok Build 什么时候压缩会话。
context_window 必须符合模型实际支持的长度。把配置数字写大,并不会凭空增加模型上下文。
连接 Ollama
官方自定义模型指南使用 CodeLlama 作为示例。先启动 Ollama 并拉取模型:
ollama serve
ollama pull codellama然后在 ~/.grok/config.toml 中加入:
[model.ollama-codellama]
model = "codellama"
base_url = "http://localhost:11434/v1"
name = "CodeLlama (Ollama)"关键是 /v1。Grok Build 使用 OpenAI 兼容 API,而不是 Ollama 原生的 generate 接口。
运行 grok models,确认自定义条目出现。启动提示时可以这样选择:
grok -p "Summarize this repository without changing files" -m ollama-codellama在 TUI 中可以使用 /model ollama-codellama 或 /m 别名。焦点位于滚动区域时,也可以用 Ctrl+M 打开模型选择器。
使用 LM Studio 或 vLLM
Grok Build 支持通用 OpenAI 兼容服务器,因此 LM Studio 和 vLLM 都是合理候选。但“兼容 OpenAI”不等于所有 agent 功能都会正常。
使用前检查:
- 服务器是否提供
/v1/chat/completions或/v1/responses; /v1/models返回的准确模型 ID;- 流式响应能否完整结束;
- 结构化工具调用,而不只是普通聊天;
- 真实上下文长度和保守的 completion 上限;
- 服务器日志里是否有字段或模板错误。
最小配置示例:
[model.local-openai]
model = "model-id-from-your-server"
base_url = "http://localhost:1234/v1"
name = "Local OpenAI-Compatible Model"
api_backend = "chat_completions"
context_window = 32768LM Studio 常用端口是 1234,vLLM 常见端口是 8000。请以你的服务器实际端口为准。
如何证明推理真的在本地
得到一次成功回答并不能证明请求走了本地。按下面步骤验证:
- 确认当前选中的是自定义模型,而不是
grok-build; - 确认
base_url是localhost、127.0.0.1或你控制的私有地址; - 发送一个小提示词,同时观察 Ollama、LM Studio 或 vLLM 日志;
- 确认预期时间和模型 ID 出现了一条请求;
- 如果工作流允许,暂时断开公网,再重复一个无害的只读提示词。

本地模型请求不等于整个应用完全离线。认证、远程抓取、代码索引、MCP 服务或其他可选服务仍可能联网。
隐私:代码、提示词、日志和遥测
本地推理减少了一项主要暴露:模型提示词不必发送到云端推理服务。但它不会自动保护每一个文件或工具。
请阅读官方配置指南以及你所安装版本的源码,重点检查:
- 遥测设置;
- 远程抓取和代码索引功能;
- MCP servers 和插件;
- shell 命令的审批行为;
- 工具是否遵守
.gitignore; .env、SSH 配置和 Git 历史中的秘密。
不要把 API key 直接写进已提交的配置文件。Grok Build 支持用 env_key 引用凭据。如果本地服务器不需要认证,应该省略 key,而不是写入假密钥。
常见错误
Connection refused
服务器没有启动、端口错误,或者容器/WSL 让 localhost 指向了另一个环境。从运行 Grok Build 的同一环境测试服务器的 /v1/models。
Model not found
model 必须和服务器返回的模型 ID 完全一致。显示名称不一定是 API 标识符。
工具调用失败
模型或 chat template 可能不支持 Grok Build 需要的工具调用格式。尝试一个明确支持 agent coding 的模型,并查看服务器原始错误。
上下文或超时错误
把 context_window 调低到模型的真实上限,缩小仓库或任务,并给没有 GPU 的本地模型更多推理时间。
流式输出提前结束
确认服务器实现了所选 api_backend。如果 Chat Completions 流式不稳定,先用同一接口测试普通聊天。
本地模型与云端 coding agent 对比
| 因素 | Grok Build + 本地模型 | 云端 coding agent |
|---|---|---|
| 模型请求 | 留在本机或私有接口 | 发送到供应商接口 |
| 质量 | 取决于模型和硬件 | 通常是前沿模型 |
| 速度 | 受本地算力限制 | 受网络和供应商容量限制 |
| 成本 | 硬件、电力和维护 | 订阅或按量计费 |
| 上下文 | 受本地运行时限制 | 通常由供应商管理 |
| 工具调用 | 需要按模型测试 | 通常针对 agent 调优 |
| 控制权 | 高 | 取决于供应商 |
如果你更看重控制权和可审计性,而不是最高模型能力,本地推理很有吸引力。Claude Code 和 Codex 更偏向托管的前沿模型;OpenCode 则是在供应商灵活性方面更接近的比较对象。
版本记录
| 日期 | 核验范围 |
|---|---|
| 2026 年 7 月 16 日 | 核对 xAI 开源公告、GitHub 安装说明、自定义模型指南、配置指南、Ollama 示例和 API 后端。LM Studio 与 vLLM 仍是兼容性指导,并非本文实测通过。 |
结论
Grok Build 本地推理是真实可行的,但它指的是把开源 agent harness 连接到独立的本地模型服务器,并不代表 Grok 4.5 权重可以下载。
先使用官方 Ollama 配置,明确选择自定义模型,并在本地服务器日志中证明请求确实到达。然后审计其他联网功能,再决定是否可以把这套环境称为离线或隐私友好。这个验证闭环比笼统的隐私承诺更有价值。
常见问题
Grok Build 可以使用本地模型吗?
可以。Grok Build 支持在 ~/.grok/config.toml 中添加自定义模型,并连接到本地 OpenAI 兼容接口,官方文档也提供了 Ollama 示例。
可以在本地运行 Grok 4.5 吗?
不能仅凭 Grok Build 开源版本实现。xAI 开源的是 coding agent harness、CLI、TUI、工具和扩展系统,并没有发布 Grok 4.5 的模型权重。
Grok Build 支持 Ollama 吗?
支持。官方自定义模型示例使用 http://localhost:11434/v1。你仍然需要确认所选 Ollama 模型有足够的上下文长度和工具调用能力。
Grok Build 是完全离线的吗?
本地推理接口可以让模型请求留在本机,但认证、远程抓取、代码索引、MCP 服务等可选功能仍可能访问网络。不要在审计前直接承诺完全离线。
Grok Build 会上传我的代码吗?
取决于当前模型接口和启用的功能。本地接口可以避免模型请求发送到云端,但仍应检查遥测、远程抓取、代码索引、工具和 MCP 服务。
LM Studio 和 vLLM 能与 Grok Build 一起使用吗?
它们都可以提供 OpenAI 兼容 API,符合 Grok Build 支持的后端形式,但是否能稳定完成流式输出和工具调用仍取决于模型、模板和服务器实现,需要自行验证。
什么本地模型适合编程?
选择适合代码任务、能满足上下文需求并稳定输出工具调用的模型。先在小型仓库和可回滚任务上测试,再处理重要代码。



