
Como executar o Grok Build com modelos locais
Aprenda a conectar o Grok Build ao Ollama e a endpoints compatíveis com OpenAI, verificar se as requisições ficam locais e entender os limites de privacidade.
O Grok Build agora pode apontar para o seu próprio endpoint de inferência. Para desenvolvedores que querem controlar código, prompts e custo do modelo, essa é a parte mais útil do lançamento open source.
Mas é importante separar duas coisas: executar o CLI do Grok Build no seu computador não é o mesmo que executar a inferência do modelo localmente. A xAI publicou o coding agent harness e a interface de terminal, mas não publicou os pesos do Grok 4.5.
Resumo: adicione um modelo personalizado em ~/.grok/config.toml, configure base_url para o seu servidor local compatível com OpenAI, selecione esse modelo no Grok Build e confirme a requisição nos logs do servidor. Ollama é o caminho oficial mais claro para começar.
O que “Grok Build local” realmente significa
Existem três partes diferentes:
- Grok Build é o agent harness. Ele lê o contexto, chama ferramentas, edita arquivos e apresenta a interface de terminal.
- O endpoint de inferência recebe a requisição do modelo. Pode ser a xAI, outro provedor cloud ou um servidor em
localhost. - Os pesos do modelo geram a resposta. Com Ollama, LM Studio ou vLLM, eles podem rodar em hardware sob seu controle.
Inferência local significa que as partes dois e três ficam no seu computador ou em uma rede privada. Instalar o CLI sozinho não garante que as requisições ficarão locais.

O que a xAI publicou — e o que não publicou
O anúncio oficial diz que o lançamento inclui o agent loop, ferramentas, TUI e o sistema de extensões para skills, plugins, hooks, MCP servers e subagents. O repositório no GitHub contém o código Rust do CLI/TUI e do agent runtime.
Isso permite inspecionar como o contexto é montado, como as ferramentas são chamadas e como conectar um endpoint de modelo personalizado.
O que você não recebe é uma cópia baixável do Grok 4.5. Nesse cenário, o modelo local é um modelo separado servido pelo Ollama ou por outro runtime compatível.
Pré-requisitos
Você precisa de:
- macOS, Linux ou Windows;
- Grok Build instalado;
- Ollama ou outro servidor compatível com OpenAI;
- um modelo que caiba na sua RAM ou VRAM;
- um repositório de teste em que seja fácil desfazer mudanças.
Modelos locais variam muito em programação. Um modelo pode responder bem no chat e falhar quando o agente precisa produzir chamadas estruturadas de ferramentas. Comece lendo um único arquivo e propondo uma mudança.
Instalar o Grok Build
macOS, Linux ou Git Bash:
curl -fsSL https://x.ai/cli/install.sh | bash
grok --versionWindows PowerShell:
irm https://x.ai/cli/install.ps1 | iex
grok --versionExistem binários pré-compilados para as três plataformas. A compilação a partir do código-fonte é suportada em macOS e Linux; o repositório classifica a compilação no Windows como best effort.
Entender o ~/.grok/config.toml
Modelos personalizados ficam em uma seção [model.*]. O guia oficial suporta OpenAI Chat Completions, OpenAI Responses e Anthropic Messages.
[model.local-coder]
model = "your-model-id"
base_url = "http://localhost:8080/v1"
name = "Local Coder"
api_backend = "chat_completions"
context_window = 32768
[models]
default = "local-coder"modelé o ID exato enviado ao servidor;base_urlé a raiz da API local ou auto-hospedada;nameé o rótulo exibido no seletor de modelos;api_backendescolhe o protocolo, normalmente Chat Completions;context_windowindica quando a sessão deve ser compactada.
Use o limite real suportado pelo modelo em context_window. Um número maior no arquivo não cria mais contexto no modelo.
Conectar o Grok Build ao Ollama
O guia oficial de modelos personalizados usa CodeLlama como exemplo. Inicie o Ollama e baixe o modelo:
ollama serve
ollama pull codellamaAdicione isto ao ~/.grok/config.toml:
[model.ollama-codellama]
model = "codellama"
base_url = "http://localhost:11434/v1"
name = "CodeLlama (Ollama)"O detalhe importante é /v1. O Grok Build usa uma API compatível com OpenAI, não o endpoint nativo generate do Ollama.
Execute grok models e confirme que a entrada personalizada aparece. Você pode escolher o modelo assim:
grok -p "Summarize this repository without changing files" -m ollama-codellamaDentro da TUI, use /model ollama-codellama ou o alias /m. O seletor também pode ser aberto com Ctrl+M quando o foco estiver no painel de scrollback.
Usar LM Studio ou vLLM
O Grok Build suporta servidores compatíveis com OpenAI, então LM Studio e vLLM são candidatos razoáveis. “Compatível com OpenAI” não garante que todos os recursos do agente funcionarão.
Antes de confiar em qualquer um:
- Confirme se o servidor expõe
/v1/chat/completionsou/v1/responses. - Copie o ID exato retornado pelo endpoint
/v1/models. - Verifique se o streaming termina corretamente.
- Teste chamadas estruturadas de ferramentas, não apenas chat.
- Configure o contexto real e um limite conservador de completion.
- Observe os logs para campos rejeitados ou erros de template.
[model.local-openai]
model = "model-id-from-your-server"
base_url = "http://localhost:1234/v1"
name = "Local OpenAI-Compatible Model"
api_backend = "chat_completions"
context_window = 32768O LM Studio costuma usar a porta 1234, enquanto o vLLM costuma usar 8000. Use a porta indicada pelo seu servidor.
Como provar que a inferência é realmente local
Uma resposta bem-sucedida não é prova suficiente.
- Verifique se o modelo selecionado é a entrada personalizada, e não
grok-build. - Confirme que
base_urlaponta paralocalhost,127.0.0.1ou um host privado sob seu controle. - Envie um prompt pequeno enquanto observa os logs do Ollama, LM Studio ou vLLM.
- Confirme que aparece uma requisição com o ID de modelo esperado.
- Se possível, desconecte temporariamente a rede pública e repita um prompt seguro somente de leitura.

Uma requisição para um modelo local não significa que todo o aplicativo esteja offline. Autenticação, busca remota, indexação de código, servidores MCP e outros recursos podem continuar usando a rede.
Privacidade: código, prompts, logs e telemetria
A inferência local reduz uma exposição importante: o prompt do modelo não precisa ser enviado a um provedor cloud. Isso não protege automaticamente todos os arquivos e ferramentas.
Leia o guia oficial de configuração e o código da versão instalada. Preste atenção a:
- configurações de telemetria;
- busca remota e indexação de código;
- servidores MCP e plugins;
- aprovação de comandos shell;
- respeito das ferramentas ao
.gitignore; - segredos em
.env, SSH e histórico do Git.
Nunca coloque uma API key diretamente em um arquivo de configuração que será commitado. Se o servidor local não exige autenticação, omita a chave em vez de adicionar um segredo falso.
Erros comuns
Connection refused
O servidor não está rodando, a porta está errada ou a fronteira de contêiner/WSL faz com que localhost aponte para outro ambiente. Teste /v1/models no mesmo ambiente em que o Grok Build está executando.
Model not found
O valor de model precisa corresponder exatamente ao ID do servidor. O nome amigável pode ser diferente do identificador da API.
Falha nas chamadas de ferramentas
O modelo ou o chat template pode não suportar o formato de chamada de ferramentas esperado pelo Grok Build. Tente um modelo voltado para coding agents e examine o erro original do servidor.
Erros de contexto ou timeout
Reduza context_window até o limite real do modelo, use um repositório ou tarefa menor e permita mais tempo quando o modelo rodar sem GPU.
O streaming para antes do fim
Confirme se o servidor implementa o api_backend selecionado. Antes de depurar o agente, teste um chat normal contra o mesmo endpoint.
Modelos locais versus coding agents na nuvem
| Fator | Grok Build + modelo local | Coding agent na nuvem |
|---|---|---|
| Requisições | Ficam no dispositivo ou endpoint privado | Vão para o provedor |
| Qualidade | Depende do modelo e do hardware | Normalmente usa um modelo de fronteira |
| Velocidade | Limitada pelo processamento local | Limitada pela rede e capacidade do provedor |
| Custo | Hardware, energia e manutenção | Assinatura ou uso |
| Contexto | Limitado pelo runtime local | Geralmente gerenciado pelo provedor |
| Ferramentas | Precisam ser testadas por modelo | Normalmente ajustadas para o agente |
| Controle | Alto | Depende do provedor |
A inferência local é mais interessante quando controle e auditabilidade importam mais que a capacidade máxima do modelo. Claude Code e Codex priorizam modelos de fronteira gerenciados; OpenCode é uma comparação mais próxima quando a flexibilidade do provedor é o ponto principal.
Histórico de versão
| Data | Escopo verificado |
|---|---|
| 16 de julho de 2026 | Foram conferidos o anúncio open source da xAI, as instruções do GitHub, o guia de modelos personalizados, a configuração, o exemplo com Ollama e os backends de API. LM Studio e vLLM continuam sendo uma orientação de compatibilidade, não um teste de laboratório nesta revisão. |
Conclusão
A inferência local do Grok Build significa conectar o agent harness open source a um servidor de modelos local separado. Não significa que os pesos do Grok 4.5 estejam disponíveis para download.
Comece com a configuração oficial do Ollama, selecione explicitamente o modelo personalizado e prove a requisição nos logs do servidor local. Depois audite os recursos que ainda usam a rede antes de chamar o ambiente de offline ou privado.
Perguntas frequentes
O Grok Build pode usar modelos locais?
Sim. Você pode adicionar modelos personalizados em ~/.grok/config.toml e conectá-los a endpoints locais compatíveis com OpenAI, incluindo o exemplo oficial com Ollama.
É possível executar o Grok 4.5 localmente?
Não apenas com o lançamento open source do Grok Build. A xAI publicou o coding agent harness, o CLI, a TUI, as ferramentas e o sistema de extensões, mas não publicou os pesos do modelo Grok 4.5.
O Grok Build funciona com Ollama?
Sim. O guia oficial de modelos personalizados usa http://localhost:11434/v1. O modelo escolhido ainda precisa ter contexto suficiente e suporte a chamadas de ferramentas.
O Grok Build é totalmente offline?
Um endpoint de inferência local mantém a inferência do modelo no dispositivo, mas autenticação, busca remota, indexação de código e servidores MCP podem fazer requisições de rede. Audite a configuração antes de chamá-la de totalmente offline.
O Grok Build envia meu código para a nuvem?
Isso depende do endpoint ativo e dos recursos habilitados. Um endpoint localhost mantém a requisição do modelo local, mas você também deve revisar telemetria, busca remota, indexação, ferramentas e servidores MCP.
LM Studio e vLLM funcionam com o Grok Build?
Eles podem expor APIs compatíveis com OpenAI, mas a compatibilidade real depende do modelo, do template de chat, do streaming e das chamadas de ferramentas. Teste antes de depender deles.
Qual modelo local devo usar para programação?
Escolha um modelo voltado para código, que caiba na sua memória, suporte o contexto necessário e produza chamadas de ferramentas com consistência. Comece com um repositório pequeno e uma tarefa reversível.
