imya — Gerador de imagens, vídeos e músicas com IA tudo-em-umimya
ModelosAPIBlogPreços
Início/Blog/Como executar o Grok Build com modelos locais
Como executar o Grok Build com modelos locais
2026/07/16

Como executar o Grok Build com modelos locais

Aprenda a conectar o Grok Build ao Ollama e a endpoints compatíveis com OpenAI, verificar se as requisições ficam locais e entender os limites de privacidade.

O Grok Build agora pode apontar para o seu próprio endpoint de inferência. Para desenvolvedores que querem controlar código, prompts e custo do modelo, essa é a parte mais útil do lançamento open source.

Mas é importante separar duas coisas: executar o CLI do Grok Build no seu computador não é o mesmo que executar a inferência do modelo localmente. A xAI publicou o coding agent harness e a interface de terminal, mas não publicou os pesos do Grok 4.5.

Resumo: adicione um modelo personalizado em ~/.grok/config.toml, configure base_url para o seu servidor local compatível com OpenAI, selecione esse modelo no Grok Build e confirme a requisição nos logs do servidor. Ollama é o caminho oficial mais claro para começar.

O que “Grok Build local” realmente significa

Existem três partes diferentes:

  1. Grok Build é o agent harness. Ele lê o contexto, chama ferramentas, edita arquivos e apresenta a interface de terminal.
  2. O endpoint de inferência recebe a requisição do modelo. Pode ser a xAI, outro provedor cloud ou um servidor em localhost.
  3. Os pesos do modelo geram a resposta. Com Ollama, LM Studio ou vLLM, eles podem rodar em hardware sob seu controle.

Inferência local significa que as partes dois e três ficam no seu computador ou em uma rede privada. Instalar o CLI sozinho não garante que as requisições ficarão locais.

Arquitetura do Grok Build enviando requisições para runtimes de modelos locais

O que a xAI publicou — e o que não publicou

O anúncio oficial diz que o lançamento inclui o agent loop, ferramentas, TUI e o sistema de extensões para skills, plugins, hooks, MCP servers e subagents. O repositório no GitHub contém o código Rust do CLI/TUI e do agent runtime.

Isso permite inspecionar como o contexto é montado, como as ferramentas são chamadas e como conectar um endpoint de modelo personalizado.

O que você não recebe é uma cópia baixável do Grok 4.5. Nesse cenário, o modelo local é um modelo separado servido pelo Ollama ou por outro runtime compatível.

Pré-requisitos

Você precisa de:

  • macOS, Linux ou Windows;
  • Grok Build instalado;
  • Ollama ou outro servidor compatível com OpenAI;
  • um modelo que caiba na sua RAM ou VRAM;
  • um repositório de teste em que seja fácil desfazer mudanças.

Modelos locais variam muito em programação. Um modelo pode responder bem no chat e falhar quando o agente precisa produzir chamadas estruturadas de ferramentas. Comece lendo um único arquivo e propondo uma mudança.

Instalar o Grok Build

macOS, Linux ou Git Bash:

curl -fsSL https://x.ai/cli/install.sh | bash
grok --version

Windows PowerShell:

irm https://x.ai/cli/install.ps1 | iex
grok --version

Existem binários pré-compilados para as três plataformas. A compilação a partir do código-fonte é suportada em macOS e Linux; o repositório classifica a compilação no Windows como best effort.

Entender o ~/.grok/config.toml

Modelos personalizados ficam em uma seção [model.*]. O guia oficial suporta OpenAI Chat Completions, OpenAI Responses e Anthropic Messages.

[model.local-coder]
model = "your-model-id"
base_url = "http://localhost:8080/v1"
name = "Local Coder"
api_backend = "chat_completions"
context_window = 32768

[models]
default = "local-coder"
  • model é o ID exato enviado ao servidor;
  • base_url é a raiz da API local ou auto-hospedada;
  • name é o rótulo exibido no seletor de modelos;
  • api_backend escolhe o protocolo, normalmente Chat Completions;
  • context_window indica quando a sessão deve ser compactada.

Use o limite real suportado pelo modelo em context_window. Um número maior no arquivo não cria mais contexto no modelo.

Conectar o Grok Build ao Ollama

O guia oficial de modelos personalizados usa CodeLlama como exemplo. Inicie o Ollama e baixe o modelo:

ollama serve
ollama pull codellama

Adicione isto ao ~/.grok/config.toml:

[model.ollama-codellama]
model = "codellama"
base_url = "http://localhost:11434/v1"
name = "CodeLlama (Ollama)"

O detalhe importante é /v1. O Grok Build usa uma API compatível com OpenAI, não o endpoint nativo generate do Ollama.

Execute grok models e confirme que a entrada personalizada aparece. Você pode escolher o modelo assim:

grok -p "Summarize this repository without changing files" -m ollama-codellama

Dentro da TUI, use /model ollama-codellama ou o alias /m. O seletor também pode ser aberto com Ctrl+M quando o foco estiver no painel de scrollback.

Usar LM Studio ou vLLM

O Grok Build suporta servidores compatíveis com OpenAI, então LM Studio e vLLM são candidatos razoáveis. “Compatível com OpenAI” não garante que todos os recursos do agente funcionarão.

Antes de confiar em qualquer um:

  1. Confirme se o servidor expõe /v1/chat/completions ou /v1/responses.
  2. Copie o ID exato retornado pelo endpoint /v1/models.
  3. Verifique se o streaming termina corretamente.
  4. Teste chamadas estruturadas de ferramentas, não apenas chat.
  5. Configure o contexto real e um limite conservador de completion.
  6. Observe os logs para campos rejeitados ou erros de template.
[model.local-openai]
model = "model-id-from-your-server"
base_url = "http://localhost:1234/v1"
name = "Local OpenAI-Compatible Model"
api_backend = "chat_completions"
context_window = 32768

O LM Studio costuma usar a porta 1234, enquanto o vLLM costuma usar 8000. Use a porta indicada pelo seu servidor.

Como provar que a inferência é realmente local

Uma resposta bem-sucedida não é prova suficiente.

  1. Verifique se o modelo selecionado é a entrada personalizada, e não grok-build.
  2. Confirme que base_url aponta para localhost, 127.0.0.1 ou um host privado sob seu controle.
  3. Envie um prompt pequeno enquanto observa os logs do Ollama, LM Studio ou vLLM.
  4. Confirme que aparece uma requisição com o ID de modelo esperado.
  5. Se possível, desconecte temporariamente a rede pública e repita um prompt seguro somente de leitura.

Verificação de privacidade mostrando as requisições do modelo dentro da estação local

Uma requisição para um modelo local não significa que todo o aplicativo esteja offline. Autenticação, busca remota, indexação de código, servidores MCP e outros recursos podem continuar usando a rede.

Privacidade: código, prompts, logs e telemetria

A inferência local reduz uma exposição importante: o prompt do modelo não precisa ser enviado a um provedor cloud. Isso não protege automaticamente todos os arquivos e ferramentas.

Leia o guia oficial de configuração e o código da versão instalada. Preste atenção a:

  • configurações de telemetria;
  • busca remota e indexação de código;
  • servidores MCP e plugins;
  • aprovação de comandos shell;
  • respeito das ferramentas ao .gitignore;
  • segredos em .env, SSH e histórico do Git.

Nunca coloque uma API key diretamente em um arquivo de configuração que será commitado. Se o servidor local não exige autenticação, omita a chave em vez de adicionar um segredo falso.

Erros comuns

Connection refused

O servidor não está rodando, a porta está errada ou a fronteira de contêiner/WSL faz com que localhost aponte para outro ambiente. Teste /v1/models no mesmo ambiente em que o Grok Build está executando.

Model not found

O valor de model precisa corresponder exatamente ao ID do servidor. O nome amigável pode ser diferente do identificador da API.

Falha nas chamadas de ferramentas

O modelo ou o chat template pode não suportar o formato de chamada de ferramentas esperado pelo Grok Build. Tente um modelo voltado para coding agents e examine o erro original do servidor.

Erros de contexto ou timeout

Reduza context_window até o limite real do modelo, use um repositório ou tarefa menor e permita mais tempo quando o modelo rodar sem GPU.

O streaming para antes do fim

Confirme se o servidor implementa o api_backend selecionado. Antes de depurar o agente, teste um chat normal contra o mesmo endpoint.

Modelos locais versus coding agents na nuvem

FatorGrok Build + modelo localCoding agent na nuvem
RequisiçõesFicam no dispositivo ou endpoint privadoVão para o provedor
QualidadeDepende do modelo e do hardwareNormalmente usa um modelo de fronteira
VelocidadeLimitada pelo processamento localLimitada pela rede e capacidade do provedor
CustoHardware, energia e manutençãoAssinatura ou uso
ContextoLimitado pelo runtime localGeralmente gerenciado pelo provedor
FerramentasPrecisam ser testadas por modeloNormalmente ajustadas para o agente
ControleAltoDepende do provedor

A inferência local é mais interessante quando controle e auditabilidade importam mais que a capacidade máxima do modelo. Claude Code e Codex priorizam modelos de fronteira gerenciados; OpenCode é uma comparação mais próxima quando a flexibilidade do provedor é o ponto principal.

Histórico de versão

DataEscopo verificado
16 de julho de 2026Foram conferidos o anúncio open source da xAI, as instruções do GitHub, o guia de modelos personalizados, a configuração, o exemplo com Ollama e os backends de API. LM Studio e vLLM continuam sendo uma orientação de compatibilidade, não um teste de laboratório nesta revisão.

Conclusão

A inferência local do Grok Build significa conectar o agent harness open source a um servidor de modelos local separado. Não significa que os pesos do Grok 4.5 estejam disponíveis para download.

Comece com a configuração oficial do Ollama, selecione explicitamente o modelo personalizado e prove a requisição nos logs do servidor local. Depois audite os recursos que ainda usam a rede antes de chamar o ambiente de offline ou privado.

Perguntas frequentes

O Grok Build pode usar modelos locais?+

Sim. Você pode adicionar modelos personalizados em ~/.grok/config.toml e conectá-los a endpoints locais compatíveis com OpenAI, incluindo o exemplo oficial com Ollama.

É possível executar o Grok 4.5 localmente?+

Não apenas com o lançamento open source do Grok Build. A xAI publicou o coding agent harness, o CLI, a TUI, as ferramentas e o sistema de extensões, mas não publicou os pesos do modelo Grok 4.5.

O Grok Build funciona com Ollama?+

Sim. O guia oficial de modelos personalizados usa http://localhost:11434/v1. O modelo escolhido ainda precisa ter contexto suficiente e suporte a chamadas de ferramentas.

O Grok Build é totalmente offline?+

Um endpoint de inferência local mantém a inferência do modelo no dispositivo, mas autenticação, busca remota, indexação de código e servidores MCP podem fazer requisições de rede. Audite a configuração antes de chamá-la de totalmente offline.

O Grok Build envia meu código para a nuvem?+

Isso depende do endpoint ativo e dos recursos habilitados. Um endpoint localhost mantém a requisição do modelo local, mas você também deve revisar telemetria, busca remota, indexação, ferramentas e servidores MCP.

LM Studio e vLLM funcionam com o Grok Build?+

Eles podem expor APIs compatíveis com OpenAI, mas a compatibilidade real depende do modelo, do template de chat, do streaming e das chamadas de ferramentas. Teste antes de depender deles.

Qual modelo local devo usar para programação?+

Escolha um modelo voltado para código, que caiba na sua memória, suporte o contexto necessário e produza chamadas de ferramentas com consistência. Comece com um repositório pequeno e uma tarefa reversível.

Todos os artigos

Autor

avatar for Imya AI Team
Imya AI Team

Categorias

  • Product
O que “Grok Build local” realmente significaO que a xAI publicou — e o que não publicouPré-requisitosInstalar o Grok BuildEntender o ~/.grok/config.tomlConectar o Grok Build ao OllamaUsar LM Studio ou vLLMComo provar que a inferência é realmente localPrivacidade: código, prompts, logs e telemetriaErros comunsConnection refusedModel not foundFalha nas chamadas de ferramentasErros de contexto ou timeoutO streaming para antes do fimModelos locais versus coding agents na nuvemHistórico de versãoConclusão

Newsletter

Join the community

Subscribe to our newsletter for the latest news and updates

imya — Gerador de imagens, vídeos e músicas com IA tudo-em-umimya

Gerador de imagens, vídeos e músicas com IA tudo-em-um. Um espaço de trabalho para todas as criações.

Modelos de Imagem com IA

  • Z Image TurboGRÁTIS
  • GPT Image 2
  • Ideogram 4.0
  • Reve 2.0
  • Nano Banana
  • Edição de imagens Qwen Plus
  • Seedream 4.0
  • Nano Banana Pro Official
  • Nano Banana Pro Trial
  • Nano Banana 2
  • Seedream 4.5
  • Seedream 5

Modelos de Vídeo com IA

  • Kling 3.0
  • Google Omni
  • MiniMax H3
  • Seedance 2.5
  • Flux 3EM BREVE
  • Seedance 2.0
  • Sora 2
  • Controle de movimento do Kling 3.0
  • Kling 3.0 Turbo
  • Grok Imagine Video 1.5
  • PixVerse V6: gerador de vídeo com IA

Melhoria de Fotos

  • Remover fundo com IA
  • Trocar fundo com IA
  • Aumentar resolução com IA
  • Restaurar fotos antigas com IA
  • Remover objetos com IA
  • Remover marca-d’água com IA
  • Removedor de marca d’água do Gemini
  • Remover logotipo com IA
  • Remover texto com IA

Retrato e Avatar

  • Gerador de fotos profissionais com IA
  • Avatar de anime com IA
  • Retrato em desenho com IA
  • Mudar cor do cabelo com IA
  • Mudar penteado com IA
  • Troca de rosto com IA

Transferência de Estilo

  • Transformar foto em anime com IA
  • Avatar de anime com IA
  • Transformar foto no estilo Ghibli com IA
  • Transformar foto em desenho com IA
  • Transferência de estilo artístico com IA
  • Foto de viagem no tempo com IA

Foto Criativa

  • Foto de casal com IA
  • Foto de família com IA
  • Foto de casamento com IA
  • Criador de cartões de Dia dos Pais com IA
  • Cartões de Natal com IA
  • Criador de cartões de Dia dos Namorados com IA
  • Criador de cartões de Dia das Mães com IA
  • Montagem de fotos em grupo com IA
  • Criador de fotos 3x4 com IA
  • Design de interiores com IA
  • Provador virtual com IA

Ferramentas Criativas

  • Z Image Turbo
  • Nano Banana
  • Nano Banana 2
  • Seedream 4.5
  • Seedream 5
  • GPT Image 2
  • Flux 2
  • Gerador de logotipos com IA
  • Remover logotipo com IA
  • Tradutor de imagens com IA
  • Design de interiores com IA
  • Mockup de produto com IA

Produto

  • Ferramentas de Imagem com IA
  • Modelos de IA
  • Preços

Empresa

  • Sobre Nós
  • Política de Privacidade
  • Termos de Serviço
  • Fale Conosco

© 2026 imya.ai · Todos os direitos reservados

☀️Claro