
로컬 모델로 Grok Build 사용하는 방법
config.toml로 Grok Build를 Ollama와 OpenAI 호환 엔드포인트에 연결하고, 요청이 로컬에 남는지 확인하는 방법을 설명합니다.
Grok Build는 이제 직접 관리하는 추론 엔드포인트를 가리킬 수 있습니다. 코드, 프롬프트, 모델 비용을 직접 통제하려는 개발자에게 오픈소스 공개의 가장 실용적인 부분입니다.
하지만 먼저 구분해야 합니다. 컴퓨터에서 Grok Build CLI를 실행하는 것과 모델 추론을 로컬에서 실행하는 것은 다릅니다. xAI가 공개한 것은 coding agent harness와 터미널 인터페이스이며 Grok 4.5 모델 가중치는 공개하지 않았습니다.
요약: ~/.grok/config.toml에 커스텀 모델을 추가하고 base_url을 로컬 OpenAI 호환 서버로 지정한 다음 Grok Build에서 해당 모델을 선택하세요. 마지막으로 로컬 서버 로그에서 요청을 확인해야 합니다. Ollama가 공식적으로 가장 명확한 시작점입니다.
“Grok Build 로컬 추론”이 의미하는 것
세 부분을 나눠서 봐야 합니다.
- Grok Build는 agent harness입니다. 컨텍스트를 읽고, 도구를 호출하고, 파일을 수정하고, 터미널 UI를 보여줍니다.
- 추론 엔드포인트는 모델 요청을 받습니다. xAI나 다른 클라우드일 수도 있고
localhost의 서버일 수도 있습니다. - 모델 가중치가 응답을 만듭니다. Ollama, LM Studio, vLLM을 사용하면 직접 관리하는 하드웨어에서 실행할 수 있습니다.
로컬 추론은 두 번째와 세 번째 부분이 자신의 컴퓨터나 사설 네트워크에 남는다는 뜻입니다. CLI를 설치했다고 요청이 자동으로 로컬에 남는 것은 아닙니다.

xAI가 공개한 것과 공개하지 않은 것
공식 발표에 따르면 공개된 내용에는 agent loop, 도구, 터미널 UI, skills, plugins, hooks, MCP servers, subagents를 위한 확장 시스템이 포함됩니다. GitHub 저장소에는 CLI/TUI와 agent runtime의 Rust 소스가 있습니다.
덕분에 컨텍스트가 구성되는 방식과 도구 호출을 살펴볼 수 있고, 커스텀 로컬 모델 엔드포인트도 연결할 수 있습니다.
하지만 다운로드할 수 있는 Grok 4.5를 얻는 것은 아닙니다. 이 설정에서 사용하는 로컬 모델은 Ollama나 다른 호환 런타임이 제공하는 별도 모델입니다.
설치 전 준비
- macOS, Linux 또는 Windows
- 설치된 Grok Build
- Ollama 또는 다른 OpenAI 호환 서버
- RAM/VRAM에 맞는 모델
- 변경을 쉽게 되돌릴 수 있는 테스트 저장소
로컬 모델의 코딩 성능은 크게 다릅니다. 일반적인 채팅은 잘해도 agent가 요구하는 구조화된 도구 호출에는 실패할 수 있습니다. 처음에는 파일 하나를 읽고 변경을 제안하는 작은 작업부터 시작하세요.
Grok Build 설치
macOS, Linux, Git Bash:
curl -fsSL https://x.ai/cli/install.sh | bash
grok --versionWindows PowerShell:
irm https://x.ai/cli/install.ps1 | iex
grok --version세 플랫폼 모두 사전 빌드 바이너리를 제공합니다. 소스 빌드는 macOS와 Linux에서 지원되며 Windows 소스 빌드는 best effort입니다.
~/.grok/config.toml 이해하기
커스텀 모델은 [model.*] 섹션에 둡니다. 공식 가이드는 OpenAI Chat Completions, OpenAI Responses, Anthropic Messages 세 백엔드를 지원합니다.
[model.local-coder]
model = "your-model-id"
base_url = "http://localhost:8080/v1"
name = "Local Coder"
api_backend = "chat_completions"
context_window = 32768
[models]
default = "local-coder"model: 서버에 보내는 정확한 모델 IDbase_url: 로컬 또는 자체 호스팅 API의 루트name: 모델 선택기에 표시되는 이름api_backend: 요청 프로토콜. 기본값은 Chat Completionscontext_window: 세션을 압축할 시점을 판단하는 값
context_window는 모델이 실제로 지원하는 값에 맞춰야 합니다. 설정 숫자만 크게 쓴다고 모델의 컨텍스트가 늘어나지는 않습니다.
Ollama 연결
공식 커스텀 모델 가이드는 CodeLlama를 예로 듭니다. 먼저 Ollama를 시작하고 모델을 받습니다.
ollama serve
ollama pull codellama~/.grok/config.toml에 추가합니다.
[model.ollama-codellama]
model = "codellama"
base_url = "http://localhost:11434/v1"
name = "CodeLlama (Ollama)"핵심은 /v1입니다. Grok Build는 Ollama의 native generate 엔드포인트가 아니라 OpenAI 호환 API를 사용합니다.
grok models를 실행해 커스텀 항목을 확인하고 다음처럼 선택할 수 있습니다.
grok -p "Summarize this repository without changing files" -m ollama-codellamaTUI에서는 /model ollama-codellama 또는 /m을 사용합니다. 스크롤 영역에 포커스가 있으면 Ctrl+M으로 모델 선택기를 열 수 있습니다.
LM Studio와 vLLM 사용하기
Grok Build는 일반 OpenAI 호환 서버를 지원하므로 LM Studio와 vLLM도 후보입니다. 다만 “OpenAI 호환”이라고 해서 모든 agent 기능이 보장되지는 않습니다.
다음 항목을 확인하세요.
/v1/chat/completions또는/v1/responses를 제공하는지/v1/models가 반환하는 정확한 모델 ID- 스트리밍 응답이 끝까지 완료되는지
- 일반 채팅이 아니라 구조화된 도구 호출이 되는지
- 실제 컨텍스트 길이와 보수적인 completion 제한
- 서버 로그에 필드나 템플릿 오류가 없는지
[model.local-openai]
model = "model-id-from-your-server"
base_url = "http://localhost:1234/v1"
name = "Local OpenAI-Compatible Model"
api_backend = "chat_completions"
context_window = 32768LM Studio는 보통 1234, vLLM은 8000 포트를 사용합니다. 실제 서버 포트를 우선하세요.
추론이 정말 로컬인지 확인하기
응답이 성공했다고 로컬 요청이 증명되는 것은 아닙니다.
- 현재 선택된 모델이
grok-build가 아니라 커스텀 항목인지 확인합니다. base_url이localhost,127.0.0.1또는 자신이 관리하는 사설 호스트인지 확인합니다.- 작은 프롬프트를 보내면서 Ollama, LM Studio 또는 vLLM 로그를 봅니다.
- 예상한 시간과 모델 ID의 요청이 나타나는지 확인합니다.
- 가능하다면 잠시 공용 네트워크를 끊고 안전한 읽기 전용 프롬프트를 반복합니다.

로컬 모델 요청과 애플리케이션 전체가 완전 오프라인이라는 것은 다릅니다. 인증, 원격 가져오기, 코드 인덱싱, MCP 등은 여전히 네트워크를 사용할 수 있습니다.
프라이버시: 코드, 프롬프트, 로그, 텔레메트리
로컬 추론은 모델 프롬프트를 클라우드 추론 서비스로 보내지 않아도 된다는 점에서 노출을 줄입니다. 하지만 모든 파일과 도구가 자동으로 보호되는 것은 아닙니다.
공식 설정 가이드와 설치한 버전의 소스를 확인하세요.
- 텔레메트리 설정
- 원격 가져오기와 코드 인덱싱
- MCP 서버와 플러그인
- shell 명령 승인 동작
- 도구가
.gitignore를 존중하는지 .env, SSH 설정, Git 기록의 비밀 정보
API key를 커밋된 설정에 직접 넣지 마세요. 로컬 서버에 인증이 필요하지 않다면 가짜 secret을 추가하지 말고 key를 생략하세요.
자주 발생하는 오류
Connection refused
서버가 실행 중이 아니거나 포트가 틀렸거나, 컨테이너/WSL 경계 때문에 localhost가 다른 환경을 가리키는 경우입니다. Grok Build가 실행되는 동일한 환경에서 /v1/models를 테스트하세요.
Model not found
model 값은 서버의 모델 ID와 정확히 일치해야 합니다. 표시 이름과 API ID가 다를 수 있습니다.
도구 호출 실패
모델이나 chat template이 Grok Build가 기대하는 도구 호출 형식을 지원하지 않을 수 있습니다. agent coding에 적합한 모델을 시도하고 서버의 원본 오류를 확인하세요.
컨텍스트 또는 타임아웃 오류
context_window를 모델의 실제 한계로 낮추고 저장소나 작업을 줄이세요. GPU 없이 실행한다면 더 긴 추론 시간을 허용하세요.
스트리밍이 중간에 멈춤
서버가 선택한 api_backend를 구현하는지 확인하세요. 먼저 같은 엔드포인트로 일반 채팅을 테스트하세요.
로컬 모델과 클라우드 coding agent 비교
| 요소 | Grok Build + 로컬 모델 | 클라우드 coding agent |
|---|---|---|
| 모델 요청 | 내 장치 또는 사설 엔드포인트 | 공급자 엔드포인트로 전송 |
| 품질 | 모델과 하드웨어에 따라 다름 | 보통 최신 모델 사용 |
| 속도 | 로컬 연산 능력에 제한 | 네트워크와 공급자 용량에 제한 |
| 비용 | 하드웨어, 전력, 유지보수 | 구독 또는 사용량 과금 |
| 컨텍스트 | 로컬 런타임의 제약 | 보통 공급자가 관리 |
| 도구 호출 | 모델별 테스트 필요 | agent에 맞게 조정된 경우가 많음 |
| 통제권 | 높음 | 공급자에 따라 다름 |
최고의 모델 성능보다 통제와 검증 가능성을 중시한다면 로컬 추론이 매력적입니다. Claude Code와 Codex는 관리형 최신 모델에 가깝고, OpenCode는 공급자 선택의 유연성 면에서 더 가까운 비교 대상입니다.
버전 기록
| 날짜 | 확인 범위 |
|---|---|
| 2026년 7월 16일 | xAI 발표, GitHub 설치 안내, 커스텀 모델 가이드, 설정 가이드, Ollama 예시와 API 백엔드를 확인했습니다. LM Studio와 vLLM은 호환성 안내이며 이 버전에서 실기 통과를 의미하지 않습니다. |
결론
Grok Build 로컬 추론은 오픈소스 agent harness를 별도의 로컬 모델 서버에 연결하는 것입니다. Grok 4.5 가중치를 다운로드할 수 있다는 뜻은 아닙니다.
먼저 공식 Ollama 설정으로 시작하고 커스텀 모델을 명시적으로 선택한 뒤 로컬 서버 로그에서 요청을 확인하세요. 그 다음 선택적 네트워크 기능을 감사한 후에야 이 환경을 오프라인 또는 프라이버시 중심이라고 설명하는 것이 안전합니다.
자주 묻는 질문
Grok Build에서 로컬 모델을 사용할 수 있나요?
가능합니다. ~/.grok/config.toml에 커스텀 모델을 추가하고 Ollama 예시를 포함한 로컬 OpenAI 호환 엔드포인트에 연결할 수 있습니다.
Grok 4.5를 로컬에서 실행할 수 있나요?
Grok Build 오픈소스 릴리스만으로는 불가능합니다. xAI가 공개한 것은 coding agent harness, CLI, TUI, 도구와 확장 시스템이며 Grok 4.5 모델 가중치는 공개되지 않았습니다.
Grok Build는 Ollama를 지원하나요?
지원합니다. 공식 커스텀 모델 예시는 http://localhost:11434/v1을 사용합니다. 선택한 Ollama 모델이 충분한 컨텍스트와 도구 호출 기능을 갖췄는지는 별도로 확인해야 합니다.
Grok Build는 완전히 오프라인인가요?
로컬 추론 엔드포인트는 모델 추론을 장치 안에 둘 수 있지만 인증, 원격 가져오기, 코드 인덱싱, MCP 같은 기능은 네트워크를 사용할 수 있습니다. 감사하기 전에는 완전 오프라인이라고 부르지 마세요.
Grok Build가 제 코드를 업로드하나요?
활성 모델 엔드포인트와 기능에 따라 다릅니다. localhost 추론을 사용해도 텔레메트리, 원격 가져오기, 코드 인덱싱, 도구와 MCP 서버를 확인해야 합니다.
LM Studio와 vLLM을 Grok Build에서 사용할 수 있나요?
둘 다 OpenAI 호환 API를 제공할 수 있지만 스트리밍, 채팅 템플릿, 도구 호출이 실제로 작동하는지는 모델과 서버에 따라 다릅니다. 의존하기 전에 테스트하세요.
코딩에 어떤 로컬 모델을 사용해야 하나요?
코딩 작업에 적합하고 필요한 컨텍스트 길이와 안정적인 도구 호출을 지원하는 모델을 선택하세요. 먼저 작은 저장소와 되돌릴 수 있는 작업에서 테스트하세요.
