imya — 올인원 AI 이미지·영상·음악 생성기imya
템플릿API블로그요금제
홈/블로그/로컬 모델로 Grok Build 사용하는 방법
로컬 모델로 Grok Build 사용하는 방법
2026/07/16

로컬 모델로 Grok Build 사용하는 방법

config.toml로 Grok Build를 Ollama와 OpenAI 호환 엔드포인트에 연결하고, 요청이 로컬에 남는지 확인하는 방법을 설명합니다.

Grok Build는 이제 직접 관리하는 추론 엔드포인트를 가리킬 수 있습니다. 코드, 프롬프트, 모델 비용을 직접 통제하려는 개발자에게 오픈소스 공개의 가장 실용적인 부분입니다.

하지만 먼저 구분해야 합니다. 컴퓨터에서 Grok Build CLI를 실행하는 것과 모델 추론을 로컬에서 실행하는 것은 다릅니다. xAI가 공개한 것은 coding agent harness와 터미널 인터페이스이며 Grok 4.5 모델 가중치는 공개하지 않았습니다.

요약: ~/.grok/config.toml에 커스텀 모델을 추가하고 base_url을 로컬 OpenAI 호환 서버로 지정한 다음 Grok Build에서 해당 모델을 선택하세요. 마지막으로 로컬 서버 로그에서 요청을 확인해야 합니다. Ollama가 공식적으로 가장 명확한 시작점입니다.

“Grok Build 로컬 추론”이 의미하는 것

세 부분을 나눠서 봐야 합니다.

  1. Grok Build는 agent harness입니다. 컨텍스트를 읽고, 도구를 호출하고, 파일을 수정하고, 터미널 UI를 보여줍니다.
  2. 추론 엔드포인트는 모델 요청을 받습니다. xAI나 다른 클라우드일 수도 있고 localhost의 서버일 수도 있습니다.
  3. 모델 가중치가 응답을 만듭니다. Ollama, LM Studio, vLLM을 사용하면 직접 관리하는 하드웨어에서 실행할 수 있습니다.

로컬 추론은 두 번째와 세 번째 부분이 자신의 컴퓨터나 사설 네트워크에 남는다는 뜻입니다. CLI를 설치했다고 요청이 자동으로 로컬에 남는 것은 아닙니다.

Grok Build 요청을 로컬 모델 런타임으로 보내는 구조도

xAI가 공개한 것과 공개하지 않은 것

공식 발표에 따르면 공개된 내용에는 agent loop, 도구, 터미널 UI, skills, plugins, hooks, MCP servers, subagents를 위한 확장 시스템이 포함됩니다. GitHub 저장소에는 CLI/TUI와 agent runtime의 Rust 소스가 있습니다.

덕분에 컨텍스트가 구성되는 방식과 도구 호출을 살펴볼 수 있고, 커스텀 로컬 모델 엔드포인트도 연결할 수 있습니다.

하지만 다운로드할 수 있는 Grok 4.5를 얻는 것은 아닙니다. 이 설정에서 사용하는 로컬 모델은 Ollama나 다른 호환 런타임이 제공하는 별도 모델입니다.

설치 전 준비

  • macOS, Linux 또는 Windows
  • 설치된 Grok Build
  • Ollama 또는 다른 OpenAI 호환 서버
  • RAM/VRAM에 맞는 모델
  • 변경을 쉽게 되돌릴 수 있는 테스트 저장소

로컬 모델의 코딩 성능은 크게 다릅니다. 일반적인 채팅은 잘해도 agent가 요구하는 구조화된 도구 호출에는 실패할 수 있습니다. 처음에는 파일 하나를 읽고 변경을 제안하는 작은 작업부터 시작하세요.

Grok Build 설치

macOS, Linux, Git Bash:

curl -fsSL https://x.ai/cli/install.sh | bash
grok --version

Windows PowerShell:

irm https://x.ai/cli/install.ps1 | iex
grok --version

세 플랫폼 모두 사전 빌드 바이너리를 제공합니다. 소스 빌드는 macOS와 Linux에서 지원되며 Windows 소스 빌드는 best effort입니다.

~/.grok/config.toml 이해하기

커스텀 모델은 [model.*] 섹션에 둡니다. 공식 가이드는 OpenAI Chat Completions, OpenAI Responses, Anthropic Messages 세 백엔드를 지원합니다.

[model.local-coder]
model = "your-model-id"
base_url = "http://localhost:8080/v1"
name = "Local Coder"
api_backend = "chat_completions"
context_window = 32768

[models]
default = "local-coder"
  • model: 서버에 보내는 정확한 모델 ID
  • base_url: 로컬 또는 자체 호스팅 API의 루트
  • name: 모델 선택기에 표시되는 이름
  • api_backend: 요청 프로토콜. 기본값은 Chat Completions
  • context_window: 세션을 압축할 시점을 판단하는 값

context_window는 모델이 실제로 지원하는 값에 맞춰야 합니다. 설정 숫자만 크게 쓴다고 모델의 컨텍스트가 늘어나지는 않습니다.

Ollama 연결

공식 커스텀 모델 가이드는 CodeLlama를 예로 듭니다. 먼저 Ollama를 시작하고 모델을 받습니다.

ollama serve
ollama pull codellama

~/.grok/config.toml에 추가합니다.

[model.ollama-codellama]
model = "codellama"
base_url = "http://localhost:11434/v1"
name = "CodeLlama (Ollama)"

핵심은 /v1입니다. Grok Build는 Ollama의 native generate 엔드포인트가 아니라 OpenAI 호환 API를 사용합니다.

grok models를 실행해 커스텀 항목을 확인하고 다음처럼 선택할 수 있습니다.

grok -p "Summarize this repository without changing files" -m ollama-codellama

TUI에서는 /model ollama-codellama 또는 /m을 사용합니다. 스크롤 영역에 포커스가 있으면 Ctrl+M으로 모델 선택기를 열 수 있습니다.

LM Studio와 vLLM 사용하기

Grok Build는 일반 OpenAI 호환 서버를 지원하므로 LM Studio와 vLLM도 후보입니다. 다만 “OpenAI 호환”이라고 해서 모든 agent 기능이 보장되지는 않습니다.

다음 항목을 확인하세요.

  1. /v1/chat/completions 또는 /v1/responses를 제공하는지
  2. /v1/models가 반환하는 정확한 모델 ID
  3. 스트리밍 응답이 끝까지 완료되는지
  4. 일반 채팅이 아니라 구조화된 도구 호출이 되는지
  5. 실제 컨텍스트 길이와 보수적인 completion 제한
  6. 서버 로그에 필드나 템플릿 오류가 없는지
[model.local-openai]
model = "model-id-from-your-server"
base_url = "http://localhost:1234/v1"
name = "Local OpenAI-Compatible Model"
api_backend = "chat_completions"
context_window = 32768

LM Studio는 보통 1234, vLLM은 8000 포트를 사용합니다. 실제 서버 포트를 우선하세요.

추론이 정말 로컬인지 확인하기

응답이 성공했다고 로컬 요청이 증명되는 것은 아닙니다.

  1. 현재 선택된 모델이 grok-build가 아니라 커스텀 항목인지 확인합니다.
  2. base_url이 localhost, 127.0.0.1 또는 자신이 관리하는 사설 호스트인지 확인합니다.
  3. 작은 프롬프트를 보내면서 Ollama, LM Studio 또는 vLLM 로그를 봅니다.
  4. 예상한 시간과 모델 ID의 요청이 나타나는지 확인합니다.
  5. 가능하다면 잠시 공용 네트워크를 끊고 안전한 읽기 전용 프롬프트를 반복합니다.

모델 요청이 로컬 워크스테이션 안에 남는지 확인하는 프라이버시 그림

로컬 모델 요청과 애플리케이션 전체가 완전 오프라인이라는 것은 다릅니다. 인증, 원격 가져오기, 코드 인덱싱, MCP 등은 여전히 네트워크를 사용할 수 있습니다.

프라이버시: 코드, 프롬프트, 로그, 텔레메트리

로컬 추론은 모델 프롬프트를 클라우드 추론 서비스로 보내지 않아도 된다는 점에서 노출을 줄입니다. 하지만 모든 파일과 도구가 자동으로 보호되는 것은 아닙니다.

공식 설정 가이드와 설치한 버전의 소스를 확인하세요.

  • 텔레메트리 설정
  • 원격 가져오기와 코드 인덱싱
  • MCP 서버와 플러그인
  • shell 명령 승인 동작
  • 도구가 .gitignore를 존중하는지
  • .env, SSH 설정, Git 기록의 비밀 정보

API key를 커밋된 설정에 직접 넣지 마세요. 로컬 서버에 인증이 필요하지 않다면 가짜 secret을 추가하지 말고 key를 생략하세요.

자주 발생하는 오류

Connection refused

서버가 실행 중이 아니거나 포트가 틀렸거나, 컨테이너/WSL 경계 때문에 localhost가 다른 환경을 가리키는 경우입니다. Grok Build가 실행되는 동일한 환경에서 /v1/models를 테스트하세요.

Model not found

model 값은 서버의 모델 ID와 정확히 일치해야 합니다. 표시 이름과 API ID가 다를 수 있습니다.

도구 호출 실패

모델이나 chat template이 Grok Build가 기대하는 도구 호출 형식을 지원하지 않을 수 있습니다. agent coding에 적합한 모델을 시도하고 서버의 원본 오류를 확인하세요.

컨텍스트 또는 타임아웃 오류

context_window를 모델의 실제 한계로 낮추고 저장소나 작업을 줄이세요. GPU 없이 실행한다면 더 긴 추론 시간을 허용하세요.

스트리밍이 중간에 멈춤

서버가 선택한 api_backend를 구현하는지 확인하세요. 먼저 같은 엔드포인트로 일반 채팅을 테스트하세요.

로컬 모델과 클라우드 coding agent 비교

요소Grok Build + 로컬 모델클라우드 coding agent
모델 요청내 장치 또는 사설 엔드포인트공급자 엔드포인트로 전송
품질모델과 하드웨어에 따라 다름보통 최신 모델 사용
속도로컬 연산 능력에 제한네트워크와 공급자 용량에 제한
비용하드웨어, 전력, 유지보수구독 또는 사용량 과금
컨텍스트로컬 런타임의 제약보통 공급자가 관리
도구 호출모델별 테스트 필요agent에 맞게 조정된 경우가 많음
통제권높음공급자에 따라 다름

최고의 모델 성능보다 통제와 검증 가능성을 중시한다면 로컬 추론이 매력적입니다. Claude Code와 Codex는 관리형 최신 모델에 가깝고, OpenCode는 공급자 선택의 유연성 면에서 더 가까운 비교 대상입니다.

버전 기록

날짜확인 범위
2026년 7월 16일xAI 발표, GitHub 설치 안내, 커스텀 모델 가이드, 설정 가이드, Ollama 예시와 API 백엔드를 확인했습니다. LM Studio와 vLLM은 호환성 안내이며 이 버전에서 실기 통과를 의미하지 않습니다.

결론

Grok Build 로컬 추론은 오픈소스 agent harness를 별도의 로컬 모델 서버에 연결하는 것입니다. Grok 4.5 가중치를 다운로드할 수 있다는 뜻은 아닙니다.

먼저 공식 Ollama 설정으로 시작하고 커스텀 모델을 명시적으로 선택한 뒤 로컬 서버 로그에서 요청을 확인하세요. 그 다음 선택적 네트워크 기능을 감사한 후에야 이 환경을 오프라인 또는 프라이버시 중심이라고 설명하는 것이 안전합니다.

자주 묻는 질문

Grok Build에서 로컬 모델을 사용할 수 있나요?+

가능합니다. ~/.grok/config.toml에 커스텀 모델을 추가하고 Ollama 예시를 포함한 로컬 OpenAI 호환 엔드포인트에 연결할 수 있습니다.

Grok 4.5를 로컬에서 실행할 수 있나요?+

Grok Build 오픈소스 릴리스만으로는 불가능합니다. xAI가 공개한 것은 coding agent harness, CLI, TUI, 도구와 확장 시스템이며 Grok 4.5 모델 가중치는 공개되지 않았습니다.

Grok Build는 Ollama를 지원하나요?+

지원합니다. 공식 커스텀 모델 예시는 http://localhost:11434/v1을 사용합니다. 선택한 Ollama 모델이 충분한 컨텍스트와 도구 호출 기능을 갖췄는지는 별도로 확인해야 합니다.

Grok Build는 완전히 오프라인인가요?+

로컬 추론 엔드포인트는 모델 추론을 장치 안에 둘 수 있지만 인증, 원격 가져오기, 코드 인덱싱, MCP 같은 기능은 네트워크를 사용할 수 있습니다. 감사하기 전에는 완전 오프라인이라고 부르지 마세요.

Grok Build가 제 코드를 업로드하나요?+

활성 모델 엔드포인트와 기능에 따라 다릅니다. localhost 추론을 사용해도 텔레메트리, 원격 가져오기, 코드 인덱싱, 도구와 MCP 서버를 확인해야 합니다.

LM Studio와 vLLM을 Grok Build에서 사용할 수 있나요?+

둘 다 OpenAI 호환 API를 제공할 수 있지만 스트리밍, 채팅 템플릿, 도구 호출이 실제로 작동하는지는 모델과 서버에 따라 다릅니다. 의존하기 전에 테스트하세요.

코딩에 어떤 로컬 모델을 사용해야 하나요?+

코딩 작업에 적합하고 필요한 컨텍스트 길이와 안정적인 도구 호출을 지원하는 모델을 선택하세요. 먼저 작은 저장소와 되돌릴 수 있는 작업에서 테스트하세요.

모든 게시글

작성자

avatar for Imya AI Team
Imya AI Team

카테고리

  • Product
“Grok Build 로컬 추론”이 의미하는 것xAI가 공개한 것과 공개하지 않은 것설치 전 준비Grok Build 설치~/.grok/config.toml 이해하기Ollama 연결LM Studio와 vLLM 사용하기추론이 정말 로컬인지 확인하기프라이버시: 코드, 프롬프트, 로그, 텔레메트리자주 발생하는 오류Connection refusedModel not found도구 호출 실패컨텍스트 또는 타임아웃 오류스트리밍이 중간에 멈춤로컬 모델과 클라우드 coding agent 비교버전 기록결론

Newsletter

Join the community

Subscribe to our newsletter for the latest news and updates

imya — 올인원 AI 이미지·영상·음악 생성기imya

올인원 AI 이미지·영상·음악 생성기. 모든 창작 결과물을 위한 단 하나의 워크스페이스.

AI 이미지 모델

  • Z Image Turbo무료
  • GPT Image 2
  • Ideogram 4.0
  • Reve 2.0
  • Nano Banana
  • Qwen 이미지 편집 Plus
  • Seedream 4.0
  • Nano Banana Pro Official
  • Nano Banana Pro Trial
  • Nano Banana 2
  • Seedream 4.5
  • Seedream 5

AI 영상 모델

  • Kling 3.0
  • Google Omni
  • MiniMax H3
  • Seedance 2.5
  • Flux 3공개 예정
  • Seedance 2.0
  • Sora 2
  • Kling 3.0 모션 컨트롤
  • Kling 3.0 Turbo
  • Grok Imagine Video 1.5
  • PixVerse V6 AI 영상 생성기

사진 보정

  • AI 배경 제거
  • AI 배경 변경
  • AI 이미지 고화질화
  • AI 오래된 사진 복원
  • AI 객체 제거
  • AI 워터마크 제거
  • Gemini 워터마크 제거기
  • AI 로고 제거
  • AI 텍스트 제거

초상화 및 아바타

  • AI 프로필 사진 생성기
  • AI 애니메이션 아바타
  • AI 카툰 초상화
  • AI 헤어 컬러 변경
  • AI 헤어스타일 변경
  • AI 얼굴 바꾸기

스타일 변환

  • AI 사진 애니메이션 변환
  • AI 애니메이션 아바타
  • AI 사진 지브리 풍 변환
  • AI 사진 스케치 변환
  • AI 아트 스타일 변환
  • AI 타임트래블 사진

창의적인 사진

  • AI 커플 사진
  • AI 가족 사진
  • AI 웨딩 사진
  • AI 아버지의 날 카드 만들기
  • AI 크리스마스 카드
  • AI 밸런타인 카드 만들기
  • AI 어버이날 카드 만들기
  • AI 단체 사진 합성
  • AI 증명사진 만들기
  • AI 룸 디자인
  • AI 가상 피팅

크리에이티브 도구

  • Z Image Turbo
  • Nano Banana
  • Nano Banana 2
  • Seedream 4.5
  • Seedream 5
  • GPT Image 2
  • Flux 2
  • AI 로고 생성기
  • AI 로고 제거
  • AI 이미지 번역
  • AI 룸 디자인
  • AI 제품 목업

제품

  • AI 이미지 도구
  • AI 모델
  • 요금제

회사

  • 회사 소개
  • 개인정보 처리방침
  • 서비스 약관
  • 문의하기

© 2026 imya.ai · 모든 권리 보유

☀️라이트