gemma 같은 로컬 모델은 똑똑하지만 혼자서는 무언가를 찾아보거나 파일을 다루지 못합니다. 도구를 제공해야 하는데, Ollama는 MCP 도구를 호출할 수 없고 MCP 서버는 Ollama와 직접 통신하지 못합니다. 이 호스트가 Ollama와 MCP 서버를 연결합니다. MCP 서버를 등록하면 모델 하나가 도구를 선택하고, 호출하고, 실제 결과로 답합니다. 추론은 100% 로컬이라 내부망·오프라인에서 쓰실 수 있습니다.
한 대화에서 법령을 찾고 문서를 생성합니다. README 예시는 korean-law-mcp와 kordoc이지만 stdio MCP 서버라면 무엇이든 연결할 수 있습니다.
gemma3·4는 thinking 모드가 켜지면 속으로 추론만 하고 도구 호출을 내보내지 않는 일이 잦습니다. "등록했는데 도구를 안 부른다"는 문제의 가장 흔한 원인입니다. 호스트가 항상 think: false를 보내 도구 호출이 안정적으로 이루어지도록 합니다.
터미널 대화형 채팅으로 쓰거나, import { McpHost }로 코드에서 불러올 수 있습니다. Ollama는 Node 내장 fetch로 호출하고 런타임 의존성은 하나뿐입니다.
Ollama 서버 한 대를 두고 사무용 PC가 네트워크로 접속하는 구성(전략 A)에서는 서버만 모델 구동에 필요한 사양을 갖추면 됩니다. 오프라인 미러링 절차는 README에 정리해 두었습니다.
| 최소 | 권장 | 비고 | |
|---|---|---|---|
| 디스크 | 12GB | 20GB | 모델 파일 약 9.6GB |
| RAM | 8GB | 16GB | CPU 전용일 때 모델을 메모리에 올릴 크기 |
| GPU | 불필요 | Apple Silicon 또는 VRAM 6GB+ | CPU로도 사용할 수 있지만 속도는 느립니다 |
ollama show의 Capabilities에 tools가 있어야 도구 호출이 됩니다.