No. 18 · Agent Tooling · npm · v0.1.2

로컬 Ollama 모델로
MCP 서버 여러 개를 씁니다.

gemma 같은 로컬 모델은 똑똑하지만 혼자서는 무언가를 찾아보거나 파일을 다루지 못합니다. 도구를 제공해야 하는데, Ollama는 MCP 도구를 호출할 수 없고 MCP 서버는 Ollama와 직접 통신하지 못합니다. 이 호스트가 Ollama와 MCP 서버를 연결합니다. MCP 서버를 등록하면 모델 하나가 도구를 선택하고, 호출하고, 실제 결과로 답합니다. 추론은 100% 로컬이라 내부망·오프라인에서 쓰실 수 있습니다.

GitHub Stars★ 22
Versionv0.1.2 · npm
Dependencies1 (@modelcontextprotocol/sdk)
RequiresNode 20+ · Ollama · tools 지원 모델
LicenseMIT
시작하기 GitHub ↗
01원리

"도로교통법 소관 부처가 어디야?"가
법령 검색 도구 호출이 됩니다.

사용자: "도로교통법 소관 부처가 어디야?" │ ▼ [Ollama 모델] ──"법령 검색 도구 써"──▶ [ollama-mcp-host] ──▶ [korean-law-mcp] ──▶ 법제처 ▲ │ └────────"경찰청입니다"───────────────┘
1.1

모델 하나, 도구 여럿

한 대화에서 법령을 찾고 문서를 생성합니다. README 예시는 korean-law-mcpkordoc이지만 stdio MCP 서버라면 무엇이든 연결할 수 있습니다.

1.2

gemma의 1번 함정을 대신 처리

gemma3·4는 thinking 모드가 켜지면 속으로 추론만 하고 도구 호출을 내보내지 않는 일이 잦습니다. "등록했는데 도구를 안 부른다"는 문제의 가장 흔한 원인입니다. 호스트가 항상 think: false를 보내 도구 호출이 안정적으로 이루어지도록 합니다.

1.3

CLI와 라이브러리

터미널 대화형 채팅으로 쓰거나, import { McpHost }로 코드에서 불러올 수 있습니다. Ollama는 Node 내장 fetch로 호출하고 런타임 의존성은 하나뿐입니다.

1.4

망분리 환경 안내

Ollama 서버 한 대를 두고 사무용 PC가 네트워크로 접속하는 구성(전략 A)에서는 서버만 모델 구동에 필요한 사양을 갖추면 됩니다. 오프라인 미러링 절차는 README에 정리해 두었습니다.

02gemma4:e4b 최소 사양

모델 파일은 9.6GB이고,
실제 상주 메모리는 3.3GB입니다.

최소권장비고
디스크12GB20GB모델 파일 약 9.6GB
RAM8GB16GBCPU 전용일 때 모델을 메모리에 올릴 크기
GPU불필요Apple Silicon 또는 VRAM 6GB+CPU로도 사용할 수 있지만 속도는 느립니다
e4b는 필요한 파라미터만 활성화해서 실측 상주 메모리가 3.3GB입니다(Apple M5·32GB RAM, 32K 컨텍스트). ollama show의 Capabilities에 tools가 있어야 도구 호출이 됩니다.
03시작하기

Ollama, 모델, MCP 서버.
세 가지만 있으면 됩니다.

1 · 2 · Ollama와 모델
ollama pull gemma4:e4b ollama serve ollama show gemma4:e4b # Capabilities 에 tools 확인
3 · 호스트
npx ollama-mcp-host # MCP 서버 경로를 등록하면 대화형 채팅 시작