Mac 로컬 LLM
기준일: 2026-07-26
난이도: 중급
공식 기준: Local LLMs on Mac
개요
macOS(Apple Silicon)에서 llama.cpp / MLX 등으로 로컬 OpenAI 호환 LLM을 띄우고 Hermes에 연결하는 가이드입니다.
핵심 개념
| 항목 | 설명 |
|---|---|
| OpenAI-compatible server | /v1/chat/completions 제공 |
| Unified memory | 통합 메모리 예산 (모델+KV+OS) |
| Quantization | Q4/Q5 등 VRAM·속도 트레이드오프 |
| Tool calling | 로컬 모델의 툴콜 품질 편차 |
| Hermes provider | custom base URL + API key 더미 |
상세
언제 로컬인가
- 데이터 로컬 유지
- 장기 실행 비용 절감
- 오프라인 실험
한계
- 소형 모델 툴콜·긴 컨텍스트 품질
- 멀티모달/비전 제한
- 배터리·발열
설정 흐름
- llama.cpp 또는 MLX 서버 기동
- 헬스체크
curl localhost:.../v1/models - Hermes provider를 해당 base URL로
hermes chat스모크 + 간단 tool 테스트
# 개념: custom OpenAI-compatible endpoint
모델 선택 팁
- 툴 사용: tool-call 파인튠/이력이 있는 모델
- 코딩: 코드 특화 가중치
- 컨텍스트: 로컬 RAM에 맞는 창 크기
벤치·튜닝
- 토큰/s, 첫 토큰 지연
- 동시 게이트웨이 부하 시 큐잉
- 주 모델 로컬 + 보조 요약 클라우드 하이브리드 가능
체크리스트
- 공식 원문과 명령·설정 키를 대조했다
- 로컬/
config.yaml/.env에서 재현 경로를 확인했다 - 권한·allowlist·시크릿 노출을 점검했다
- 실패 시 롤백·비활성화 방법을 알고 있다
다음 단계
기준일: 2026-07-26 — 공식 문서 동기화 코퍼스