Pexels photo 30469970

뮤즈 글리머 30B 로컬 실행 — 32GB면 돌아간다

📌 핵심 요약메타 뮤즈 글리머 30B를 내 PC에서 돌리는 데 필요한 실제 메모리, 파일별 용량, RTX 5090 기준 초당 233토큰이라는 공식 속도, 그리고 반드시 켜야 하는 실행 옵션을 공식 모델 카드 기준으로 정리했습니다.

메타가 2026년 8월 공개한 뮤즈 글리머(Muse Glimmer) 30B는 “클라우드 없이 내 컴퓨터에서 상시 돌아가는 에이전트”를 정면으로 겨냥한 오픈 모델입니다.

결론부터 말하면 RAM(또는 VRAM) 32GB면 공식 4비트로 무난하게 돌아가고, 24GB면 16.76GB짜리 경량본이 대상이며, 16GB는 이 모델의 사정권이 아닙니다. LM Studio가 안내하는 최소치 26GB와 파일 용량 16.76GB가 어긋나 보이는 건 KV 캐시·비전 인코더·드래프터가 모델 위에 더 얹히기 때문입니다. 아래에서 파일별 실제 용량, 속도, 그리고 반드시 켜야 하는 실행 옵션을 정리합니다.

뮤즈 글리머 30B는 어떤 모델인가

LM Studio 모델 페이지 설명에 따르면 뮤즈 글리머는 자율 에이전트 작업을 목적으로 설계된 30B급 오픈 모델로, 멀티스텝 추론·안정적인 툴 사용·멀티모달 이해·실패 복구를 하나의 모델에 묶었습니다. 단순한 대화형 모델이 아니라, 함수 스키마를 따라 여러 단계를 진행하다가 툴 호출이 실패하면 원인을 진단하고 재시도하는 흐름을 전제로 만들어졌다는 점이 핵심입니다.

공식 스펙 요약

항목 내용
아키텍처 밀집(dense) 인과 트랜스포머, 약 29.6B 파라미터
비전 인코더 1.8B 파라미터(전용 퍼셉션 인코더, 텍스트·이미지 교차 입력)
컨텍스트 131,072 토큰 이상
추론 강도 low / medium / high / xhigh 4단계 조절
다국어 100개 이상 언어 학습
배포 형식 BF16 세이프텐서 + 공식 GGUF(4비트 양자화 2종: 16.76 GB / 19.65 GB)
에이전트 스캐폴드 OpenClaw, Hermes Agent 등 오케스트레이션 패턴 호환

메타는 24GB·32GB 소비자 하드웨어를 겨냥한 4비트 양자화 2종을 함께 제공하며, 한 번의 순전파로 16토큰 블록을 통째로 제안하고 본 모델이 병렬 검증하는 경량 DFlash 스펙큘레이티브 디코딩 드래프터도 같이 배포합니다.

실제 속도는 얼마나 나오나

공식 모델 카드가 배치 크기 1, 그리디 디코딩 조건으로 직접 측정치를 공개했습니다. 혼자 쓰는 사람이 체감하는 속도가 바로 이 조건입니다(K-Quant-17GB + 양자화 드래프터 기준, 맥은 ExecuTorch·RTX는 llama.cpp 로 측정).

장비 드래프터 없이 DFlash 적용 배속
Nvidia RTX 5090 74.9 tok/s 233.4 tok/s 3.1배
Apple M5 Max 26.6 tok/s 50.2 tok/s 1.8배
Apple M4 Max 23.7 tok/s 37.8 tok/s 1.5배
DFlash 드래프터를 붙이면 RTX 5090에서 3.1배
233.4tok/s

RTX 5090

50.2tok/s

M5 Max

37.8tok/s

M4 Max

  1. RTX 5090233.4tok/s
  2. M5 Max50.2tok/s
  3. M4 Max37.8tok/s

맥북 M4 Max에서도 초당 수십 토큰이면 대화는 매끄럽게 흘러갑니다. 다만 드래프터를 안 붙이면 손해가 큽니다 — 같은 장비에서 1.5~3.1배가 그냥 날아갑니다.

내 PC에서 돌아갈까 — 양자화별 용량

먼저 파일 용량과 필요 메모리는 다릅니다. LM Studio는 가장 작은 뮤즈 글리머 실행에 최소 26GB RAM을 안내하는데, 정작 공식 4비트 파일은 16.76GB입니다. 차이는 KV 캐시와 비전 인코더, 드래프터가 모델 위에 더 얹히기 때문입니다. 공식 카드는 언어 모델을 20GB 아래로 압축해 KV 캐시·퍼셉션 인코더·드래프터가 24GB 또는 32GB 안에서 동시에 돌아가도록 맞췄다고 설명합니다.

공식 GGUF (메타 배포)

파일 용량 용도
muse-glimmer-30B-kquant-17gb.gguf 16.76 GB 24GB 하드웨어 겨냥
muse-glimmer-30B-kquant-dynamic.gguf 19.65 GB 32GB 하드웨어 겨냥
mmproj-kquant.gguf 1.40 GB 비전 프로젝터(이미지 입력용)
dflash-kquant.gguf 1.63 GB DFlash 드래프터(속도 3배)

멀티모달과 속도 가속을 쓰려면 본체 하나만으로는 안 되고 mmproj·dflash를 같이 받아야 합니다. 위 속도표의 233 tok/s도 본체 + 드래프터 조합에서 나온 숫자입니다.

커뮤니티 GGUF — 더 잘게 쪼갠 선택지

공식 배포는 4비트 2종뿐이라, 그 사이나 아래위를 원하면 커뮤니티 빌드를 씁니다.

Q4_K_M(16.94GB)과 Q8_0(29.61GB)은 12.7GB 차이
29.61GB

Q8_0

22.87GB

Q6_K

19.81GB

Q5_K_M

16.94GB

Q4_K_M

15.34GB

IQ4_XS

12.82GB

IQ3_M

  1. Q8_029.61GB
  2. Q6_K22.87GB
  3. Q5_K_M19.81GB
  4. Q4_K_M16.94GB
  5. IQ4_XS15.34GB
  6. IQ3_M12.82GB
파일 용량 메모리 기준 현실적인 대상
Q8_0 29.61 GB 48GB 이상
Q6_K 22.87 GB 32GB (빠듯)
Q5_K_M 19.81 GB 32GB
Q4_K_M 16.94 GB 24~32GB, 무난한 기본값
IQ4_XS 15.34 GB 24GB
IQ3_M 12.82 GB 16GB 도전 시 최후의 선택

⚠️ 용량 표를 볼 때 주의할 점 — 뮤즈 글리머는 공개 다음 날 GGUF 리포가 여러 개 만들어졌는데, 그중에는 README에 파일 목록과 용량만 적어 두고 실제 파일은 하나도 올라오지 않은 리포도 있습니다(2026-08-11 확인 시점 기준). 게다가 같은 이름의 양자화라도 리포마다 용량이 조금씩 다릅니다. 위 표는 실제로 파일이 올라와 있는 NANI-Nithin/Muse-Glimmer-30B-GGUF 기준이며, 받기 전에 리포의 Files 탭에서 파일이 실재하는지와 실제 용량을 반드시 확인하세요.

커뮤니티 빌드는 대체로 텍스트 전용이라 mmproj와 DFlash 드래프터가 빠져 있습니다. 이미지 입력이나 속도 가속이 필요하면 공식 리포에서 그 둘을 따로 받아 --mmproj-md … -ngld 99 로 붙이면 됩니다.

실행 전 반드시 확인할 3가지

1. llama.cpp 빌드 b10353 이상: muse-glimmer 지원은 2026년 8월 10일 PR #26841로 머지돼 릴리스 b10353에 처음 실렸습니다. b10344 이하는 아키텍처 자체를 인식하지 못해 파일 로드를 거부합니다.
2. --jinja 필수: 채팅 템플릿이 GGUF 안에 박혀 있어서 별도 템플릿 파일은 필요 없지만, 이 옵션이 빠지면 llama-mtmd-clithis custom template is not supported 로 아예 죽습니다.
3. 추론 트레이스를 분리하려면 llama-server: llama-clillama-mtmd-cli는 생각 과정을 본문에 그대로 섞어 출력합니다. contentreasoning_content로 갈라 받고 싶다면 서버를 써야 합니다.

공식 리포가 안내하는 실행 줄입니다.

BASH
./build/bin/llama-server \
    -m       muse-glimmer-30B-kquant-17gb.gguf \
    --mmproj mmproj-kquant.gguf \
    -a muse-glimmer-30B \
    -ngl 99 -c 131072 -np 4 \
    --host 127.0.0.1 --port 8080 \
    --jinja \
    --temp 1.0 --top-p 0.95 --top-k 64

여기에 드래프터를 붙이면 앞서 본 3배 가속이 걸립니다. 메모리는 1.6GB 정도 더 씁니다.

BASH
    -md dflash-kquant.gguf -ngld 99

놓치기 쉬운 함정 하나llama-server-c-np 슬롯 수로 나눠 씁니다. 위 예시처럼 -c 131072 -np 4 로 띄우면 요청 하나가 쓰는 컨텍스트는 32,768 입니다. 기동 로그의 n_ctx_slot 값이 실제 상한이니 그 숫자를 보세요.

응답이 content 대신 to=self<|message|> 로 시작한다면 빌드가 채팅 파서보다 오래된 것입니다. 반대로 기동 시 뜨는 [spec] failed to measure draft model memory 경고는 무해합니다 — 드래프터는 정상 동작합니다.

로컬로 돌릴까, 클라우드에 올릴까

판단 기준은 결국 메모리와 가동 시간 두 가지입니다.

LM Studio가 안내하는 최소 요구치가 26GB RAM입니다. 이 선을 넘는 PC나 워크스테이션이 이미 있다면 상시 구동형 에이전트는 로컬이 유리합니다. 24시간 켜 두는 사용 패턴에서 시간당 과금은 그대로 누적되지만, 로컬은 전기요금 외에 추가 비용이 붙지 않기 때문입니다.

반대로 메모리가 모자라거나 하루 몇 번만 쓰는 간헐적 사용이라면, 30B급 모델을 위해 장비를 새로 맞추는 것보다 클라우드 GPU 인스턴스가 합리적입니다. 다만 시간당 단가는 제공업체·리전·GPU 종류에 따라 크게 갈리고 수시로 바뀌므로, 이 글에 숫자를 박아두는 대신 쓰려는 제공업체의 현재 가격표를 직접 확인하시길 권합니다. 무활동 시 인스턴스를 자동으로 내리는 옵션이 있는지도 함께 보세요 — 간헐적 사용에서는 이 옵션 유무가 월 비용을 가릅니다.

어떤 용도에 적합한가

공식 설명이 꼽는 권장 용도는 로컬·자율 AI 에이전트, 코딩과 디버깅, 구조화된 함수 호출, 스크린샷·차트·문서 이해, 합성 데이터 생성, LLM-as-a-judge 평가 워크플로입니다.

라이선스는 Apache 2.0입니다. 공식 모델 카드가 전체 가중치·양자화본·DFlash 드래프터·퍼셉션 인코더를 모두 Apache 2.0으로 배포한다고 명시하므로 상용 이용에 별도 제약이 붙지 않습니다. 함께 걸려 있는 Usage Policy 는 불법 행위, 무기·군사 용도, 무면허 전문 자격 행위(금융·법률·의료), 사칭과 허위정보, 악성코드 생성 등을 금지하는 일반적인 사용 정책이지 상업적 사용을 제한하는 조항이 아닙니다(만 18세 미만 사용 대상 아님도 함께 명시). 다만 모델 카드는 에이전트로 쓸 때 되돌릴 수 없는 작업에는 사람의 확인 절차를 두라고 별도로 권고합니다 — 상시 구동 에이전트를 만들 계획이라면 이쪽이 라이선스보다 중요한 대목입니다.

참고 자료

meta-models/Muse-Glimmer-30B — 공식 모델 카드 (스펙·속도 측정치·Apache 2.0)
meta-models/Muse-Glimmer-30B-GGUF — 공식 GGUF 배포 (파일 용량·실행 명령·b10353 빌드 요건)
Muse Glimmer Usage Policy (금지 사용 목록 원문)
NANI-Nithin/Muse-Glimmer-30B-GGUF — 커뮤니티 양자화 (양자화별 용량)
Muse Glimmer — LM Studio 모델 페이지 — “To run the smallest Muse Glimmer, you need at least 26 GB of RAM” (2026-08-11 확인)

자주 묻는 질문

실행했더니 추론 과정이 답변 본문에 섞여 나옵니다.

llama-cli 나 llama-mtmd-cli 로 띄운 경우입니다. 두 CLI 는 생각 과정을 본문에 그대로 섞어 출력하므로, content 와 reasoning_content 를 분리해 받으려면 llama-server 를 써야 합니다. 서버로 띄웠는데도 응답이 to=self 로 시작한다면 빌드가 채팅 파서보다 오래된 것이니 b10353 이상으로 올리세요.

맥북 통합 메모리는 어떻게 계산하나요?

통합 메모리는 GPU와 CPU가 나눠 쓰므로 전체 용량을 그대로 모델에 배정할 수 없습니다. 공식 카드는 24GB·32GB 봉투 안에서 모델과 KV 캐시·인코더·드래프터가 함께 돌아가도록 맞췄다고 설명하므로, 32GB 맥이라면 16.76GB 경량본이 안전한 출발점입니다. 컨텍스트를 크게 열수록 KV 캐시가 늘어 스왑이 시작되니 -c 값을 함께 조절하세요.

DFlash 드래프터를 안 붙이면 얼마나 느려지나요?

공식 모델 카드 측정 기준으로 RTX 5090은 233.4 tok/s에서 74.9 tok/s로 3.1배, M5 Max는 50.2에서 26.6으로 1.8배, M4 Max는 37.8에서 23.7로 1.5배 느려집니다. 드래프터 파일은 1.63GB에 불과하므로 메모리가 아주 빠듯한 경우가 아니면 붙이는 편이 이득입니다.

다운로드하려는 GGUF 리포가 진짜인지 어떻게 확인하나요?

리포의 Files and versions 탭을 직접 열어 .gguf 파일이 실제로 올라와 있는지, 표시된 용량이 README 설명과 맞는지 확인하세요. 공개 직후에는 README에 파일 목록만 적어 두고 실제 업로드는 없는 리포가 생깁니다. 다운로드 수와 최종 수정 시각도 함께 보면 판별에 도움이 됩니다.

Similar Posts

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다