Muse Glimmer: 24GB급 로컬 실행을 겨냥한 멀티모달 에이전트
Meta가 30B 밀집 모델을 4비트로 압축해 24GB급 장치에서 실행하고 DFlash 초안 모델로 생성을 가속하는 오픈 웨이트 에이전트 모델 Muse Glimmer를 공개했다.
한 문장 요약: Meta가 30B 밀집 모델을 4비트로 압축해 24GB급 장치에서 실행하고 DFlash 초안 모델로 생성을 가속하는 오픈 웨이트 에이전트 모델 Muse Glimmer를 공개했다.
무엇이 발표됐나
Meta는 8월 10일 Muse Glimmer를 Apache 2.0으로 공개했다. 약 296억 파라미터의 밀집 모델로 텍스트와 이미지를 입력받아 텍스트를 생성하며, 131,072토큰 이상의 문맥을 지원한다. BF16 본체뿐 아니라 32GB용 동적 양자화와 24GB용 17GB 양자화 가중치, 추측 디코딩용 DFlash 초안 모델을 함께 배포했다. 모델 카드와 평가 방법도 공개했지만 llama.cpp, MLX, ExecuTorch 등 일부 최적화 통합은 발표 당시 “수일 내 제공” 단계였다.
로컬 에이전트를 위한 구조
언어 본체의 52개 층은 2,048토큰 슬라이딩 윈도의 로컬 어텐션 세 층과 전역 어텐션 한 층을 반복한다. 쿼리 헤드 32개가 KV 헤드 2개를 공유하는 GQA로 캐시 부담을 낮췄고, 약 18억 파라미터 ViT-G/14 인코더가 화면·차트·문서를 처리한다. 사전학습에서는 더 큰 Muse Spark의 로짓을 증류하고, 중간 학습에서 긴 문맥과 에이전트 궤적을 늘렸다. 이후 지도 미세조정, 온폴리시 증류와 강화학습을 결합했다.
속도 설계도 체크포인트의 일부다. 5층 DFlash 모델이 본체의 다섯 중간 층 표현을 읽어 한 번에 16토큰 블록을 제안하면 본체가 병렬로 수락하거나 수정한다. Meta는 17GB 양자화 모델과 초안 모델을 RTX 5090에서 배치 1·greedy decoding으로 측정해 초당 74.9토큰에서 233.4토큰으로 3.1배 빨라졌다고 보고했다. 이 글은 그 수치를 재현하지 않았다.
개발자에게 왜 중요한가
로컬 에이전트는 코드, 문서, 메시지와 자격 증명을 클라우드 API로 보내지 않는 선택지를 준다. Muse Glimmer는 모델 가중치만 공개한 것이 아니라 양자화, 비전 인코더, 초안 모델과 에이전트 평가 조건을 한 배포 경로로 묶었다. 따라서 팀은 모델 정확도와 함께 메모리 상주 여부, 도구 호출 지연, 실패 복구, 이미지 처리 비용을 같은 장치에서 비교할 수 있다.
다만 로컬 실행이 곧 안전한 실행은 아니다. 파일과 자격 증명에 접근하는 에이전트에는 최소 권한, 작업 디렉터리 격리, 외부 통신 제한과 되돌릴 수 없는 동작의 사람 승인이 여전히 필요하다. 모델 카드의 프롬프트 인젝션 평가에서도 공격 성공률이 0이 아니었다.
한계와 검증 포인트
24GB 목표는 17GB 양자화 가중치 기준이다. 긴 대화와 여러 이미지의 KV 캐시, 비전 인코더, DFlash 메모리를 합치면 실제 수용 문맥은 줄 수 있다. 공식 양자화 품질 저하는 15개 벤치마크 평균이고, 에이전트 점수는 Meta 내부 하네스·LLM 심판·서로 다른 비교 모델 설정이 섞여 있다. 도입 전에는 목표 장치에서 문맥 길이별 최고 메모리, 첫 토큰과 전체 지연, 도구 스키마 오류율, 중단 후 재개 성공률을 측정해야 한다. 민감 데이터 업무라면 프롬프트 인젝션에 의한 파일 유출과 권한 오용도 별도 공격 평가가 필요하다.
공식 1차 출처
- Introducing Muse Glimmer — Meta, 2026-08-10
- Muse Glimmer 모델 카드와 가중치 — 구조, 양자화, 라이선스와 실행 자료
- Muse Glimmer Evaluation Methodology — 벤치마크별 하네스와 채점 조건