| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| 9 | 10 | 11 | 12 | 13 | 14 | 15 |
| 16 | 17 | 18 | 19 | 20 | 21 | 22 |
| 23 | 24 | 25 | 26 | 27 | 28 | 29 |
| 30 | 31 |
- AI 에이전트
- 실무
- LLM
- 앤트로픽
- GPT-5.6
- 카드 없이
- Android Studio
- 안드로이드 스튜디오
- Gemini
- 개발자
- Anthropic
- 무료 LLM
- 오픈모델
- 오픈웨이트
- MCP
- AI 코딩
- Android
- ai 뉴스
- 바이브코딩
- 로컬 llm
- 홍드로이드
- Claude
- claude code
- ChatGPT
- 무료 ai
- ai코딩
- cursor
- 안드로이드
- OpenAI
- codex
- Today
- Total
홍드로이드의 야매코딩
메타가 노트북에서 돌아가는 AI를 무료로 풀었다 — Muse Glimmer 30B 본문

에이전트를 공짜로
2026년 8월 10일, 메타가 Muse Glimmer 30B를 공개했습니다. 요점은 세 가지예요. ①인터넷 없이 내 컴퓨터에서 돌아가고 ②단순 대화가 아니라 도구를 쓰며 일하는 에이전트이고 ③Apache 2.0이라 상업적으로 써도 됩니다. 그동안 "로컬 모델은 느리고 답답하다"는 인식이 있었는데, 그래픽카드 한 장에 올라가는 크기로 이걸 하겠다는 겁니다. 실행 사양과 방법, 그리고 벤치마크를 어디까지 믿어야 하는지까지 정리했습니다.
🎮 24GB 그래픽카드 한 장이면 양자화 버전 구동 가능
🛠️ 도구 사용·다단계 추론·멀티모달(텍스트+이미지)
📜 Apache 2.0 — 상업적 이용 허용
⚠️ 벤치마크는 제조사 자체 공개 수치입니다
뭐가 새로운 건가
"오픈 모델이 또 나왔네" 정도로 넘길 수도 있는데, 이번 건은 조합이 다릅니다.
일한다 — 답만 하는 게 아니라 도구를 호출하고 여러 단계를 밟습니다
자유롭다 — Apache 2.0이라 회사 제품에 넣어도 됩니다
→ 그동안 이 셋을 다 갖춘 선택지가 드물었습니다.
참고로 이 모델은 메타의 더 큰 모델을 압축(증류)해서 만든 경량판으로 알려져 있습니다. 큰 모델의 능력을 작은 몸집에 옮겨 담은 셈이라, 크기 대비 성능이 이 모델의 승부처입니다.
내 그래픽카드로 돌아갈까?
공식 모델 문서에 VRAM 용량별 권장 버전이 나와 있습니다. 성능 손실까지 함께 표기돼 있어서 판단하기 좋아요.
3090·4090 같은 24GB 카드 보유자라면 바로 해당됩니다. 가장 현실적인 선택지예요.
5090급 32GB 카드라면 여기가 맞습니다.
카드 두 장 또는 대용량 통합 메모리를 가진 맥이 해당됩니다.
스펙 정리
| 항목 | 내용 |
|---|---|
| 파라미터 | 약 296억(29.6B) |
| 컨텍스트 | 131,072 토큰 이상 (약 13만) |
| 입력 형태 | 텍스트 + 이미지 (멀티모달) |
| 에이전트 기능 | 도구 호출 · 다단계 추론 · 실패 복구 |
| 라이선스 | Apache 2.0 (상업 이용 가능) |
| 배포 | Hugging Face · GGUF 양자화 버전 제공 |
벤치마크 — 그리고 얼마나 믿을지
| 분야 | 항목 | 점수 |
|---|---|---|
| 코딩 | SWE-Bench Verified | 76.0 |
| 코딩 | SWE-Bench Pro | 51.2 |
| 에이전트 | MCP Atlas | 75.5 |
| 수학 | AIME 2026 | 94.7 |
| 과학 | GPQA Diamond | 83.5 |
※ 메타 공개 모델 문서 기준. 30B급 모델이 이 점수대를 낸다면 인상적이지만, 벤치마크 점수와 실사용 체감은 자주 어긋납니다. 본인 작업으로 직접 확인해보세요.
실제로 돌려보기
공식 GGUF 양자화 파일이 함께 배포돼서 설치가 어렵지 않습니다. 가장 간단한 방법은 한 줄이에요.
# llama.cpp — 모델을 받아서 바로 서버로 띄우기
llama serve -hf meta-models/Muse-Glimmer-30B-GGUF
# 그 다음 브라우저나 앱에서 로컬 주소로 접속해 사용
# 파일이 수십 GB이므로 다운로드에 시간이 걸립니다
· vLLM — 여러 요청을 동시에 처리할 때
· 커뮤니티 최적화 버전 — 더 작게 압축한 배포판도 올라와 있습니다
→ 도구별 지원 상황은 계속 갱신되니 각 프로젝트 문서를 확인하세요.
이게 왜 의미 있나
| 이런 경우 | 달라지는 점 |
|---|---|
| 코드를 밖으로 못 보내는 회사 | 데이터가 PC를 안 떠납니다 |
| 대량 반복 작업으로 API 요금이 큰 경우 | 전기요금만 듭니다 |
| 서비스에 모델을 얹어 파는 경우 | Apache 2.0이라 가능 |
| 인터넷이 불안정한 환경 | 오프라인 동작 |
· 양자화하면 성능이 조금 깎입니다 — 문서에도 손실률이 표기돼 있어요
· 그래픽카드 값이 듭니다 — 24GB 카드가 없으면 시작부터 막힙니다
· 에이전트에 실행 권한을 주는 건 별개 위험 — 로컬이라고 안전한 게 아닙니다
마지막 항목을 특히 강조하고 싶습니다. 로컬 모델이라 데이터가 안 나가는 것과, 그 모델이 내 PC에서 뭘 할 수 있는지는 다른 문제입니다. 파일을 고치고 명령을 실행하게 할 거라면 권한 관리를 먼저 챙기세요.
자주 묻는 질문
Llama 커뮤니티 라이선스에는 사용자 수 임계값·표시 의무·파생 모델 작명 규칙이 붙습니다. 이 글의 모델이 Apache 2.0이라는 건 그런 조건이 없다는 뜻입니다
· 무료로 풀렸는데 한국이 적용 지역에서 빠진 사례 — MiniMax H3
오픈웨이트라고 다 같지 않습니다. 지역 제한이 붙은 라이선스도 실제로 나왔습니다
🔎 그다음 모델(Muse Spark 1.2)은 아직입니다 — 8월 12일 확인
Glimmer에 이어 Muse Spark 1.2의 가중치도 공개된다는 소식이 돌고 있어서, 8월 12일 오전에 세 경로를 직접 확인했습니다. 세 곳 모두 아직 없었습니다.
- 공식 조직 계정 — 공개 모델 4개, 전부 Glimmer 계열(원본·GGUF·assistant·ExecuTorch). Spark 없음
- 사이트 전체 검색 — 0건. 개인 계정 업로드조차 없습니다 → 지금 "Spark 가중치"라는 파일이 보이면 의심하세요
- 메타 AI 공식 블로그 — 최신 Muse Spark 글은 1.1, 7월 9일자. 1.2 관련 글 없음
공개 예고의 구체적 내용(시점·라이선스·사양)은 1차 출처를 확인하지 못해 인용하지 않았습니다. 직접 확인하는 방법과 계속 갱신되는 확인 기록은 공식 저장소를 열어본 기록에 있습니다. 요약하면 — 공식 조직 페이지에서 정렬을 'Recently updated'로 바꿔두시면 기사보다 먼저 아십니다.
다만 벤치마크 점수는 직접 확인하고 믿으세요.
출처·주의 — 사양·라이선스·VRAM 권장치·벤치마크는 2026년 8월 메타가 공개한 모델 문서와 공식 블로그에서 직접 확인했습니다. 벤치마크 점수는 제조사 자체 발표치로 독립 검증 전이며, 측정 조건에 따라 달라질 수 있어 참고용으로만 보시기 바랍니다. 실행 방법과 지원 도구는 생태계 상황에 따라 빠르게 바뀌므로 각 프로젝트의 최신 문서를 확인하세요. 라이선스 적용 범위와 상업적 이용 조건은 원문을 직접 확인해야 하며 본 글은 법률 자문이 아닙니다. 특정 기업·서비스와 제휴 관계가 없습니다.
'AI & Vibe Coding' 카테고리의 다른 글
| AI 음성 유료 원가 — 1시간 회의록이 3분 성우 음성보다 싸다 (0) | 2026.08.11 |
|---|---|
| AI 번역 유료로 쓸 때 진짜 비용 — 한 장짜리 문서가 5만 자로 계산되는 이유 (0) | 2026.08.11 |
| AI 도구 학생·창업자 할인 총정리 — 없어진 것과 아직 되는 것 (0) | 2026.08.11 |
| 회사에서 AI 쓸 때 보안 체크리스트 — 막는 대신 안전하게 쓰는 법 (0) | 2026.08.11 |
| AI 이미지·영상 툴 진짜 비용 — 10초 영상 한 편에 얼마 드나 (0) | 2026.08.11 |
