| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | ||||
| 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| 11 | 12 | 13 | 14 | 15 | 16 | 17 |
| 18 | 19 | 20 | 21 | 22 | 23 | 24 |
| 25 | 26 | 27 | 28 | 29 | 30 | 31 |
- 자동화
- Android Studio
- 오픈웨이트
- ai에이전트
- 카드 없이
- 무료 ai
- 안드로이드
- ai 뉴스
- claudecode
- Gemini
- MCP
- 안드로이드 스튜디오
- Claude
- 개발 생산성
- 개발환경
- LLM
- claude code
- 홍드로이드
- 바이브코딩
- AI 에이전트
- 실무
- AI 에이전트 개발
- 오픈모델
- 무료로 시작하기
- 개발자 도구
- 클로드코드
- OpenAI
- Anthropic
- Android
- AI 코딩
- Today
- Total
홍드로이드의 야매코딩
리퀴드 디스파크 공개 — 비전 모델을 맥에서 최대 3배 빠르게 본문

같은 답을 더 빨리 내놓는 방법이 있습니다. 리퀴드 AI의 디스파크는 비전 모델의 답을 바꾸지 않으면서, 메모리를 조금만 더 쓰고 토큰 생성 속도를 맥에서 최대 3.13배 끌어올립니다.
리퀴드 AI가 자사 비전·언어 모델을 가속하는 디스파크 초안 모델을 공개했습니다. 국내 블로그에서도 「추측 디코딩으로 3배 빨라졌다」는 소개가 나왔는데, 숫자마다 측정 조건이 다르고 「체감 속도는 그만큼 안 오른다」는 단서가 중요합니다. 공식 블로그와 허깅페이스 모델 카드, 라이선스를 직접 확인해 정리했습니다. 맥이나 노트북에서 작은 모델을 돌려 보는 분이라면 실용적인 소식입니다.
짧게 정리하면
- 디스파크는 가벼운 초안 모델이 다음 토큰을 미리 짐작하고 본 모델이 검증하는 추측 디코딩 방식으로, 출력은 본 모델과 똑같이 유지됩니다.
- 초안 모델은 약 2억 8천만 개 규모로 배포 모델의 크기를 8.9%만 늘리고, 토큰 생성 속도는 그래픽카드에서 최대 2.66배, 맥에서 최대 3.13배 빨라집니다.
- 가중치는 허깅페이스에 공개되고 라마씨피피·에스지랭·엠엘엑스를 첫날부터 지원하지만, 라이선스에 상업적 이용 조건이 붙습니다.
리퀴드 AI 블로그의 디스파크 공개 글과 허깅페이스 모델 카드, 라이선스 원문을 대조했습니다. 모든 속도 수치는 리퀴드 AI가 잰 값이고, 직접 돌려 보지는 않았습니다.
추측 디코딩이 뭔가
추측 디코딩은 작고 빠른 초안 모델이 다음 여러 토큰을 미리 짐작하고, 크고 느린 본 모델이 그 짐작을 한 번에 검증하는 방식입니다. 본 모델이 받아들이면 여러 토큰을 한 번에 확정하니 빨라지고, 틀리면 본 모델이 고쳐 쓰기 때문에 최종 출력은 본 모델만 쓸 때와 같습니다. 블로그는 같은 샘플링 조건에서 결과가 분포상 동일해 손실이 없다고 적었습니다. 흥미로운 점은 초안 모델 입장에서는 입력이 글이든 이미지든 상관없다는 것입니다. 숨은 층에 도달하면 글과 이미지 조각 모두 같은 형태의 수치 덩어리가 되기 때문에, 글 모델에 쓰던 방법을 비전 모델에 그대로 적용했다고 합니다.
초안 모델은 약 2억 7,950만 개 규모로, 배포하는 모델의 매개변수를 8.9%만 늘립니다. 온도를 올리면 초안과 본 모델이 고를 토큰이 갈라져 받아들이는 비율이 떨어지고, 그만큼 속도 이득도 줄어듭니다. 공개 모델을 로컬에서 돌리는 흐름 자체는 무료 코딩 AI 오픈모델 총정리에서도 다뤘는데, 디스파크는 그 모델들을 더 빨리 돌리는 쪽에 가깝습니다.
얼마나 빨라지나
리퀴드 AI 블로그 기준, 하드웨어별 속도 향상(모두 리퀴드 측정·16비트·배치 1)
| 환경 | 토큰 생성 속도 | 끝에서 끝까지 |
|---|---|---|
| 맥 엠5 맥스, 엠엘엑스 | 2.30~3.13배 | 1.56~2.62배 |
| 맥 엠3 울트라, 라마씨피피 | 1.57~2.14배 | 1.30~1.77배 |
| 그래픽카드(에이치100), 에스지랭 | 2.04~2.66배 | 1.64~2.27배 |
여섯 가지 비전 과제는 일반 시각 질의, 글자 읽기, 이미지 설명, 차트 질의, 복합 추론, 여러 차례 대화입니다. 검증 한 번에 받아들이는 토큰은 대략 3.2~4.57개 범위였고, 이 비율은 하드웨어나 실행기보다 초안 모델과 작업에 따라 달라진다고 블로그는 적었습니다. 머리글의 「3.13배」는 맥 엠5 맥스에서 토큰 생성 속도만 따진 가장 유리한 숫자입니다. 표에서 보듯 토큰 생성 속도와 끝에서 끝까지 걸리는 시간은 차이가 큽니다. 내 환경에 맞는 숫자를 고를 때는 어느 하드웨어의 무슨 측정인지부터 봐야 합니다. 로컬 실행에 필요한 그래픽 메모리는 로컬 LLM 돌릴 PC 사양에, 노트북 사양별 추천은 노트북에서 무료로 AI 돌리기에 정리해 뒀습니다.
추측 디코딩은 생성 단계만 빠르게 합니다. 블로그는 이미지가 비전 인코더를 거치고 수백 개의 시각 토큰을 처리하는 준비 단계는 그대로라고 분명히 적었습니다. 특히 연산 능력이 낮은 노트북에서는 이 준비 단계가 전체 시간의 큰 몫을 차지해서, 생성 속도가 크게 올라도 끝에서 끝까지 시간은 그보다 적게 줄어듭니다. 토큰 생성 속도 수치만 보고 전체가 세 배 빨라진다고 기대하면 어긋납니다. 짧은 답을 자주 내는 작업일수록 체감 이득이 작다는 점도 함께 보세요.
받는 법과 라이선스
허깅페이스 모델 카드·라이선스 기준(2026년 10월 1일 확인)
| 항목 | 내용 |
|---|---|
| 받는 곳 | 허깅페이스. 세이프텐서와 지지유에프 형식 |
| 지원 실행기 | 라마씨피피, 에스지랭, 엠엘엑스 비전 모델 지원 |
| 짝 모델 | 본 모델과 초안 모델을 맞춰 써야 함(형식도 일치) |
| 라이선스 | 리퀴드 공개 라이선스. 비상업·연구는 무료, 상업 이용은 조건부 |
가중치는 공개돼 내려받아 고치고 쓸 수 있지만 완전한 자유 라이선스는 아닙니다. 라이선스 원문에는 비상업·연구 목적은 무료이고, 상업적 이용은 연 매출 1,000만 달러를 기준으로 조건이 갈린다고 적혀 있습니다. 개인이 연구나 토이 프로젝트로 쓰는 건 문제가 없지만, 제품에 넣어 수익을 낼 계획이라면 매출 기준과 조항을 반드시 확인해야 합니다. 「오픈 가중치」라는 말만 보고 아무 데나 써도 된다고 넘기면 안 됩니다. 라마씨피피용 지지유에프 파일이 함께 제공되니, 평소 내 PC로 무료 AI를 돌리던 방식 그대로 맥에서 시험해 볼 수 있습니다.
자주 묻는 질문
출력 품질이 떨어지지는 않나요
블로그는 같은 샘플링 조건에서 추측 디코딩의 결과가 본 모델에서 바로 뽑은 것과 분포상 동일해 손실이 없다고 적었습니다. 속도를 위해 품질을 깎는 방식이 아니라, 같은 답을 더 빨리 낸다는 설명입니다.
메모리가 얼마나 더 드나요
초안 모델 때문에 배포 모델의 매개변수가 8.9% 늘어난다고 모델 카드에 적혀 있습니다. 초안 모델 자체는 약 2억 8천만 개 규모입니다. 그만큼의 추가 메모리를 감수하고 속도를 얻는 구조입니다.
한국어 성능은 어떤가요
이번 글은 속도 가속이 중심이고 언어별 성능은 다루지 않았습니다. 디스파크는 본 모델의 답을 그대로 재현하므로, 한국어 품질은 본 모델인 비전·언어 모델 쪽을 직접 시험해 판단해야 합니다.
이번 공개의 값어치는 「작은 비전 모델을 맥에서 더 빠르게」라는 구체적인 쓸모에 있습니다. 다만 세 배라는 숫자는 생성 단계만의 이야기이고, 노트북에서는 준비 단계 때문에 체감 이득이 그보다 작습니다. 저라면 라마씨피피용 파일을 받아 평소 쓰던 비전 작업 한두 개로 끝에서 끝까지 시간을 직접 재 보고, 상업적으로 쓸 거라면 라이선스의 매출 기준부터 확인하겠습니다.
확인한 곳: 리퀴드 AI 블로그 「비전·언어 모델 가속 디스파크」(작동 방식, 하드웨어별 속도, 온도 영향, 생성 단계 한정 한계), 허깅페이스 모델 카드(초안 매개변수·메모리·지원 실행기·짝 모델), 리퀴드 공개 라이선스(비상업·상업 조건). 2026년 10월 1일 기준입니다.
'AI & Vibe Coding' 카테고리의 다른 글
| 커서 보안 봇 2종 공개 — 코드 올릴 때마다 취약점 자동 점검 (0) | 2026.10.01 |
|---|---|
| 디플 번역 서버 공개 — 클로드 코드에 한 줄로 붙이는 무료 번역 (0) | 2026.10.01 |
| 마이크로소프트 AI 확산 보고서 — 한국 40.6%와 오픈 모델로 기운 토큰 (0) | 2026.10.01 |
| 그록 팀 봇 공개 — 누가 쓸 수 있나와 봇을 이루는 네 가지 (0) | 2026.10.01 |
| 제미나이 4 아르곤 발표 — 지금 누가 쓸 수 있나와 가격 정리 (0) | 2026.10.01 |