| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- AI 에이전트 개발
- Android Studio
- 안드로이드
- Gemini
- claude code
- 개발환경
- 클로드 API
- ai에이전트
- Android
- ai 뉴스
- claudecode
- 개발자 도구
- MCP
- OpenAI
- 안드로이드 스튜디오
- 무료 ai
- Claude
- 클로드코드
- AI 에이전트
- 자동화
- 실무
- 오픈모델
- 홍드로이드
- 카드 없이
- 무료 LLM
- AI 코딩
- LLM
- 바이브코딩
- 무료로 시작하기
- 개발 생산성
- Today
- Total
홍드로이드의 야매코딩
국산 AI 오픈모델 31종, 좋아요 53에 다운로드 1 본문

국산 AI 모델의 라이선스와 성능표를 세는 김에 목록을 훑다가 이상한 계정을 하나 발견했습니다. 대기업이 아닌데 모델이 31개였고, 거의 전부 아파치 2.0이었습니다. 더 특이한 게 있었는데, 완성된 모델만 올린 게 아니라 훈련 도중의 중간 저장본까지 통째로 공개해뒀습니다. 모델 카드에는 "한국어 대상 LLM 중 최초"라고 적혀 있고요. 그래서 다운로드 수를 봤습니다. 1회였습니다. 좋아요는 53개인데요.
📌 30초 요약
- 31종 중 28종이 아파치 2.0입니다. 상업 이용까지 완전히 열려 있습니다.
- 훈련 중간 저장본을 단계별로 공개했습니다. 카드 원문이 "한국어 대상 LLM 중 최초"라고 밝힙니다.
- 가장 많이 받아간 모델이 1,405회입니다. 대기업 모델 하나가 60만 회니까 430배 차이입니다.
- 좋아요와 다운로드가 따로 놉니다 — 70B 중간 저장본은 좋아요 53, 다운로드 1.
- 만든 곳은 2024년에 생긴 스타트업입니다. 프리시드 57억으로 1년 반 동안 31개를 냈습니다.
- 성적이 나쁜 것도 아닙니다 — 20억대 모델이 한국어 시험에서 750B짜리와 1.4점 차였습니다.
31종을 전부 열어봤습니다
공개 목록을 통째로 받아 세어보니 모델 31종이었습니다. 라이선스 분포가 눈에 띕니다 — 28종이 아파치 2.0이고, 자체 약관이 하나, 나머지는 표시가 없는 저장소입니다. 앞서 국산 모델 라이선스를 열 개 세어봤을 때 대기업 쪽에서는 자체 약관이 절반을 넘었고 상업 이용을 아예 막은 곳도 있었는데, 여기는 거의 전부 표준 오픈소스 라이선스입니다.
종류도 한 갈래가 아닙니다. 범용 모델, 전문가 혼합 구조 모델, 생명과학용, 번역 전용 소형 모델, 슬라이드 생성용까지 계열이 여러 개로 갈립니다. 1년 반 사이에 나온 것들입니다.
훈련 도중을 통째로 열었습니다
가장 특이한 대목이 여기입니다. 보통 모델을 공개한다고 하면 다 만들어진 최종 가중치를 올립니다. 그런데 이 계정에는 훈련이 진행되는 도중의 저장본이 단계별로 올라와 있습니다.
🧪 이게 왜 드문 일인가
최종 가중치만 있으면 "이 모델이 뭘 할 수 있나"는 알 수 있지만 "어떻게 그렇게 됐나"는 알 수 없습니다. 중간 저장본이 있으면 학습이 진행되며 능력이 어느 지점에서 생겼는지를 연구자가 직접 되짚어볼 수 있습니다. 그래서 공개 이유도 카드에 "학습 역학 연구를 진전시키기 위해"라고 적혀 있습니다. 저장 간격까지 명시돼 있는데 — 0.5B는 약 200억 토큰마다, 1.9B는 약 400억 토큰마다, 7B와 70B는 약 1,600억 토큰마다입니다. 각 단계는 저장소 브랜치 이름으로 구분해서 원하는 시점을 골라 받을 수 있게 해뒀습니다. 그리고 카드 첫 문장이 이렇게 시작합니다 — "한국어를 겨냥한 LLM 중 처음으로."
덧붙여, 원래는 시스템 점검용으로 돌렸던 0.5B와 1.9B 훈련까지 함께 풀었습니다. 카드 표현으로는 "작은 규모에서 학습 거동을 분석할 자료로서 가치가 있어서"입니다. 버릴 것도 공개한 셈이죠.
그런데 아무도 안 받아갑니다
여기서 숫자가 이상해집니다. 공개일 기준 누적 다운로드입니다.
| 저장소 | 좋아요 | 다운로드 |
|---|---|---|
| 70B 중간 저장본 | 53 | 1 |
| 7B 중간 저장본 | 8 | 35 |
| 21B 추론 모델 | 29 | 506 |
| 7B (계정 내 최다) | 26 | 1,405 |
좋아요와 다운로드가 따로 논다
70B 중간 저장본은 좋아요 53에 다운로드 1입니다. 사람들이 "이건 좋은 일이다"라고 표시는 하는데 실제로 받아가지는 않는다는 뜻입니다.
계정 전체에서 가장 많이 받아간 모델도 1,405회입니다. 앞서 세어본 대기업 모델 하나가 60만 회를 넘겼으니 약 430배 차이입니다. 그런데 그 대기업 계열 중에는 상업 이용이 금지된 것도 있었습니다.
누가 만들고 있나
찾아보니 2024년 2월에 생긴 국내 스타트업이었습니다. 대표는 국내 대형 포털의 대표 한국어 모델 개발에 참여했던 연구자이고, 자연어 처리 쪽 연구를 오래 해온 이력이 있습니다. 투자는 프리시드 약 57억 원(420만 달러) 규모로, 벤처캐피털 여러 곳이 참여했습니다.
그러니까 프리시드 단계 회사가 1년 반 동안 31개 모델을 내놓으면서 훈련 중간 과정까지 공개하고 있는 셈입니다. 대기업들이 수천억 규모 프로젝트로 모델을 만들면서 자체 약관을 붙이는 동안에요. 규모로 겨루는 게임이 아니라 공개 범위로 자리를 잡으려는 전략으로 읽힙니다.
성적도 나쁘지 않습니다
"개방적이지만 성능이 떨어져서 안 쓰이는 것 아닌가" 하는 의심이 자연스럽습니다. 그래서 국산 모델 성능표를 나란히 놓았던 글의 숫자를 다시 보면 이렇습니다 — 이 회사의 20.7B짜리 추론 모델이 한국어 문화·언어 시험에서 82.8점이었고, 같은 시험에서 750B짜리 대기업 모델이 84.2점이었습니다.
36배 작은 모델이 1.4점 차입니다. 물론 다른 시험(지식형)에서는 격차가 더 벌어지고, 각 회사가 자기 채점으로 낸 숫자라 그대로 믿을 것도 아닙니다. 다만 "안 쓰이는 이유가 성능"이라고 단정하기는 어렵다는 정도는 말할 수 있습니다.
그럼 왜 안 쓰일까
확인된 답은 없습니다. 다만 숫자를 놓고 보면 짐작 가는 이유 셋이 있습니다. 어디까지나 제 추정입니다.
| 짐작 | 근거 |
|---|---|
| 이름값 | 모델을 고를 때 회사 이름부터 보는 게 보통입니다. 좋아요는 눌리는데 다운로드가 안 따라오는 게 그 신호로 보입니다. |
| 쓸 자리가 좁음 | 중간 저장본은 연구용입니다. 서비스에 넣을 물건이 아니라 애초에 받아갈 사람이 적습니다. |
| 알려지지 않음 | "한국어 LLM 최초"라고 카드에 적혀 있는데도 기사로는 거의 안 다뤄졌습니다. 저도 목록을 세다 우연히 봤습니다. |
셋 중 마지막이 제일 아깝습니다. 공개해두고 아무도 모르면 공개하지 않은 것과 결과가 같아집니다. 모델을 어디서 찾고 어떻게 받는지가 낯설다면 허깅페이스 사용법부터 보시면 되고, 계정 이름으로 목록을 훑는 것만으로도 이런 걸 찾을 수 있습니다.
🔁 좋아요가 아니라 순위표에 올라간 경우
국산 오픈모델이 좋아요는 받아도 실제로 안 받아간다는 이야기를 했는데, 공식 순위표 상위권으로 올라간 사례가 나왔습니다. 화면을 보고 직접 조작하는 국산 모델이 9월 18일 공개됐고, 화면 인식 시험에서 2위에 이름을 올렸습니다. ★갈린 지점이 분명합니다 — 범용 성능으로 겨루지 않고 「화면 조작」이라는 좁은 자리를 골랐고, 라이선스를 아파치로 열어 가져다 쓰는 문턱을 없앴습니다. 이 글에서 짚은 「내려받기 수가 진짜 지표」라는 기준은 그대로 유효하니, 이 모델도 몇 달 뒤 같은 잣대로 보시면 됩니다.
자주 묻는 질문
Q. 중간 저장본은 일반인이 써서 뭐 하나요?
솔직히 쓸 일이 거의 없습니다. 연구·교육 목적으로 "모델이 학습하면서 어떻게 변하는지"를 들여다보려는 사람을 위한 자료입니다. 다만 공개했다는 사실 자체는 의미가 있습니다 — 검증할 수 있게 열어뒀다는 신호니까요. 실제로 쓸 모델을 찾고 계시면 최종 버전 쪽을 보시면 됩니다.
Q. 아파치 2.0이면 회사에서 써도 되나요?
표준 오픈소스 라이선스라 상업 이용이 열려 있습니다. 다만 저는 변호사가 아니고, 실제 도입 전에는 원문을 직접 확인하셔야 합니다. 국산 모델별로 조건이 얼마나 갈리는지는 라이선스 실측 글에 표로 정리해뒀습니다.
Q. 무료로 한번 돌려보려면요?
작은 모델부터가 현실적입니다. 이 계정에도 번역 전용 1.8B처럼 개인 PC에서 감당되는 크기가 있습니다. 무료로 시도해볼 경로 자체는 허깅페이스 무료 활용 3가지에 정리해뒀습니다. 20B가 넘어가면 개인 장비로는 버겁습니다.
🧭 정직하게 덧붙이면
①다운로드 수치는 2026년 8월 19일 조회 시점이고, 공개 플랫폼이 집계하는 값입니다. 어떤 방식의 접근을 세는지는 저도 정확히 모릅니다 — 미러나 사내 캐시로 받아간 건 안 잡힐 수 있습니다. ②"안 쓰인다"는 제 해석이고, 짐작 셋은 근거 있는 추정일 뿐 확인된 원인이 아닙니다. ③성능 수치는 각 회사 자체 공개값이라 제가 재현하지 않았습니다. ④회사 정보(설립 시기·투자 규모·대표 이력)는 언론 보도를 통해 확인한 것이고 회사 공식 자료를 직접 열지는 못했습니다. ⑤저는 이 회사와 아무 관계가 없고, 모델을 직접 돌려보지도 않았습니다.
AI 모델과 도구를 항목별로 뜯어본 글들은 AI 지출 정리 허브에 모아두고 있습니다. 국산 모델 쪽은 라이선스 → 성능표 → 개방도 순으로 세 번 세어본 셈인데, 세 번 다 목록 바깥에 있는 게 더 흥미로웠습니다.
출처: 허깅페이스 공개 API의 계정 모델 목록과 각 저장소 모델 카드 원문(2026-08-19 직접 조회). 인용한 "한국어 대상 LLM 중 최초"와 저장 간격은 중간 체크포인트 저장소 카드의 영문 원문을 옮긴 것입니다. 회사 설립 시기·투자 규모·대표 이력은 국내 언론 보도(2024) 기준입니다. 다운로드·좋아요 수치는 조회 시점 값이며 계속 변동합니다.
'AI & Vibe Coding' 카테고리의 다른 글
| Claude 스킬 API, latest 쓰면 남이 바꿉니다 (0) | 2026.08.21 |
|---|---|
| Claude 브라우저 도구, 묻기 전에 6,600토큰 (0) | 2026.08.21 |
| OpenAI 훈련 중단, 30분 안에 못 밝히면 멈춥니다 (0) | 2026.08.19 |
| Codex 5년 작업 2주, 원문에만 있는 단서 넷 (0) | 2026.08.19 |
| Cloudflare 무료 AI 한도, 모델 따라 26배 (0) | 2026.08.19 |
