| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- 개발환경
- Gemini
- 카드 없이
- MCP
- 자동화
- 오픈모델
- AI 에이전트 개발
- AI 코딩
- ai에이전트
- 무료로 시작하기
- 개발 생산성
- 무료 LLM
- LLM
- Android
- 클로드 API
- Claude
- 홍드로이드
- claude code
- 바이브코딩
- 클로드코드
- 안드로이드 스튜디오
- 무료 ai
- Android Studio
- AI 에이전트
- 개발자 도구
- 안드로이드
- OpenAI
- claudecode
- ai 뉴스
- 실무
- Today
- Total
홍드로이드의 야매코딩
국산 화면 조작 AI 오픈모델 — 리더보드 2위·아파치 라이선스로 공개 본문

화면을 보고 직접 마우스를 움직이는 AI는 그동안 해외 상용 모델의 영역이었습니다. 그런데 국내에서 만든 모델이 9월 18일 오픈소스로 공개되면서, 공식 리더보드 2위에 이름을 올렸습니다. 게다가 라이선스가 아파치 2.0입니다.
숫자가 큽니다 — 3,970억 매개변수. 다만 이 숫자를 그대로 읽으면 오해가 생깁니다. 한 번에 도는 건 그중 170억뿐이거든요.
📌 30초 요약
- 화면 인식에서 2위입니다.
- 라이선스가 아파치입니다.
- 활성은 170억뿐입니다.
- 메모리는 다 올려야 합니다.
- 한국어 손실이 적습니다.
1. 화면을 보고 직접 누르는 쪽
이 모델이 하는 일은 두 단계입니다. 먼저 화면 속에서 눌러야 할 것이 어디 있는지 찾아내고, 그다음 실제 운영체제 환경에서 그 일을 끝까지 해냅니다. 앞 단계만 잘해도 「버튼을 찾는」 모델이지만, 뒤 단계까지 가야 일을 맡길 수 있는 모델이 됩니다.
비슷한 기능을 상용 모델 쪽에서 쓰실 때의 제약과 견주면 차이가 분명합니다. 그쪽은 쓸 수 있는 운영체제가 정해져 있고 가려지는 창도 있었죠. 이쪽은 가중치를 받아 내 환경에 올리는 방식이라 그런 제약이 다르게 걸립니다 — 대신 올릴 장비가 필요하고요.
계보도 짧지 않습니다. 이 회사는 320억짜리로 시작해 2,350억을 거쳐 이번 규모까지 왔습니다. 화면 조작에 특화한 건 최근 두 판올림이고요.
2. 점수로 본 자리
발표에 나온 수치는 네 갈래입니다. 화면에서 대상을 찾는 능력과, 실제로 일을 끝내는 능력을 따로 잽니다.
| 무엇을 재나 | 결과 |
|---|---|
| 고난도 화면 인식 | 75.6점 — 공식 순위 2위 |
| 운영체제에서 일 끝내기 | 70.5점 — 바탕 모델 대비 크게 상승 |
| 윈도우 환경 과제 | 50.9점 (9.1점 올림) |
| 한국어 시험 여덟 종 | 바탕 대비 2점 안쪽으로 유지 |
셋째 줄을 눈여겨보실 만합니다. 윈도우 환경에서 재는 시험이 따로 있고 거기서 9.1점을 끌어올렸다는 건데, 50.9점이라는 절대 수치는 함께 봐야 합니다. 기사에서 「9.1점 향상」만 보면 높아 보이지만 이 분야는 아직 절반 언저리라는 뜻이기도 하니까요.
넷째 줄은 다른 종류의 성과입니다. 특정 능력을 얹으면 원래 잘하던 게 깎이기 마련인데 한국어 시험에서 손실을 2점 안쪽으로 묶었다는 것이죠. 국산 모델끼리 서로를 비교 대상에 안 넣던 관행을 생각하면, 바탕 모델과의 차이를 스스로 밝힌 점도 눈에 띕니다.
★점수에 조건이 붙는다는 것도 알아 두시면 좋습니다. 화면 인식 점수는 화면을 확대해 다시 보는 방식을 쓰면 1점가량 더 올라갑니다. 즉 같은 모델이라도 어떻게 보여 주느냐에 따라 결과가 달라집니다. 모델 카드에 적힌 권장값도 같은 맥락인데, 화면 사진은 대략 1,670만 화소 안쪽일 때 가장 잘 맞고, 지난 화면은 다섯 장까지만 들려 주라고 돼 있습니다. 화면을 더 많이, 더 크게 넣는다고 좋아지는 게 아니라는 뜻이죠.
3. 숫자가 커 보이는 이유
3,970억이라는 숫자만 보면 국내에서 이런 걸 만들었다고? 싶습니다. 실은 구조에 답이 있습니다 — 이 모델은 전체를 다 쓰는 게 아니라 질문마다 필요한 부분만 골라 쓰는 방식입니다. 그래서 한 번 답할 때 실제로 도는 건 약 170억이죠.
⚠️ 활성 170억이어도 메모리는 3,970억을 다 올려야 합니다
「도는 건 170억뿐」이라는 말을 「170억짜리 장비면 된다」로 읽으면 안 됩니다. 골라 쓰려면 고를 대상이 전부 메모리에 올라가 있어야 하니까요. 즉 속도와 비용은 작은 모델급인데 필요한 메모리는 큰 모델급입니다. 공개된 실행 예시도 고성능 가속기 여덟 장에 나눠 올리는 구성이고, 절반 용량으로 줄인 판이 함께 제공돼도 개인 장비로 내려오는 크기는 아닙니다. 내 PC 사양으로 무엇이 돌아가는지 따져 보셨던 기준으로는 이 모델이 안 들어옵니다 — 빌려 쓰거나 서비스로 접근하는 쪽을 보셔야 합니다.
다만 이 구조 덕분에 만드는 쪽의 문턱은 낮아졌습니다. 발표에 따르면 가속기 여덟 장으로 학습했고, 전체를 새로 훈련하는 대신 일부만 덧붙여 학습하는 방식을 썼습니다. 큰 모델을 통째로 다시 만드는 것과는 자원 규모가 다릅니다.
4. 아파치 2.0이라는 것
국산 오픈모델에서 라이선스는 늘 확인해야 할 항목이었습니다. 이름만 「오픈」이고 조건이 붙는 경우가 적지 않았으니까요. 이번 공개는 아파치 2.0이라 상업적 사용과 수정, 재배포가 열려 있습니다.
| 항목 | 내용 |
|---|---|
| 바탕이 된 모델 | 같은 규모의 해외 공개 모델 |
| 받는 곳 | 공개 모델 저장소에 가중치째 |
| 제공 형식 | 원본과 절반 용량판 두 가지 |
| 한 번에 읽는 양 | 십삼만 토큰 남짓까지 |
첫째 줄은 짚고 넘어갈 대목입니다. 바탕은 해외에서 공개한 모델이고, 여기에 화면 조작 능력과 한국어 유지를 얹은 것입니다. 처음부터 끝까지 국내에서 만든 모델과는 성격이 다릅니다 — 그렇다고 값이 없다는 뜻은 아닙니다. 공개된 바탕 위에 특화 능력을 얹어 상위권에 올린 뒤 그대로 다시 열어 놓는 것도 생태계에서 하나의 기여니까요. 다만 「순수 국산」을 찾고 계셨다면 구분해 보셔야 합니다.
실제로 올려 쓰실 계획이라면 넷째 줄도 챙기세요. 한 번에 십삼만 토큰 남짓을 읽을 수 있는데, 화면 사진은 글자보다 훨씬 많은 자리를 차지합니다. 지난 화면을 다섯 장으로 묶어 두라는 권장값이 괜히 나온 게 아닙니다 — 긴 작업일수록 무엇을 들려 줄지 골라야 합니다.
덧붙여 이 모델은 가중치를 그대로 받는 방식이라, 화면 내용이 바깥으로 나가지 않는 환경을 꾸릴 수 있습니다. 업무 화면을 조작하게 시키려면 이 점이 상용 서비스와 갈리는 지점이죠. 물론 그만한 장비를 마련하는 비용과 맞바꾸는 셈입니다.
자주 묻는 질문 (FAQ)
Q. 제 컴퓨터에서 돌려 볼 수 있나요
어렵습니다. 한 번에 도는 건 170억이어도 전체를 메모리에 올려야 하기 때문입니다. 공개된 실행 예시가 고성능 가속기 여덟 장 구성이라, 개인 장비로는 절반 용량판도 버겁습니다.
Q. 상업적으로 써도 되나요
라이선스가 아파치 2.0이라 사용·수정·재배포가 열려 있습니다. 다만 바탕이 된 해외 공개 모델의 조건도 함께 확인하시는 편이 안전합니다.
Q. 2위면 실제로 잘 쓰이나요
2위는 화면에서 대상을 찾는 시험 기준입니다. 일을 끝까지 해내는 쪽은 아직 절반 언저리라, 사람이 확인하는 단계를 빼기엔 이릅니다.
Q. 한국어 성능은 떨어졌나요
발표 기준으로 한국어 시험 여덟 종에서 바탕 모델과 2점 안쪽입니다. 화면 조작을 얹으면서도 원래 능력을 크게 깎지 않았다는 뜻입니다.
정리하면
- 찾는 능력은 상위권입니다.
- 끝내는 능력은 아직입니다.
- 속도는 작고 메모리는 큽니다.
- 라이선스는 열려 있습니다.
- 바탕은 해외 공개 모델입니다.
※ 2026년 9월 18일 국내 매체 두 곳의 보도와 공개된 모델 카드를 대조해 정리했습니다. 기사에 증가 폭만 실린 항목은 모델 카드의 절대 점수를 함께 적었습니다.
※ 벤치마크 순위는 측정 시점과 조건에 따라 달라지고 리더보드는 계속 갱신됩니다. 도입을 검토하신다면 최신 순위와 라이선스 조항을 직접 확인하세요.
'AI & Vibe Coding' 카테고리의 다른 글
| Jev AI 모델이란 — 글자 대신 선택지·출력 토큰은 공짜 (0) | 2026.09.21 |
|---|---|
| 클로드 코드 하위 에이전트 재개 — 이력 그대로 이어짐·내가 멈춘 건 거부 (0) | 2026.09.18 |
| 클로드 코드 하위 에이전트 기억 — 범위 셋·켜면 쓰기 도구가 따라옴 (0) | 2026.09.18 |
| 클로드 코드 하위 에이전트 도구 — 적어 둬도 빠지는 것들·명령만 막는 법 (0) | 2026.09.18 |
| 클로드 코드 대화 갈라내기 — 맥락 그대로 물려받고 캐시까지 공유 (0) | 2026.09.18 |
