| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- MCP
- claude code
- 오픈모델
- claudecode
- 카드 없이
- Claude
- 바이브코딩
- 개발자 도구
- LLM
- Gemini
- Anthropic
- 무료 ai
- 자동화
- 개발환경
- 클로드코드
- 클로드 API
- AI 에이전트
- AI 코딩
- ai에이전트
- Android
- 실무
- 홍드로이드
- AI 에이전트 개발
- Android Studio
- ai 뉴스
- 무료로 시작하기
- 안드로이드 스튜디오
- OpenAI
- 안드로이드
- 개발 생산성
- Today
- Total
홍드로이드의 야매코딩
GPT-6 솔 성능 뜯어보기 — 여섯 중 넷만 오르고 둘은 내림 본문

값이 절반으로 내렸다는 소식이 크게 다뤄졌는데, 점수표를 들여다보면 「전부 좋아졌다」는 아닙니다. 회사 설명도 여섯 잣대 중 넷에서 올랐다고 적고 있죠.
나머지 둘이 어디냐가 중요합니다. 하필 소프트웨어 수정과 컴퓨터 조작에서 최고 점수가 이전 세대보다 낮습니다 — 코딩에 쓰려던 분이라면 짚고 넘어가야 할 대목입니다.
📌 30초 요약
- 넷은 오르고 둘은 내림입니다.
- 코딩 최고점이 낮아졌습니다.
- 대신 값이 확 줄었습니다.
- 업무 자동화는 경쟁사가 위입니다.
- 싼 게 답일 때가 있습니다.
1. 내려간 자리부터
보도된 내용 중 가장 조용히 지나간 문장이 이것입니다 — 소프트웨어 수정과 컴퓨터 조작 시험에서 솔의 최고 점수가 이전 세대보다 낮다는 것이죠. 값이 절반이라는 헤드라인에 묻히기 쉬운 대목입니다.
이게 뜻하는 바는 분명합니다. 가장 어려운 문제를 끝까지 풀어내는 능력은 조금 물러섰고, 대신 보통 난이도를 훨씬 싸게 처리하는 쪽으로 무게가 옮겨 갔습니다. 회사가 실수가 절반으로 줄었다고 강조한 것과도 맞아떨어지죠 — 덜 틀리는 것과 더 어려운 걸 푸는 건 다른 능력이니까요.
이런 방향 전환 자체는 이상한 일이 아닙니다. 작은 등급 모델을 만들 때는 모든 걸 다 잘하게 만들기보다 「자주 쓰는 일을 싸게」 쪽으로 다듬는 게 보통이니까요. 문제는 발표문이 그 절충을 앞세우지 않는다는 점입니다 — 「값 절반」과 「실수 절반」이 먼저 나오고, 내려간 항목은 세부 수치에 묻힙니다.
그래서 새 모델 소식을 보실 때 「무엇이 올랐나」만큼 「무엇이 안 올랐나」를 함께 찾아보시는 습관이 값을 합니다. 대개 발표문 어딘가에 「대부분의」·「여섯 중 넷」 같은 단서가 붙어 있고, 그 단서가 빠진 항목이 바로 절충한 자리입니다.
⚠️ 어려운 작업을 맡기던 분은 그대로 갈아타면 안 됩니다
새 세대가 나오면 「최신이 더 좋겠지」라고 생각하기 쉽습니다. 그런데 이번엔 가장 까다로운 작업에서 최고 점수가 뒤로 갔습니다. 복잡한 버그를 끝까지 추적하거나 화면을 보고 여러 단계를 밟는 작업이라면, 갈아탄 뒤 성공률이 떨어져도 값이 싸져서 눈치채기 어려울 수 있습니다. 청구액만 보면 개선처럼 보이니까요. 어려운 작업을 맡기고 계셨다면 갈아타기 전에 평소 시키던 일 열 건 정도로 성공률을 먼저 재 보세요. 싸졌는데 두 번 시켜야 한다면 아낀 게 아닙니다.
2. 그래도 값을 보면 달라집니다
점수만 보면 아쉽지만 「그 점수를 내는 데 든 값」을 함께 놓으면 그림이 바뀝니다. 공개된 수치에서 모든 항목의 작업당 값이 대략 절반 이상 줄었기 때문이죠.
| 잣대 | 솔의 점수 · 작업당 값 |
|---|---|
| 소프트웨어 수정 | 68.8% · 2.74달러 |
| 긴 과제 수행 | 56.4% · 2.93달러 |
| 어려운 코드 과제 | 49.3% · 2.14달러 |
| 업무 자동화 | 33.2% · 0.27달러 |
넷째 줄이 이 모델의 성격을 가장 잘 보여 줍니다. 한 건에 400원이 안 드는 자리죠. 점수가 33%라 낮아 보이지만, 열 번 시켜도 4천 원이 안 됩니다. 실패하면 다시 시키면 되는 종류의 일이라면 이 값이 압도적입니다.
반대로 첫째·둘째 줄은 한 건에 3천~4천 원대입니다. 여기서는 실패 한 번의 값이 크니 성공률이 훨씬 중요해집니다. 같은 모델을 두고도 어느 일에 쓰느냐에 따라 따져야 할 잣대가 달라진다는 뜻이죠.
3. 경쟁 모델과 나란히 놓으면
마침 같은 날 나온 경쟁 모델과 겹치는 잣대가 둘 있습니다. 나란히 놓으면 이렇습니다.
| 겹치는 잣대 | 솔 ↔ 경쟁 모델 |
|---|---|
| 업무 자동화 | 33.2% ↔ 40.0% |
| 어려운 코드 과제 | 49.3% ↔ 54.4% |
| 넣는 쪽 값 | 2달러 ↔ 4달러 |
| 내놓는 쪽 값 | 10달러 ↔ 20달러 |
그림이 깔끔합니다 — 점수는 경쟁 모델이 앞서고 값은 솔이 절반입니다. 어느 쪽이 낫다기보다 「성공률을 살 것이냐, 횟수를 살 것이냐」의 문제죠.
다만 이 비교를 너무 곧이곧대로 받아들이시면 안 됩니다. 회사마다 공개하는 잣대가 다르고, 이름이 같아도 판올림이 다르면 조건이 어긋납니다. 여기 적은 두 항목은 판올림이 맞아떨어진 경우라 놓아 본 것이고, 나머지는 나란히 세울 수 없습니다.
4. 그래서 어떻게 고르나
기준은 실패를 얼마나 감당할 수 있느냐 하나로 좁혀집니다. 실패해도 다시 시키면 그만인 일 — 분류, 초안 만들기, 대량 처리 — 이라면 값이 싼 쪽이 거의 항상 이깁니다. 열 번 시켜도 한 번 값이 안 되니까요.
반대로 사람이 뒤를 봐 줘야 하거나 되돌리기 어려운 일이라면 성공률 몇 퍼센트가 값 차이를 덮습니다. 판정만 떼어 값싼 모델에 맡기던 방식처럼, 한 작업 안에서도 단계를 갈라 붙이는 게 결국 가장 알뜰합니다.
끝으로 확인 방법 하나. 새 모델로 갈아타실 때는 평소 시키던 일 열 건을 골라 양쪽에 똑같이 돌려 보세요. 공개된 점수보다 내 작업에서의 성공률과 값이 훨씬 정확한 잣대입니다.
이때 무엇을 성공으로 볼지 먼저 정해 두셔야 합니다. 「그럴듯해 보인다」로 세면 값싼 쪽이 유리하게 나오기 쉽거든요. AI 답을 잴 기준을 미리 만들어 두던 작업이 이런 순간에 값을 합니다 — 기준이 있으면 모델이 바뀔 때마다 재는 게 아니라 돌리기만 하면 되니까요. 값이 이렇게 자주 움직이는 시기라면 더더욱 그렇습니다.
자주 묻는 질문 (FAQ)
Q. 이전 세대보다 나빠진 건가요
여섯 중 넷은 올랐고 둘은 최고 점수가 내려갔습니다. 평균적으로는 덜 틀리고 훨씬 싸졌지만, 가장 어려운 문제에서는 뒤로 갔다고 보시면 됩니다.
Q. 코딩에 써도 되나요
보통 난이도는 값 대비 훌륭합니다. 다만 복잡한 버그 추적처럼 어려운 작업이라면 갈아타기 전에 성공률을 직접 재 보세요.
Q. 경쟁 모델과 점수 차이가 큰가요
겹치는 두 잣대에서 5~7점 정도 앞섭니다. 대신 값이 두 배라, 그 차이를 살 값어치가 있는 작업인지로 판단하시면 됩니다.
Q. 작업당 값은 믿을 만한가요
특정 시험 환경에서 잰 수치입니다. 방향을 보는 데는 좋지만 내 지출을 예측하는 값은 아닙니다. 실제 작업으로 한 번 재 보셔야 합니다.
정리하면
- 둘은 뒤로 갔습니다.
- 덜 틀리는 것과 다릅니다.
- 작업당 값은 절반 아래입니다.
- 점수는 경쟁사가 위입니다.
- 실패 감당으로 가르세요.
※ 발표 직후 공개된 벤치마크 수치를 여러 매체에서 대조해 정리했습니다. 경쟁 모델과의 비교는 판올림이 맞아떨어지는 두 항목만 골라 적었습니다.
※ 점수와 작업당 값은 시험 환경 기준이라 실제 결과와 다를 수 있습니다. 도입 전 직접 재 보시길 권합니다.
'AI & Vibe Coding' 카테고리의 다른 글
| 루나와 솔 갈라 쓰기 — 작업당 값은 열 배·점수는 두 점 차 (0) | 2026.09.23 |
|---|---|
| GPT-6 루나 출시 — 백만 토큰 0.1달러·요약과 분류 전용 (0) | 2026.09.23 |
| GPT-6 솔 출시 — 값은 절반·작업당 비용도 절반으로 (0) | 2026.09.23 |
| 오퍼스 5.5 안전장치 — 보안 작업은 옛 모델이 대신 받음 (0) | 2026.09.23 |
| 클로드 오퍼스 5.5 출시 — 값은 20% 내리고 캐시 읽기는 60% 내림 (0) | 2026.09.23 |
