홍드로이드의 야매코딩

GPT-6 루나 출시 — 백만 토큰 0.1달러·요약과 분류 전용 본문

AI & Vibe Coding

GPT-6 루나 출시 — 백만 토큰 0.1달러·요약과 분류 전용

홍드로이드 2026. 9. 23. 18:11
반응형

9월 22일 함께 나온 두 모델 중 작은 쪽이 GPT-6 루나입니다. 값이 눈에 띄는데 — 백만 토큰에 넣는 쪽 0.1달러입니다. 우리 돈 140원 남짓이죠.

회사가 권하는 쓰임이 분명합니다 — 목표가 뚜렷한 대량 작업입니다. 문서를 요약하고, 정보를 뽑아내고, 짧은 질문에 답하는 일이죠. 글을 길게 쓰는 자리가 아니라 많이 처리하는 자리입니다.

📌 30초 요약

  • 백만 토큰에 0.1달러입니다.
  • 캐시는 0.01달러입니다.
  • 맥락은 형과 똑같습니다.
  • 점수도 형에 가깝습니다.
  • 작업당 값은 10분의 1입니다.

1. 값이 어느 수준인가

숫자를 먼저 보겠습니다. 넣는 쪽 0.1달러, 내놓는 쪽 0.5달러입니다. 캐시에 올려 둔 걸 다시 읽으면 0.01달러까지 내려가고요.

항목(백만 토큰당) 값
넣는 쪽 0.1달러 — 약 140원
내놓는 쪽 0.5달러 — 약 700원
캐시 읽기 0.01달러 (90% 할인)
형과 견주면 넣는 쪽 기준 20분의 1

감을 잡으시려면 이렇게 보시면 됩니다. 책 한 권 분량이 대략 10만 토큰이니, 책 열 권을 통째로 읽히는 데 140원인 셈입니다. 대량으로 훑어야 하는 일에서는 값을 거의 신경 쓰지 않아도 되는 수준이죠.

넷째 줄의 20분의 1이 이 모델의 자리를 말해 줍니다. 같은 회사의 큰 쪽이 넣는 쪽 2달러인데 여기는 0.1달러니까요. 다만 내놓는 쪽은 5분의 1이라 비율이 다릅니다 — 답을 길게 쓰는 작업일수록 격차가 줄어든다는 뜻이죠. 짧게 답하는 일에 붙일수록 값 차이를 온전히 누립니다.

2. 싼데 성능은 어떤가

여기가 놀라운 대목입니다. 값이 20분의 1인데 점수는 형과 몇 점 차이밖에 안 납니다.

잣대 루나 (작업당 값)
소프트웨어 수정 66.6% (0.22달러)
긴 과제 수행 50.9% (0.15달러)
어려운 코드 과제 42.4% (0.11달러)
업무 자동화 20.7% (0.037달러)

첫째 줄을 보시면 소프트웨어 수정에서 66.6%입니다. 형이 68.8%였으니 2.2점 차이인데, 작업당 값은 2.74달러 대 0.22달러로 열두 배가 넘게 벌어집니다. 같은 일을 열 번 시켜도 형 한 번 값이 안 되는 셈이죠.

정확도 쪽도 좋아졌습니다. 이전 세대의 큰 모델과 견줘 41%에서 54%가량 실수가 줄었다고 하고, 소프트웨어 수정에서는 값이 약 59% 절약됐다고 합니다. 맥락 창도 형과 같아서 백만 토큰을 넘게 받습니다.

3. 어떤 일에 붙이나

회사가 드는 쓰임은 대량 분류·추출·라우팅·요약 넷입니다. 공통점은 답이 짧고, 판단이 단순하고, 건수가 많다는 것이죠.

이 쓰임은 판정만 떼어 값싼 도구에 맡기던 방식과 정확히 겹칩니다. 다만 차이가 하나 있는데, 루나는 여전히 글을 쓰는 모델이라는 점입니다. 요약문이나 추출 결과를 문장으로 내놓을 수 있죠. 대신 형식이 어긋날 여지도 함께 남습니다.

⚠️ 업무 자동화 점수는 20.7%입니다

표의 넷째 줄을 그냥 넘기면 안 됩니다. 여러 단계를 밟아 업무를 끝내는 시험에서 다섯 번에 한 번꼴로 성공합니다. 형이 33.2%, 경쟁사 상위 모델이 40.0%인 것과 견주면 확실히 낮죠. 값이 싸다고 여러 단계짜리 작업을 통째로 맡기면 대부분 실패합니다. 이 모델의 자리는 한 번에 하나씩 판단하는 일입니다 — 문서 하나 요약, 항목 하나 분류처럼요. 여러 단계가 필요하다면 단계를 잘게 쪼개 각각을 맡기고, 흐름은 코드가 쥐는 구조로 짜셔야 합니다.

4. 값이 이렇게 내려가면

이 정도 값이 되면 기존에 포기했던 일들이 다시 계산에 들어옵니다. 메일 수만 통을 분류한다거나, 고객 문의 전부에 태그를 붙인다거나, 문서 수천 건에서 특정 항목을 뽑아내는 일들이죠. 예전에는 값 때문에 사람이 하거나 아예 안 하던 작업입니다.

다만 싸다고 다 좋은 건 아닙니다. 건수가 많다는 건 틀린 것도 많이 쌓인다는 뜻이거든요. 5%가 틀리는 작업을 만 건 돌리면 500건이 틀린 채로 들어갑니다. 확률을 함께 받아 경계선을 긋던 방식처럼, 어디까지 자동으로 넘기고 어디부터 사람이 볼지를 정해 두셔야 합니다.

쓸 수 있는 곳은 형과 같습니다 — 업무용 챗지피티, 코드 작업 도구, 개발자용 접속 셋이고 출시 당일부터 열렸습니다. 형과 루나를 어떻게 갈라 쓰는지는 따로 정리해 두었습니다.

값이 이 수준까지 내려온 배경도 한 번 짚어 둘 만합니다. 작은 모델의 값은 지난 한 해 동안 꾸준히 떨어져 왔는데, 이번엔 성능을 거의 유지하면서 절반을 깎았다는 점이 다릅니다. 무료로 쓸 수 있는 선택지를 모아 보던 때와 견주면, 이제는 「무료냐 유료냐」보다 「이 값이면 그냥 쓰지」 쪽으로 판단이 옮겨 가는 구간에 들어선 셈입니다.

물론 무료 선택지가 의미 없어진 건 아닙니다. 카드를 등록하지 않고 시작할 수 있다는 조건은 여전히 큰 차이고, 대량으로 돌리기 전 시험 삼아 돌려 볼 자리로는 무료 쪽이 편합니다. 다만 실제 운영 단계로 넘어갈 때의 문턱은 확실히 낮아졌습니다.

자주 묻는 질문 (FAQ)

Q. 이렇게 싼데 왜 형을 쓰나요

여러 단계를 밟는 작업에서 차이가 큽니다. 업무 자동화 점수가 20.7% 대 33.2%죠. 한 번에 하나씩 판단하는 일이면 루나로 충분합니다.

Q. 코딩에도 쓸 수 있나요

소프트웨어 수정에서 66.6%로 형과 2.2점 차이입니다. 단순한 수정이라면 값 대비 훌륭하지만, 복잡한 추적은 형이나 상위 모델이 맞습니다.

Q. 한국어도 되나요

공개된 점수는 대부분 영어 기준입니다. 대량으로 돌리기 전에 우리말 표본 수백 건으로 먼저 재 보시길 권합니다 — 값이 싼 만큼 시험 비용도 거의 안 듭니다.

Q. 맥락 창이 작지 않나요

아닙니다. 형과 똑같이 백만 토큰을 넘게 받습니다. 값이 싸면서 큰 자료를 받을 수 있다는 게 이 모델의 강점입니다.

정리하면

  • 백만 토큰에 140원입니다.
  • 점수는 형과 몇 점 차이입니다.
  • 맥락은 똑같이 큽니다.
  • 여러 단계는 약합니다.
  • 많이 돌리면 오류도 쌓입니다.

※ 2026년 9월 22일 발표 직후 공개된 가격·성능 수치를 여러 매체에서 대조해 정리했습니다. 원화 환산은 대략적인 값이라 환율에 따라 달라집니다.

※ 작업당 값은 특정 시험 환경 기준입니다. 실제 지출은 넣는 자료의 양에 따라 크게 달라집니다.

반응형
Comments