홍드로이드의 야매코딩

프롬프트를 조금 더 넣었더니 값이 두 배 — Grok 4.6 단가표가 안 보여주는 것 본문

AI & Vibe Coding

프롬프트를 조금 더 넣었더니 값이 두 배 — Grok 4.6 단가표가 안 보여주는 것

홍드로이드 2026. 8. 14. 00:33
반응형

Grok 4.6 · 요금 구조

프롬프트를 1퍼센트 늘렸는데
값이 두 배가 됩니다.

오타가 아닙니다. 문서에 이렇게 적혀 있습니다 — "프롬프트가 해당 문턱에 닿는 요청은 그 요청의 모든 토큰이 높은 요율로 청구됩니다." 출력 토큰까지 포함해서요.

앞 글에서 Grok의 이미지 쪽을 봤으니 이번엔 언어 모델입니다. 새로 나온 Grok 4.6이 독립 평가에서 GPT 최신 모델과 같은 점수를 받았는데 값은 훨씬 쌉니다. 그래서 단가표를 열어봤다가 조건절 하나를 발견했습니다.

📌 30초 요약

  • 독립 평가 지수에서 둘 다 61점. 그런데 출력 단가는 6달러 대 30달러입니다.
  • ⚠️ 그 6달러는 프롬프트가 20만 토큰 미만일 때만입니다.
  • 문턱에 닿으면 입력·출력 전부 두 배로 청구됩니다.
  • ⚠️ 집계 사이트에는 낮은 쪽 단가만 표시됩니다. 평가 사이트도 마찬가지였습니다.
  • GPT-5.6은 같은 이름이 셋으로 갈립니다 — 입력 단가가 50배 차이납니다.

① 같은 점수, 다른 값 — 제3자 실측

만든 회사가 낸 숫자 말고 독립 평가 기관이 직접 잰 값을 먼저 놓습니다. 같은 지수(v4.1.1), 같은 방식입니다.

항목 Grok 4.6 (high) GPT-5.6 Sol (max)
지능 지수 61 61
입력 100만 토큰 2.00 달러 5.00 달러
출력 100만 토큰 6.00 달러 30.00 달러
출력 속도 초당 65.5 토큰 초당 59.8 토큰
컨텍스트 50만 100만

Artificial Analysis 자체 측정 · 지수 v4.1.1 · 2026년 8월 14일 조회

점수가 같은데 출력이 5배 쌉니다. 속도도 조금 빠릅니다. 여기까지만 보면 고민할 게 없어 보입니다. 평가 기관 페이지에는 지수 과제 하나당 0.84달러가 들었다는 계산까지 붙어 있습니다.

② 그런데 그 단가가 조건부입니다

만든 회사의 개발자 문서를 열었더니 단가가 한 줄이 아니라 두 줄이었습니다.

구간 입력 캐시 입력 출력
프롬프트 20만 미만 2.00 0.50 6.00
프롬프트 20만 이상 4.00 1.00 12.00

100만 토큰당 달러 · 개발자 문서 기준

📄 문서의 각주 — 여기가 핵심입니다

"requests whose prompt reaches the listed token threshold are billed at the higher rate for all tokens in the request."

→ 프롬프트가 문턱에 닿는 순간, 그 요청의 모든 토큰이 높은 요율로 청구됩니다. 넘은 부분만이 아니라 전부입니다. 출력 토큰도 포함이고요.

기준은 프롬프트 토큰 수입니다. 컨텍스트 창 크기가 아니라 이번에 실제로 보낸 프롬프트가 얼마냐로 갈립니다. 50만 컨텍스트를 내세우는 모델인데, 그 컨텍스트를 절반만 써도 이미 두 배 구간입니다.

③ 2천 토큰 차이로 값이 두 배 — 계산해봤습니다

문턱을 사이에 두고 거의 같은 요청 두 개를 비교했습니다. 출력은 둘 다 1만 토큰으로 고정했습니다.

# A. 프롬프트 199,000 토큰 (문턱 아래)
0.199 x 2.00  +  0.010 x 6.00  = 0.458 달러

# B. 프롬프트 201,000 토큰 (문턱 위)
0.201 x 4.00  +  0.010 x 12.00 = 0.924 달러

# 프롬프트는 1퍼센트 늘었는데 값은
0.924 / 0.458 = 2.02 배

💡 그래서 GPT와 다시 비교하면

30만 토큰짜리 문서를 넣고 1만 토큰을 받는 작업이라면 —
Grok 4.6 : 0.3 × 4.00 + 0.01 × 12.00 = 1.32 달러
GPT-5.6 Sol : 0.3 × 5.00 + 0.01 × 30.00 = 1.80 달러

여전히 Grok이 쌉니다. 다만 1.36배이지, 단가표만 보고 짐작한 2.7배가 아닙니다.

⚠️ 위 숫자는 제가 계산한 것입니다

문서에 있는 건 단가와 각주뿐이고, 위 금액은 그걸로 제가 산수한 값입니다. 캐시를 쓰지 않는다고 가정했고, 실제 청구서로 대조해보지도 않았습니다. 구조를 보여주려는 예시지 견적이 아닙니다.

④ 집계 사이트에는 이 구조가 안 보입니다

여러 모델을 모아 보여주는 곳들을 확인해봤습니다. 전부 낮은 쪽 단가만 표시하고 있었습니다.

어디서 본 값 Grok 4.6 단가 구간 표시
개발자 문서 2.00 / 6.00 과 4.00 / 12.00 있음
모델 중개 플랫폼 2.00 / 6.00 없음
독립 평가 기관 2.00 / 6.00 없음

틀린 값을 적었다는 게 아닙니다. 짧은 요청이라면 2.00과 6.00이 맞습니다. 다만 비교표는 대개 한 칸에 한 숫자만 넣기 때문에, 구간이 있는 모델은 유리한 쪽만 남습니다.

🧭 그래서 이렇게 보세요 — 2분

1. 비교표에서 후보를 좁힙니다. 거기까지가 집계 사이트의 역할입니다.

2. 고른 모델의 공식 가격 페이지를 열고 각주까지 읽습니다. 표 아래 작은 글씨에 조건이 있습니다. 검색어는 모델명 + pricing이면 됩니다.

⑤ 같은 이름이 셋입니다 — 50배 차이

비교하려고 GPT 쪽 목록을 뽑다가 본 것입니다. "GPT-5.6"이라는 이름 아래 세 가지가 따로 있었습니다.

이름 입력 출력
GPT-5.6 Luna 0.10 0.60
GPT-5.6 Terra 1.00 6.00
GPT-5.6 Sol 5.00 30.00

100만 토큰당 달러 · 모델 목록 API 실측 · 셋 다 컨텍스트 105만

입력 기준 Luna와 Sol이 50배 차이입니다. "GPT-5.6을 쓴다"는 말만으로는 비용이 정해지지 않는다는 뜻입니다. 각각에 probatch 변형까지 따로 있어서 실제 조합은 더 많습니다. 모델 이름 뒤에 붙은 단어까지가 모델 이름입니다.

⑥ 벤치 숫자는 누가 쟀나 — 의심했다가 틀렸습니다

만든 회사 발표문에는 벤치마크 열 가지가 실려 있습니다. 그 페이지는 전부 자체 측정치라고 표기하고 있고, 그중 지능 지수 61점만 제3자 지표를 인용한 것이었습니다.

🔍 확인해봤고, 제 의심이 틀렸습니다

처음 평가 기관의 모델 목록 페이지를 열었을 때 Grok 4.6이 안 보였습니다. "벤더가 인용한 점수가 원 출처에서 확인이 안 되는 건가" 싶었습니다.

그래서 모델 상세 페이지를 따로 열었더니 있었습니다. 지수 v4.1.1에서 61점, 184개 중 6위. 목록 페이지를 제가 일부만 받았던 겁니다. 인용은 맞았고 제 의심이 틀렸습니다. 확인 없이 "확인이 안 된다"고 썼으면 없는 문제를 만들 뻔했습니다.

나머지 아홉 개 항목은 여전히 만든 회사가 잰 숫자입니다. 그래서 이 글의 비교표에는 제3자가 잰 값만 넣었습니다. 자체 측정치가 틀렸다는 게 아니라, 같은 조건에서 잰 것끼리 비교해야 비교가 되기 때문입니다.

자주 묻는 것

Q. 그래서 뭐가 더 좋나요?

둘 다 안 써봤습니다. 이 글에 성능 우열은 없습니다. 제3자 지수로는 같은 점수이고, 값은 짧은 요청이면 Grok이 확실히 싸고 긴 요청이면 격차가 줄어든다는 것까지입니다.

Q. 문턱을 피할 수 있나요?

기준이 한 요청의 프롬프트 길이이니, 긴 문서를 여러 요청으로 쪼개면 낮은 구간에 머뭅니다. 다만 쪼개면 맥락이 끊기고 요청 수가 늘어납니다. 어느 쪽이 이득인지는 작업마다 다릅니다 — 제가 일반화할 수 있는 부분이 아닙니다.

Q. 다른 모델도 이런 구간이 있나요?

같은 회사의 이전 버전에도 같은 구조가 있었습니다. 다른 회사 것은 이번에 전부 확인하지 않았습니다. 쓰시는 모델의 가격 페이지에서 표 아래 각주를 보세요.

📌 보탬 (8월 14일) — 같은 회사가 봇 제품도 내놨습니다

이 글에서 문서의 각주까지 읽으라고 했는데, 같은 회사 신제품에서도 같은 일이 있었습니다. 봇 발표 페이지에 "봇들은 자기 컴퓨터를 가진다""봇들이 컴퓨터 하나를 공유한다"같이 적혀 있습니다. 내 계정 로그인을 맡기는 제품이라 그냥 넘기기 어려운 차이입니다 → 봇에게 내 계정 로그인을 넘기기 전에

📌 보탬 (8월 14일) — "다른 곳도 그런가"를 확인했습니다

이 글 각주에 "타 제공사의 구간 요금 유무는 확인하지 않았다"고 적었는데, 세 곳을 열어봤습니다. Gemini에도 구간 요금이 있었고 임계는 똑같이 20만 토큰이었습니다. 다만 Pro 계열에만 있고 Flash 계열은 단일가였습니다. Claude는 없다고 명시합니다 — "90만 토큰 요청도 9천 토큰과 같은 요율". 그리고 단가와 무관하게 같은 글의 토큰이 30퍼센트 더 나오는 경우도 찾았습니다 → 단가가 같아도 청구는 다릅니다

✨ 정리하면

제3자 지수로는 같은 61점인데 출력 단가는 6달러 대 30달러. 여기까지는 명확합니다.

다만 그 6달러는 프롬프트 20만 토큰 미만일 때이고, 문턱에 닿으면 그 요청의 모든 토큰이 두 배가 됩니다. 비교표에는 낮은 쪽만 실립니다.

표로 후보를 좁히고, 공식 가격 페이지의 각주까지 읽으세요. 2분이면 됩니다.

🧭 AI 지출 전체 그림

모델을 고른 다음엔 쓰면서 새는 곳이 따로 있습니다. 개인·개발자·회사별로 묶어둔 허브는 여기입니다 → AI에 쓰는 돈 총정리 — 숨은 비용 7가지

🔗 비용 시리즈


확인 시점 — 2026년 8월 14일. ✅ 1차 확인 : xAI 개발자 문서의 모델 가격표(구간별 단가·캐시 입력가·컨텍스트) 및 각주 원문 "requests whose prompt reaches the listed token threshold are billed at the higher rate for all tokens in the request." · xAI 공식 발표문(2026-08-12 출시, 벤치마크 열 항목이 자체 측정으로 표기됨) · 제3자 실측 : Artificial Analysis의 Grok 4.6(high)·GPT-5.6 Sol(max) 모델 상세 페이지(지수 v4.1.1, 지능 지수·단가·출력 속도·컨텍스트, 순위 184개 중 6위) · 플랫폼 API 실측 : 모델 목록 API로 GPT-5.6 세 갈래의 단가와 컨텍스트 수집. 제가 계산한 것 : 본문 ③의 금액은 위 단가로 직접 산수했으며 캐시 미사용을 가정한 예시입니다. 실제 청구서와 대조하지 않았습니다. 확인하지 않은 것 : 두 모델을 직접 실행한 성능 비교 · 자체 측정 벤치 아홉 항목의 재현 · 타 제공사의 구간 요금 유무 · 요청 분할 시의 실제 손익. 가격과 순위는 예고 없이 바뀝니다. 제휴·협찬 없습니다.

반응형
Comments