| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| 9 | 10 | 11 | 12 | 13 | 14 | 15 |
| 16 | 17 | 18 | 19 | 20 | 21 | 22 |
| 23 | 24 | 25 | 26 | 27 | 28 | 29 |
| 30 | 31 |
- 바이브코딩
- LLM
- 실무
- 오픈웨이트
- claude code
- Anthropic
- ChatGPT
- 앤트로픽
- 안드로이드
- Gemini
- Android Studio
- 안드로이드 스튜디오
- codex
- Claude
- cursor
- 오픈모델
- 로컬 llm
- AI 코딩
- MCP
- Android
- GPT-5.6
- OpenAI
- 무료 ai
- ai 뉴스
- 카드 없이
- AI 에이전트
- 무료 LLM
- ai코딩
- 홍드로이드
- 개발자
- Today
- Total
홍드로이드의 야매코딩
배치로 절반 값에 씁니다 — 다만 지출 상한을 넘길 수 있습니다 본문

배치 처리 · 비용
모든 토큰이 절반 값.
대신 상한이 헐거워집니다.
급하지 않은 작업을 묶어 보내면 입력도 출력도 전부 50퍼센트입니다. 그런데 문서 한구석에 이런 문장이 있었습니다 — "설정해둔 지출 상한을 약간 넘을 수 있습니다."
비용을 줄이는 수단을 차례로 봤습니다. 지출 상한으로 막고, 사용량을 읽고, 캐싱으로 반복분을 깎았습니다. 마지막 한 장이 남았습니다 — 아예 값을 절반으로 만드는 방법입니다.
📌 30초 요약
- 묶어서 비동기로 보내면 모든 사용량이 표준가의 50퍼센트입니다.
- 대부분 1시간 안에 끝나고, 24시간이 지나면 만료됩니다.
- 만료·취소된 요청은 과금되지 않습니다. 이건 문서에 명시돼 있습니다.
- 캐싱 할인과 겹쳐 쓸 수 있습니다. 다만 배치 안에서 캐시 예열은 안 됩니다.
- ⚠️ 설정해둔 지출 상한을 약간 넘을 수 있습니다. 상한이 절대선이 아니라는 뜻입니다.
① 할인폭은 명확합니다 — 전부 절반
📄 원문
"All usage is charged at 50% of the standard API prices."
"a 50% discount on all usage compared to standard API prices. This applies to input tokens, output tokens, and any special tokens."
→ 조건부 할인이 아닙니다. 입력·출력·특수 토큰까지 전부 절반입니다.
대신 즉시 답이 오지 않습니다. 요청을 묶어 던져두고 나중에 결과를 받아오는 방식입니다. 문서는 "대부분의 배치가 1시간 안에 끝난다"고 적고 있고, 결과는 전부 완료됐을 때 또는 24시간이 지났을 때 중 먼저 오는 쪽에 받을 수 있습니다.
💡 이런 작업에 맞습니다
문서가 든 예는 대량 데이터 분석, 대규모 평가, 상품 설명이나 요약 같은 대량 생성입니다. 공통점은 사람이 화면 앞에서 기다리지 않는 작업이라는 겁니다. 채팅 응답처럼 즉시성이 필요한 곳에는 못 씁니다.
② 안 끝나면 돈은 어떻게 되나
24시간 만료라는 말을 들으면 "그럼 하다 만 것도 돈을 내나"가 걱정됩니다. 문서에 답이 있습니다.
✅ 원문 — 과금되지 않는 경우
expired : "Batch reached its 24-hour expiration before this request could be sent to the model. You will not be billed for these requests."
canceled : "User canceled the batch before this request could be sent to the model. You will not be billed for these requests."
→ 모델에 전달되기 전에 만료되거나 취소된 요청은 청구되지 않습니다. 단서를 그대로 읽으세요 — "모델에 보내지기 전에"가 조건입니다.
그리고 한 요청이 실패해도 배치 전체가 멈추지 않습니다. 성공한 것만 결과로 받고 나머지는 상태값으로 구분됩니다. 대량 작업에서 이건 꽤 중요한 성질입니다.
⏳ 취소는 즉시 안 될 수 있습니다
문서에 "취소가 즉시 효력을 갖지 않을 수 있다"고 적혀 있습니다. 잘못 던진 걸 급히 멈추려 해도 이미 모델로 넘어간 요청은 과금됩니다. 던지기 전에 확인하는 편이 낫습니다.
③ 여기가 이 글의 핵심입니다 — 상한이 헐거워집니다
지출 상한을 거는 법에서 "상한은 곧 멈추는 날짜"라고 썼습니다. 그 전제를 흔드는 문장이 배치 문서에 있었습니다.
📄 원문 — 제한 사항 항목에 한 줄
"Because of high throughput and concurrent processing, batches may go slightly over your Workspace's configured spend limit."
→ 처리량이 크고 동시에 돌아가기 때문에, 배치는 설정된 지출 상한을 약간 넘을 수 있습니다.
⚠️ 범위를 정확히 잡겠습니다
문서가 쓴 단어는 "slightly"(약간)입니다. 얼마까지가 약간인지는 적혀 있지 않습니다. 그리고 이건 배치 처리의 특성으로 언급된 것이지, 상한 기능 전반이 무력하다는 뜻이 아닙니다.
제가 확인하지 못한 것 — 실제로 얼마나 넘는지, 초과분이 청구되는지, 초과 시 알림이 오는지. 전부 문서에 없고 저도 시험해보지 않았습니다. 제가 말할 수 있는 건 "넘을 수 있다고 문서가 적어뒀다"까지입니다.
그래도 실무적인 함의는 분명합니다. 대량 배치를 돌릴 계획이라면 상한을 예산에 딱 맞춰 잡지 마세요. 여유를 두고 그 아래로 잡는 편이 안전합니다.
④ 캐싱과 겹칠 수 있습니다 — 조건이 하나 붙습니다
앞 글의 캐싱 할인과 배치 할인이 중첩됩니다. 문서가 "두 기능의 할인이 겹쳐 적용된다"고 명시합니다. 다만 배치는 비동기라 주의할 점이 하나 있습니다.
📄 배치 안에서는 캐시 예열이 안 됩니다
문서 설명은 이렇습니다 — 배치 처리 중에 쓰인 임시 캐시 항목은 후속 요청이 실행되기 전에 만료될 가능성이 크기 때문에 예열용 설정을 배치 안에서는 지원하지 않습니다.
→ 그래서 문서는 배치와 함께 쓸 때 1시간짜리 캐시를 권합니다. 5분짜리는 배치가 도는 사이에 만료돼버리니까요.
앞 글에서 1시간 캐시는 세 번은 써야 본전이라고 계산했는데, 배치는 애초에 수백·수천 건을 한 번에 던지는 구조라 그 조건이 자연스럽게 채워집니다. 이 조합에서는 1시간 쪽이 맞습니다.
⑤ 한도와 보관 기간
| 항목 | 문서 기재 |
|---|---|
| 배치 하나의 최대 | 10만 건 또는 256 MB 중 먼저 도달하는 쪽 |
| 처리 시간 | 대부분 1시간 내 · 24시간 넘으면 만료 |
| 결과 보관 | 29일 — 기준은 생성 시각이지 완료 시각이 아님 |
| 범위 | API 키가 속한 워크스페이스 단위 |
| 수정 | 제출한 배치는 수정 불가 — 취소 후 재제출 |
📅 29일 기준이 생성 시각이라는 점
문서가 "created_at 기준이지 처리 완료 시각이 아니다"라고 못박아뒀습니다. 배치가 늦게 끝났다면 내려받을 수 있는 기간이 그만큼 짧아집니다. 결과를 오래 두고 쓸 거면 받아서 따로 저장해두세요.
자주 묻는 것
Q. 개인이 쓸 일이 있나요?
구독 요금제(웹·앱)에는 해당 없습니다. API를 직접 부르는 경우의 이야기입니다. 다만 개인이라도 글 수백 개를 한꺼번에 요약하거나 분류하는 작업이라면 값이 절반이 됩니다.
Q. 속도 제한은 따로인가요?
배치 API에는 자체 속도 제한이 있습니다. 그리고 문서는 수요와 요청량에 따라 처리가 느려질 수 있고, 그러면 24시간 만료가 더 많이 발생할 수 있다고 적어뒀습니다. 마감이 걸린 작업엔 안 맞습니다.
Q. 어떤 모델을 쓸 수 있나요?
문서에는 현재 활성 모델 전부가 지원된다고 되어 있습니다. 다만 기능 중에는 배치에서 제외되는 것들이 있어서, 쓰시려는 기능이 목록에 있는지는 직접 확인하셔야 합니다. 저는 전체 목록을 다 대조하지는 않았습니다.
📌 보탬 (8월 14일) — 단가가 하나가 아닌 경우도 있습니다
이 글은 배치로 절반을 다뤘습니다. 반대 방향도 있습니다 — 어떤 모델은 프롬프트 길이에 따라 단가가 두 배가 됩니다. 문턱에 닿는 순간 입력과 출력 전부가 높은 요율로 바뀌고, 비교표에는 낮은 쪽만 실립니다. 절감 수단을 따지기 전에 기준 단가가 하나인지부터 보셔야 합니다 → 프롬프트를 조금 더 넣었더니 값이 두 배
✨ 정리하면
급하지 않은 대량 작업이면 전부 절반 값입니다. 조건부 할인이 아니라 입력·출력 전부요.
만료·취소된 건 과금되지 않습니다. 단 모델로 넘어가기 전이어야 합니다.
그리고 지출 상한을 약간 넘을 수 있다고 문서가 적어뒀습니다. 대량으로 돌릴 거면 상한을 예산에 딱 맞추지 마세요.
🧭 AI 지출 전체 그림
이 글로 비용 절감 수단 네 가지가 모였습니다 — 상한 · 사용량 읽기 · 캐싱 · 배치. 개인·개발자·회사별로 묶어둔 허브는 여기입니다 → AI에 쓰는 돈 총정리 — 숨은 비용 7가지
🔗 비용 시리즈
- 지출 상한 거는 법 — 이 글에서 전제가 하나 흔들립니다
- 사용량 화면 읽는 법 — 숫자가 총량이 아닙니다
- 캐싱은 조용히 실패합니다 — 배치와 겹쳐 쓸 수 있습니다
- 첫 결제 전에 확인할 것
확인 시점 — 2026년 8월 13일 밤. ✅ 1차 확인 : Claude 플랫폼 문서 「Batch processing」 원문 직접 열람 — 50퍼센트 할인 문구 2건, 배치 한도(10만 건·256 MB), 처리 시간과 24시간 만료, 결과 보관 29일 및 생성 시각 기준, 만료·취소 요청의 미과금 문구, 지출 상한 초과 가능 문구, 캐싱 할인 중첩과 배치 내 캐시 예열 미지원, 제출 후 수정 불가와 취소 지연, 워크스페이스 범위, 배치 자체 속도 제한. 인용문은 원문 그대로입니다. 확인하지 않은 것 : 실제 API 호출로 검증 · 지출 상한을 얼마나 초과하는지("slightly"의 범위는 문서에 없음) · 초과분의 청구·알림 여부 · 배치에서 제외되는 기능의 전체 목록 · 타 제공사의 배치 정책. 가격과 한도는 예고 없이 바뀝니다. 제휴·협찬 없습니다.
'AI & Vibe Coding' 카테고리의 다른 글
| 프롬프트를 조금 더 넣었더니 값이 두 배 — Grok 4.6 단가표가 안 보여주는 것 (0) | 2026.08.14 |
|---|---|
| Grok 이미지가 부분 수정을 지원합니다 — 검색되는 설명은 대부분 출시 전 글입니다 (0) | 2026.08.14 |
| 30B 모델은 30GB가 아닙니다 — 받기 전에 재보는 법 (0) | 2026.08.13 |
| 프롬프트 캐싱은 조용히 실패합니다 — 에러도 안 납니다 (0) | 2026.08.13 |
| 결제 첫 달에 볼 것 — 사용량 화면의 숫자가 전부가 아닙니다 (0) | 2026.08.13 |
