홍드로이드의 야매코딩

Claude 한국어 성능 — 영어의 96.7%, 급을 낮추면 벌어집니다 본문

AI & Vibe Coding

Claude 한국어 성능 — 영어의 96.7%, 급을 낮추면 벌어집니다

홍드로이드 2026. 9. 1. 11:35
반응형

"AI는 영어로 물어봐야 잘한다"는 말, 한 번쯤 들어보셨을 겁니다. 그런데 공식 문서에 언어별 성능을 영어 대비 백분율로 정리한 표가 있더군요. 한국어는 96.7%였습니다. 생각보다 차이가 작죠. 진짜 이야기는 그다음입니다 — 모델 급을 낮추는 순간, 떨어지는 폭이 언어마다 완전히 달라집니다. 싼 모델로 갈아탈 계획이라면 이 표를 먼저 봐야 합니다.

📌 30초 요약

  • ★★한국어는 영어의 96.7% — 일본어·중국어와 사실상 동급입니다.
  • ★급을 낮추면 언어마다 손해가 다릅니다 — 여기가 진짜입니다.
  • ★영어권 기준으로 판단하면 안 됩니다 — 손해가 두 배 가까이 큽니다.
  • ⚠️ 이 숫자는 "번역된 시험 문제"를 푼 점수입니다.
  • 확장 사고를 켠 상태의 점수입니다.
  • 응답 언어는 추론에 맡기지 말고 지시로 못박으세요.

한국어는 영어의 96.7%입니다

표는 영어를 100%로 놓고 나머지 언어를 상대 점수로 보여줍니다. 중간 급 모델 기준으로 한국어가 96.7%. 위에는 스페인어(98.2%), 이탈리아어(97.9%), 포르투갈어(97.8%), 프랑스어(97.5%)가 있고, 그 아래로 인도네시아어·독일어·아랍어·중국어가 촘촘하게 붙어 있습니다.

눈에 띄는 건 한국어(96.7%)·일본어(96.8%)·중국어(96.9%)가 사실상 같은 자리라는 점입니다. 힌디어도 한국어와 같은 수치고요. "동아시아 언어라서 불리하다"는 통념이 이 표에서는 안 보입니다. 아래쪽으로 내려가면 벵골어(95.4%), 스와힐리어(91.1%), 요루바어(79.7%) 순으로 떨어지는데, 진짜 격차는 언어권이 아니라 디지털 자료가 얼마나 쌓였느냐에서 갈립니다.

급을 낮출 때 손해가 언어마다 다릅니다

여기가 이 표에서 가장 값진 부분입니다. 같은 표에 가벼운 급 모델의 점수도 함께 실려 있는데, 두 급의 차이가 언어마다 전혀 다릅니다.

언어 중간 급 → 가벼운 급
스페인어 98.2% → 96.4% (거의 안 떨어짐)
한국어 96.7% → 93.3% (스페인어의 두 배 가까이)
스와힐리어 91.1% → 78.3% (뚝 떨어짐)
요루바어 79.7% → 52.7% (절반 수준)

결론이 분명합니다. "가벼운 모델로 바꿔도 큰 차이 없더라"는 영어권 후기를 그대로 믿으면 안 됩니다. 영어 기준으로는 손실이 거의 없어 보여도, 한국어에서는 그 손실이 눈에 띄게 큽니다. 자료가 적은 언어로 갈수록 격차는 더 벌어지고요. 무료·오픈 모델로 갈아타는 흐름을 검토 중이라면, 영어 벤치마크만 보고 결정하지 말고 한국어로 직접 같은 작업을 돌려보세요.

💡 실전 판단 기준

단순 분류·요약처럼 답이 짧은 일이면 급을 낮춰도 체감이 적습니다. 반대로 긴 글을 쓰거나 미묘한 뉘앙스를 다루는 일이면 한국어에서 격차가 그대로 드러나요. 문서 자체도 "표에 없는 언어도 되니 내 용도로 직접 시험해 보라"고 권합니다. 결국 내가 실제로 시킬 일로 재보는 게 유일한 답입니다.

이 숫자가 재는 것과 안 재는 것

숫자를 믿기 전에 무엇을 잰 건지 알아야죠. 이 점수는 영어로 된 객관식 지식 시험을 전문 번역가가 사람 손으로 옮긴 다국어판으로 잰 겁니다. 기계 번역이 아니라는 게 중요해요 — 자료가 적은 언어일수록 번역 품질이 점수를 좌우하는데 그걸 사람이 맡았으니까요.

동시에 한계도 분명합니다. 이건 "그 언어로 자연스럽게 글을 쓰는 능력"이 아니라 "번역된 문제를 푸는 능력"입니다. 문체가 자연스러운지, 존댓말이 맞는지, 문화적 맥락을 아는지는 이 표에 안 담겨요. 그리고 한 가지 더 — 확장 사고를 켠 상태에서 잰 점수입니다. 껐을 때도 같은 비율이 나온다는 보장은 없습니다. 무료로 API를 써볼 수 있는 곳들에서 같은 조건을 맞춰 비교해 보면 체감이 다를 수 있어요.

실제로 쓸 때 챙길 네 가지

문서가 권하는 실무 지침이 몇 개 있는데, 하나같이 "알아서 해주겠지"를 경계합니다.

첫째, 응답 언어를 추론에 맡기지 마세요. 알아서 맞추긴 하지만, 실제 서비스라면 지시문에 명시하는 게 확실합니다. 특히 대화 내내 안정적으로 유지하려면 매 질문이 아니라 시스템 지시 쪽에 넣어야 해요. 사용자가 언어를 고를 수 있는 앱이면, 그 선택을 지시문에 끼워 넣으세요 — 사용자가 쓴 문장에서 눈치채길 기대하지 말고.

둘째, 번역을 시킬 땐 출발 언어와 도착 언어를 둘 다 말하고 "번역문만 내놓으라"고 덧붙이세요. 셋째, 음차 표기 말고 원래 문자로 넣는 게 결과가 좋습니다. 넷째, 문장이 딱딱하면 "원어민이 쓰듯 관용적으로 써달라"고 한마디 붙이면 유창해집니다. 긴 대화에서 앞부분이 정리되는 상황이라면, 이 언어 지시가 시스템 쪽에 있어야 사라지지 않는다는 점도 같이 기억해 두세요.

🔁 한국어가 아예 대상에서 빠지는 기능도 있습니다

한국어 성능이 영어의 96.7%라는 건 「답을 얼마나 잘 하느냐」 얘기인데, 기능 자체가 한국어를 안 보는 자리도 있습니다. 입력창 맞춤법 검사가 그렇습니다 — 한국어·중국어·일본어 등은 검사 대상에서 통째로 빠집니다. 게다가 검사 프로그램을 직접 깔아야 동작하고요. 모델의 한국어 실력과 도구의 한국어 지원은 별개라, 기능을 켤 때마다 「이건 한글에도 적용되나」를 따로 확인하는 편이 낫습니다.

자주 묻는 질문 (FAQ)

Q. 그럼 영어로 물어보는 게 이득인가요?

품질 차이만 보면 3%p 남짓이라 대부분의 일에서는 체감이 적습니다. 다만 토큰이 더 드는 문제는 별개예요. 품질과 비용은 나눠서 따지세요.

Q. 표에 없는 언어는 안 되나요?

됩니다. 문서가 "표에 실린 것보다 훨씬 많은 언어를 다룬다"고 밝히고, 표준 문자 체계를 쓰는 대부분의 언어를 처리한다고 적어요. 다만 성능은 언어마다 다르니 직접 시험해 보라고 합니다.

Q. 자료가 적은 언어는 아예 못 쓰나요?

문서 표현은 "의미 있는 수준의 능력은 유지한다"입니다. 다만 앞의 표에서 봤듯 급을 낮출 때 무너지는 폭이 가장 큰 쪽이 여기예요. 그런 언어일수록 급을 아끼면 안 됩니다.

Q. 번역 품질을 미리 검증하려면?

문서가 "서비스에 내보내기 전에 평가 기준을 세우고 시험하라"는 안내로 연결합니다. 표의 점수는 출발점이지 결론이 아니라는 뜻이죠.

✨ 정리하면

한국어 성능은 걱정할 만큼 낮지 않습니다. 정작 조심할 건 "싼 모델로 갈아탈 때"예요 — 영어에서는 거의 티가 안 나는 손실이 한국어에서는 두 배 가까이 커집니다. 영어권 후기 말고 내 작업으로 직접 재보고, 응답 언어는 시스템 지시에 못박으세요. 모델 급과 비용을 함께 저울질하는 흐름은 AI 지출 관리 허브에 단계별로 정리해 두었습니다.

출처: Claude 공식 문서 「다국어 지원」 (2026-09-01 열람). 점수는 영어 객관식 지식 시험을 전문 번역가가 옮긴 다국어판으로 측정한 값이며, 확장 사고를 켠 상태 기준입니다. 모델과 판이 바뀌면 수치도 달라질 수 있습니다.

반응형
Comments