홍드로이드의 야매코딩

루나와 솔 갈라 쓰기 — 작업당 값은 열 배·점수는 두 점 차 본문

AI & Vibe Coding

루나와 솔 갈라 쓰기 — 작업당 값은 열 배·점수는 두 점 차

홍드로이드 2026. 9. 23. 18:14
반응형

솔과 루나가 같은 날 나왔는데, 회사가 권하는 쓰임이 다릅니다. 그런데 점수표를 나란히 놓으면 생각보다 차이가 작습니다 — 어떤 항목은 2.2점밖에 안 벌어지죠.

반면 작업 한 건을 끝내는 값은 열 배가 넘게 갈립니다. 그래서 고르는 기준이 「어느 쪽이 더 똑똑하냐」가 아니라 「이 일에 그 차이를 살 값어치가 있냐」가 됩니다.

📌 30초 요약

  • 코드 수정은 2.2점 차입니다.
  • 업무 자동화는 12.5점 차입니다.
  • 값은 열 배 넘습니다.
  • 단계가 많으면 솔입니다.
  • 건수가 많으면 루나입니다.

1. 어디서 벌어지고 어디서 붙나

네 잣대를 나란히 놓으면 항목마다 격차가 전혀 다릅니다. 이게 이번 두 모델을 가르는 핵심입니다.

잣대 솔 ↔ 루나 (격차)
소프트웨어 수정 68.8 ↔ 66.6 (2.2점)
긴 과제 수행 56.4 ↔ 50.9 (5.5점)
어려운 코드 과제 49.3 ↔ 42.4 (6.9점)
업무 자동화 33.2 ↔ 20.7 (12.5점)

첫째 줄과 넷째 줄을 견줘 보세요. 한 번에 끝나는 수정 작업은 2.2점밖에 차이가 안 나는데, 여러 단계를 밟아야 하는 자동화는 12.5점이 벌어집니다. 격차가 다섯 배 넘게 다른 거죠.

이유는 짐작하기 어렵지 않습니다. 단계가 길어질수록 중간에 한 번 삐끗할 확률이 쌓입니다. 한 단계에서 95%씩 맞아도 열 단계를 밟으면 절반 가까이 떨어지죠. 작은 모델의 약점은 한 번의 판단이 아니라 그 판단을 이어 붙일 때 드러납니다.

이 성질은 설계에 바로 써먹을 수 있습니다. 작은 모델을 쓰고 싶다면 긴 흐름을 통째로 맡기지 말고 단계를 잘게 쪼개 각각을 따로 시키면 됩니다. 단계 사이를 잇는 판단은 코드가 하고요. 그러면 한 번의 판단만 잘하면 되는 구조가 되니 약점이 드러날 자리가 줄어듭니다. 값이 스무 배 싼 모델을 쓰면서도 정확도를 지키는 흔한 방법입니다.

2. 값을 함께 놓으면

점수 격차는 항목마다 다른데 값 격차는 어디서나 열 배 안팎으로 일정합니다. 그래서 점수가 붙는 항목일수록 루나가 유리해집니다.

작업당 값 솔 ↔ 루나
소프트웨어 수정 2.74 ↔ 0.22달러 (12배)
긴 과제 수행 2.93 ↔ 0.15달러 (19배)
어려운 코드 과제 2.14 ↔ 0.11달러 (19배)
업무 자동화 0.27 ↔ 0.037달러 (7배)

첫째 줄이 가장 극적입니다. 2.2점을 더 받으려고 열두 배를 내는 구조죠. 단순 계산으로 루나를 열 번 시켜도 솔 한 번 값이 안 됩니다. 실패해도 다시 시키면 되는 일이라면 답이 정해져 있는 셈입니다.

반대로 넷째 줄은 격차가 7배로 가장 작은데 점수 차이는 가장 큽니다. 이 조합에서는 솔을 쓸 이유가 분명하죠. 값 격차가 작고 점수 격차가 큰 자리가 바로 비싼 모델의 자리입니다.

한 가지 덧붙이면, 값 격차가 항목마다 다른 건 답 길이 때문입니다. 넣는 쪽 값은 스무 배 차이인데 내놓는 쪽은 다섯 배거든요. 그래서 답을 길게 쓰는 작업일수록 두 모델의 값이 가까워집니다. 자동화처럼 답이 긴 쪽에서 격차가 7배로 줄어든 것도 그 때문이죠. 뒤집어 말하면 짧게 답하는 일일수록 싼 모델의 이점이 온전히 살아납니다.

3. 갈라 붙이는 요령

둘 중 하나를 고르는 게 아니라 한 작업 안에서 나눠 쓰는 쪽이 실속 있습니다. 흐름은 이렇습니다 — 앞단에서 걸러 내고 분류하는 일은 루나, 실제로 고치고 만드는 일은 솔에게 맡기는 것이죠.

예를 들어 들어온 이슈 수백 건을 처리한다면, 루나가 먼저 종류를 나누고 급한 것을 골라내고 중복을 걸러 냅니다. 그렇게 남은 것만 솔에게 넘기죠. 판정을 떼어 값싼 쪽에 맡기던 구조와 같은 생각인데, 여기서는 같은 회사 두 모델로 층을 나누는 셈입니다.

⚠️ 앞단에서 잘못 거르면 뒤에서 못 살립니다

나눠 쓰는 구조에는 함정이 하나 있습니다. 값싼 모델이 앞에서 「이건 처리할 필요 없음」으로 걸러 버리면, 비싼 모델은 그걸 볼 기회조차 없습니다. 뒤에 아무리 좋은 모델을 세워도 앞단의 실수는 복구되지 않죠. 그래서 앞단은 「버리는 판단」보다 「넘기는 판단」 쪽으로 기울여 두는 게 안전합니다 — 애매하면 넘기게요. 값이 열 배 차이라도 앞단에서 흘린 한 건이 사고로 이어지면 그 절약은 의미가 없습니다. 걸러 내는 비율을 처음에는 넉넉히 잡고, 실제 결과를 보며 조이는 순서로 가세요.

4. 정하는 순서

고민을 줄이는 순서가 있습니다. 먼저 「이 일이 몇 단계인가」를 보세요. 한 번의 판단으로 끝나면 루나로 시작하시면 됩니다. 여러 단계를 밟아야 하면 솔이 기본이고요.

다음은 「틀리면 어떻게 되나」입니다. 다시 시키면 그만인지, 사람이 손봐야 하는지, 아니면 되돌릴 수 없는지죠. 되돌릴 수 없는 쪽으로 갈수록 비싼 모델과 사람 확인이 함께 필요합니다.

마지막은 실제로 재 보는 것입니다. 두 모델은 값 차이가 커서 시험 자체가 거의 공짜입니다. 평소 시키던 일 스무 건을 양쪽에 돌려 보면 공개된 점수보다 훨씬 정확한 답이 나옵니다. 무엇을 성공으로 볼지 기준을 세워 두는 일을 먼저 해 두시면, 앞으로 모델이 또 바뀌어도 돌리기만 하면 됩니다.

자주 묻는 질문 (FAQ)

Q. 그냥 루나만 쓰면 안 되나요

한 번에 끝나는 일이라면 됩니다. 다만 여러 단계를 밟는 작업에서는 12.5점이 벌어집니다. 자동화 흐름 전체를 맡기면 실패가 잦아집니다.

Q. 코드 수정은 어느 쪽인가요

점수가 2.2점 차이에 값은 열두 배라, 단순한 수정은 루나가 유리합니다. 복잡한 추적이 필요하면 솔이나 그 위 모델로 올리세요.

Q. 나눠 쓰면 관리가 복잡하지 않나요

두 갈래 정도면 감당할 만합니다. 앞단은 거르고 뒤는 처리하는 단순한 구조로 시작하세요. 더 잘게 나누는 건 효과를 확인한 뒤에 해도 늦지 않습니다.

Q. 어느 쪽부터 시험할까요

루나부터입니다. 값이 거의 안 드니 먼저 돌려 보고, 결과가 모자랄 때 솔로 올리는 순서가 낭비가 적습니다.

정리하면

  • 격차는 항목마다 다릅니다.
  • 단계가 길면 벌어집니다.
  • 값은 열 배 안팎입니다.
  • 앞단은 넉넉히 넘기세요.
  • 싼 쪽부터 재 보세요.

※ 2026년 9월 22일 발표 직후 공개된 두 모델의 점수와 작업당 값을 대조해 정리했습니다. 격차 계산은 공개 수치를 그대로 쓴 것입니다.

※ 시험 환경 기준 수치라 실제 작업에서의 성공률과는 다를 수 있습니다. 도입 전 직접 재 보시길 권합니다.

반응형
Comments