홍드로이드의 야매코딩

Jev와 기존 LLM 차이 — 쓰지 않고 고르며 확률까지 함께 본문

AI & Vibe Coding

Jev와 기존 LLM 차이 — 쓰지 않고 고르며 확률까지 함께

홍드로이드 2026. 9. 21. 17:55
반응형

앞 글에서 살펴본 Jev를 두고 「그냥 작은 LLM 아니냐」고 보시는 분이 많습니다. 그런데 답을 만들어 내는 방식 자체가 다릅니다. 우리가 아는 모델은 한 글자씩 이어 쓰며 다음 글자를 예측하는데, 이쪽은 그 과정이 아예 없습니다.

차이는 네 군데에서 갈립니다 — 무엇을 내놓느냐, 어떻게 만드느냐, 확률을 주느냐, 값을 어떻게 받느냐. 하나씩 보면 「대체재가 아니라 다른 물건」이라는 게 분명해집니다.

📌 30초 요약

  • 이어 쓰지 않습니다.
  • 질문끼리 독립입니다.
  • 확률이 보정돼 있습니다.
  • 이유는 못 듣습니다.
  • 보정은 묶음 단위입니다.

1. 이어 쓰기와 고르기

지금 쓰는 모델들은 앞에 나온 것을 보고 다음 조각을 예측하는 일을 반복합니다. 그래서 답이 길어질수록 시간이 늘고, 앞에서 한 번 삐끗하면 뒤가 통째로 휩쓸립니다. 「분류만 해 달라」고 시켜도 속으로는 글을 쓰고 있는 셈이죠.

Jev는 그 반복이 없습니다. 보도된 바로는 한 번의 처리로 결과를 내고 70에서 500밀리초 사이에 돌아옵니다. 공식 문서 쪽 표현으로는 각 질문을 나란히, 서로 독립적으로 평가한다고 돼 있죠. 질문 다섯 개를 한 번에 던져도 서로 간섭하지 않습니다.

이 「독립」이 생각보다 큽니다. 기존 모델에 질문 셋을 한 번에 시키면 앞 답이 뒤 답에 영향을 줍니다 — 첫 질문에서 「화가 많이 났다」고 판단하면 그 뒤 판단도 그쪽으로 기울죠. 사람이 보기엔 자연스럽지만 측정값으로 쓰기엔 곤란한 성질입니다. 여기서는 각 질문이 같은 자료를 따로따로 보고 답하므로 서로 물들지 않습니다.

기존 모델 Jev 쪽
조각을 이어 붙여 생성 한 번에 골라 냄
길수록 느려짐 답 길이가 고정
앞 실수가 뒤로 번짐 질문끼리 독립
형식을 지켜 달라고 부탁 형식이 애초에 고정

넷째 줄이 실무에서 제일 크게 다가옵니다. 기존 모델로 분류를 시키면 「반드시 이 형식으로만 답하라」고 신신당부해야 하고, 그래도 가끔 설명을 덧붙이거나 괄호를 빠뜨립니다. 여기서는 그 실패 자체가 없습니다 — 내놓을 수 있는 게 정해진 값뿐이니까요.

2. 확률을 함께 준다는 것

기존 모델에 「확신하나요」라고 물으면 「매우 확신합니다」 같은 문장이 돌아옵니다. 그 말이 실제 정확도와 얼마나 맞는지는 알 수 없죠. Jev는 확률을 값으로 돌려주고, 그 확률이 실제 결과에 맞춰 조정되도록 훈련됐다고 문서가 밝힙니다.

이게 왜 쓸모 있냐면 자동화의 경계선을 숫자로 그을 수 있기 때문입니다. 「0.9 이상이면 그냥 처리, 그 아래는 사람에게」처럼요. AI 답변을 평가할 기준을 따로 만들어 두던 작업이 한결 쉬워집니다 — 평가 대상이 문장이 아니라 숫자니까요.

⚠️ 보정은 묶음 단위라, 개별 답을 보장하지 않습니다

문서가 못 박아 둔 문장입니다 — 보정은 예측 묶음에 걸쳐 측정되며, 개별 답이 맞다는 보장은 아닙니다. 즉 「0.95」가 떴다고 그 한 건이 95% 맞다는 뜻으로 읽으면 안 됩니다. 0.95가 뜬 사례를 백 건 모으면 그중 대략 아흔다섯 건이 맞더라는 쪽에 가깝습니다. 그래서 한 건의 판단이 치명적인 자리—의료·법률 판정, 되돌릴 수 없는 삭제—에 이 숫자 하나만 믿고 문을 열어 두면 안 됩니다. 경계선은 많이 쌓였을 때의 비율을 보고 정하는 값입니다.

덧붙여 이유를 물을 수 없다는 점도 감안하셔야 합니다. 기존 모델은 어설프더라도 근거를 적어 주는데, 이쪽은 왜 그렇게 판단했는지 설명하지 않도록 만들어졌습니다. 설명이 필요한 자리라면 판단은 이쪽에 맡기고 설명은 기존 모델에 따로 시키는 식으로 나눠야 합니다.

3. 값이 붙는 자리가 다릅니다

요금 구조도 갈립니다. 기존 모델은 입력과 출력에 각각 값을 매기고 출력이 대체로 더 비쌉니다. 답이 길어질수록 청구액이 오르죠. Jev는 입력만 받고 출력은 청구하지 않습니다 — 애초에 돌려주는 게 숫자 몇 개라 받을 것이 없습니다.

따질 거리 어떻게 갈리나
청구 기준 양쪽 ↔ 입력만
비용이 커지는 축 답 길이 ↔ 넣는 자료량
질문을 늘릴 때 호출마다 ↔ 자료는 한 번만
넣을 수 있는 것 그림·소리도 ↔ 글자만

셋째 줄이 설계에 영향을 줍니다. 같은 문의를 두고 세 가지를 판단해야 한다면, 기존 모델에서는 세 번 부르거나 한 번에 다 시키고 형식을 맞춰 달라고 해야 했습니다. 여기서는 자료를 한 번만 넣고 질문 셋을 묶어 보냅니다. 같은 앞부분을 다시 보내 캐시로 아끼던 요령과 목적은 비슷한데, 이쪽은 구조 자체가 그렇게 생겼습니다.

4. 그래서 어느 쪽을 쓰나

둘 중 하나를 고르는 문제가 아닙니다. 글을 만들어야 하면 기존 모델, 결정만 필요하면 이쪽입니다. 문서도 작고 원자적인 질문에 맞춰져 있고 긴 추론이 필요하면 잘게 나누라고 적어 두었습니다.

실제로는 같이 쓰는 그림이 자연스럽습니다. 앞단에서 걸러 내고, 본 작업은 기존 모델이 하고, 결과를 다시 점검하는 식이죠. 일을 맡길 하위 일꾼을 두고 결과만 받아 보던 구조와 비슷한데, 차이는 이 일꾼이 말을 못 하고 숫자만 내민다는 점입니다.

한 가지 더 갈리는 대목은 훈련 방식입니다. 우리가 쓰는 모델들은 사람이 매긴 선호를 따라 더 나은 답을 쓰도록 다듬어졌습니다. 반면 이쪽은 문서 표현대로 보정된 결정을 돌려주도록 훈련됐죠. 목표가 「사람이 보기 좋은 답」이 아니라 「확률이 실제와 맞아떨어지는 판단」이라는 뜻입니다. 만든 사람이 지금 방식의 LLM을 다듬던 쪽에서 나왔다는 점을 떠올리면, 같은 문제를 반대편에서 푼 시도로 읽힙니다.

자주 묻는 질문 (FAQ)

Q. 작은 LLM을 쓰는 것과 뭐가 다른가요

작은 모델도 여전히 글을 이어 씁니다. 형식을 어길 수 있고 답 길이만큼 값이 붙죠. 이쪽은 내놓을 수 있는 형태가 고정이라 그 실패가 구조적으로 없습니다.

Q. 확률이 높으면 믿어도 되나요

묶음으로 보면 믿을 만하고, 한 건으로는 아닙니다. 문서가 직접 「개별 답의 정확성을 보장하지 않는다」고 적었습니다. 되돌릴 수 없는 처리에는 사람 확인을 남겨 두세요.

Q. 판단 이유를 받을 수 있나요

없습니다. 이유를 설명하지 않도록 만들어진 모델입니다. 근거가 필요하면 판단과 설명을 다른 모델에 나눠 맡기셔야 합니다.

Q. 기존 모델을 걷어낼 수 있나요

아닙니다. 글쓰기·코딩·대화는 전혀 못 합니다. 겹치는 영역은 분류와 점수 매기기 정도이고, 그 부분만 떼어 오는 쪽이 현실적인 쓰임입니다.

정리하면

  • 만드는 방식이 다릅니다.
  • 형식 어길 일이 없습니다.
  • 확률로 선을 긋습니다.
  • 그 선은 묶음 기준입니다.
  • 대체가 아니라 분업입니다.

※ 공식 문서의 「시스템 원」 개념과 모델 사양을 읽고 정리했으며, 지연 시간 수치는 국내 보도를 함께 참고했습니다. 기존 모델 쪽 설명은 일반적인 동작 방식을 옮긴 것입니다.

※ 2026년 9월 21일 기준입니다. 값과 한도는 예고 없이 바뀔 수 있다고 문서가 밝히고 있습니다.

반응형
Comments