| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | ||||
| 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| 11 | 12 | 13 | 14 | 15 | 16 | 17 |
| 18 | 19 | 20 | 21 | 22 | 23 | 24 |
| 25 | 26 | 27 | 28 | 29 | 30 | 31 |
- claude code
- 오픈모델
- LLM
- 개발 생산성
- claudecode
- 카드 없이
- 바이브코딩
- MCP
- ai 뉴스
- Android
- 개발자 도구
- ai에이전트
- 오픈웨이트
- 자동화
- 개발환경
- 홍드로이드
- Gemini
- 안드로이드 스튜디오
- 실무
- 무료로 시작하기
- AI 에이전트 개발
- 안드로이드
- Android Studio
- Anthropic
- Claude
- 무료 ai
- AI 코딩
- OpenAI
- AI 에이전트
- 클로드코드
- Today
- Total
홍드로이드의 야매코딩
모델 바꿀 때 다시 읽는 대화 본문

대화 도중에 모델을 바꿔본 적 있으실 겁니다. 가벼운 질문은 싼 모델로 하다가 어려운 대목에서 센 모델로 올리는 식이죠. 그런데 그때 새 모델은 앞의 대화를 처음부터 다시 계산합니다. 사람이 보기엔 대화가 이어지는데, 안에서는 지금까지의 내용을 통째로 다시 읽는 작업이 한 번 벌어집니다. 이걸 건너뛰는 방법을 담은 논문이 최근 공개돼서 원문을 열어봤는데, 저자들이 스스로 "놀랍게도"라고 적은 대목이 있었습니다.
📌 30초 요약
① AI는 대화 내용을 계산해둔 형태로 보관합니다. 매번 처음부터 읽지 않으려고요.
② 모델이 바뀌면 그 보관분을 못 씁니다. 저장·해석 방식이 모델마다 다르기 때문입니다.
③ 그래서 새 모델이 전체를 다시 계산합니다. 대화가 길수록 이 비용이 커집니다.
④ 논문은 그 보관분을 변환해서 넘기는 방법을 제안합니다. 다시 학습시킬 필요 없이 계산식 하나로요.
⑤ 속도는 2.7배에서 25배까지 빨라졌습니다. 정확도는 73~98% 유지됐습니다.
⑥ 다만 시험한 여섯 조합 중 넷만 그랬고, 둘은 크게 무너졌습니다. 논문이 직접 밝힌 내용입니다.
왜 다시 읽어야 하나
AI가 답을 만들 때는 두 단계를 거칩니다. 먼저 지금까지의 대화 전체를 한 번 훑어서 계산 결과를 쌓아두고, 그 다음 그 결과를 재활용하면서 한 글자씩 답을 내놓습니다. 쌓아두는 쪽을 캐시라고 부릅니다. 이게 있어서 대화가 열 번 스무 번 이어져도 매번 처음부터 다시 읽지 않습니다.
문제는 모델을 갈아탈 때입니다. 모델마다 이 캐시를 만들고 해석하는 방식이 달라서, 앞 모델이 쌓아둔 것을 새 모델이 읽을 수 없습니다. 결국 새 모델이 대화 전체를 처음부터 다시 계산합니다. 대화가 짧으면 티가 안 나지만, 길어질수록 이 재계산이 그대로 시간과 값으로 돌아옵니다.
💡 이게 왜 지금 문제가 됐나
논문은 이 재계산이 발생하는 상황을 세 가지로 꼽습니다 — 값과 품질을 저울질해 등급을 오르내릴 때, 대화 도중 모델을 바꿀 때, 작업 성격에 따라 자동으로 다른 모델에 배분할 때. 전부 요즘 늘어난 사용 방식입니다. 한 모델만 계속 쓰던 시절에는 없던 비용이 새로 생긴 셈입니다.
같은 계열이면 규칙이 비슷했습니다
연구진이 찾은 실마리는 이렇습니다. 같은 계열의 모델은 크기가 달라도 캐시에 담긴 정보가 서로 비슷한 규칙을 따른다는 것. 규칙이 비슷하면 복잡한 재학습 없이 간단한 계산식 하나로 변환할 수 있습니다.
| 측정 | 한 층만 썼을 때 | 여러 층을 함께 썼을 때 |
|---|---|---|
| 키 정보 설명력 | 56% | 79% |
| 값 정보 설명력 | 32% | 65% |
같은 계열의 작은 모델과 큰 모델을 놓고 잰 수치입니다. 작은 모델이 이미 읽어둔 것으로 큰 모델이 쌓았을 내용의 상당 부분을 예측할 수 있다는 뜻입니다. 다만 키 쪽이 값 쪽보다 훨씬 잘 맞는다는 점도 같이 드러났습니다.
방법 자체는 의외로 단출합니다
"AI 문제를 AI로 푼다"가 아니라 통계 계산 한 번으로 끝냅니다. 세 단계고, 각 단계마다 이유가 붙어 있습니다.
# 1단계 — 어느 층을 볼지 고른다
받는 쪽의 각 층마다
가장 잘 맞는 보내는 쪽 층 몇 개를 선택
# 2단계 — 위치 정보를 떼어낸다
캐시에서 위치 표시를 제거
이유: 위치를 빼야 변환식이 길이와 무관해져서
대화 길이가 달라도 같은 식을 재사용할 수 있다
# 3단계 — 계산식을 맞춘다
보정용 데이터 500개 · 각 1,024토큰
공개 학습 데이터셋에서 가져온 소량
→ 재학습 없음. 회귀 계산 한 번으로 끝
2단계가 특히 실용적입니다. 위치 정보를 미리 떼어내면 변환식이 대화 길이와 상관없어집니다. 한 번 만들어두면 짧은 대화든 긴 대화든 그대로 쓸 수 있다는 뜻이라, 매번 다시 맞출 필요가 없습니다. 보정에 쓴 데이터도 500개뿐입니다.
기사가 넘어간 절반
결과를 소개한 글들은 대체로 "정확도 73~98% 유지, 속도 최대 25배"로 정리합니다. 틀린 말은 아닙니다. 그런데 논문 초록에는 같은 문장 안에 이런 대목이 붙어 있습니다.
📄 초록에 적힌 그대로
"Surprisingly, across six pairs in three families, this linear mapper retains 73-98% of the receiver's standalone-prefill accuracy on four pairs, while two degrade sharply."
옮기면 — 세 계열 여섯 조합 중 네 조합에서만 73~98%를 유지했고, 두 조합은 급격히 나빠졌다는 것입니다. 성공률로 치면 여섯 중 넷입니다.
실패한 쪽에는 대안을 따로 마련했습니다. 단순한 계산식 대신 작은 신경망을 쓰면 최대 37%포인트까지 회복됐습니다. 다만 그건 더 이상 "계산식 한 번"이 아니게 된다는 뜻이기도 합니다.
"놀랍게도"라는 단어를 저자들이 직접 썼다는 점이 눈에 띕니다. 이 단어는 보통 기대보다 잘 됐을 때 쓰는데, 여기서는 이렇게 단순한 방법이 절반 넘게 통했다는 것과 그런데도 일부는 무너졌다는 것을 한 문장에 같이 담고 있습니다. 성과와 한계를 분리하지 않고 붙여 쓴 서술이라, 옮길 때도 붙여서 옮기는 게 맞다고 봤습니다.
🔁 다시 안 읽어도 되는 자리도 있습니다
모델을 바꾸면 쌓아 둔 걸 다시 읽는다는 이야기를 했는데, 반대로 쌓아 둔 것을 그대로 물려받는 자리도 생겼습니다. 지금 대화를 갈라내 곁일을 맡기는 방식인데, 지시문과 도구 정의가 부모와 글자 하나까지 같아서 첫 요청이 부모의 캐시를 그대로 재사용합니다. ★이 글이 짚은 원리를 뒤집어 쓰는 셈입니다 — 앞부분이 같으면 살고 달라지면 깨진다는 성질은 그대로인데, 같게 만들어 두고 이득을 보는 쪽이죠. 새 하위 에이전트를 띄우는 것보다 싸게 끝나는 이유가 여기 있습니다.
자주 묻는 질문
Q. 지금 쓰는 서비스에 적용된 건가요?
아닙니다. 공개된 연구 논문이지 제품 기능이 아닙니다. 실험도 공개 모델들을 대상으로 했습니다. 다만 웹에서 모델을 바꿀 때 다시 계산이 일어난다는 사실 자체는 이 논문과 무관하게 이미 그렇게 작동하고 있습니다.
Q. 아무 모델끼리나 되는 건가요?
아닙니다. 같은 계열이면서 내부 구조의 특정 조건이 맞는 짝끼리만 시험했습니다. 계열이 다르거나 구조가 크게 다른 모델 사이에서도 통할지는 논문이 직접 "추가 연구가 필요하다"고 밝히고 있습니다. 서로 다른 회사 모델을 오가는 상황과는 거리가 있습니다.
Q. 그럼 지금 제가 할 수 있는 건 뭔가요?
모델을 자주 갈아타는 습관에 값이 붙는다는 걸 알아두는 정도가 현실적입니다. 특히 대화가 길어진 다음에 바꾸는 게 제일 비쌉니다. 바꿀 생각이라면 대화 초반에, 혹은 아예 새 대화로 시작해서 필요한 맥락만 옮기는 편이 낫습니다. 싼 모델로 갈아타는 방법을 쓸 때도 같은 계산이 적용됩니다.
🧾 솔직하게 밝혀둘 것
① 초록과 기사 본문을 읽은 것이고 논문 전체를 검토하지 않았습니다. 실험 설계의 타당성은 제가 판단할 수 있는 범위가 아닙니다.
② 연구 단계입니다. 검증을 거쳤는지, 실제 서비스에 들어갈지는 알 수 없습니다. 논문이 나왔다는 것과 제품이 된다는 것은 다릅니다.
③ 숫자는 특정 조건에서 나온 것입니다. 2.7~25배라는 폭이 넓다는 건 조건에 따라 결과가 크게 갈린다는 뜻이기도 합니다.
④ 본문의 설명은 비유를 섞은 것이라 원 논문의 기술적 서술과 정확히 같지 않습니다. 정확한 내용은 원문을 보시는 편이 낫습니다.
⑤ "모델을 바꾸면 재계산된다"를 특정 서비스에 그대로 대입하지 마세요. 서비스마다 내부 처리 방식이 공개돼 있지 않고, 제가 확인한 것도 아닙니다.
✨ 정리하면
모델을 갈아타는 게 공짜처럼 보이지만 안에서는 대화를 한 번 다시 읽는 일이 벌어집니다. 이 논문은 그걸 건너뛰는 길을 보여줬고, 방법이 재학습 없이 계산식 한 번이라는 점이 인상적이었습니다. 동시에 여섯 중 둘은 무너졌다는 사실을 초록 첫머리에 같이 적어둔 것이 이 논문에서 제일 신뢰가 가는 대목이었습니다.
값을 줄이는 쪽으로 이어보려면 저가 모델 갈아타기와 토큰 아끼는 실전 정리가 있고, AI에 쓰는 돈 전체를 순서대로 보려면 AI 지출 허브를 참고하시면 됩니다.
※ 출처: 2026년 8월 4일 공개된 사전 공개 논문 초록 원문과 국내 보도. 2026년 8월 25일 확인 기준이며, 사전 공개 논문은 동료 심사를 거치지 않았을 수 있고 내용이 수정될 수 있습니다. 본문의 비유적 설명은 이해를 돕기 위한 것으로 원문 서술과 일대일로 대응하지 않습니다.
'AI & Vibe Coding' 카테고리의 다른 글
| 클로드 코드, 한도 풀리면 자동 재개 (0) | 2026.08.25 |
|---|---|
| 막는 robots.txt, 내주는 llms.txt (1) | 2026.08.25 |
| 오픈AI 데브데이 서울, 마감 9월 4일 (0) | 2026.08.25 |
| AI 학습 거부와 검색 노출은 별개 (0) | 2026.08.25 |
| 공개된 AI 지시문, 금지어 세 개 (0) | 2026.08.25 |