| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- AI 에이전트
- ai 뉴스
- 오픈모델
- 홍드로이드
- LLM
- Gemini
- MCP
- claudecode
- 실무
- AI 코딩
- 안드로이드
- OpenAI
- 자동화
- 무료로 시작하기
- 안드로이드 스튜디오
- Anthropic
- 카드 없이
- claude code
- Android
- 개발 생산성
- 바이브코딩
- ai에이전트
- 클로드 API
- AI 에이전트 개발
- Claude
- 개발환경
- 무료 ai
- 개발자 도구
- Android Studio
- 클로드코드
- Today
- Total
홍드로이드의 야매코딩
클로드 플러그인 평가 명령 — 채점기 6종·기준선 대조·빌드 차단 점수 본문

플러그인이나 스킬을 만들어 두고 이게 실제로 잘 먹히는지 확인하는 방법은, 지금까지 직접 몇 번 써 보는 것뿐이었습니다.
이제 시험 묶음을 만들어 점수를 내는 명령이 생겼습니다. 그런데 진짜 요점은 점수가 아닙니다. 플러그인을 뺀 채로 똑같이 돌려 보고 그 차이를 보는 것이 이 도구의 중심입니다.
📌 30초 요약
- 시험 하나가 기본 여섯 번 돕니다. 플러그인 켜고 3회, 빼고 3회.
- 채점기는 여섯 가지고, 그중 둘만 판정 모델을 부릅니다.
- 점수가 높아도 플러그인 덕이 아닐 수 있습니다. 차이값을 보세요.
- 실행 전부가 내 한도나 내 청구서에서 나갑니다.
1. 시험 하나가 여섯 번 도는 이유
시험 하나는 현실적인 프롬프트 한 개와 채점기 하나 이상으로 이뤄집니다. 프롬프트는 내 플러그인을 쓰는 사람이 실제로 칠 법한 문장이어야 합니다 — 스킬 이름을 불러 주는 문장 말고요. 그게 핵심인데, 이름을 대지 않아도 알아서 불려 나오는지가 사실상 플러그인의 실력이기 때문입니다.
여기서 왜 여러 번 도느냐. 한 번 돌린 결과는 운일 수 있어서입니다. 그래서 기본이 3회고, 실행 하나의 점수는 통과한 채점기의 비율, 시험 하나의 점수는 그 3회의 평균입니다. 그리고 기본 설정이 플러그인을 뺀 쪽도 똑같이 3회 돌리게 되어 있어서, 시험 하나가 곧 여섯 번입니다. 시험이 열 개면 예순 번이고요.
시험 묶음을 손으로 짤 필요는 없습니다. 만들기 명령을 돌리면 클로드가 내 플러그인을 읽고 좋은 결과가 어떤 모습인지 되물은 뒤, 걸려야 할 프롬프트와 걸리면 안 되는 프롬프트를 제안하고, 각각에 맞는 채점기를 설계하고, 한 번 시범 실행까지 해 본 다음 파일로 적어 줍니다. 이미 열어 둔 세션에서 클로드에게 시켜도 됩니다.
2. 채점기 여섯 가지
채점기 하나는 파일 하나입니다. 직접 짠 코드로 채점하는 방식은 없고, 준비된 여섯 가지 안에서 골라야 합니다.
| 종류 | 통과 조건 |
|---|---|
| 무늬 찾기 | 답변·기록·파일 안에 무늬가 있음 (없음·정확히 N회로도 가능) |
| 도구 호출 | 그 도구를 부른 횟수가 최소·최대 사이 (둘 다 0이면 「부르면 안 됨」) |
| 도구 순서 | 두 도구가 다 불렸고 앞엣것이 먼저임 |
| 파일 생성 | 이름 무늬에 맞는 파일을 실행 중에 만듦 |
| 기준표 판정 | 판정 모델이 세 표 중 두 표 이상 통과를 줌 |
| 본보기 대조 | 저장해 둔 본보기 기록만큼은 해냈다고 판정됨 |
앞의 네 가지는 기록과 파일에서 계산으로 나오니 공짜고, 뒤의 두 가지만 모델을 부릅니다. 매 실행마다 채점기 하나당 판정이 세 번씩 붙으니, 기준표 채점기를 남발하면 비용이 그쪽에서 불어납니다.
여기 함정이 하나 있습니다. 스킬이 불린 것도 확인됐는데 차이값이 마이너스로 나오는 경우입니다. 이때는 플러그인을 의심하기 전에 판정 모델을 먼저 의심하라고 적혀 있습니다. 기본 판정 모델이 작고 빠른 쪽이라, 답이 맞는데도 기준표에 적힌 모양과 형식이 다르다는 이유로 틀렸다고 매길 수 있기 때문입니다. 더 센 모델로 바꿔 다시 돌리고, 기준표에서 형식 이야기를 빼는 게 처방입니다. 결과가 도구나 판정 방식에 따라 갈리는 건 모델보다 하네스가 점수를 가른다는 이야기에서 본 것과 같은 구조입니다.
3. 점수가 1.0이어도 플러그인 덕이 아닐 수 있습니다
시험마다 플러그인을 올린 쪽과 아무것도 안 올린 쪽을 같은 횟수로 돌려 두 점수와 그 차이를 나란히 보여 줍니다. 왜 이렇게까지 하느냐 하면, 점수가 높은 이유가 두 가지이기 때문입니다. 내 플러그인이 잘 만들어졌거나, 아니면 그 일이 원래 플러그인 없이도 되는 일이거나. 양쪽 다 1.0이 나왔다면 후자입니다. 차이값이 0이면 내 플러그인은 그 시험에서 한 일이 없다는 뜻이고요.
여기서 셈법이 한 겹 더 들어갑니다. 「스킬이 불렸는가」를 보는 채점기는 플러그인이 없는 쪽에서 절대로 통과할 수 없습니다. 그대로 세면 없는 쪽 점수가 0으로 깔리면서 차이값이 부풀죠. 그래서 이런 검사는 양쪽 모두 점수에서 빼고, 켠 쪽에서는 통과·실패 표시등으로만 보여 줍니다. 보고서에서 「통과 못 했는데 점수는 만점」인 줄이 보인다면 대개 이겁니다. 첫 실행에서 가장 흔한 결과는 차이값이 0인데 스킬 호출 검사가 실패하는 그림인데, 스킬 설명문이 자연스러운 표현에 안 걸린다는 뜻입니다.
4. 실행 한 번이 내 청구서입니다
⚠️ 한도에 걸린 실행은 「회귀」처럼 보입니다
평가 실행과 판정 호출은 전부 내 자격으로 나가는 진짜 모델 호출입니다. 그래서 묶음을 돌리는 중에 요금제 한도나 호출 제한에 걸리면, 그 뒤 실행들은 오류로 끝난 채 그대로 채점되어 대개 0점이 됩니다.
문제는 묶음이 중단되지 않고 끝까지 돌면서 「부분 실행」 표시도 안 붙는다는 점입니다. 결과만 보면 플러그인이 망가진 것처럼 보입니다. 점수를 믿기 전에 비고 칸의 오류 문구부터 확인하고, 한도가 풀린 뒤 실행 횟수를 줄여 다시 돌리세요.
비용은 몇 군데서 묶을 수 있습니다. 실행 횟수를 낮추거나, 기준선을 꺼서 절반으로 줄이거나, 자주 도는 묶음에는 판정 모델을 안 부르는 채점기만 넣거나. 비용 상한을 걸어 두면 그 위로는 새 실행이 시작되지 않습니다. 다만 상한은 실행 시작 전에만 검사해서, 이미 돌던 것들은 끝까지 가므로 그만큼은 넘길 수 있습니다. 한도를 걸어 두는 발상 자체는 노력 수준에 상한을 두는 설정과 같은 계열입니다.
빌드 검사에 물릴 때는 통과 기준 점수가 관문이 됩니다. 기본값이 1.0이라 시험 하나라도 만점이 아니면 실패로 끝납니다. 내 기준에 맞게 낮춰 잡아야 합니다. 그리고 대상 모델과 판정 모델을 둘 다 고정해 두는 게 중요합니다. 안 그러면 모델이 새로 깔린 날의 점수 변화를 내 플러그인 탓으로 읽게 됩니다. 새 모델로 옮길 때 고칠 목록을 훑는 자리에서 이 묶음을 한 번 돌려 보는 것도 쓸모가 있습니다.
| 끝난 상태 | 무슨 뜻인가 |
|---|---|
| 정상 | 모든 시험이 기준 점수 이상 · 시험 파일도 다 읽힘 |
| 실패 | 기준 미달 · 시험 파일 오류 · 시험이 하나도 없음 · 신뢰 확인 안 됨 |
| 부분 실행 | 비용 상한에 닿음 · 자격증명 거절 (결과 파일은 남음) |
실행마다 일회용 홈 디렉터리와 설정이 새로 생겨 내 개인 설정·훅·지침 파일·다른 플러그인은 하나도 안 올라옵니다. 재미있는 건 시험지 자체를 에이전트가 못 본다는 점입니다. 평가 디렉터리는 실행 중에 읽을 수 없어서, 클로드는 자기가 어떤 기준으로 채점당하는지 모른 채 일합니다. 그리고 기본 허용 도구가 읽기 전용뿐이라, 셸이나 파일 쓰기가 필요하면 따로 허용해 줘야 합니다. 안 주면 도구가 아예 목록에서 빠집니다. 도입 단계를 순서대로 밟는 중이라면 AI 도입 한 바퀴를 모아 둔 글에서 이 단계의 위치를 확인해 보세요.
자주 묻는 질문 (FAQ)
Q. 한 번 돌리면 모델 호출이 몇 번이나 일어나나요?
대략 시험 수 × 실행 수만큼 플러그인을 켠 쪽에서 돌고, 기준선까지 켜져 있으면 같은 양이 한 번 더 붙습니다. 여기에 판정을 쓰는 채점기마다 실행당 짧은 호출이 세 번씩 더 얹힙니다. 시험 다섯 개짜리 묶음도 서른 번 남짓한 실행이 된다는 뜻이라, 처음엔 실행 수를 1로 줄이고 기준선을 꺼 놓고 시작하는 편이 안전합니다.
Q. 윈도우에서 그대로 쓸 수 있나요?
읽기 전용 도구만 쓰는 시험이면 문제없습니다. 그런데 셸 명령을 허용하는 순간 이야기가 달라집니다. 셸은 반드시 운영체제 수준 격리 안에서 돌게 되어 있는데, 일반 윈도우에는 그 받침이 없습니다. 격리 없이 그냥 돌리는 대신 실행을 거절하도록 만들어져 있어서, 셸이 필요한 묶음은 리눅스 호환 계층에서 돌려야 합니다.
Q. 점수가 돌릴 때마다 달라지는데 믿어도 되나요?
흔들리는 건 대개 판정 모델을 쓰는 채점기입니다. 읽을 글이 길수록 더 흔들립니다. 그래서 긴 결과물은 무늬 찾기로 옮기고, 기준표는 통과 조건과 실패 조건을 구체적으로 적어 짧은 출력에만 쓰는 게 권장됩니다. 판정 모델을 고정해 두는 것도 필수고요. 그래도 남는 흔들림은 여러 번 돌린 평균이 흡수해 줍니다.
Q. 점수가 좋으면 그 플러그인은 안전한 건가요?
전혀 다른 이야기입니다. 문서가 못을 박아 뒀습니다 — 묶음을 통과했다는 사실은 그 플러그인이 안전한지에 대해 아무것도 말해 주지 않습니다. 평가를 돌리는 것 자체가 그 플러그인의 코드를 내 컴퓨터에서 내 권한으로 여는 일이라서, 남이 만든 훅이 붙어 있거나 실제 외부 서버를 띄우는 경우라면 격리된 환경에서만 돌리고 점수도 참고만 하라고 적혀 있습니다.
정리하면
- 점수 말고 빼고 돌렸을 때와의 차이를 보세요.
- 긴 결과물은 무늬 찾기, 짧은 답만 기준표 판정으로.
- 빌드에 물릴 땐 두 모델을 다 고정해 두세요.
- 점수가 갑자기 떨어졌다면 한도 오류부터 의심하세요.
※ 공개된 안내 문서를 읽고 정리했습니다. 명령 이름·옵션·파일 이름은 우리말로 풀어 적었고, 직접 묶음을 만들어 돌려 보지는 않았습니다.
※ 실행 횟수·기준 점수·시간 한도 같은 기본값은 열람 시점 기준이며 판올림에 따라 달라질 수 있습니다. 비용은 정가 기준 추정치로 표시되므로 실제 청구액이나 요금제 한도 소진량과는 차이가 납니다. 돌리기 전에 원문의 준비 조건 항목을 확인하세요.
'AI & Vibe Coding' 카테고리의 다른 글
| iOS 앱 클로드 연동 — 키 없이 앱 증명·온디바이스와 같은 코드 (0) | 2026.09.14 |
|---|---|
| AI 에이전트 자격증명 금고 — 못 보는 비밀값·나갈 때 치환·서명은 실패 (0) | 2026.09.14 |
| 클로드 모델 이전 가이드 — 사고 끄기 불가·첫 블록 변경·요금 두 배 (1) | 2026.09.11 |
| AI 도구 사내 출시 공지 — 보내기 전 점검 6가지·임원 서명 효과 (0) | 2026.09.11 |
| 클로드 코드 사내 확산 안내서 — 주당 40분·30일 계획·손 떼는 신호 (0) | 2026.09.11 |
