홍드로이드의 야매코딩

AI 학습 거부와 검색 노출은 별개 본문

AI & Vibe Coding

AI 학습 거부와 검색 노출은 별개

홍드로이드 2026. 8. 25. 09:23
반응형

"AI가 내 글을 학습하는 게 싫다"와 "AI 검색에 내 글이 안 나온다"는 정반대 고민처럼 보입니다. 그런데 두 문제를 담당하는 스위치가 서로 다른 곳에 달려 있습니다. AI 회사들의 크롤러 공식 문서를 열어보니 봇이 학습용·검색용·사용자 요청용 세 갈래로 갈라져 있었고, 문서에 "각 설정은 서로 독립적"이라고 적혀 있었습니다. 그리고 막아도 읽히는 경로가 따로 있었습니다.

📌 30초 요약

① 봇이 학습용·검색용·사용자 요청용 세 종류로 나뉘어 있습니다. 이름도 다 다릅니다.

"각 설정은 서로 독립"이라고 문서에 적혀 있습니다. 학습만 막고 검색엔 남을 수 있습니다.

③ 검색용 봇을 막으면 AI 검색 답변에서 빠집니다. 학습 차단과는 무관한 결과입니다.

사용자가 직접 시켜서 오는 방문은 규칙이 다릅니다. 그리고 회사마다 그 규칙이 어긋납니다.

티스토리 robots.txt에는 AI 봇 규칙이 한 줄도 없습니다. 지금은 전부 열려 있는 상태입니다.

⑥ 개별 블로그가 그 파일을 고칠 수 없으니, 차단이 아니라 인용되기 좋게 쓰는 쪽이 실질적인 선택지입니다.

봇이 세 갈래로 갈라져 있습니다

예전에는 "AI 크롤러"라고 하면 하나였습니다. 지금은 같은 회사 안에서도 목적별로 이름이 갈려 있고, 각각 따로 허용하거나 막을 수 있게 돼 있습니다. 두 회사의 공식 문서를 나란히 놓으면 구조가 같습니다.

역할 A사 봇 이름 B사 봇 이름 막으면 생기는 일
모델 학습 GPTBot ClaudeBot 학습 자료로 쓰지 말라는 표시가 됩니다
검색 노출 OAI-SearchBot Claude-SearchBot AI 검색 답변에서 빠집니다
사용자 요청 ChatGPT-User Claude-User 회사마다 결과가 다릅니다

💡 문서에 못 박혀 있는 한 문장

"각 설정은 서로 독립적이다." 예시까지 붙어 있습니다 — 검색 결과에는 나오게 하려고 검색용 봇은 허용하면서, 학습에는 쓰지 말라고 학습용 봇은 막을 수 있다는 겁니다. 흔히 하나로 뭉뚱그려 생각하는 두 가지가 애초에 다른 손잡이였던 셈입니다.

학습을 막아도 검색엔 남습니다

"AI 학습 거부"를 켜두면 AI 검색 결과에서도 통째로 사라진다고 알고 계신 분이 많습니다. 문서를 보면 그렇지 않습니다. 학습용 봇을 막는 것은 "이 내용을 모델 훈련에 쓰지 말라"는 표시일 뿐이고, AI 검색 답변에 인용될지는 검색용 봇을 열어뒀는지가 결정합니다.

📄 검색용 봇을 막았을 때

"Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers, though can still appear as navigational links."

옮기면 — 검색용 봇을 막은 사이트는 AI 검색 답변에 나오지 않지만, 길 안내용 링크로는 여전히 등장할 수 있다는 뜻입니다. "답변에 인용되는 것"과 "링크로 걸리는 것"이 또 갈립니다.

실무에서 놓치기 쉬운 조건도 하나 붙어 있습니다. robots.txt를 고쳐도 검색 쪽에 반영되기까지 약 24시간이 걸린다고 적혀 있습니다. 바꾸고 바로 확인해서 "안 먹혔다"고 판단하면 이른 셈입니다.

막아도 읽히는 경로가 따로 있습니다

세 번째 봇, 즉 사람이 "이 링크 좀 읽어줘"라고 시켜서 오는 방문이 이 글에서 제일 흥미로운 대목이었습니다. 이건 자동 수집이 아니라 사용자가 개시한 행동이라, 취급이 다릅니다. 그런데 두 회사가 서로 다르게 적어놨습니다.

# 같은 성격의 봇인데 문서 설명이 어긋납니다

A사 · 사용자 요청 봇
  "사용자가 시작한 행동이므로
   robots.txt 규칙이 적용되지 않을 수 있다"
  → 막아둬도 읽힐 수 있다는 뜻
  + 이 봇은 검색 노출 여부를 결정하지 않음

B사 · 사용자 요청 봇
  "이 봇을 막으면 사용자 질문에 답할 때
   콘텐츠를 가져오지 못한다"
  → robots.txt로 제어된다는 뜻
  + 다만 그만큼 노출이 줄 수 있다고 함께 안내

🧠 여기서 얻을 수 있는 결론

"AI를 전부 막았다"는 상태는 사실상 만들기 어렵습니다. 자동 수집은 파일 한 줄로 거를 수 있어도, 사람이 주소를 직접 붙여넣고 읽어달라고 하는 경로는 회사에 따라 그 파일 밖에 있습니다.

그래서 "막을 것이냐"보다 "어떻게 인용될 것이냐"가 실제로 결정할 수 있는 문제입니다. 공개된 글이라면 언젠가 누군가의 질문에 답하는 재료로 쓰인다고 보는 편이 현실에 가깝습니다.

티스토리는 지금 어떤 상태인가

남의 이야기로 끝내지 않으려고 이 블로그 주소의 robots.txt를 직접 열어봤습니다. 결과가 명확했습니다.

# 실제 응답 (2026-08-25 확인)
User-agent: *
Disallow: /guestbook
Disallow: /manage
Disallow: /owner
Disallow: /admin
Disallow: /search

User-agent: bingbot
Crawl-delay: 20

# AI 봇 이름은 한 줄도 없습니다 → 전부 허용 상태
# 막혀 있는 건 방명록·관리·검색 같은 운영 경로뿐

정리하면 티스토리 블로그는 기본적으로 AI 학습·검색 봇 모두에 열려 있고, 이 파일은 서비스가 도메인 단위로 관리하기 때문에 개별 블로그 운영자가 여기에 줄을 추가할 수 없습니다. 즉 "AI 학습을 막을까 말까"는 애초에 우리가 고를 수 있는 항목이 아닙니다. 남는 선택지는 어차피 읽힐 글을 어떻게 쓸 것인가 하나입니다.

그 방향은 기존 검색 최적화와 크게 다르지 않습니다. 질문 형태의 소제목, 표로 정리한 비교, 숫자와 출처가 붙은 문장은 사람이 읽기에도 좋고 인용 단위로 잘라내기에도 좋습니다. AI로 블로그 글을 쓰는 방법을 정리하면서 "저품질을 피하려면"이라고 적었던 항목들이, 결과적으로 인용되기 좋은 글의 조건과 상당 부분 겹칩니다.

자주 묻는 질문

Q. 티스토리에서 AI 학습을 거부할 수 있나요?

robots.txt로는 어렵습니다. 그 파일은 서비스가 도메인 단위로 제공하고, 오늘 확인한 내용에는 AI 봇 관련 규칙이 없습니다. 개별 글 단위로 막는 표준적인 방법도 마련돼 있지 않습니다. 비공개 전환 말고는 확실한 차단 수단이 없다고 보는 편이 정확합니다.

Q. 학습을 막으면 AI 검색에서도 사라지나요?

아닙니다. 다른 스위치고, 문서에 "각 설정은 독립적"이라고 적혀 있습니다. 반대로 검색용 봇만 막으면 학습 여부와 무관하게 AI 답변에서 빠집니다. 어느 AI 검색이 어떤 식으로 출처를 붙이는지는 AI 검색 도구를 비교한 글에 정리해뒀습니다.

Q. 내 글이 AI 답변에 인용됐는지 알 수 있나요?

직접적인 통계는 없습니다. 대신 서버 로그에서 봇 이름을 구분할 수는 있습니다. 각 봇은 고유한 접속 문자열을 쓰고 공개된 IP 목록도 회사가 제공합니다. 다만 티스토리처럼 로그를 못 보는 환경에서는 이 방법도 쓸 수 없어, 유입 경로 통계에서 AI 서비스 이름이 보이는지 정도가 현실적인 확인 수단입니다.

🧾 솔직하게 밝혀둘 것

① 제가 확인한 것은 이 블로그 주소로 요청했을 때 돌아온 robots.txt 하나입니다. 티스토리 전체가 항상 같은 내용을 준다고 확인하지는 못했습니다.

robots.txt는 강제가 아니라 요청입니다. 규칙을 지키겠다고 밝힌 봇에만 의미가 있고, 무시하는 수집기까지 막아주지는 않습니다.

봇 이름과 정책은 회사가 수시로 바꿉니다. 본문 내용은 2026년 8월 25일 문서 기준이고, 예전 글에 적힌 이름이 지금도 유효한지는 따로 확인해야 합니다.

"AI 검색에 안 나온다"의 원인이 봇 설정만은 아닙니다. 색인 자체가 안 됐거나 질문과 안 맞았을 수도 있어, 이 글로 원인을 단정할 수는 없습니다.

두 회사 문서만 읽었습니다. 다른 검색·AI 서비스는 봇 구성과 규칙이 또 다르므로, 그대로 일반화하면 안 됩니다.

✨ 정리하면

"AI를 막을까"라는 질문은 이미 세 개로 쪼개져 있었습니다. 학습에 쓰이는 것, 검색 답변에 인용되는 것, 누군가 링크를 붙여넣어 읽히는 것이 각각 다른 손잡이고, 세 번째는 회사에 따라 그 손잡이가 아예 없기도 합니다. 여기에 티스토리처럼 파일을 못 고치는 환경이 겹치면, 남는 선택지는 결국 어차피 읽힐 글을 어떻게 쓸 것인가입니다.

AI가 무엇을 읽고 어떤 지시를 받아 답하는지는 공개된 지시문을 정리한 글에서 이어지고, AI에 쓰는 돈 전체를 순서대로 보려면 AI 지출 허브를 참고하시면 됩니다.

※ 출처: 두 AI 기업의 크롤러 공식 문서 원문과 이 블로그 주소의 robots.txt 응답. 2026년 8월 25일 확인 기준이며, 봇 이름·정책·반영 시간은 변경될 수 있습니다. 표의 회사 표기는 규칙 차이를 보여주려는 것이라 A사·B사로 적었습니다.

반응형
Comments