무엇을 하는 봇인가
웹사이트가 검색 엔진과 AI 검색 봇에게 읽히는 상태인지, 공개 정보만으로 점검합니다. robots.txt·사이트맵·공개 페이지의 HTML 같은, 누구나 브라우저로 볼 수 있는 것만 봅니다.
자기식별
모든 요청에 아래 User-Agent 를 그대로 실어 보냅니다. 브라우저인 척하지 않습니다.
User-Agent 전문
ConnectAI-VisibilityBot/1.0 (+https://connectai.kr/bot)robots.txt 제품 토큰
ConnectAI-VisibilityBotrobots.txt 에서 우리를 지목할 때 쓰는 이름입니다. RFC 9309 §2.2.1 의 제품 토큰 문법을 따라 숫자를 넣지 않았습니다.
차단하는 방법
robots.txt 에 아래 두 줄을 넣으시면 됩니다. 다음 회차부터 이 도메인에 요청하지 않습니다.
User-agent: ConnectAI-VisibilityBot
Disallow: /이름은 대소문자를 가리지 않습니다. 일부 경로만 막으시려면 `Disallow: /` 대신 그 경로를 적으시면 됩니다.
차단하셔도 불이익은 없습니다. 저희가 만드는 점검 결과에서 이 도메인이 낮게 평가되거나 목록에 남는 일은 없습니다 — 페이지를 한 장도 받지 않습니다. 다만 차단 여부를 확인하려면 robots.txt 자체는 읽어야 하므로, 그 한 건과 도메인 이름 조회(DNS)는 계속 나갑니다.
무엇을, 왜 가져가나
가져가는 것은 아래가 전부입니다. 각 항목은 점검표의 특정 문항에 대한 근거로 쓰입니다.
- robots.txt
- 크롤러에게 무엇을 허용·차단하는지, 사이트맵을 선언했는지 확인합니다.
- sitemap.xml 과 그 안의 하위 사이트맵
- 검색 엔진에게 알리고 있는 페이지 목록을 확인합니다. 점검 범위의 분모가 여기서 나옵니다.
- /llms.txt
- AI 에게 전달되는 요약문이 있는지, 그 문장을 사이트가 직접 관리하는지 확인합니다.
- 사이트맵에 실린 공개 페이지의 HTML 과 응답 헤더
- 제목·설명·canonical·구조화 데이터·hreflang·이미지 대체텍스트 같은, 기계가 읽는 표시를 확인합니다.
- 홈 주소의 응답 상태와 리다이렉트, 없는 주소 한 번의 응답
- https 전환·도메인 단일화·없는 주소의 404 응답을 확인합니다.
- 도메인의 공개 DNS 레코드(A·AAAA·TXT)
- 검색 도구 소유확인 값이 DNS 쪽에 있는지 확인합니다.
하지 않는 것
- 로그인이 필요한 영역에 접근하지 않습니다. 계정을 만들지도, 로그인을 시도하지도 않습니다.
- 폼을 제출하지 않습니다. 문의·구독·장바구니 같은 상태를 바꾸는 요청을 보내지 않습니다.
- 쿠키를 저장하거나 되돌려 보내지 않습니다.
- Referer 헤더를 보내지 않습니다.
- 가져간 내용을 AI 모델 학습에 사용하지 않습니다.
- 가져간 내용을 제3자에게 판매하거나 재배포하지 않습니다.
- 취약점을 찾지 않습니다. 공개된 주소만 평범한 GET 으로 받습니다 — 연결이 되지 않거나 끊기거나 시간이 초과되면 한 번만 다시 시도합니다. 오류 응답은 다시 요청하지 않습니다(robots.txt 의 5xx 만 예외).
robots.txt 를 어떻게 따르나
- RFC 9309(Robots Exclusion Protocol)를 따릅니다.
- 먼저 우리 제품 토큰을 지목한 그룹을 찾고, 없으면 `User-agent: *` 그룹을 따릅니다.
- `Crawl-delay` 가 우리 기본 간격보다 크면 그쪽에 맞춰 더 느리게 요청합니다. 다만 한 요청당 최대 30초까지입니다 — 그보다 큰 값을 선언하셨다면 30초 간격으로 갑니다.
- robots.txt 가 5xx 를 반환하면 잠시 뒤 한 번 더 확인하고, 그래도 5xx 이면 그 사이트는 **아예 크롤하지 않습니다.** 규격상 전면 차단으로 해석되는 상황이라, 읽을 수 없을 때는 읽지 않는 쪽을 택합니다.
- `429 Too Many Requests` 를 한 번이라도 받으면 그 회차를 즉시 중단하고, `Retry-After` 를 기록한 뒤 그 도메인을 24시간 쉽니다.
- 차단이 걸려 있으면 그 사이트는 점검하지 않습니다. 사이트 운영자 본인이 서면으로 허용한 경우에만 예외가 됩니다.
요청 간격과 상한
한 번의 점검(회차)이 한 도메인에 만들 수 있는 부하의 상한입니다.
| 동시 요청(도메인당) | 1 |
|---|---|
| 요청 사이 최소 간격 | 1000 ms |
| 회차당 요청 수 상한 | 320 |
| 회차당 다운로드 상한 | 200 MB |
| 회차 시간 상한 | 30 min |
| 한 회차에 읽는 페이지 상한 | 300 |
| 같은 도메인 재점검 간격 | 24 h |
`Crawl-delay` 가 선언돼 있으면 최소 간격은 그 값까지 늘어납니다. 직전 응답이 느리면 간격을 스스로 더 벌립니다.
무엇을 남기고, 어떻게 지우나
- 응답 상태 코드와 응답 헤더
- 받은 페이지의 원본 HTML
- 그 HTML 에서 뽑아낸 사실(제목·설명·구조화 데이터의 종류 등)과 판정 결과
원본 HTML 의 보관 기간은 아직 확정하지 않았습니다. 확정되면 그 일수를 이 페이지에 숫자로 적습니다. 확정 전에도 아래 주소로 요청하시면 지웁니다.
삭제 요청은 아래 주소로 보내 주세요. 해당 도메인의 소유를 확인한 뒤 그 도메인에서 받은 자료를 지웁니다.
문의
이 봇의 요청에 대한 문의·차단 요청·삭제 요청은 아래 주소로 보내 주세요. 담당자 개인 연락처가 아니라 역할 주소입니다.
문의 주소 support@connectai.kr
이 페이지의 값은 수집기가 실제로 쓰는 상수와 코드로 묶여 있습니다. 여기 적힌 것과 실제 요청이 다르면 그건 우리가 약속을 어긴 것이니, 위 주소로 알려 주세요.
최종 수정 · 2026-09-15