30년 된 영화 데이터 사이트 'TheNumbers.com'이 AI 봇 트래픽 폭증으로 서비스 중단됨
데이터 스크래핑(Data Scraping) 및 예측 시장에서의 정보 우위 확보 목적의 해킹 시도가 원인으로 추정됨
오래된 웹사이트 아키텍처(Legacy Architecture)의 취약성과 AI 시대의 새로운 위협을 보여줌
데이터 격리 아키텍처(Data Isolation Architecture) 및 봇 트래픽 관리의 중요성이 부각됨
커뮤니티에서는 AI 봇의 무분별한 스크래핑이 웹사이트 운영 비용을 기하급수적으로 증가시킨다는 점에 주목합니다. 특히 OpenAI, Anthropic 등 거대 AI 모델들의 대규모 데이터 수집은 기존 웹사이트의 대역폭(Bandwidth) 및 호스팅 비용을 감당하기 어려운 수준으로 끌어올립니다. 이는 Read the Docs, iFixit 등 다수 사이트에서 수백 GB에서 수 TB 단위의 트래픽 비용으로 나타난 실제 사례로 뒷받침됩니다. 결과적으로 봇 트래픽에 대한 과금 모델(Pay-per-crawl) 도입이 시급하다는 의견이 지배적입니다.
논의에서는 TheNumbers.com이 표적이 된 이유로 예측 시장(Prediction Markets)에서의 정보 비대칭성(Information Asymmetry)을 지적합니다. Polymarket과 같은 플랫폼에서 영화 흥행 성적 데이터를 실시간으로 활용하여 선행 매매(Front-running)를 시도하는 세력이 존재하며, 이를 위해 AI를 이용한 해킹이 시도되었을 가능성이 높다고 봅니다. 이는 데이터 접근 속도가 곧 금전적 이득으로 직결되는 새로운 형태의 사이버 공격 동기를 보여줍니다.
30년 된 레거시 시스템(Legacy System)은 160,000개 이상의 소스 파일과 복잡한 구조로 인해 AI 기반의 자동화된 취약점 탐색(Automated Vulnerability Probing)에 매우 취약했습니다. XBOW와 같은 AI 기반 침투 테스터의 등장으로 해킹의 진입 장벽이 낮아진 상황에서, 과거에는 소수의 전문가만이 가능했던 공격이 이제는 저렴한 AI 구독으로 가능해졌습니다. 이는 데이터 격리 아키텍처(Data Isolation Architecture)와 같은 보안 강화 조치가 필수적임을 시사합니다.
과거 웹사이트는 인간 사용자와 검색 엔진 크롤러를 대상으로 운영되었으나, 이제는 LLM 학습, 에이전트 기반 AI 트래픽, 예측 시장 참여자 등 6가지 이상의 다양한 트래픽을 고려해야 합니다. Cloudflare는 봇 차단 및 콘텐츠 사용량 기반 과금 등 새로운 방어 메커니즘을 제시하지만, AI 기업들의 협조 없이는 실효성이 제한적입니다. 정적 사이트 생성기(Static Site Generator)와 같은 데이터 격리 아키텍처(Data Isolation Architecture) 도입 및 봇 트래픽에 대한 명확한 정책 수립이 요구됩니다.
과거 오픈 웹(Open Web)은 검색 엔진이 콘텐츠를 읽는 대가로 사용자를 돌려보내는 상호 이익 구조였으나, 이제는 AI 봇이 콘텐츠를 소비하고 사용자는 AI 요약으로 대체되면서 이 관계가 깨졌습니다. Wikipedia의 사례처럼 AI 봇이 트래픽의 상당 부분을 차지하고 인간 방문자 수는 감소하는 현상은 오픈 웹의 지속 가능성에 대한 근본적인 질문을 던집니다. 데이터 미저장 정책(Zero-Retention Policy)과 같은 접근 방식이 필요하다는 의견도 있습니다.