Cloudflare опубликовал расследование: он застал команду Perplexity за «скрытым» сканированием сайтов — обходом robots.txt, сменой user-agent и использованием ротирующих IP/ASN, которые не были заявлены публично. По данным Cloudflare, такие обходы фиксировались на десятках тысяч доменов и насчитывали миллионы запросов в день. Perplexity ответил, что в отчёте «много недоразумений» и назвал публикацию «публицити-стунтом».

Почему это важно (простая аналогия)

Представьте, что на двери вашего склада висит табличка «Не входить — охраняется». Большой поисковый робот проходит и уважает знак — стучит и уходит. А система, о которой говорит Cloudflare, сначала представляется охраннику, а если её не пускают — снимает бейдж и пробирается через грузовой проход в маске. Это нарушение доверия владельцев ресурсов и может причинять ущерб — от лишней нагрузки на сервер до нелегального копирования контента.

Научим создавать своих безопасных GPT-агентов на бесплатном вебинаре с СЕО-Зерокодера!

Что именно обнаружил Cloudflare (технически, но коротко)

  • Perplexity сначала использовал объявленные user-agents, например PerplexityBot и Perplexity-User (в отчёте — большая доля трафика, \~20–25 млн запросов/день в примере).

  • Когда эти агенты блокировались, Cloudflare зафиксировал вызовы с «маскировкой» — типичный Chrome на macOS (в отчёте — \~3–6 млн запросов/день), IP-адреса вне списка, смену ASN и ротацию адресов.
  • Такая техника позволяет обходить правила robots.txt и сетевые блоки (WAF), что и обнаруживали тестовые домены Cloudflare.
  • На основе ML- и сетевых сигналов Cloudflare сформировал «фингерпринт» скрытого краулера и снял Perplexity со списка верифицированных ботов.

Что это значит для владельцев сайтов

  1. Нарушение конфиденциальности и прав — если вы явным образом запретили индексирование, а ваш контент всё равно попал в индекс/больше не принадлежит только вам, это проблема.
  2. Нагрузка на инфраструктуру — миллионы запросов в день могут съедать трафик и ресурсы.
  3. Репутационные риски — средства защиты (paywall, robots.txt, WAF) оказываются неэффективны, если их легко обходят.

Как защититься (практические шаги)

В первую очередь стоит регулярно проверять логи и системы мониторинга на признаки необычного трафика. Повышенное количество запросов от разных IP-адресов с одинаковым поведением может указывать на автоматизированный сбор данных.

Эффективным инструментом станет использование WAF с правилами блокировки по репутации. Крупные провайдеры, такие как Cloudflare, уже добавили сигнатуры, позволяющие автоматически отсеивать подозрительных краулеров.

Для дополнительной фильтрации полезно настраивать challenge-механизмы — например, CAPTCHA. В случае серьёзной угрозы можно применять жёсткое блокирование подозрительных источников.

Не менее важно открыто публиковать политику доступа к контенту и требовать от агрегаторов честной идентификации: корректного user-agent и списка используемых IP-адресов.

Если же речь идёт о коммерческом использовании материалов без разрешения, стоит рассмотреть возможность применения юридических мер.

Что говорят стороны

Cloudflare настаивает, что обнаружил скрытую, обходную активность и поэтому де-верифицировал Perplexity; рекомендует сайтам пользоваться инструментами защиты и подчёркивает важность стандартов (RFC по robots.txt и т. п.).

Perplexity в заявлении отметили, что выводы — преувеличены и есть недоразумения; подробностей мало (они называют публикацию «публицити-стунтом»).

Коротко о стандартах и хороших практиках

  • robots.txt — не закон, а de-facto соглашение: большинство «хороших» краулеров его уважают.
  • Принципы «хорошего краулера»: прозрачность (user-agent + список IP), умеренность (rate limits), отделение задач (по виду деятельности — индексирование/сканирование/архивирование).
  • Open standards (например, Web Bot Auth) и публичные списки IP помогают владельцам сайтов принимать осознанные решения.

Итог и что ждать дальше

Cloudflare зафиксировал и публично указал на поведение, которое большинство администраторов сайтов сочтёт некорректным. В ответ Perplexity оспаривает выводы. Главное, что из этой истории уже есть практический результат — инструменты защиты для владельцев сайтов и повышенное внимание к прозрачности работы AI-краулеров. Для пользователей и владельцев сайтов разумный вывод такой: следите за логами, публикуйте ограничения доступа и требуйте от сервисов честной идентификации.

 

Большой практикум
ЗАМЕНИ ВСЕ НЕЙРОСЕТИ НА ОДНУ — PERPLEXITY
ПОКАЖЕМ НА КОНКРЕТНЫХ КЕЙСАХ
  • Освой нейросеть Perplexity и узнай, как пользоваться функционалом остальных ИИ в одном
  • УЧАСТВОВАТЬ ЗА 0 РУБ.
  • Расскажем, как получить подписку
Участвовать бесплатно
ОНЛАЙН-ПРАКТИКУМ
ЗАПУСК нейросети DEEPSEEK R1 ЛОКАЛЬНО НА СВОЕМ КОМПЬЮТЕРЕ
ЧТО БУДЕТ НА ОБУЧЕНИИ?
  • ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросеть DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ
Участвовать бесплатно