Cloudflare опубликовал расследование: он застал команду Perplexity за «скрытым» сканированием сайтов — обходом robots.txt, сменой user-agent и использованием ротирующих IP/ASN, которые не были заявлены публично. По данным Cloudflare, такие обходы фиксировались на десятках тысяч доменов и насчитывали миллионы запросов в день. Perplexity ответил, что в отчёте «много недоразумений» и назвал публикацию «публицити-стунтом».
Почему это важно (простая аналогия)
Представьте, что на двери вашего склада висит табличка «Не входить — охраняется». Большой поисковый робот проходит и уважает знак — стучит и уходит. А система, о которой говорит Cloudflare, сначала представляется охраннику, а если её не пускают — снимает бейдж и пробирается через грузовой проход в маске. Это нарушение доверия владельцев ресурсов и может причинять ущерб — от лишней нагрузки на сервер до нелегального копирования контента.
Научим создавать своих безопасных GPT-агентов на бесплатном вебинаре с СЕО-Зерокодера!
Что именно обнаружил Cloudflare (технически, но коротко)
- Perplexity сначала использовал объявленные user-agents, например
PerplexityBotиPerplexity-User(в отчёте — большая доля трафика, \~20–25 млн запросов/день в примере).
- Когда эти агенты блокировались, Cloudflare зафиксировал вызовы с «маскировкой» — типичный Chrome на macOS (в отчёте — \~3–6 млн запросов/день), IP-адреса вне списка, смену ASN и ротацию адресов.
- Такая техника позволяет обходить правила
robots.txtи сетевые блоки (WAF), что и обнаруживали тестовые домены Cloudflare. - На основе ML- и сетевых сигналов Cloudflare сформировал «фингерпринт» скрытого краулера и снял Perplexity со списка верифицированных ботов.
Что это значит для владельцев сайтов
- Нарушение конфиденциальности и прав — если вы явным образом запретили индексирование, а ваш контент всё равно попал в индекс/больше не принадлежит только вам, это проблема.
- Нагрузка на инфраструктуру — миллионы запросов в день могут съедать трафик и ресурсы.
- Репутационные риски — средства защиты (paywall,
robots.txt, WAF) оказываются неэффективны, если их легко обходят.
Как защититься (практические шаги)
В первую очередь стоит регулярно проверять логи и системы мониторинга на признаки необычного трафика. Повышенное количество запросов от разных IP-адресов с одинаковым поведением может указывать на автоматизированный сбор данных.
Эффективным инструментом станет использование WAF с правилами блокировки по репутации. Крупные провайдеры, такие как Cloudflare, уже добавили сигнатуры, позволяющие автоматически отсеивать подозрительных краулеров.
Для дополнительной фильтрации полезно настраивать challenge-механизмы — например, CAPTCHA. В случае серьёзной угрозы можно применять жёсткое блокирование подозрительных источников.
Не менее важно открыто публиковать политику доступа к контенту и требовать от агрегаторов честной идентификации: корректного user-agent и списка используемых IP-адресов.
Если же речь идёт о коммерческом использовании материалов без разрешения, стоит рассмотреть возможность применения юридических мер.
Что говорят стороны
Cloudflare настаивает, что обнаружил скрытую, обходную активность и поэтому де-верифицировал Perplexity; рекомендует сайтам пользоваться инструментами защиты и подчёркивает важность стандартов (RFC по robots.txt и т. п.).
Perplexity в заявлении отметили, что выводы — преувеличены и есть недоразумения; подробностей мало (они называют публикацию «публицити-стунтом»).
Коротко о стандартах и хороших практиках
robots.txt— не закон, а de-facto соглашение: большинство «хороших» краулеров его уважают.- Принципы «хорошего краулера»: прозрачность (user-agent + список IP), умеренность (rate limits), отделение задач (по виду деятельности — индексирование/сканирование/архивирование).
- Open standards (например, Web Bot Auth) и публичные списки IP помогают владельцам сайтов принимать осознанные решения.
Итог и что ждать дальше
Cloudflare зафиксировал и публично указал на поведение, которое большинство администраторов сайтов сочтёт некорректным. В ответ Perplexity оспаривает выводы. Главное, что из этой истории уже есть практический результат — инструменты защиты для владельцев сайтов и повышенное внимание к прозрачности работы AI-краулеров. Для пользователей и владельцев сайтов разумный вывод такой: следите за логами, публикуйте ограничения доступа и требуйте от сервисов честной идентификации.
- Освой нейросеть Perplexity и узнай, как пользоваться функционалом остальных ИИ в одном
- УЧАСТВОВАТЬ ЗА 0 РУБ.
- Расскажем, как получить подписку
- ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросеть DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ

