Краулинг (сканирование) — это процесс, при котором поисковый робот-краулер обходит страницы сайта, скачивает их содержимое и передаёт дальше на обработку. Это первый из трёх этапов работы поиска: сначала краулинг, затем индексация, затем ранжирование. Если страницу не просканировали, она не попадёт в индекс и не появится в выдаче.

Коротко о главном:

  • Краулинг отвечает на вопрос «поисковик вообще увидел страницу?», а не «на каком месте она стоит».
  • Управляют сканированием файл robots.txt, карта сайта sitemap.xml, внутренние ссылки и скорость ответа сервера.
  • У сайта есть краулинговый бюджет — сколько URL робот готов и способен обойти.
  • Проверить, как сканируется сайт, можно в Google Search Console и Яндекс.Вебмастере.
  • Частая причина «страница не в поиске» — её просто не дошли просканировать или закрыли в robots.txt.

Краулинг, индексация и ранжирование: чем отличаются

Путь страницы в поиске: от обхода роботом до позиции в выдаче
Путь страницы в поиске: от обхода роботом до позиции в выдаче

Три этапа часто путают и называют одним словом «индексация». Но это разные процессы, и ломается SEO обычно на первом. По документации Google, поиск работает в три стадии: crawling (сканирование), indexing (индексирование) и serving (выдача результатов). Каждая следующая стадия зависит от предыдущей — сломался обход, и дальше по цепочке уже ничего не поедет.

Краулинг — робот находит URL и скачивает HTML, картинки, видео. Индексация — поисковик разбирает скачанное, понимает, о чём страница, и кладёт данные в индекс (большую базу). Ранжирование — при запросе пользователя система выбирает из индекса подходящие страницы и сортирует их по релевантности и качеству.

Параметр Краулинг Индексация Ранжирование
Что делает Обходит и скачивает страницы Анализирует контент и заносит в индекс Сортирует страницы под запрос
Кто выполняет Робот-краулер (Googlebot, YandexBot) Обработчик индекса Алгоритмы ранжирования
Результат Копия страницы у поисковика Запись в базе индекса Позиция в выдаче
Когда происходит Первым, регулярно повторяется После сканирования В момент запроса пользователя
Что ломается без него Страница невидима поисковику Страница есть, но не в базе Страница в базе, но не в топе

Вывод: пока краулинг не прошёл, спорить о позициях бессмысленно — поисковик ещё не держал страницу в руках.

Как работает краулер: Googlebot и YandexBot

Краулер (он же бот, паук, spider) — это программа, которая по алгоритму решает, какие сайты обходить, как часто и сколько страниц забирать за раз. У Google это Googlebot, у Яндекса — YandexBot.

Работа краулера по шагам:

  • Обнаружение URL. Часть адресов поисковик уже знает по прошлым обходам. Новые он находит, когда извлекает ссылку с известной страницы на новую, либо когда вы сами присылаете список страниц через sitemap.
  • Проверка правил. Перед загрузкой робот сверяется с robots.txt — какие разделы сканировать можно, а какие закрыты.
  • Скачивание и рендеринг. Бот забирает HTML и запускает найденный JavaScript, чтобы увидеть страницу так же, как её видит браузер.
  • Переход по ссылкам. Со скачанной страницы робот собирает новые ссылки и ставит их в очередь на обход — так строится карта сайта.

Отсюда практический смысл внутренней перелинковки: страница без единой входящей ссылки и без записи в sitemap для робота почти не существует — ему неоткуда о ней узнать.

Частота обхода тоже не фиксированная. Робот возвращается тем чаще, чем важнее и «живее» страница: главную и активно обновляемые разделы он навещает регулярно, а забытую карточку из глубины каталога может не трогать неделями. Поэтому свежесть контента и обновления — это ещё и сигнал «заходи почаще».

Что такое краулинговый бюджет

Краулинговый бюджет — это набор URL, которые Google способен и хочет просканировать на вашем сайте. Он складывается из двух частей.

  • Лимит скорости сканирования (crawl capacity limit) — сколько параллельных соединений робот может открыть без перегрузки сервера и с какой задержкой между запросами. Если сайт отвечает быстро, лимит растёт; если тормозит или отдаёт ошибки сервера — падает.
  • Потребность в сканировании (crawl demand) — насколько поисковику вообще нужно обходить эти URL. На неё влияют популярность страниц (популярные обходят чаще, чтобы держать свежими) и их устаревание (систему интересуют изменения).

Бюджет впустую жгут дубли, «мусорные» URL с параметрами сортировок и фильтров, soft 404 (страница отдаёт код 200, но по сути пустая), длинные цепочки редиректов. Все они забирают визиты робота, которые могли бы уйти на полезные страницы. Согласно руководству Google по краулинговому бюджету, для большинства сайтов это не проблема — беспокоиться о бюджете стоит крупным проектам (от миллиона страниц с еженедельным обновлением), средним сайтам от 10 тысяч страниц с ежедневными изменениями и площадкам, где много URL в статусе «Обнаружена — не проиндексирована». Маленькому корпоративному сайту оптимизировать бюджет обычно нечего: его и так обойдут целиком.

Что влияет на краулинг

  • robots.txt. Закрытый в нём раздел робот не станет скачивать. Ошибка в одной строке способна спрятать от поиска половину сайта.
  • sitemap.xml. Карта сайта — прямой список URL для обхода, особенно важна для новых и глубоко вложенных страниц.
  • Внутренние ссылки. Чем меньше кликов от главной до страницы и чем больше на неё ведёт ссылок, тем вероятнее и чаще её обойдут.
  • Скорость и стабильность сервера. Быстрые ответы поднимают лимит сканирования, ошибки 5xx и таймауты — снижают.
  • Дубли и качество URL. Много однотипных страниц с параметрами размывают внимание робота и тратят бюджет впустую.
  • Глубина вложенности. Чем длиннее путь от главной до страницы, тем реже до неё доходит очередь обхода. Плоская структура сканируется охотнее.

Ни один из этих факторов не работает в одиночку. Быстрый сервер не спасёт страницу, закрытую в robots.txt; чистый robots.txt не поможет странице-сироте без ссылок. Краулинг — это сумма условий, и слабое звено определяет результат.

Как проверить краулинг

В Google Search Console есть отчёт «Статистика сканирования» (Crawl stats) — сколько запросов сделал Googlebot, какие коды ответа получил, сколько времени грузились страницы. Инструмент «Проверка URL» показывает по конкретному адресу, был ли он просканирован, когда и с какими проблемами.

В Яндекс.Вебмастере те же данные дают разделы «Индексирование → Статистика обхода» (какие страницы обошёл YandexBot и с каким кодом ответа) и «Проверить статус URL». Отдельно смотрите «Страницы в поиске» — расхождение между обойдёнными и попавшими в поиск страницами и есть зона роста.

На что смотреть в первую очередь: доля ответов 200 против ошибок 4xx/5xx, среднее время загрузки и динамика числа обойдённых страниц. Всплеск ошибок сервера или резкий рост времени ответа — сигнал, что робот упрётся в лимит и сократит обход. А если в отчётах много обойдённых, но не проиндексированных URL, дело уже не в краулинге, а в качестве и уникальности этих страниц.

Почему страница не сканируется: частые проблемы

  • Закрыта в robots.txt. Директива Disallow на нужный раздел — робот не заходит.
  • Нет входящих ссылок и записи в sitemap. Странице-сироте неоткуда взяться в очереди обхода.
  • Сервер отдаёт ошибки или тормозит. При 5xx и долгих ответах поисковик снижает частоту обхода.
  • Статус «Обнаружена — не проиндексирована». URL известен, но робот пока не дошёл до скачивания — типично при раздутом бюджете и множестве низкоценных страниц.
  • Цепочки редиректов и soft 404. Робот тратит визиты на пустышки вместо полезных страниц.

Важно не путать: если страница закрыта тегом noindex, она сканируется, но не индексируется. Если закрыта в robots.txt — не сканируется вовсе. Это разные рычаги, и лечатся они по-разному. Более того, есть неочевидная ловушка: чтобы поисковик увидел тег noindex, он должен страницу просканировать. Закроете её в robots.txt в надежде убрать из индекса — робот не зайдёт, тега не прочитает, и уже проиндексированная страница может так и остаться в выдаче. Правильный порядок: сначала открыть обход и дать noindex, дождаться переобхода, и только потом при желании закрывать в robots.txt.

Коротко

Краулинг — вход в поиск. Сначала робот должен физически обойти и скачать страницу, и только потом речь заходит об индексации и позициях. Держите robots.txt чистым, sitemap актуальным, сервер быстрым, а важные страницы — в двух-трёх кликах от главной. Тогда бюджет сканирования тратится на то, что приносит трафик.

Если хотите разбираться в технической стороне сайтов и продвижения без глубокого программирования, у Зерокодера есть курсы по SEO и веб-разработке на нейросетях — там эти процессы разбирают на практике.

Частые вопросы

Краулинг и индексация — это одно и то же?

Нет. Краулинг — обход и скачивание страницы роботом. Индексация — разбор скачанного и запись в базу поисковика. Сначала краулинг, потом индексация.

Как заставить поисковик просканировать страницу быстрее?

Добавьте её в sitemap.xml, поставьте на неё внутренние ссылки с уже индексируемых страниц и отправьте URL на переобход через Google Search Console или Яндекс.Вебмастер.

Что такое краулинговый бюджет простыми словами?

Это сколько страниц вашего сайта поисковый робот готов и способен обойти за отведённое время. У небольших сайтов его хватает с запасом; у крупных бюджет приходится экономить, убирая дубли и мусорные URL.

Почему страница есть на сайте, но её нет в поиске?

Частые причины: закрыта в robots.txt, на неё нет ссылок и записи в sitemap, сервер отдаёт ошибки, либо стоит статус «Обнаружена — не проиндексирована», когда робот ещё не дошёл до скачивания.

Чем краулинг отличается от ранжирования?

Краулинг определяет, увидел ли поисковик страницу вообще. Ранжирование определяет, на каком месте она встанет в выдаче по запросу. Между ними — индексация.

РОССИЙСКИЕ НЕЙРОСЕТИ ДЛЯ ЖИЗНИ И КАРЬЕРЫ В 2025
Присоединяйся к онлайн-вебинару.
В прямом эфире разберем и потестируем лучшие на сегодняшний день отечественные ИИ!
Вы узнаете о том:
  • Выполним базовые задачи на российских нейросетях и посмотрим на результаты!
  • Файл-инструкцию «Как сделать нейро-фотосессию из своего фото бесплатно, без иностранных карт и прочих сложностей»
  • Покажем 10+ способов улучшить свою жизнь с ИИ каждому — от ребенка и пенсионера до управленца и предпринимателя
Участвовать бесплатно
ОБЗОРНЫЙ ПРАКТИКУМ ПО НАШУМЕВШИМ НЕЙРОСЕТЯМ
Нейросети DEEPSEEK И QWEN
За 2 часа сделаем полный обзор новых мощных ИИ-моделей, которые бросают вызов нейросети ChatGPT
Вы узнаете:
  • Возможность получить Доступ в Нейроклуб на целый месяц
  • Как ИИ ускоряет работу и приносит деньги
  • За 2 часа вы получите четкий план, как начать работать с ИИ прямо сейчас!
Участвовать бесплатно