Краулинговый бюджет
Краулинговый бюджет — лимит страниц, которые поисковый робот обходит на сайте за отведённое время. По данным Google, у большинства сайтов до 10 тысяч URL проблем с бюджетом нет, а вот у крупных порталов и магазинов на сотни тысяч страниц он становится узким горлом индексации.
Определение Краулинговый бюджет
Краулинговый бюджет (crawl budget) — это количество URL, которое поисковый робот готов обойти на конкретном сайте за единицу времени. Складывается он из двух величин: скорости сканирования (сколько запросов сервер выдержит без падения) и потребности в сканировании (насколько поисковику вообще интересны ваши страницы). По данным Google, сайты до 10 тысяч URL могут о бюджете не думать — их обходят целиком за считанные дни. А вот интернет-магазин на 300 тысяч карточек с фильтрами легко генерирует миллион URL, и робот физически не успевает дойти до новинок.
Как работает / Применение
Робот приходит на сайт «пачками»: делает N запросов, смотрит на скорость ответа и коды состояния, затем корректирует темп. Если сервер отвечает за 200 мс и отдаёт 200 OK — краулер ускоряется. Если пошли таймауты и 5xx — сбрасывает скорость, чтобы не уронить хост. За один визит на средний магазин Яндекс может обойти от 2 до 5 тысяч URL. Дальше вопрос простой: на что он потратит эти 5 тысяч запросов — на 500 новых товаров или на 4500 копий одной карточки в разных сортировках?
Именно здесь бюджет утекает. Робот честно скачивает мусор, тратит на него квоту, а действительно важные страницы остаются в очереди на неделю-две. Ниже — типичные пожиратели бюджета и что с ними делать.
| Что тратит бюджет | Пример URL | Как экономить |
|---|---|---|
| Параметры фильтров и сортировки | /catalog?sort=price&color=red&page=3 | Clean-param в robots.txt, canonical на базовый URL |
| Дубли и версии для печати | /article/123?print=1 | rel=canonical, закрыть в robots.txt |
| Цепочки редиректов 301 | A → B → C → D | Схлопнуть в один прямой редирект 301 |
| Битые ссылки и 404 | /old-page (удалён) | Убрать из перелинковки и sitemap |
| Пагинация без ограничений | ?page=1..500 | Ограничить глубину, canonical на первую |
Виды / Подходы к оптимизации
Работу с бюджетом делят на три направления. Первое — техническое сокращение мусора: закрываем от обхода служебные разделы, сессии, корзину, результаты внутреннего поиска через robots.txt. Второе — управление дублями: настраиваем канонические URL через тег rel=canonical, схлопываем варианты одной страницы в один адрес, чтобы робот не индексировал десять копий. Третье — ускорение и приоритизация: держим отдачу сервера в пределах 200–500 мс, обновляем карту сайта sitemap.xml с корректными датами lastmod и приоритетами, чтобы направить краулер на важное.
Отдельно стоит вопрос частоты обновления. Робот учится: если раздел блога меняется раз в день, а карточки — раз в месяц, он выстроит расписание обхода под это. Стабильная структура и предсказуемое обновление контента экономят бюджет лучше любых директив — краулер перестаёт «ощупывать» весь сайт каждый раз.
Инструменты / Метрики / Пример
Главный источник данных — Яндекс.Вебмастер (раздел «Индексирование» → «Статистика обхода») и Google Search Console (отчёт «Статистика сканирования»). Там видно, сколько URL робот запрашивал по дням, какие коды получал и сколько времени занимала загрузка. Для аудита структуры и поиска дублей используют Screaming Frog, Netpeak Spider и Топвизор. Логи сервера (access.log) показывают реальное поведение краулера точнее любой панели.
Мини-кейс. Магазин на 1С-Битрикс: 240 тысяч товаров, но робот из-за фильтров видел 1,8 миллиона URL. В Вебмастере обход составлял 6 тысяч страниц в сутки — то есть на полный проход уходило бы 300 дней, новинки индексировались через 3–4 недели. После закрытия параметров через Clean-param, склейки дублей канониклами и чистки sitemap количество «видимых» роботу URL упало до 280 тысяч. Обход тех же 6 тысяч в сутки стал попадать в реальные карточки: срок индексации новинок сократился с 25 до 4 дней, а органический трафик за квартал вырос на 34%.
Связанные концепции
- Индексация — попадание обойдённой страницы в базу поиска; бюджет определяет, дойдёт ли до неё робот
- robots.txt — файл директив, которым закрывают мусорные разделы от обхода
- Sitemap — карта сайта, приоритизирующая обход важных URL
- Технический SEO-аудит — комплексная проверка, с которой начинают оптимизацию бюджета
- Редирект 301 — цепочки редиректов пожирают квоту робота
- Скорость загрузки — прямой множитель для скорости сканирования
Частые ошибки
- Закрывают дубли в robots.txt, но оставляют на них внутренние ссылки — робот всё равно ходит по ним из перелинковки
- Ставят canonical, но ведут его на страницу с редиректом или на 404 — сигнал игнорируется
- Забывают чистить sitemap: карта отдаёт удалённые URL, робот тратит визиты на 404
- Гонятся за бюджетом на сайте в 500 страниц, где проблемы нет в принципе — оптимизируют то, что не болит
- Оставляют бесконечную пагинацию и календари, которые генерируют URL до бесконечности
Частые вопросы
Что такое краулинговый бюджет простыми словами?
Это лимит страниц, которые поисковый робот успевает обойти на вашем сайте за отведённое ему время. Представьте курьера, который за смену развозит 5000 адресов: если половина адресов — дубли и тупики, до новых домов он просто не доедет. Так же и робот тратит квоту на мусор вместо свежих товаров и статей.
Каким сайтам вообще нужно думать о краулинговом бюджете?
По данным Google, сайтам до 10 тысяч URL беспокоиться незачем — их обходят целиком за несколько дней. Проблема касается крупных проектов: интернет-магазинов с фильтрами, агрегаторов, порталов и маркетплейсов на сотни тысяч и миллионы страниц. Там правильная настройка обхода напрямую влияет на скорость индексации и трафик.
Что сильнее всего тратит краулинговый бюджет?
Главные пожиратели: URL с параметрами фильтров и сортировки (одна карточка в сотне вариаций), дубли страниц, цепочки редиректов 301, битые ссылки на 404 и бесконечная пагинация. На магазине это легко раздувает реальные 200 тысяч товаров до 2 миллионов URL, и робот тонет в копиях вместо полезных страниц.
Как экономить краулинговый бюджет?
Закройте мусорные разделы в robots.txt и через Clean-param, склейте дубли каноническими URL, схлопните цепочки редиректов в прямые, почистите sitemap.xml от удалённых страниц и держите отдачу сервера в пределах 200–500 мс. Это базовый набор в рамках SEO-продвижения, дающий кратный эффект на крупных сайтах.
Где посмотреть, как робот обходит мой сайт?
В Яндекс.Вебмастере — раздел «Индексирование» → «Статистика обхода»: сколько URL и с какими кодами робот запрашивал по дням. В Google Search Console — отчёт «Статистика сканирования». Детальнее всего покажут логи сервера. Разбор этих данных — часть технического SEO-аудита и настройки архитектуры сайта на разработке.