Гайды по SEO-проверке

robots.txt: что слушают Яндекс и Google, и чем отличается от снятия с индекса

Опубликовано 2026-09-03 · 13 мин

robots.txt — политика обхода, а не прямой инструмент индекса. Команды шаблонных сайтов регулярно путают Disallow с «удалением из поиска», копируют robots тестового стенда на продакшен и закрывают целые префиксы каталога «на всякий случай». Ошибка дорого обходится: sitemap уже отдаёт тысячи URL, а robots запрещает обход /catalog/ — краулер не видит noindex на страницах, которые вы считали снятыми с публикации. На шаблонных витринах robots проверяют в одном пакете с sitemap и meta robots на пилоте, иначе массовая публикация умножает противоречивые сигналы. Этот гайд разбирает, как Яндекс и Google читают robots.txt, чем Disallow отличается от noindex и снятия с индекса, и как проверить политику до масштабирования — с аудитом выборки «SEO-чек» и процедурным использованием Яндекс.Вебмастера после запуска. Только белые методы: без серых схем обхода robots и без советов прятать слабые страницы от краулера вместо улучшения контента.

Что такое robots.txt и чего он не делает

robots.txt — текстовый файл в корне домена с директивами для роботов: Allow, Disallow, Sitemap, иногда Crawl-delay для Яндекса. Он говорит, какие пути можно обходить, а не какие страницы должны быть в поисковой выдаче.

URL, закрытый Disallow, может остаться в индексе, если на него ссылаются с других сайтов или он был проиндексирован раньше. Робот перестаёт регулярно обходить страницу, но сниппет не исчезает автоматически — нужен noindex или удаление через инструменты вебмастера после снятия блокировки обхода.

robots.txt не заменяет контроль доступа к приватным данным. Файл публичен; не прячьте в нём секреты. Для закрытых разделов — аутентификация, а не только Disallow.

На шаблонных сайтах одна строка Disallow: /catalog/ может обнулить обнаружение всего коммерческого кластера. Поэтому robots проверяют на пилоте в том же релизе, что и sitemap и первые URL шаблона.

Disallow vs noindex vs снятие с индекса

Disallow в robots.txt: «не ходи по этому пути». Краулер может не увидеть meta noindex на странице, потому что не зашёл. Страница при этом всё ещё может фигурировать в выдаче по внешним ссылкам — классическая ловушка для команд, которые «закрыли раздел robots и ждут исчезновения».

meta robots noindex или X-Robots-Tag: noindex на ответе страницы: «не включай в индекс». Робот должен получить HTML или заголовок — для этого путь обычно не Disallow, а наоборот Allow с noindex на самих URL, которые нужно снять.

Снятие с индекса уже проиндексированного URL: сначала уберите Disallow, чтобы робот увидел noindex, либо используйте инструменты удаления в Яндекс.Вебмастере по процедуре кабинета. Порядок шагов важен; перепутанный порядок затягивает очистку выдачи на недели.

F-10 в методологии белых практик: не используйте robots.txt для снятия с индекса вместо noindex. Для шаблонных слабых вариантов — noindex на строке или блок публикации, а не массовый Disallow «чтобы не светить».

Яндекс vs Google: практические отличия

Оба поддерживают директивы User-agent, Disallow, Allow и Sitemap. Синтаксис wildcard (* и $) в Google документирован широко; Яндекс поддерживает * в Disallow/Allow — проверяйте на тестовом пути, а не предполагайте идентичность на устаревших правилах.

Директива Crawl-delay исторически ассоциируется с Яндексом; Google её игнорирует. Не полагайтесь на delay как на стратегию «сэкономить обход» — лучше чистый sitemap и отсутствие мусорных URL.

Разные идентификаторы роботов: Yandex, Googlebot и бот изображений Google. На шаблонных сайтах редко нужны отдельные секции, но медиа-каталоги иногда требуют явного Allow для изображений при жёстком Disallow на параметрах.

Яндекс.Вебмастер показывает, как робот видел robots при последних визитах — полезно после запуска. До запуска быстрее загрузка выборки через «SEO-чек» на production host с согласованным файлом.

Типичные ошибки на шаблонных запусках

robots тестового стенда с Disallow: / скопирован на продакшен вместе с развёртыванием — весь сайт закрыт от обхода, sitemap бесполезен.

Disallow на /api/ или /search/ случайно перекрывает префикс /search-engine-tools/ из-за префиксного совпадения без понимания сопоставления путей.

Закрыли фасетные параметры ?sort= в robots, но оставили канонические URL без параметров открытыми — хорошо; наоборот — закрыли канонический каталог, оставив параметрические дубли в sitemap — плохо.

Sitemap указывает на URL в Disallow — противоречивый сигнал: вы просите индексировать то, что запрещаете обходить. Краулер тратит бюджет на ошибки интерпретации.

CDN отдаёт другой robots.txt, чем origin — классика при миграции на периферию без синхронизации правил.

Allow, Disallow и приоритет правил

Более длинное совпадение пути обычно побеждает в типичных конфигурациях, но не полагайтесь на интуицию: фиксируйте тестовый URL и смотрите загрузку в отчётах. Документируйте порядок правил в репозитории инфраструктуры, не только в голове DevOps.

Allow: /catalog/public/ после Disallow: /catalog/ — распространённый паттерн для частичного открытия подкаталога. Ошибка в слэше ломает весь каталог.

Отдельные robots для поддоменов: blog.example.com и www.example.com — разные файлы. Шаблонный каталог на поддомене требует отдельного порога до запуска.

Не используйте robots для скрытия тонкого кластера от ответственности: если раздел не готов к индексу — noindex на шаблоне или не публикуйте строки, а не «закроем robots до лучших времён» без плана контента.

Связка robots.txt, sitemap и meta robots

Здоровый запуск: robots Allow на префикс шаблона, Sitemap с production URL, пилотные страницы без noindex, canonical на себя. Проверка тройки в одной выборке — минимальный порог «SEO-чек».

noindex на пилоте при URL в sitemap — частый баг CMS: маркетинг включил индекс на шаблоне, флаг тестового стенда забыли снять. Выборка ловит несоответствие быстрее, чем ждать отчёт Вебмастера.

X-Robots-Tag на уровне CDN может переопределять meta в HTML — сверяйте заголовки и body на одной загрузке.

После смены robots разверните и перепроверяйте в течение 24 часов: кеш периферии держит старый файл.

Проверка robots.txt на пилоте до запуска

Скачайте production robots.txt тем же host, что в sitemap loc — не внутренний URL за VPN.

Убедитесь, что префикс нового кластера не под Disallow и что нет случайного Disallow: / из тестового стенда.

Проверьте директивы Sitemap — HTTPS, правильный host, файлы отдают 200.

Загрузите три пилотных URL: meta robots, canonical, статус 200, отсутствие X-Robots-Tag: noindex на коммерческих страницах.

Зафиксируйте скриншот robots в артефакте запуска — визуальное сравнение при инциденте быстрее текстовых логов.

Согласуйте с командой, кто владеет robots на CDN vs origin — один владелец на файл.

Сравнение способов проверки политики обхода

Задачи до запуска и после запуска разные. Таблица ниже — нейтральное сравнение без заявления, что аудит выборки заменяет официальный кабинет или комбайн по сводным баллам.

SEO-чекЯндекс.ВебмастерКомбайн (PR-CY и аналоги)
Живая загрузка robots.txt + выборка URL на индексируемость (meta, canonical, статус)Отчёты о robots, индексации и запрос переобхода после измененийТехнический аудит: наличие robots, базовые Disallow, иногда sitemap
До масштаба: пилот, несоответствие noindex/sitemap/robotsПосле подключения сайта: как Яндекс видел обход и индексПериодический обзор домена для маркетинговых отчётов
Не эмулирует все типы роботов и не юридически валидирует соответствиеОфициальная обратная связь по индексу и файлам на стороне ЯндексаМожет не отличить CDN robots от origin без глубокого обхода
Явно не обещает полный обход сайта и не заменяет контентную экспертизуНе заменяет проверку шаблона до первой публикации URLСводные модули видимости — другой продуктовый слой, не порог политики обхода
История аудитов, экспорт для тикета запускаИнструмент «Анализ robots.txt» и диагностика исключённых страницСводные чеклисты «техническое SEO» в одном PDF

Когда менять robots, а когда шаблон

Меняйте robots, когда путь не должен обходиться вообще: личный кабинет, корзина, служебные API, результаты внутреннего поиска с параметрами.

Меняйте шаблон и политику индекса, когда проблема в качестве или дублях контента: noindex на слабых строках, 404 на удалённых, canonical на главный вариант фасета.

Не закрывайте Disallow весь новый коммерческий раздел «пока контент сырой» без плана noindex на уровне строк — иначе вы откладываете индекс, но не решаете тонкость.

После исправления robots подождите переобхода — недели, не часы. Поведенческие и индексные сигналы оценивайте с горизонтом минимум три недели, не по дневным колебаниям.

Как «SEO-чек» помогает с robots и индексируемостью

Аудит домена включает загрузку robots.txt, чтение директив Sitemap и проверку выборки URL на конфликты: Disallow vs наличие в sitemap, noindex vs ожидание индекса, canonical на другой host.

Результаты относятся к проанализированной выборке и моменту загрузки. Не все комбинации типов роботов и не все правила периферии покрываются.

Используйте отчёт как блокер массовой публикации при критических сбоях индексируемости. Правки вносятся в инфраструктуру и CMS; инструмент не разворачивает robots за вас.

Повторяйте аудит после каждого изменения robots или конфигурации CDN. Регрессии часто приходят из слияния конфигов, а не из SEO-правок контента.

Белые границы и частые вопросы команд

Серые схемы «показать краулеру одно, пользователю другое» или массово прятать дверные страницы за Disallow вместо качества — вне области и против правил белых практик.

Честная стратегия для слабых вариантов шаблона: не публиковать строку, noindex, или объединить в хаб — не обход правил обхода.

Документируйте политику обхода рядом со спецификацией шаблона, чтобы новые разработчики не открывали служебные префиксы на продакшене без noindex.

Юридические и compliance требования к индексации персональных данных — отдельное ревью; robots — не инструмент защиты персональных данных по смыслу регуляторики.

Пошаговый сценарий снятия раздела с индекса

Шаг 1: определите, нужен ли разделу обход. Если URL должны исчезнуть из выдачи, но оставаться доступными по прямой ссылке — нужен noindex на ответе, а не только Disallow.

Шаг 2: уберите конфликтующие URL из sitemap, чтобы не просить индексацию того, что снимаете.

Шаг 3: отдайте noindex на целевых страницах и убедитесь, что путь не закрыт Disallow — иначе робот не увидит тег.

Шаг 4: запросите переобход в Яндекс.Вебмастере по процедуре кабинета и мониторьте статусы исключённых страниц.

Шаг 5: после стабилизации выдачи решите, нужен ли Disallow для экономии бюджета обхода на служебных путях. Порядок «сначала Disallow, потом удивление, что noindex не работает» — типичная ошибка.

Документируйте дату и причину каждого изменения robots в журнале инфраструктуры. При инциденте «весь каталог выпал из выдачи» сравнение файла за последние сутки — первый артефакт расследования.

Чего инструмент не делает

«SEO-чек» делает живую загрузку robots.txt вашего домена и проверяет индексируемость на выборке URL — не эмулирует полностью все краулеры, не гарантирует снятие с индекса после Disallow и не заменяет процедуры Яндекс.Вебмастера. Disallow и noindex решают разные задачи; путаница между ними — частая причина месяцев «висящих» URL в выдаче. Трактуйте отчёт как порог до запуска и контроль регрессий, а окончательный статус индекса подтверждайте кабинетом поисковика.

FAQ

Как применять гайды вместе с проверкой выборки.

robots.txt — это то же самое, что noindex?+

Нет. robots управляет обходом пути. noindex на странице говорит не включать URL в индекс. Закрытый Disallow URL может остаться в выдаче; для снятия нужен noindex или инструменты вебмастера после того, как робот увидит сигнал.

Достаточно ли Disallow, чтобы убрать раздел из поиска?+

Часто нет. Если URL уже в индексе или на него ссылаются, сниппет может сохраняться. Уберите Disallow с целевых URL, отдайте noindex, дождитесь переобхода или используйте удаление через Яндекс.Вебмастер по инструкции кабинета.

Яндекс и Google читают robots одинаково?+

Базовые Disallow/Allow/Sitemap поддерживаются обоими, но детали wildcard, Crawl-delay и отдельные боты различаются. Тестируйте критичные пути на пилотных URL и сверяйтесь с документацией; не копируйте robots с чужого домена без проверки.

Почему URL в sitemap, но под Disallow?+

Это ошибка конфигурации: вы одновременно просите обнаружение и запрещаете обход. Исправьте либо sitemap, либо robots, согласно тому, должны ли URL индексироваться.

Может ли «SEO-чек» исправить robots за меня?+

Нет. Сервис диагностирует конфликты в выборке. Правки файла robots, CDN и CMS остаются на вашей стороне; после развёртывания запустите повторный аудит.

Как часто перепроверять robots после запуска шаблонного каталога?+

После каждого релиза, затрагивающего инфраструктуру, CDN или префиксы пути. Плюс плановый аудит выборки раз в спринт на ключевых кластерах и мониторинг отчётов Яндекс.Вебмастера о исключённых страницах.