Гайды по SEO-проверке
robots.txt: что слушают Яндекс и Google, и чем отличается от снятия с индекса
Опубликовано 2026-09-03 · 13 мин
robots.txt — политика обхода, а не прямой инструмент индекса. Команды шаблонных сайтов регулярно путают Disallow с «удалением из поиска», копируют robots тестового стенда на продакшен и закрывают целые префиксы каталога «на всякий случай». Ошибка дорого обходится: sitemap уже отдаёт тысячи URL, а robots запрещает обход /catalog/ — краулер не видит noindex на страницах, которые вы считали снятыми с публикации. На шаблонных витринах robots проверяют в одном пакете с sitemap и meta robots на пилоте, иначе массовая публикация умножает противоречивые сигналы. Этот гайд разбирает, как Яндекс и Google читают robots.txt, чем Disallow отличается от noindex и снятия с индекса, и как проверить политику до масштабирования — с аудитом выборки «SEO-чек» и процедурным использованием Яндекс.Вебмастера после запуска. Только белые методы: без серых схем обхода robots и без советов прятать слабые страницы от краулера вместо улучшения контента.
Что такое robots.txt и чего он не делает
robots.txt — текстовый файл в корне домена с директивами для роботов: Allow, Disallow, Sitemap, иногда Crawl-delay для Яндекса. Он говорит, какие пути можно обходить, а не какие страницы должны быть в поисковой выдаче.
URL, закрытый Disallow, может остаться в индексе, если на него ссылаются с других сайтов или он был проиндексирован раньше. Робот перестаёт регулярно обходить страницу, но сниппет не исчезает автоматически — нужен noindex или удаление через инструменты вебмастера после снятия блокировки обхода.
robots.txt не заменяет контроль доступа к приватным данным. Файл публичен; не прячьте в нём секреты. Для закрытых разделов — аутентификация, а не только Disallow.
На шаблонных сайтах одна строка Disallow: /catalog/ может обнулить обнаружение всего коммерческого кластера. Поэтому robots проверяют на пилоте в том же релизе, что и sitemap и первые URL шаблона.
Disallow vs noindex vs снятие с индекса
Disallow в robots.txt: «не ходи по этому пути». Краулер может не увидеть meta noindex на странице, потому что не зашёл. Страница при этом всё ещё может фигурировать в выдаче по внешним ссылкам — классическая ловушка для команд, которые «закрыли раздел robots и ждут исчезновения».
meta robots noindex или X-Robots-Tag: noindex на ответе страницы: «не включай в индекс». Робот должен получить HTML или заголовок — для этого путь обычно не Disallow, а наоборот Allow с noindex на самих URL, которые нужно снять.
Снятие с индекса уже проиндексированного URL: сначала уберите Disallow, чтобы робот увидел noindex, либо используйте инструменты удаления в Яндекс.Вебмастере по процедуре кабинета. Порядок шагов важен; перепутанный порядок затягивает очистку выдачи на недели.
F-10 в методологии белых практик: не используйте robots.txt для снятия с индекса вместо noindex. Для шаблонных слабых вариантов — noindex на строке или блок публикации, а не массовый Disallow «чтобы не светить».
Яндекс vs Google: практические отличия
Оба поддерживают директивы User-agent, Disallow, Allow и Sitemap. Синтаксис wildcard (* и $) в Google документирован широко; Яндекс поддерживает * в Disallow/Allow — проверяйте на тестовом пути, а не предполагайте идентичность на устаревших правилах.
Директива Crawl-delay исторически ассоциируется с Яндексом; Google её игнорирует. Не полагайтесь на delay как на стратегию «сэкономить обход» — лучше чистый sitemap и отсутствие мусорных URL.
Разные идентификаторы роботов: Yandex, Googlebot и бот изображений Google. На шаблонных сайтах редко нужны отдельные секции, но медиа-каталоги иногда требуют явного Allow для изображений при жёстком Disallow на параметрах.
Яндекс.Вебмастер показывает, как робот видел robots при последних визитах — полезно после запуска. До запуска быстрее загрузка выборки через «SEO-чек» на production host с согласованным файлом.
Типичные ошибки на шаблонных запусках
robots тестового стенда с Disallow: / скопирован на продакшен вместе с развёртыванием — весь сайт закрыт от обхода, sitemap бесполезен.
Disallow на /api/ или /search/ случайно перекрывает префикс /search-engine-tools/ из-за префиксного совпадения без понимания сопоставления путей.
Закрыли фасетные параметры ?sort= в robots, но оставили канонические URL без параметров открытыми — хорошо; наоборот — закрыли канонический каталог, оставив параметрические дубли в sitemap — плохо.
Sitemap указывает на URL в Disallow — противоречивый сигнал: вы просите индексировать то, что запрещаете обходить. Краулер тратит бюджет на ошибки интерпретации.
CDN отдаёт другой robots.txt, чем origin — классика при миграции на периферию без синхронизации правил.
Allow, Disallow и приоритет правил
Более длинное совпадение пути обычно побеждает в типичных конфигурациях, но не полагайтесь на интуицию: фиксируйте тестовый URL и смотрите загрузку в отчётах. Документируйте порядок правил в репозитории инфраструктуры, не только в голове DevOps.
Allow: /catalog/public/ после Disallow: /catalog/ — распространённый паттерн для частичного открытия подкаталога. Ошибка в слэше ломает весь каталог.
Отдельные robots для поддоменов: blog.example.com и www.example.com — разные файлы. Шаблонный каталог на поддомене требует отдельного порога до запуска.
Не используйте robots для скрытия тонкого кластера от ответственности: если раздел не готов к индексу — noindex на шаблоне или не публикуйте строки, а не «закроем robots до лучших времён» без плана контента.
Связка robots.txt, sitemap и meta robots
Здоровый запуск: robots Allow на префикс шаблона, Sitemap с production URL, пилотные страницы без noindex, canonical на себя. Проверка тройки в одной выборке — минимальный порог «SEO-чек».
noindex на пилоте при URL в sitemap — частый баг CMS: маркетинг включил индекс на шаблоне, флаг тестового стенда забыли снять. Выборка ловит несоответствие быстрее, чем ждать отчёт Вебмастера.
X-Robots-Tag на уровне CDN может переопределять meta в HTML — сверяйте заголовки и body на одной загрузке.
После смены robots разверните и перепроверяйте в течение 24 часов: кеш периферии держит старый файл.
Проверка robots.txt на пилоте до запуска
Скачайте production robots.txt тем же host, что в sitemap loc — не внутренний URL за VPN.
Убедитесь, что префикс нового кластера не под Disallow и что нет случайного Disallow: / из тестового стенда.
Проверьте директивы Sitemap — HTTPS, правильный host, файлы отдают 200.
Загрузите три пилотных URL: meta robots, canonical, статус 200, отсутствие X-Robots-Tag: noindex на коммерческих страницах.
Зафиксируйте скриншот robots в артефакте запуска — визуальное сравнение при инциденте быстрее текстовых логов.
Согласуйте с командой, кто владеет robots на CDN vs origin — один владелец на файл.
Сравнение способов проверки политики обхода
Задачи до запуска и после запуска разные. Таблица ниже — нейтральное сравнение без заявления, что аудит выборки заменяет официальный кабинет или комбайн по сводным баллам.
| SEO-чек | Яндекс.Вебмастер | Комбайн (PR-CY и аналоги) |
|---|---|---|
| Живая загрузка robots.txt + выборка URL на индексируемость (meta, canonical, статус) | Отчёты о robots, индексации и запрос переобхода после изменений | Технический аудит: наличие robots, базовые Disallow, иногда sitemap |
| До масштаба: пилот, несоответствие noindex/sitemap/robots | После подключения сайта: как Яндекс видел обход и индекс | Периодический обзор домена для маркетинговых отчётов |
| Не эмулирует все типы роботов и не юридически валидирует соответствие | Официальная обратная связь по индексу и файлам на стороне Яндекса | Может не отличить CDN robots от origin без глубокого обхода |
| Явно не обещает полный обход сайта и не заменяет контентную экспертизу | Не заменяет проверку шаблона до первой публикации URL | Сводные модули видимости — другой продуктовый слой, не порог политики обхода |
| История аудитов, экспорт для тикета запуска | Инструмент «Анализ robots.txt» и диагностика исключённых страниц | Сводные чеклисты «техническое SEO» в одном PDF |
Когда менять robots, а когда шаблон
Меняйте robots, когда путь не должен обходиться вообще: личный кабинет, корзина, служебные API, результаты внутреннего поиска с параметрами.
Меняйте шаблон и политику индекса, когда проблема в качестве или дублях контента: noindex на слабых строках, 404 на удалённых, canonical на главный вариант фасета.
Не закрывайте Disallow весь новый коммерческий раздел «пока контент сырой» без плана noindex на уровне строк — иначе вы откладываете индекс, но не решаете тонкость.
После исправления robots подождите переобхода — недели, не часы. Поведенческие и индексные сигналы оценивайте с горизонтом минимум три недели, не по дневным колебаниям.
Как «SEO-чек» помогает с robots и индексируемостью
Аудит домена включает загрузку robots.txt, чтение директив Sitemap и проверку выборки URL на конфликты: Disallow vs наличие в sitemap, noindex vs ожидание индекса, canonical на другой host.
Результаты относятся к проанализированной выборке и моменту загрузки. Не все комбинации типов роботов и не все правила периферии покрываются.
Используйте отчёт как блокер массовой публикации при критических сбоях индексируемости. Правки вносятся в инфраструктуру и CMS; инструмент не разворачивает robots за вас.
Повторяйте аудит после каждого изменения robots или конфигурации CDN. Регрессии часто приходят из слияния конфигов, а не из SEO-правок контента.
Белые границы и частые вопросы команд
Серые схемы «показать краулеру одно, пользователю другое» или массово прятать дверные страницы за Disallow вместо качества — вне области и против правил белых практик.
Честная стратегия для слабых вариантов шаблона: не публиковать строку, noindex, или объединить в хаб — не обход правил обхода.
Документируйте политику обхода рядом со спецификацией шаблона, чтобы новые разработчики не открывали служебные префиксы на продакшене без noindex.
Юридические и compliance требования к индексации персональных данных — отдельное ревью; robots — не инструмент защиты персональных данных по смыслу регуляторики.
Пошаговый сценарий снятия раздела с индекса
Шаг 1: определите, нужен ли разделу обход. Если URL должны исчезнуть из выдачи, но оставаться доступными по прямой ссылке — нужен noindex на ответе, а не только Disallow.
Шаг 2: уберите конфликтующие URL из sitemap, чтобы не просить индексацию того, что снимаете.
Шаг 3: отдайте noindex на целевых страницах и убедитесь, что путь не закрыт Disallow — иначе робот не увидит тег.
Шаг 4: запросите переобход в Яндекс.Вебмастере по процедуре кабинета и мониторьте статусы исключённых страниц.
Шаг 5: после стабилизации выдачи решите, нужен ли Disallow для экономии бюджета обхода на служебных путях. Порядок «сначала Disallow, потом удивление, что noindex не работает» — типичная ошибка.
Документируйте дату и причину каждого изменения robots в журнале инфраструктуры. При инциденте «весь каталог выпал из выдачи» сравнение файла за последние сутки — первый артефакт расследования.
Чего инструмент не делает
«SEO-чек» делает живую загрузку robots.txt вашего домена и проверяет индексируемость на выборке URL — не эмулирует полностью все краулеры, не гарантирует снятие с индекса после Disallow и не заменяет процедуры Яндекс.Вебмастера. Disallow и noindex решают разные задачи; путаница между ними — частая причина месяцев «висящих» URL в выдаче. Трактуйте отчёт как порог до запуска и контроль регрессий, а окончательный статус индекса подтверждайте кабинетом поисковика.
FAQ
Как применять гайды вместе с проверкой выборки.
robots.txt — это то же самое, что noindex?+
Нет. robots управляет обходом пути. noindex на странице говорит не включать URL в индекс. Закрытый Disallow URL может остаться в выдаче; для снятия нужен noindex или инструменты вебмастера после того, как робот увидит сигнал.
Достаточно ли Disallow, чтобы убрать раздел из поиска?+
Часто нет. Если URL уже в индексе или на него ссылаются, сниппет может сохраняться. Уберите Disallow с целевых URL, отдайте noindex, дождитесь переобхода или используйте удаление через Яндекс.Вебмастер по инструкции кабинета.
Яндекс и Google читают robots одинаково?+
Базовые Disallow/Allow/Sitemap поддерживаются обоими, но детали wildcard, Crawl-delay и отдельные боты различаются. Тестируйте критичные пути на пилотных URL и сверяйтесь с документацией; не копируйте robots с чужого домена без проверки.
Почему URL в sitemap, но под Disallow?+
Это ошибка конфигурации: вы одновременно просите обнаружение и запрещаете обход. Исправьте либо sitemap, либо robots, согласно тому, должны ли URL индексироваться.
Может ли «SEO-чек» исправить robots за меня?+
Нет. Сервис диагностирует конфликты в выборке. Правки файла robots, CDN и CMS остаются на вашей стороне; после развёртывания запустите повторный аудит.
Как часто перепроверять robots после запуска шаблонного каталога?+
После каждого релиза, затрагивающего инфраструктуру, CDN или префиксы пути. Плюс плановый аудит выборки раз в спринт на ключевых кластерах и мониторинг отчётов Яндекс.Вебмастера о исключённых страницах.