Определение
robots.txt — robots.txt — текстовый файл в корне сайта, который сообщает роботам, какие разделы можно и нельзя сканировать.
Короткий ответ
robots.txt управляет сканированием, а не индексацией. Чтобы убрать страницу из индекса, используйте noindex — и страница должна оставаться доступной для сканирования.
Как работает
Файл находится по адресу /robots.txt и действует только для своего хоста и протокола. Правила группируются по User-agent; если подходит несколько правил, побеждает самое длинное (более специфичное), при равенстве — Allow. Поведение стандартизировано в RFC 9309.
User-agent: *
Disallow: /admin/
Disallow: /*?sort=
Sitemap: https://garbuz.online/sitemap.xmlЧастые ошибки
- Disallow: / остался после переноса со staging;
- заблокированы CSS/JS, нужные для рендеринга;
- закрыта страница с noindex (робот больше не видит директиву);
- нет директивы Sitemap.
Как проверить
Используйте отчёт robots.txt в Search Console и тестер robots.txt.
Источники
- RFC 9309: Robots Exclusion Protocol — IETF
- Introduction to robots.txt — Google Search Central