Перейти к содержимому
Garbuz.Online
SEO Wiki · Техническое SEO

robots.txt

Автор: SEO-специалист Опубликовано

Определение

robots.txt — robots.txt — текстовый файл в корне сайта, который сообщает роботам, какие разделы можно и нельзя сканировать.

Короткий ответ

robots.txt управляет сканированием, а не индексацией. Чтобы убрать страницу из индекса, используйте noindex — и страница должна оставаться доступной для сканирования.

Как работает

Файл находится по адресу /robots.txt и действует только для своего хоста и протокола. Правила группируются по User-agent; если подходит несколько правил, побеждает самое длинное (более специфичное), при равенстве — Allow. Поведение стандартизировано в RFC 9309.

robots
User-agent: *
Disallow: /admin/
Disallow: /*?sort=

Sitemap: https://garbuz.online/sitemap.xml

Частые ошибки

  • Disallow: / остался после переноса со staging;
  • заблокированы CSS/JS, нужные для рендеринга;
  • закрыта страница с noindex (робот больше не видит директиву);
  • нет директивы Sitemap.

Как проверить

Используйте отчёт robots.txt в Search Console и тестер robots.txt.

Источники

  1. RFC 9309: Robots Exclusion Protocol — IETF
  2. Introduction to robots.txt — Google Search Central
→sitemap.xml→

Расскажите о проекте

Обсудим ваш проект?

Оставьте адрес сайта и цель — в течение рабочего дня получите первые наблюдения и следующие шаги.

Или напишите напрямую