Definiție
robots.txt — robots.txt este un fișier text din rădăcina site-ului care spune roboților ce secțiuni pot sau nu pot fi scanate.
Răspuns scurt
robots.txt controlează scanarea, nu indexarea. Pentru a scoate o pagină din index folosiți noindex — iar pagina trebuie să rămână accesibilă pentru scanare.
Cum funcționează
Fișierul se află la /robots.txt și se aplică doar gazdei și protocolului respectiv. Regulile sunt grupate pe User-agent; când mai multe reguli se potrivesc, câștigă cea mai lungă (mai specifică), iar la egalitate — Allow. Comportamentul este standardizat în RFC 9309.
User-agent: *
Disallow: /admin/
Disallow: /*?sort=
Sitemap: https://garbuz.online/sitemap.xmlGreșeli frecvente
- Disallow: / lăsat după lansarea de pe staging;
- blocarea fișierelor CSS/JS necesare randării;
- blocarea unei pagini cu noindex (robotul nu mai vede directiva);
- lipsa directivei Sitemap.
Cum verificați
Folosiți raportul robots.txt din Search Console și testerul robots.txt.
Surse
- RFC 9309: Robots Exclusion Protocol — IETF
- Introduction to robots.txt — Google Search Central