Wat is robots.txt?
Een robots.txt-bestand geeft crawlers regels over welke URL’s op een website ze mogen opvragen. Het beheert vooral crawlverkeer. Het is geen betrouwbare methode om een webpagina uit Google te houden en het beveiligt geen gevoelige informatie.
Waar staat robots.txt en wat bevat het?
Het bestand staat op de hoofdlocatie van een host, bijvoorbeeld https://www.example.be/robots.txt. Regels worden per crawler gegroepeerd met onder meer User-agent, Disallow en Allow. Een regel met Sitemap kan verwijzen naar de XML-sitemap.
Robots.txt regelt crawling, niet gegarandeerd indexering
Wanneer een URL door robots.txt wordt geblokkeerd, kan Google de inhoud niet crawlen. De URL kan soms toch in zoekresultaten verschijnen als andere pagina’s ernaar linken. Gebruik robots.txt daarom niet om vertrouwelijke of uitsluitend interne pagina’s te verbergen.
Wanneer gebruikt u noindex of een wachtwoord?
- Geen vermelding in zoekresultaten: gebruik een
noindex-metatag of HTTP-header en zorg dat de crawler de pagina kan bereiken om die regel te lezen. - Privé-informatie: bescherm de pagina met authenticatie of andere echte toegangscontrole.
- Crawlverkeer beperken: gebruik robots.txt alleen voor URL’s die crawlers niet hoeven op te vragen, zolang belangrijke paginaresources beschikbaar blijven.
Controleer wijzigingen zorgvuldig
Een fout in robots.txt kan belangrijke pagina’s of bestanden ontoegankelijk maken voor crawlers. Test het bestand na aanpassingen en controleer in Google Search Console hoe Google een belangrijke URL ziet.