Was robots.txt ist
Eine reine Textdatei in der Wurzel eines Hosts, unter /robots.txt, die Crawlern sagt, welche URL-Pfade sie anfragen dürfen. Sie ist eine Crawl-Anweisung und keine Zugriffskontrolle: Die Datei ist öffentlich, und ein Crawler, der sie ignoriert, verletzt technisch nichts. In RFC 9309 sind nur vier Direktiven standardisiert: User-agent, Allow, Disallow und Sitemap.


