Che cos'è robots.txt
Un file di testo semplice nella radice di un host, in /robots.txt, che indica ai crawler quali percorsi URL possono richiedere. È un'istruzione di scansione, non un controllo di accesso: il file è pubblico e un crawler che lo ignora non viola nulla sul piano tecnico. Solo quattro direttive sono standardizzate in RFC 9309: User-agent, Allow, Disallow e Sitemap.


