ChatGPT non rispetta sempre il file robots.txt

Il limite del robots.txt
Nuovi dati indicano che il bot di ChatGPT usato per recuperare pagine web può raggiungere siti che lo avevano escluso tramite il file robots.txt.
Il file robots.txt contiene istruzioni rivolte ai crawler e viene spesso utilizzato dai gestori dei siti per indicare quali aree non dovrebbero essere visitate. Tuttavia, secondo la documentazione di OpenAI richiamata dalla fonte, queste regole potrebbero non applicarsi al bot incaricato di recuperare contenuti per ChatGPT.
Perché la distinzione è importante
Il comportamento evidenziato riguarda il recupero delle pagine richieste dagli utenti e non implica necessariamente che ogni bot di OpenAI ignori le indicazioni del sito. La documentazione distingue infatti tra finalità e strumenti diversi, rendendo necessario verificare quale agente effettui la richiesta.
Per i gestori dei siti, la vicenda mostra che il solo robots.txt potrebbe non essere sufficiente per controllare ogni forma di accesso automatizzato. Le modalità tecniche e le eventuali misure aggiuntive dipendono dalla configurazione del servizio e dalle indicazioni aggiornate del fornitore.
Fonte: Search Engine Journal