# robots.txt - www.centrosportivoitaliano.it # Aggiornato: 2026-09-01 # # NOTA: nessun contenuto pubblico viene sottratto ai crawler. # L'unico blocco sui contenuti riguarda gli URL-trappola generati # dalla vecchia paginazione ricorsiva (due o piu' 'pag=' nello stesso # URL): erano spazio di URL infinito, non pagine reali. # La paginazione normale (un solo pag=N) resta interamente crawlabile. # # Il pattern e' stato generalizzato il 2026-09-02 da '&pag=' a 'pag=': # la ricorsione si presenta in due forme, con i parametri nel percorso # ('...&pag=2&cerca=&pag=3&cerca=') oppure nella query string # ('/archivio?&pag=2&cerca=?&pag=3&cerca='), a seconda che l'URL di # partenza avesse gia' un separatore. Il pattern generalizzato le copre # entrambe, e continua a richiedere DUE occorrenze. User-agent: * Disallow: /*pag=*pag= Disallow: /admin/ Disallow: /demos/ Disallow: /autodeploy.php Disallow: /info.php Disallow: /test.php # Bot ad alto volume: nessuna esclusione di contenuto, solo richiesta # di rallentare il rate. Amazonbot e bingbot rispettano Crawl-delay; # GPTBot lo ignora ma rispetta Disallow. User-agent: GPTBot Disallow: /*pag=*pag= Disallow: /admin/ Disallow: /demos/ Crawl-delay: 5 User-agent: Amazonbot Disallow: /*pag=*pag= Disallow: /admin/ Disallow: /demos/ Crawl-delay: 10 User-agent: bingbot Disallow: /*pag=*pag= Disallow: /admin/ Disallow: /demos/ Crawl-delay: 5 Sitemap: https://www.centrosportivoitaliano.it/sitemap/sitemap.xml