# ============================================================================= # robots.txt - www.caiauronzo.it # # ATTENZIONE: questo e' un FILE FISICO in public_html. # L'editor robots.txt di Yoast SEO NON ha piu' alcun effetto: le modifiche # vanno fatte qui via FTP/File Manager. Il blocco WordPress in .htaccess # contiene "RewriteCond %{REQUEST_FILENAME} !-f", quindi un file reale ha # sempre la precedenza sul robots.txt virtuale generato da WordPress. # # Motivo del passaggio a file fisico (12/08/2026): # - il robots.txt virtuale costava un bootstrap PHP per ognuna delle 167 # richieste registrate nei log # - veniva dichiarato cacheable per 30 giorni: il del # blocco AccelerateWP non poteva applicarsi a un URL virtuale (FilesMatch # valuta il file realmente servito, cioe' index.php), quindi restava solo # ExpiresDefault "access plus 1 month". Con un file fisico la regola scatta # e il robots.txt torna a no-cache/must-revalidate. # # NOTA IMPORTANTE sulla struttura: un crawler che trova un gruppo dedicato al # proprio nome ignora del tutto il gruppo "User-agent: *". Per questo le # direttive Disallow sono ripetute in ogni gruppo. # # NON aggiungere Disallow sui percorsi del vecchio sito Joomla # (/images/phocagallery/, /photos/, /ultime-notizie/, *.html): rispondono 410 o # 301 dall'.htaccess. Un URL bloccato qui non puo' essere scansionato, quindi # Google non vedrebbe mai il 410 e lo terrebbe indicizzato a tempo # indeterminato. Il 410 funziona solo se il crawler lo puo' leggere. # ============================================================================= # --- Regola generale ------------------------------------------------------- User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php # --- Crawler SEO commerciali: rallentati, non bloccati ---------------------- # Nei log AhrefsBot ha scaricato ogni sitemap 19 volte in 2 giorni (172 # richieste, 130 delle quali su PHP). Google ignora Crawl-delay: per Googlebot # si usa Search Console. Bing, Ahrefs e Semrush lo rispettano. User-agent: AhrefsBot Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Crawl-delay: 20 User-agent: SemrushBot Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Crawl-delay: 20 User-agent: DotBot Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Crawl-delay: 30 User-agent: Barkrowler Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Crawl-delay: 30 User-agent: PetalBot Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Crawl-delay: 30 # --- Crawler senza alcun ritorno per un sito locale italiano --------------- User-agent: SeekportBot Disallow: / User-agent: Bytespider Disallow: / # --- Crawler AI: DECISIONE DA PRENDERE CON IL CLIENTE ---------------------- # ChatGPT-User e Claude-User NON sono crawler automatici: recuperano una # pagina solo quando un utente reale fa una domanda e riceve il link in # risposta. Nei log ChatGPT-User conta 239 richieste da 141 IP diversi, 89 # delle quali sulla home. E' traffico di persone che cercano informazioni sui # sentieri: bloccarlo significa perdere visibilita'. # # GPTBot, ClaudeBot, CCBot e Applebot-Extended raccolgono invece contenuti per # l'addestramento dei modelli. Se il CAI Auronzo non vuole che i propri testi # e le proprie foto vengano usati a questo scopo, togliere il '#' alle righe # seguenti. E' una scelta di policy, non tecnica. # # User-agent: GPTBot # Disallow: / # # User-agent: ClaudeBot # Disallow: / # # User-agent: CCBot # Disallow: / # # User-agent: Applebot-Extended # Disallow: / # # User-agent: Google-Extended # Disallow: / # # User-agent: meta-externalagent # Disallow: / # --- Sitemap --------------------------------------------------------------- Sitemap: https://www.caiauronzo.it/sitemap_index.xml