# NOTA SEO: /organizzatori e /sponsorship NON sono in Disallow qui di proposito. # Vanno lasciate crawlabili da Googlebot affinché legga l'header # X-Robots-Tag: noindex (middleware NoIndex) e le rimuova in modo PERMANENTE # dall'indice. Un Disallow impedirebbe a Google di vedere il noindex e le pagine # resterebbero indicizzate. L'esclusione di quelle aree è gestita dal noindex, # non da robots.txt. NON ri-aggiungere qui il Disallow. # (I bot AI-search restano comunque bloccati nei rispettivi blocchi più sotto.) User-agent: * Disallow: /admin Disallow: /admin-tools # ── AI search / answer engines ────────────────────────────────────────────── # Questi bot fetchano in tempo reale per rispondere a query utente citando # la fonte: li lasciamo accedere ai contenuti pubblici. NON usano i contenuti # per training. User-agent: OAI-SearchBot Disallow: /admin Disallow: /admin-tools Disallow: /organizzatori Disallow: /sponsorship User-agent: ChatGPT-User Disallow: /admin Disallow: /admin-tools Disallow: /organizzatori Disallow: /sponsorship User-agent: PerplexityBot Disallow: /admin Disallow: /admin-tools Disallow: /organizzatori Disallow: /sponsorship User-agent: Perplexity-User Disallow: /admin Disallow: /admin-tools Disallow: /organizzatori Disallow: /sponsorship # Claude-SearchBot (indicizzazione per la ricerca di Claude) e Claude-User # (fetch su richiesta esplicita dell'utente) sono le due controparti "ricerca" # di Anthropic, distinte da ClaudeBot che è addestramento ed è bloccato sotto. # Aggiunti il 2026-08-07: prima non comparivano affatto e ricadevano su # `User-agent: *`, quindi erano ammessi ma senza queste due esclusioni — e # spendevano il 43% del crawl (1352 richieste su 3135) fra le pagine di # rivendica e il form sponsorship, che sono noindex e non gli servono a niente. User-agent: Claude-SearchBot Disallow: /admin Disallow: /admin-tools Disallow: /organizzatori Disallow: /sponsorship User-agent: Claude-User Disallow: /admin Disallow: /admin-tools Disallow: /organizzatori Disallow: /sponsorship # ── AI training: blocchiamo l'uso dei contenuti per addestrare LLM ────────── # NB: ClaudeBot qui sotto rispetta il Disallow. Verificato sui log nginx il # 2026-08-07: 69 richieste, tutte e sole a /robots.txt, nessuna pagina di # contenuto. È anche il motivo per cui nel rate limiter NON lo banniamo — un # ban gli impedirebbe di leggere proprio il file che lo tiene fuori. User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: Claude-Web Disallow: / User-agent: anthropic-ai Disallow: / User-agent: CCBot Disallow: / User-agent: Bytespider Disallow: / User-agent: Google-Extended Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: FacebookBot Disallow: / User-agent: Meta-ExternalAgent Disallow: / User-agent: cohere-ai Disallow: / User-agent: Diffbot Disallow: / User-agent: ImagesiftBot Disallow: / User-agent: Omgilibot Disallow: / # SEO crawler aggressivi senza valore per il portale User-agent: AhrefsBot Disallow: / User-agent: SemrushBot Disallow: / User-agent: MJ12bot Disallow: / User-agent: DotBot Disallow: / User-agent: BLEXBot Disallow: / Sitemap: https://festorum.it/sitemap.xml