# Controllo dei crawler AI e dei bot di ricerca

Source: https://support.kapsulehost.com/it-it/site-crawlers

La scheda Crawler controlla quali visitatori automatici sono autorizzati a indicizzare il tuo sito, raggruppati in motori di ricerca, motori di risposta AI, strumenti SEO e bot di anteprima social. Questa guida spiega cosa fa ciascun gruppo, cosa consente KapsuleHost per impostazione predefinita e cosa comporta realmente bloccarli.

## Dove si trovano le impostazioni Crawler in KPanel

1. Accedi a [KPanel](https://kpanel.kapsulehost.com).
2. Fai clic su **Siti web** nella barra laterale sinistra, poi fai clic sul sito.
3. Nel menu a sinistra del sito, apri **Prestazioni**, poi **Crawler**.

L'indirizzo diretto è `/websites/<site-id>/crawlers`.

![La pagina Crawlers per un sito in KPanel, con i controlli per i crawler AI e i bot di ricerca](https://support.kapsulehost.com/help/screenshots/site-crawlers.e60d4ece.webp)

## Cosa cambia realmente questa pagina

Attivare o disattivare un gruppo riscrive il file `robots.txt` del tuo sito. Quel file è una richiesta pubblicata ai visitatori automatici che si comportano correttamente, e i principali crawler la rispettano.

Ne derivano due conseguenze, ed entrambe sono importanti.

**È una richiesta, non un muro.** Un crawler che ignora `robots.txt` non è influenzato da nulla in questa pagina. Se il tuo problema è lo scraping da parte di qualcosa che non si identifica onestamente, questo non è lo strumento giusto: usa invece l'elenco di blocco IP o il filtro per paese nella pagina **Sicurezza** del sito. Vedi [Sicurezza del sito](https://support.kapsulehost.com/it-it/site-security) e [Blocco per paese per un sito](https://support.kapsulehost.com/it-it/site-geo-blocking).

**Controlla la scansione, non ciò che è già indicizzato.** Bloccare un crawler ferma le future scansioni. I contenuti già presenti in un indice generalmente ne escono nel tempo, ma non all'istante.

Le modifiche vengono salvate nel momento in cui attivi un interruttore. La pagina mostra **Saving**, poi **Saved, robots.txt updated**.

## I quattro gruppi

**Motori di ricerca.** I crawler tradizionali dietro i normali risultati di ricerca: Googlebot, Bingbot, DuckDuckBot, Applebot e YandexBot.

**Motori di ricerca e risposta AI.** Crawler per sistemi che includono i tuoi contenuti in risposte generate dall'AI e riepiloghi di ricerca: GPTBot e OAI-SearchBot di OpenAI, ClaudeBot e anthropic-ai di Anthropic, PerplexityBot, Google-Extended, Cohere, Meta e Diffbot.

**Strumenti SEO e analisi.** Crawler di piattaforme usate per analizzare i siti: AhrefsBot, SemrushBot, MJ12bot, DotBot e Baiduspider.

**Social media e anteprima.** Crawler che recuperano una scheda di anteprima quando qualcuno condivide un link: Twitterbot, il recuperatore di anteprime di Facebook, LinkedInBot, Slackbot e Discordbot.

Ogni scheda di gruppo elenca tutti i crawler che contiene, con il relativo proprietario, così puoi vedere esattamente cosa copre un interruttore prima di attivarlo.

## L'impostazione predefinita di KapsuleHost: i crawler AI sono consentiti

Ogni gruppo è consentito per impostazione predefinita, inclusi i crawler AI, e questa è una posizione deliberata, non una svista.

Diversi host bloccano silenziosamente i crawler AI per conto dei loro clienti. Noi no, perché è il tuo traffico e la tua decisione, e perché quel comportamento predefinito costa visibilità. I risultati di ricerca AI sono una fonte reale e crescente di rinvii. Un sito che i sistemi AI non possono leggere non compare in quelle risposte, il che significa che non ottiene quel traffico.

Se vuoi bloccarli, il controllo è proprio qui. Semplicemente non faremo questa scelta al posto tuo senza dirtelo.

## Decidere per ogni gruppo

**Motori di ricerca.** Lascia consentito a meno che il sito non sia genuinamente privato, nel qual caso la protezione con password è comunque lo strumento giusto. Vedi [Proteggere un sito con password](https://support.kapsulehost.com/it-it/site-password-protect).

**Motori di ricerca e risposta AI.** Questa è la vera decisione in questa pagina.

Consentili se vuoi traffico e citazioni dalle risposte AI, il che vale per quasi tutti i siti commerciali, editori e attività di servizi.

Valuta di bloccarli se il tuo contenuto è il tuo prodotto e il fatto di essere riassunto elimina il motivo per visitarlo, se hai restrizioni contrattuali o di licenza su come i contenuti possono essere riutilizzati, oppure se hai fatto una scelta editoriale deliberata riguardo all'addestramento dell'AI.

Sii onesto riguardo al compromesso. Bloccarli significa che il tuo sito scompare dai riepiloghi di ricerca e dalle risposte generate dall'AI, e questa è una perdita di traffico misurabile, non un rischio teorico.

**Strumenti SEO e analisi.** Il gruppo più difendibile da bloccare. Non ti forniscono nulla direttamente: permettono ad altre persone di analizzare il tuo sito e possono aggiungere un carico di scansione reale su un sito di grandi dimensioni. Bloccarli significa che il tuo sito è meno visibile negli strumenti di ricerca dei concorrenti, cosa che alcuni considerano un vantaggio. Il costo è che anche i tuoi strumenti SEO potrebbero perdere dati sul tuo sito.

**Social media e anteprima.** Lascia consentito a meno che tu non voglia mai anteprime dei link. Bloccarli significa che i link al tuo sito condivisi su piattaforme social e app di chat appaiono come URL nudi senza titolo, descrizione o immagine, il che riduce in modo misurabile il tasso di click.

## Bloccare tutti i crawler AI in una volta

In fondo alla pagina c'è una scheda zona di pericolo, **Blocca tutti i crawler AI**. Aggiunge regole di esclusione per ogni crawler del gruppo AI in un'unica azione.

Facendo clic si richiede prima una conferma, e la conferma indica chiaramente la conseguenza: il tuo sito scomparirà dai riepiloghi di ricerca AI, e questo comporta una perdita di traffico reale.

> **Warning:** Questa è una decisione sul traffico, non sulla sicurezza. Bloccare i crawler AI non protegge il tuo contenuto dalla copia: chiunque può comunque leggere le tue pagine, e un malintenzionato non avrebbe comunque rispettato `robots.txt`. Ciò che fa in modo affidabile è rimuoverti dalle risposte generate dall'AI. Assicurati che sia questo il compromesso che vuoi.

L'azione è reversibile. Riattiva il gruppo AI e le regole di esclusione vengono rimosse al salvataggio successivo. Rientrare in un indice in seguito richiede tempo.

## Chi può modificare questa impostazione

Modificare le impostazioni dei crawler richiede il permesso di scrittura sul sito. Con un ruolo di sola lettura gli interruttori sono disabilitati, e passandoci sopra con il mouse viene spiegato il motivo. Chiedi a un proprietario dell'account di apportare la modifica oppure adegua il tuo ruolo.

## Risoluzione dei problemi

**Ho bloccato un gruppo ma il crawler continua a visitare il sito.** I crawler che si comportano correttamente rileggono periodicamente `robots.txt` anziché prima di ogni richiesta, quindi lascia passare del tempo. Se non si ferma mai, il crawler non sta rispettando il file e ti serve invece un controllo di accesso. Vedi [Sicurezza del sito](https://support.kapsulehost.com/it-it/site-security).

**Le mie pagine sono ancora nei risultati di ricerca dopo il blocco.** Il blocco ferma le future scansioni. Le voci già presenti nell'indice scadono nel tempo. Per rimuovere rapidamente i contenuti, usa lo strumento di rimozione del motore di ricerca stesso.

**Le anteprime dei link hanno smesso di funzionare.** Il gruppo social è bloccato. Riattivalo.

**Il mio strumento SEO non ha dati per il mio sito.** Il gruppo SEO è bloccato, il che influisce sui tuoi strumenti così come su quelli di tutti gli altri.

**Il traffico è calato dopo aver cambiato qualcosa qui.** Controlla quali gruppi sono bloccati. Se la ricerca o l'AI sono disattivati, è questa la causa, e riattivarli avvia il recupero.

**Un crawler a cui tengo non è elencato.** I gruppi coprono i principali crawler nominati. Tutto ciò che non è elencato rientra nella regola generale di consenso in cima al file e non viene bloccato da questi interruttori.

**Il mio sito non viene indicizzato affatto e qui è tutto consentito.** Qualcos'altro lo sta bloccando. Controlla se la protezione con password dell'intero sito è attiva, se il filtro per paese sta bloccando la regione del crawler, oppure se il sito si trova su un indirizzo condiviso anziché sul tuo dominio.

## Pagine correlate

- [Analisi del traffico del sito](https://support.kapsulehost.com/it-it/site-analytics) per vedere cosa ti costa realmente il traffico dei crawler in termini di richieste e banda.
- [Sicurezza del sito](https://support.kapsulehost.com/it-it/site-security) per il blocco IP e altri controlli di accesso reali.
- [Blocco per paese per un sito](https://support.kapsulehost.com/it-it/site-geo-blocking) per il filtro basato sulla geografia.
- [Proteggere un sito con password](https://support.kapsulehost.com/it-it/site-password-protect) per nascondere un sito a tutto, crawler inclusi.
