Aller au contenu
Sommaire
Sites web

Contrôler les robots d'indexation IA et les moteurs de recherche

Traduction automatique. L'original en anglais est disponible si besoin.

L'onglet Crawlers contrôle quels visiteurs automatisés sont autorisés à indexer votre site, regroupés en moteurs de recherche, moteurs de réponse IA, outils SEO et robots d'aperçu social. Ce guide explique ce que fait chaque groupe, ce que KapsuleHost autorise par défaut, et ce que bloquer coûte réellement.

Où se trouvent les réglages des robots dans KPanel

  1. Connectez-vous à KPanel.
  2. Cliquez sur Sites web dans la barre latérale gauche, puis cliquez sur le site.
  3. Dans le menu gauche du site, ouvrez Performances, puis Robots d'exploration.

L'adresse directe est /websites/<site-id>/crawlers.

La page Crawlers pour un site dans KPanel, avec les contrôles des robots IA et des robots de recherche

Ce que cette page modifie réellement

Activer ou désactiver un groupe réécrit le fichier robots.txt de votre site. Ce fichier est une demande publiée à destination des visiteurs automatisés bien élevés, et les principaux robots la respectent.

Deux conséquences en découlent, et les deux comptent.

C'est une demande, pas un mur. Un robot qui ignore robots.txt n'est affecté par rien sur cette page. Si votre problème est le pillage de contenu par quelque chose qui ne s'identifie pas honnêtement, ce n'est pas le bon outil : utilisez plutôt la liste de blocage IP ou le filtrage par pays sur la page Sécurité du site. Voir Sécurité du site et Blocage par pays pour un site.

Cela contrôle l'exploration, pas ce qui est déjà indexé. Bloquer un robot arrête les récupérations futures. Le contenu déjà présent dans un index en disparaît généralement avec le temps, mais pas instantanément.

Les modifications s'enregistrent dès que vous activez un interrupteur. La page affiche Saving, puis Saved, robots.txt updated.

Les quatre groupes

Moteurs de recherche. Les robots traditionnels derrière les résultats de recherche classiques : Googlebot, Bingbot, DuckDuckBot, Applebot et YandexBot.

Moteurs de recherche et de réponse IA. Robots pour les systèmes qui intègrent votre contenu dans des réponses générées par IA et des aperçus de recherche : GPTBot et OAI-SearchBot d'OpenAI, ClaudeBot et anthropic-ai d'Anthropic, PerplexityBot, Google-Extended, Cohere, Meta et Diffbot.

Outils SEO et d'analyse. Robots provenant de plateformes utilisées pour auditer les sites : AhrefsBot, SemrushBot, MJ12bot, DotBot et Baiduspider.

Médias sociaux et aperçus. Robots qui récupèrent une carte d'aperçu lorsqu'un lien est partagé : Twitterbot, le robot d'aperçu de Facebook, LinkedInBot, Slackbot et Discordbot.

Chaque carte de groupe liste tous les robots qui le composent, avec leur propriétaire, afin que vous puissiez voir exactement ce qu'un interrupteur couvre avant de l'actionner.

Le réglage par défaut de KapsuleHost : les robots IA sont autorisés

Chaque groupe est autorisé par défaut, y compris les robots IA, et il s'agit d'une position délibérée plutôt que d'un oubli.

Un certain nombre d'hébergeurs bloquent discrètement les robots IA au nom de leurs clients. Nous ne le faisons pas, parce que c'est votre trafic et votre décision, et parce que ce réglage par défaut vous coûte de la visibilité. Les résultats de recherche IA sont une source réelle et croissante de recommandations. Un site que les systèmes IA ne peuvent pas lire n'apparaît pas dans ces réponses, ce qui signifie qu'il ne reçoit pas ce trafic.

Si vous souhaitez les bloquer, le contrôle est juste ici. Nous ne ferons simplement pas ce choix à votre place sans vous en informer.

Décider pour chaque groupe

Moteurs de recherche. Laissez autorisé, sauf si le site est véritablement privé, auquel cas la protection par mot de passe est de toute façon le bon outil. Voir Protéger un site par mot de passe.

Moteurs de recherche et de réponse IA. C'est la vraie décision de cette page.

Autorisez-les si vous souhaitez du trafic et des citations provenant des réponses IA, ce qui est le cas pour presque tous les sites commerciaux, éditeurs et entreprises de services.

Envisagez de les bloquer si votre contenu est votre produit et que le fait d'être résumé supprime la raison de visiter votre site, si vous avez des restrictions contractuelles ou de licence sur la manière dont le contenu peut être réutilisé, ou si vous avez fait un choix éditorial délibéré concernant l'entraînement des IA.

Soyez honnête sur le compromis. Bloquer signifie que votre site disparaît des aperçus et réponses de recherche générés par IA, et c'est une perte de trafic mesurable, pas un risque théorique.

Outils SEO et d'analyse. Le groupe le plus défendable à bloquer. Ils ne vous apportent rien directement : ils permettent à d'autres personnes d'auditer votre site, et ils peuvent ajouter une charge d'exploration réelle sur un grand site. Les bloquer signifie que votre site est moins visible dans les outils de recherche de vos concurrents, ce que certains considèrent comme un avantage. Le coût est que vos propres outils SEO peuvent également perdre des données sur votre site.

Médias sociaux et aperçus. Laissez autorisé, sauf si vous ne voulez jamais d'aperçus de liens. Bloquer ce groupe signifie que les liens vers votre site partagés sur les plateformes sociales et les applications de messagerie apparaissent comme des URL nues, sans titre, description ni image, ce qui réduit de manière mesurable le taux de clic.

Bloquer tous les robots IA en une seule fois

En bas de la page se trouve une carte de zone de danger, Bloquer tous les robots IA. Elle ajoute des règles de refus pour chaque robot du groupe IA en une seule action.

Cliquer dessus demande d'abord une confirmation, et cette confirmation énonce clairement la conséquence : votre site disparaîtra des aperçus de recherche IA, et cela coûte du trafic réel.

C'est une décision de trafic, pas une décision de sécurité. Bloquer les robots IA ne protège pas votre contenu contre la copie : n'importe qui peut toujours lire vos pages, et un acteur malveillant n'allait de toute façon jamais respecter robots.txt. Ce que cela fait de manière fiable, c'est vous retirer des réponses générées par IA. Assurez-vous que c'est bien le compromis que vous voulez faire.

L'action est réversible. Réactivez le groupe IA et les règles de refus sont supprimées au prochain enregistrement. Réintégrer un index par la suite prend du temps.

Qui peut modifier ce réglage

Modifier les réglages des robots nécessite la permission d'écriture sur le site. Avec un rôle en lecture seule, les interrupteurs sont désactivés, et survoler l'un d'eux explique pourquoi. Demandez à un propriétaire de compte d'effectuer la modification ou ajustez votre rôle.

Dépannage

J'ai bloqué un groupe mais le robot visite toujours mon site. Les robots bien élevés relisent périodiquement le fichier robots.txt plutôt qu'avant chaque requête, laissez donc le temps faire son effet. Si cela ne s'arrête jamais, le robot ne respecte pas le fichier et vous avez besoin d'un contrôle d'accès à la place. Voir Sécurité du site.

Mes pages sont toujours dans les résultats de recherche après le blocage. Le blocage arrête l'exploration future. Les entrées d'index existantes expirent avec le temps. Pour supprimer du contenu rapidement, utilisez l'outil de suppression propre au moteur de recherche.

Les aperçus de liens ne fonctionnent plus. Le groupe social est bloqué. Réactivez-le.

Mon outil SEO n'a aucune donnée pour mon site. Le groupe SEO est bloqué, ce qui affecte vos outils tout comme ceux de tout le monde.

Le trafic a chuté après une modification ici. Vérifiez quels groupes sont bloqués. Si la recherche ou l'IA est désactivée, c'est la cause, et le fait de la réactiver amorce la récupération.

Un robot qui m'intéresse n'est pas listé. Les groupes couvrent les principaux robots nommés. Tout ce qui n'est pas listé relève de la règle d'autorisation générale en haut du fichier et n'est pas bloqué par ces interrupteurs.

Mon site n'est pas du tout indexé et tout est autorisé ici. Autre chose le bloque. Vérifiez si la protection par mot de passe de l'ensemble du site est activée, si le filtrage par pays bloque la région du robot, ou si le site se trouve sur une adresse partagée plutôt que sur votre propre domaine.

Pages associées

Cet article vous a-t-il aidé ?

Vous êtes une IA ? Lisez cette page en Markdown

Articles connexes

Connexion via SFTP : FileZilla, Cyberduck et ligne de commandeSFTP (Secure File Transfer Protocol) vous donne un accès direct aux fichiers de votre site sur le serveur.…Certificats SSL et HTTPSCet article explique ce qu'est le SSL en termes simples, comment KapsuleHost gère automatiquement le SSL pour vos sites, et que faire en cas de problème avec…Sites web : par où commencerComment fonctionne l'hébergement de sites web chez KapsuleHost, ce qui se trouve sur chaque onglet d'un site, et quel guide lire selon la tâche qui vous occupe.…Surveillance de la disponibilité du siteChaque site hébergé chez KapsuleHost est vérifié automatiquement toutes les 60 secondes, et l'onglet Disponibilité vous montre le résultat : statut actuel,…

Toujours bloqué ?

Demandez à Kora, qui connaît votre compte, ou contactez notre équipe.

Nous contacterContacter le support