跳至正文
目录
网站

控制AI爬虫和搜索机器人

此内容为机器翻译,如需查阅原文请查看英语版本。

Crawlers(爬虫)标签页用于控制允许哪些自动化访问者对您的网站进行索引,这些访问者分为搜索引擎、AI问答引擎、SEO工具和社交预览机器人四类。本指南将说明每一类的作用、KapsuleHost默认允许的内容,以及屏蔽它们实际上会带来什么代价。

KPanel中爬虫设置的位置

  1. 登录KPanel。
  2. 点击左侧边栏中的网站,然后点击对应的网站。
  3. 在该网站的左侧菜单中,打开性能,然后点击爬虫。

直接访问地址为/websites/<site-id>/crawlers。

KPanel中某网站的Crawlers页面,显示AI爬虫和搜索机器人控制选项

此页面实际改变了什么

切换某个分组的开关会重写您网站的robots.txt文件。该文件是向遵守规范的自动化访问者发出的公开请求,主流爬虫会遵循它。

由此产生两个后果,二者都很重要。

这是一种请求,而非一堵墙。 对于无视robots.txt的爬虫,本页面的任何设置都不会产生影响。如果您要解决的问题是某个不诚实表明身份的程序进行的抓取,那么这个工具并不适用:请改用网站安全页面上的IP封锁列表或国家/地区过滤功能。请参阅网站安全和针对某网站的国家/地区封锁。

它控制的是抓取行为,而非已被收录的内容。 屏蔽某个爬虫会阻止未来的抓取。已被收录的内容通常会随着时间推移逐渐从索引中移除,但不会立即生效。

切换开关后会立即保存更改。页面会显示Saving,随后显示Saved, robots.txt updated。

四个分组

搜索引擎。 支撑普通搜索结果的传统爬虫:Googlebot、Bingbot、DuckDuckBot、Applebot和YandexBot。

AI搜索与问答引擎。 用于将您的内容纳入AI生成答案和搜索摘要的系统所使用的爬虫:OpenAI的GPTBot和OAI-SearchBot,Anthropic的ClaudeBot和anthropic-ai,以及PerplexityBot、Google-Extended、Cohere、Meta和Diffbot。

SEO与分析工具。 用于审计网站的平台所使用的爬虫:AhrefsBot、SemrushBot、MJ12bot、DotBot和Baiduspider。

社交媒体与预览。 当有人分享链接时用于抓取预览卡片的爬虫:Twitterbot、Facebook预览抓取程序、LinkedInBot、Slackbot和Discordbot。

每个分组卡片都列出了其中的每一个爬虫及其所有者,以便您在切换开关之前准确了解该开关所涵盖的范围。

KapsuleHost的默认设置:允许AI爬虫

默认情况下,每个分组均处于允许状态,包括AI爬虫,这是一个经过深思熟虑的立场,而非疏忽。

许多主机商会悄悄地代表客户屏蔽AI爬虫。我们不会这样做,因为这是您的流量,应由您来决定,而且这样的默认设置会让您失去可见度。AI搜索结果是一个真实且不断增长的引荐流量来源。AI系统无法读取的网站不会出现在这些答案中,这意味着它将无法获得这部分流量。

如果您想屏蔽它们,控制选项就在此处。我们只是不会在不告知您的情况下替您做出这个决定。

针对每个分组做出决定

搜索引擎。 除非网站确实需要保密,否则建议保持允许状态,在需要保密的情况下,密码保护才是合适的工具。请参阅为网站设置密码保护。

AI搜索与问答引擎。 这才是本页面上真正需要做决定的地方。

如果您希望从AI生成的答案中获得流量和引用,就应允许它们,这适用于几乎所有商业网站、出版商和服务型企业。

如果您的内容本身就是您的产品,被摘要概括会让用户失去访问网站的理由;或者您在内容复用方面受到合同或许可限制;又或者您对AI训练做出了明确的编辑立场,那么可以考虑屏蔽它们。

请如实权衡利弊。屏蔽意味着您的网站将从AI生成的搜索摘要和答案中消失,这是可衡量的流量损失,而非理论上的风险。

SEO与分析工具。 这是最容易被正当化屏蔽的一类。它们并不会直接为您带来任何好处:它们让其他人得以审计您的网站,并且在大型网站上可能会增加实际的抓取负载。屏蔽它们意味着您的网站在竞争对手的调研工具中可见度降低,有些人会将此视为一项优点。代价是,您自己的SEO工具也可能因此丢失有关您网站的数据。

社交媒体与预览。 除非您完全不希望出现链接预览,否则应保持允许状态。屏蔽这些爬虫意味着,在社交平台和聊天应用中分享的网站链接将仅显示为裸链接,没有标题、描述或图片,这会明显降低点击率。

一次性屏蔽所有AI爬虫

页面底部有一个危险操作卡片,即阻止所有AI爬虫。它会一次性为AI分组中的每一个爬虫添加禁止规则。

点击该选项会先要求确认,确认提示中明确说明了后果:您的网站将从AI搜索摘要中消失,这会造成实际的流量损失。

这是一项有关流量的决定,而非安全决定。屏蔽AI爬虫并不能保护您的内容不被复制:任何人仍然可以阅读您的页面,而心怀不轨者本来就不会遵守robots.txt。它能够可靠地做到的,是将您从AI生成的答案中移除。请确保这正是您想要的取舍。

该操作是可逆的。将AI分组的开关重新打开后,禁止规则会在下次保存时被移除。但之后重新被纳入索引需要一定时间。

谁可以更改此设置

更改爬虫设置需要具备网站写入权限。使用只读角色时,这些开关会被禁用,将鼠标悬停在开关上会说明原因。请联系账户所有者进行更改,或调整您的角色权限。

故障排查

我屏蔽了某个分组,但该爬虫仍在访问。 遵守规范的爬虫会定期重新读取robots.txt,而不是在每次请求前都读取,因此请给它一些时间。如果情况始终没有改善,说明该爬虫并未遵守该文件,您需要改用访问控制手段。请参阅网站安全。

屏蔽后,我的页面仍出现在搜索结果中。 屏蔽只会阻止未来的抓取。现有的索引条目会随时间推移而过期。如需快速移除内容,请使用相应搜索引擎自带的移除工具。

链接预览失效了。 社交分组已被屏蔽。请将其重新打开。

我的SEO工具无法获取我网站的数据。 SEO分组已被屏蔽,这不仅影响您,也会影响其他所有人的工具。

我更改了这里的设置后,流量下降了。 请检查哪些分组被屏蔽了。如果搜索引擎或AI分组被关闭,那就是原因所在,重新打开即可开始恢复流量。

我关心的某个爬虫未被列出。 这些分组涵盖的是主要的知名爬虫。未列出的爬虫均适用于文件顶部的通用允许规则,不受这些开关的屏蔽。

我的网站完全没有被收录,而这里的所有设置都是允许状态。 那么问题出在别处。请检查是否启用了全站密码保护、国家/地区过滤是否屏蔽了该爬虫所在的地区,或者该网站是否使用的是共享地址而非您自己的域名。

相关页面

这对您有帮助吗?

您是 AI 吗?以 Markdown 格式阅读本页

相关文章

通过 SFTP 连接:FileZilla、Cyberduck 与命令行SFTP(Secure File Transfer Protocol,安全文件传输协议)可让您直接访问服务器上网站的文件。本指南涵盖成功连接所需的全部内容,从查找凭据到排查错误。…SSL 证书与 HTTPS本文将以通俗易懂的语言说明什么是SSL、KapsuleHost如何为您的网站自动处理SSL,以及当证书出现问题时应如何处理。 --- 什么是 SSL,为什么它很重要?…网站:从何处开始KapsuleHost的网站托管如何运作、一个站点的每个标签页上有什么内容,以及针对您眼前的任务应该阅读哪一篇指南。 托管站点的一切都在KPanel侧边栏的网站中管理。…网站正常运行时间监控KapsuleHost 上的每个网站都会每 60 秒自动检查一次,"正常运行时间"标签页会显示检查结果:当前状态、正常运行时间百分比、响应时间,以及完整的事件历史记录。…

仍未解决?

询问了解您账户的 Kora,或联系我们的团队。

联系我们发送邮件