AI机器人流量一年增长62.5%:AmazonBot与Meta爬虫占据主要访问量,网站运营攻略
近日,数据和技术公司51Degrees发布的最新数据显示,在截至2026年5月29日的一年时间里,来自AI公司的机器人流量增长了62.5%。到2026年5月,AI机器人已经占据网站访问会话的13%,高于一年前的8%。随着AI公司持续抓取互联网内容,AI机器人正在成为网站流量结构中越来越重要的一部分,同时也给网站运营者带来了新的内容传播和服务器资源压力。
AI机器人占网站访问会话13%
51Degrees对约30亿次网站访问进行了分析,数据覆盖电信、广告、媒体、零售、金融服务和科技等多个行业网站。研究共识别出72种与AI相关的机器人,其中AmazonBot和Meta-External-Agent的访问量最为突出。
5月29日当天,AmazonBot产生了643万次网站访问会话,Meta-External-Agent产生423万次,两者合计约占这72种AI机器人访问会话的63%。
从整体网站访问量来看,AmazonBot在监测期间占全部网站访问量的4%以上,Meta-External-Agent则接近3%。这意味着AI机器人带来的抓取流量已经不再是一个边缘现象,而是逐渐成为网站流量结构中的重要组成部分。
AmazonBot与Meta机器人占据主要访问量
根据机器人流量分析平台Known Agents的数据,AmazonBot通常会进行“大范围、高频率”的抓取,每次访问获取的页面数量明显高于普通搜索爬虫。
对于网站运营者来说,这种抓取方式带来的影响并不只是访问数据发生变化。AI机器人访问频率和单次抓取页面数量较高时,也可能进一步增加网站服务器、带宽以及相关基础设施的压力。
除AmazonBot和Meta-External-Agent外,AhrefsBot和微软BingBot的访问量也较为突出。5月29日,AhrefsBot产生217万次访问,占全部网站会话的2.3%;BingBot产生162万次访问,占全部网站会话的1.3%。
其中,AhrefsBot主要用于支持Ahrefs营销情报平台和Yep搜索引擎,BingBot则用于微软必应搜索引擎发现和抓取网页,并建立搜索结果索引。
AmazonBot、Meta-External-Agent、AhrefsBot和BingBot四种机器人合计占72种AI机器人抓取会话的85%,成为当前AI相关机器人访问流量中的主要来源。
ClaudeBot和OpenAI Search Bot访问量相对较小
相比排名靠前的机器人,其他AI机器人目前的访问规模明显较小,但同样已经形成一定的抓取量。
5月29日,Anthropic旗下ClaudeBot和OpenAI Search Bot的AI机器人访问量分别排名第七和第九,访问会话量约为28.8万次和12.9万次。
需要注意的是,本次研究统计范围主要集中在与AI相关的机器人,并没有将负责生成普通搜索结果的谷歌主要爬虫纳入统计,因此数据并不能代表互联网全部自动化抓取流量。
AI抓取让出版商面临新的收益与成本问题
随着AI模型和AI搜索工具不断发展,网站内容的传播方式也正在发生变化。
过去,出版商发布内容后,主要依靠搜索引擎抓取和排名获得用户访问。而现在,AI公司同样会抓取大量网页内容,并将相关信息用于模型训练或生成AI答案。
对于出版商而言,AI抓取存在两方面影响。一方面,网站内容可能通过AI工具获得新的传播渠道,增加内容被用户发现的机会;另一方面,如果大量内容被持续抓取,却没有形成对应收益,也可能进一步增加服务器、带宽等运营成本。
因此,AI机器人流量快速增长之后,网站如何管理自动化抓取,也逐渐成为出版商需要考虑的问题。
robots.txt成为网站管理AI抓取的重要工具
目前,网站运营者可以通过robots.txt,也就是“机器人排除协议”,向自动化程序说明哪些网页或区域不希望被抓取。
不过,从实际情况来看,出版商对AI机器人的robots.txt限制并不全面。Known Agents数据显示,目前出版商仅通过robots.txt屏蔽了约21%的AI抓取机器人。
不同网站之间的差距也比较明显。Adweek、The San Diego Tribune和Arkansas Democrat Gazette目前对Known Agents追踪的AI机器人实现了100%的robots.txt覆盖,而W Magazine、Screenrant、Semafor、CBS News和Digital Spy的屏蔽覆盖率相对较低,仅有2%的机器人被列入robots.txt限制范围。
大多数AI机器人会遵守robots.txt
从执行情况来看,AI机器人并不一定会主动忽略网站设置的抓取规则。
Known Agents表示,AI抓取机器人和数据供应商有95.6%的时间会遵守robots.txt请求。这意味着当前出版商面临的问题,并不完全是机器人拒绝执行限制,而是部分网站还没有将相关AI机器人全面纳入robots.txt限制范围。
对于希望减少AI抓取的网站来说,如何识别不同类型的机器人,并根据自身内容策略制定合理的抓取规则,将成为后续网站运营中的重要工作。
第三方抓取仍然是出版商担心的问题
尽管robots.txt能够在一定程度上帮助网站表达抓取意愿,但出版商仍然存在另一层担忧,即AI公司可能通过第三方数据供应商或其他公司抓取网站内容,从而绕过部分直接限制。
这也意味着,随着AI机器人流量持续增长,网站内容管理正在从传统的搜索引擎优化,逐渐延伸到自动化抓取、AI搜索和内容授权等新的场景。
从目前的数据来看,AI机器人在网站访问中的占比已经明显提升。对于出版商和网站运营者而言,未来需要在内容传播、AI曝光、抓取管理以及服务器成本之间寻找更加合理的平衡。
