【互联网变天:机器人流量首次反超人类,Agent 时代拉开大幕】
点击链接打开👉 https://m.toutiao.com/is/VwGOYkquY7s/ VwGOYkquY7s` eRk:/ q@e.Ox :1pm
复制此条消息,打开「今日头条APP」或「今日头条极速版APP」后直接查看~
对于这一点,我是深有体会的。因为之前我那个个人博客网站。都20几年了。平常很少有人就是主,大部分都是那个谷歌等等搜索引擎的那个bot。抱着在搜索,还有一些SEO的这种排名网站。直到最近几个月,这个。亚马逊AWS的S3账单。这个翻倍式的增加。才发现这个大量的这种AI爬虫。因为这个爬虫现在。已经。转向是AI向open AI以及其他的这种关系的一种PA虫等等就是说。占到最主要的流量了。这些大部分的信息都可能都是陈芝麻,烂谷子都20几年的。而且都是大部分也是开源的一些数据镜像,本来我很多是作为个人备份。结果现在我。看起来就是说。AI在疯狂的搜集数据在。所以这篇文章讲的以后的流量可能大部分是机器人。这1d这论这个论断是有基础的。我是我觉得是可信的。
AI爬虫流量反超人类
导出时间:2026/6/8 07:30:14
来源地址:https://www.doubao.com/chat/38429333126921986
消息数量:2
核心观点
机器人访问流量超越自然人访问已是落地事实,AI 智能爬虫规模化抓取正在重构全网流量结构,个人站点 S3 存储、带宽成本暴涨就是最直观实证,Agent 普及会进一步加速这个趋势。
一、结合你的博客实例拆解现状
-
过往流量构成 建站二十余年,早期流量主体是真人访客 + 谷歌等传统搜索引擎 Bot。传统爬虫逻辑固定:遵循 robots 协议、定向抓取页面索引、抓取频次可控,抓取内容仅限页面正文,极少批量下载附件、备份资源,因此早年 S3 存储、流出带宽开销平稳,账单长期波动很小。 早年 SEO 站点爬虫也以关键词收录为目的,抓取范围、频率可控,不会全盘扒站。
-
近阶段成本暴涨根源:生成式 AI 爬虫崛起 OpenAI、Anthropic、各类垂直大模型训练爬虫、第三方 Agent 采集工具成为流量主力,和传统 Bot 有本质区别:
- 抓取逻辑无边界:不再局限网页正文,会遍历全站目录、历史归档、老旧备份文件、二十年前存档数据,哪怕是冷门历史资料、开源镜像备份都全盘拉取;
- 抓取频次无节制:大量 AI 爬虫无视 robots 限制、反爬规则,多 IP 分布式轮询、全天候不间断爬取,持续消耗出站流量;
- 目标是全量数据集:AI 训练需要海量多源文本,老旧个人博客的冷门存档、小众开源备份是低成本优质数据源,成为爬虫重点薅取对象,直接推高 AWS S3 流出费用(S3 计费核心在对外流出流量)。 你留存多年的个人备份资源,本意自用归档,被动沦为大模型训练素材库。
二、机器人流量反超人类的三层底层逻辑
- 供给端:大模型持续刚需原始数据 全球各类通用大模型、行业垂直模型迭代、微调、RAG 知识库搭建,需要源源不断的互联网原始文本,真人产出内容增速远跟不上 AI 的数据消耗速度,倒逼爬虫常态化全网搜刮。
- 工具端:Agent 降低爬虫开发门槛 过去写爬虫需要专业开发,如今基于大模型封装的采集 Agent 开箱即用,中小团队、个人都能低成本搭建分布式爬取集群,爬虫数量爆发式增长。
- 用户端:真人上网行为被分流 一部分自然人从浏览网页转向使用 AI 问答工具(ChatGPT、国内各类大模型),不再直接访问原始站点;AI 代为检索、整合网页内容,实质变成机器人代人访问网站,进一步挤压真人流量占比。
三、后续演化预判(贴合 Agent 时代趋势)
- 流量结构固化:未来中小站点普遍会出现「70%+ 流量来自各类机器人,剩余才是真人 + 传统搜索引擎」,头部资讯、资源站点机器人占比甚至突破 90%;
- 建站成本分化:个人站长、静态资源站持续承压,S3、云服务器带宽支出逐年走高;部分站长被迫开启付费访问、资源鉴权、针对性封禁主流 AI 爬虫 UA;
- 行业规则博弈:版权、爬虫合规矛盾激化,陆续出现站点针对 OpenAI、主流 AI 厂商 IP 段限流、封禁,大模型企业要么付费授权数据源,要么转向合规开源数据集采购。
四、对应你的个人站点落地应对思路
- Nginx 配置 UA 黑名单,拦截 OpenAI、主流 AI 爬虫标识;
- 借助 AWS 安全组、WAF 封禁高频异常访问 IP 段,限制非合规爬虫出站下载备份文件;
- 重要历史备份资源做访问鉴权,禁止匿名全量下载,从源头削减 S3 异常流量损耗。
整体来看文章论断贴合一线建站实际,AI 爬虫扩张不是短期泡沫,是大模型产业扩张带来的长期行业变化。