滚动行为也能识别 AI 爬虫:73.4% 准确率离生产还很远
据 作者的实验记录,人类和 AI 浏览 Agent 在滚动页面时可能表现出不同的时间模式。作者使用“突发性”(Burstiness)和“记忆性”(Memory)两个时间序列指标,把滚动事件转成特征,再用 LightGBM 训练分类器。
据 作者的实验记录,人类和 AI 浏览 Agent 在滚动页面时可能表现出不同的时间模式。作者使用“突发性”(Burstiness)和“记忆性”(Memory)两个时间序列指标,把滚动事件转成特征,再用 LightGBM 训练分类器。
在这组受控数据里,只使用两个特征的模型准确率达到 73.4%。人类滚动通常呈现更明显的突发节奏,而部分 Agent 的滚动更规律。ChatGPT Agent 是最容易和人类混淆的对象,说明更像浏览器的自动化工具会逐渐削弱传统行为检测的区分度。
但 73.4% 不能直接翻译成“网站已经能识别 AI”。实验数据规模较小,每个 Agent 大约只有 150 个页面交互样本,而且数据来自专门控制的测试网站。不同网站的页面长度、滚动条样式、内容密度和用户设备都会改变行为分布,模型换到真实流量上很可能明显降级。
更重要的是,行为检测会带来误伤。用户使用触控板、屏幕阅读器、键盘翻页或高速滚动时,轨迹可能和训练集中的“异常行为”相似。如果网站把单一指标直接变成封禁条件,保护内容的同时也可能把真实用户挡在门外。
这项实验更适合作为一个信号:AI 爬虫不再只是改 User-Agent 或加载 JavaScript 的问题,网站开始观察更细的交互时序。但可靠的防护仍需要把滚动、鼠标、键盘、请求频率、会话历史和账号信誉组合起来,并为误判提供申诉与降级路径。

关键事实
- 特征:滚动事件的 Burstiness 和 Memory。
- 模型:LightGBM。
- 结果:受控实验准确率 73.4%。
- 局限:样本量小、网站环境单一、需要结合更多行为特征。
OC 判断
行为识别可以增加爬虫防线,但不应被包装成稳定的“人机证明”。一项实验准确率越高,越需要同时公开数据分布、误判成本和对无障碍用户的影响。
为什么重要
- 对网站:可以把滚动行为作为风险信号,而不是单独的封禁依据。
- 对用户:正常的非鼠标操作可能被模型误判,需要保留申诉和替代访问方式。
- 对 AI 生态:内容网站正在从识别请求,转向识别 Agent 的完整交互轨迹。
评论
围绕这篇文章补充信息、提出问题或分享观察。