欢迎访问我的博客,有问题可以在任意文章底部留言评论

IAB/ABC Spiders & Bots List是什么?如何过滤机器人流量

程序化广告 Haran 6年前 (2020-04-15) 4571次浏览 0个评论

更新时间:2026年8月19号

网站分析和广告监测中经常会出现大量非人类流量,例如:

  • 搜索引擎爬虫;
  • 网站监控工具;
  • SEO抓取工具;
  • 自动化测试程序;
  • 广告验证机器人;
  • 恶意刷量程序。

如果这些请求被计入访问、广告展示或点击,可能导致用户数、页面浏览量、广告曝光和点击率失真。

IAB Tech Lab提供的 IAB/ABC International Spiders & Bots List,就是广告和媒体行业用于识别已知爬虫与机器人流量的一项标准资源。

但需要先明确:

这份名单只能识别已经收录的已知机器人,不能检测所有无效流量,更不能证明未命中名单的访问一定来自真人。

IAB/ABC分别是什么?

IAB和ABC是两个不同的行业机构:

  • IAB:Interactive Advertising Bureau,互动广告局;
  • ABC UK:Audit Bureau of Circulations,英国发行量审计局。

IAB最初与ABC合作建立这份行业名单。现在由IAB Tech Lab提供订阅和访问,IAB委托The Alliance for Audited Media(AAM)承担名单的评估、管理和发布工作。

ABC UK及Spiders & Bots Policy Board也会参与名单修改和治理。

因此,“IAB/ABC”表示这份名单的行业合作背景,不是一个机构的完整名称。

 

IAB/ABC Spiders & Bots List是什么?

IAB/ABC Spiders & Bots List是一项按年订阅的行业名单,帮助企业识别已知的自动化访问,包括搜索引擎爬虫、监测工具及其他非人类流量。

它主要用于:

  • 网站与App流量分析;
  • 广告展示和点击计量;
  • 广告投放效果监测;
  • 媒体与广告主之间的数据对账;
  • General Invalid Traffic(GIVT,一般无效流量)过滤;
  • 减少因机器人流量产生的错误计费。

例如,一个搜索引擎爬虫在一天内访问网站10,000个页面。如果这些请求直接计入网站访问或广告展示,就可能严重放大流量和可计费曝光。

通过匹配User-Agent等特征,测量系统可以把这类已知机器访问从统计或计费数据中排除。

 

名单包含哪些内容?

根据IAB Tech Lab当前的官方说明,IAB/ABC Spiders & Bots List主要由两份文本文件组成。

名单 作用
Valid Browsers/User Agents List 识别已知的有效浏览器或User-Agent
Known Robots List 识别已知的爬虫和机器人User-Agent

官方没有将“IP Exclusion List”列为第三份核心标准文件。

在提交新机器人时,可以同时提供相关IP地址、日志样本和活动特征,帮助维护机构判断是否应将其加入名单。但是,这不代表订阅产品一定包含一份独立、完整的机器人IP排除名单。

具体文件内容仍应以实际订阅后获得的版本和订阅协议为准。

双重过滤是如何工作的?

IAB建议将两份名单配合使用,这种方法通常称为 Dual-pass Filtering

简化流程如下:原始访问或广告请求——>检查是否属于有效浏览器或User-Agent ——>检查是否命中已知机器人名单——>结合IP、请求频率和行为特征继续判断——>进入分析或广告计费数据

第一轮:识别有效浏览器

系统先检查User-Agent是否符合已知浏览器或客户端的特征。

但命中有效浏览器名单,只能说明User-Agent看起来像常见浏览器,不能证明访问者一定是真人。

机器人完全可以伪装成Chrome、Safari或Edge的User-Agent。

 

第二轮:排除已知机器人

系统再检查请求是否命中Known Robots List。

如果命中,可以将其从网站分析、广告展示、点击或计费数据中排除。

这种双重过滤方法可以减少明显的机器人流量,但仍需要配合其他无效流量检测机制。

 

过滤不等于封禁

IAB/ABC名单主要用于数据测量和计费过滤,不等于直接阻止爬虫访问网站。

两者的目的不同:

操作 目的
流量过滤 请求仍可访问网站,但不计入分析或广告计费
服务器封禁 直接拒绝请求访问网站
robots.txt 向合规爬虫声明允许或禁止抓取的路径
WAF或Bot Management 根据请求特征识别并阻止异常流量

搜索引擎爬虫属于非人类流量,但通常不应因为命中机器人名单就直接封禁,否则可能影响网站抓取和搜索收录。

更合理的做法是:

在分析和广告计量中排除搜索引擎爬虫,但继续允许Googlebot、Bingbot等合规搜索爬虫访问必要页面。

 

为什么需要这个列表

  • 在网站分析、广告展示/投放、流量监测中,非人类流量(如爬虫、机器人)会 严重扭曲数据:例如虚假访问、重复请求、刷量行为。
  • 使用该列表可以帮助剔除或过滤这些已知非-人类流量,从而提升数据准确性、公信力,以及广告/媒体交易的透明度。 
  • 在广告行业中,如英国的JICWEBS标准、美国IAB的曝光/计量指南中,过滤机器人流量是已推荐或要求的实践。

 

如何获取和订阅?

IAB Tech Lab采用年度订阅模式,订阅期从注册日期起计算12个月。

完成付款并签署Data Subscription Agreement后,订阅机构可以通过Tech Lab Tools Portal获取名单。

当前官方公布的年费为:

订阅类型 年费
IAB US General Member 5,000美元
IAB Tech Lab Member 5,000美元
IAB Associate Member 7,500美元
非会员 15,000美元

企业不需要成为IAB Tech Lab会员也可以购买,但会员价格更低。

订阅联系邮箱:spiders@iabtechlab.com

以上价格及访问方式可能调整,购买前应以IAB Tech Lab订阅页面显示的信息为准。

 

名单多久更新一次?

IAB Tech Lab表示名单按月更新,以纳入AAM、ABC UK、Policy Board以及行业参与者提交的新浏览器和机器人信息。

官方没有明确保证在每月25日前发布,因此不建议写成固定发布日期。

订阅机构及其他行业参与者都可以提交新发现的机器人。提交信息通常包括:完整User-Agent、相关IP地址、日志样本、自动化访问行为、工具来源或所有者、支持其分类的其他证据。

名单修改由AAM评估,并由Spiders & Bots Policy Board参与监督和批准。

 

这份名单有哪些限制?

IAB/ABC Spiders & Bots List并不是完整的Bot Detection系统。

它难以单独识别以下流量:

  • 使用正常浏览器User-Agent的机器人;
  • 通过住宅代理不断更换IP的流量;
  • 模拟鼠标、滚动和点击行为的自动化程序;
  • 尚未被提交和收录的新机器人;
  • 被恶意修改或伪装的User-Agent;
  • 由真实设备和浏览器产生的流量作弊;
  • 更接近正常用户行为的Sophisticated Invalid Traffic(SIVT)。

因此,企业不能采用下面这种判断:有命中IAB名单= 一定是真实用户

更合理的无效流量检测方式是综合使用:

  • IAB/ABC机器人名单;
  • IP信誉与数据中心IP识别;
  • 请求频率和访问速度;
  • Cookie与设备标识;
  • JavaScript执行能力;
  • 页面访问路径;
  • 会话时长及交互行为;
  • 广告曝光、点击和转化之间的关系;
  • WAF或专业Bot Management工具。

 

总结

IAB/ABC Spiders & Bots List是广告和媒体行业用于识别已知爬虫与机器人流量的一项标准资源。

它包含:

  • 有效浏览器或User-Agent名单;
  • 已知机器人名单。

企业可以利用这两份名单执行Dual-pass Filtering,减少机器人流量对网站分析、广告展示、点击和计费数据的影响。

但这份名单只能解决已知机器人识别问题,不能替代完整的无效流量检测、反作弊或Bot Management系统。实际应用中,应结合IP、访问频率、设备、Cookie和行为特征综合判断。


有疑问可以在底部留言
喜欢 (2)
发表我的评论
取消评论

Hi,您需要填写昵称和邮箱!

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址