使用Bot管理管控AI爬虫

更新时间:
复制 MD 格式

针对AI爬虫、AI智能体及AI搜索请求,可通过WAF Bot管理的“AI爬虫管控”功能查看请求概览与详细数据,并一键执行流量处置。此类自动化程序主要用于高频抓取网页内容,以支持模型训练、知识库构建及AI应用运行。该功能可协助网站精准识别并管控此类流量,在保护知识产权与核心商业数据的同时,避免服务器带宽资源被过度消耗。

基本概念

  • AI 爬虫(AI-Crawler)

    • 核心目的:批量抓取站点内容,用于大语言模型训练或构建检索增强生成(RAG)语料。

    • 行为特征:执行批量、遍历式的数据抓取。此类程序通常会在请求头中声明专属的 User-Agent,并声明遵循 robots.txt 协议。

    • 与传统爬虫的区别:抓取的内容主要用于模型训练或语料库建设,通常不会为站点带来直接的流量回报。

    • 典型代表:GPTBot(OpenAI)、ClaudeBot(Anthropic)、Google-Extended、CCBot(Common Crawl)、Bytespider 等。

  • AI 搜索(AI-Search)

    • 核心目的:响应用户的实时提问,从站点获取特定内容作为生成答案的引用来源。

    • 行为特征:由用户的单次提问驱动,执行实时、按需的单次访问,而非后台的批量遍历。此类访问通常会在生成的回答中附带来源链接,能够为站点提供曝光度与引用价值。

    • 典型代表:OAI-SearchBot(OpenAI)、PerplexityBot(Perplexity)、Gemini-Deep-Research(Google)等。

  • AI 智能体(AI-Agent)

    • 核心目的:代替真实用户在站点上执行特定业务操作,例如信息查询、价格比对、表单填写、账号登录或订单提交。

    • 行为特征:具有明确意图的交互行为。除读取内容外,还会执行点击、表单提交等完整的业务流程。此类程序通常驱动真实的浏览器环境,其访问指纹高度接近真人用户。这是最难识别且最易引发业务安全风险的一类访问。

    • 典型代表:ChatGPT-User(OpenAI)、Claude-User(Anthropic),以及各类基于 Computer-Use 或浏览器自动化技术的 AI Agent。

操作步骤

说明

执行操作前,请确保已满足如下条件:

  1. 已存在防护对象:Web业务须已接入WAF,若尚未将业务接入,请参见接入概述

  2. 已开通Bot管理:包年包月用户须开通Bot管理(包年包月基础版不支持)。具体操作请参见开通Bot管理

登录Web应用防火墙3.0控制台。在顶部菜单栏,选择WAF实例的资源组和地域(中国内地非中国内地),在左侧导航栏,选择防护配置 > BOT管理 > AI爬虫管控

查看 AI 爬虫请求概览

AI爬虫管控页面,系统展示 AI 爬虫总请求数已识别 AI 爬虫已拦截 AI 爬虫请求数。页面下方提供详细数据列表,支持通过顶部搜索栏按时间防护对象路径AI 类别等条件进行筛选查询。

字段说明

  • 名称:AI 爬虫或智能体的具体名称。

  • 类别:AI 的类型,包括 AI-Crawler(AI 爬虫)、AI-Agent(AI 智能体)和 AI-Search(AI 搜索)。

  • 请求数拦截请求数:当前统计周期内,该 AI 发起的总请求次数及被 WAF 成功拦截的次数。

  • 趋势图:请求量的变化趋势可视化图表。

  • TOP 接口:请求量最高的访问路径(例如 /index.php)。

  • 防护对象:接入WAF的防护对象。

处置AI爬虫请求

默认情况下,WAF不存在针对AI爬虫请求的规则,若此行为无法满足业务需求,可针对特定 AI 请求进行手动干预。操作步骤如下:

  1. AI爬虫管控页面下方区域,定位至目标AI名称。

  2. 单击其操作列的观察拦截执行处置。

    1. 观察:仅记录请求日志,不阻断流量。

    2. 拦截:记录请求日志并阻断流量。

系统将根据所选操作自动生成对应的高级自定义规则模板与规则,可以在高级自定义规则页面进行查看。具体内容,请参见配置Bot管理高级自定义规则

配置建议

针对不同类型的 AI 流量,建议采取差异化的管控策略,避免采取统一的拦截或放行机制。具体策略如下:

一、AI 爬虫管控策略

  1. 明确授权与基础管控:首先需评估是否允许站点内容被用于大模型训练。若拒绝授权,建议对训练类爬虫实施拦截或限速;若允许授权,亦应实施频率控制,以防止高频抓取影响源站性能。

  2. 实施分级管控:可根据内容价值进行差异化管理。对核心页面(如正文、商品详情页)实施严格管控,对公开介绍页等常规内容可适当放宽限制。

二、AI 搜索管控策略

  1. 默认放行与监控:多数站点期望通过 AI 搜索获取曝光与引用价值,建议对此类流量默认放行,并同步配置频率与流量监控机制。

  2. 精细化权限控制:若对内容版权或引用范围存在顾虑,可对特定目录或页面单独设置访问限制,确保公开内容可被正常引用,同时防止敏感内容泄露。

三、AI 智能体管控策略

  1. 接入业务安全风控:此类流量风险最高,不建议仅采取简单的拦截措施,而应将其接入Bot管理Web防护/App防护账号安全防护

  2. 强化关键业务防护:针对登录、下单、领券、表单提交等关键业务动作,建议叠加账号安全防护、访问频率限制与人机校验机制。此举旨在防范自动化作弊行为(如批量注册、抢占库存、恶意套利等),同时确保正常真人用户的业务体验不受影响。

四、策略实施与动态调整

上述策略可根据实际业务需求组合使用。建议先利用 AI 爬虫管控系统的流量分析与统计报表,持续观察各类 AI 流量的构成与演变趋势。在此基础上,逐步调整放行、限速与拦截规则,以在内容保护、业务安全与流量价值之间实现最佳平衡。