1/5

EDPB发布AI网络抓取指南:公开网页不等于可直接训练

围绕 EDPB 发布生成式 AI 网络抓取指南,拆解公开网页、个人数据、训练合规与明文暴露之间的边界。

公开网页,不等于 AI 训练免检

很多人把「网页能打开」理解成「AI 可以随便抓」。7 月 8 日,欧洲数据保护委员会(EDPB)发布《生成式 AI 场景下网络抓取指南》并启动公开征求意见,讨论的正是这条边界。

这次发生了什么

EDPB 发布 Guidelines 03/2026,专门讨论生成式 AI 开发中的网络抓取。它目前仍是公开征求意见版,不是最终法规;反馈期截至 2026 年 10 月 30 日。

公开可见,仍可能是个人数据

EDPB 明确提醒:只要网络抓取涉及个人数据的收集、存储、整理或检索,就可能落入 GDPR 的处理范围。页面公开可见,不等于数据自动失去个人属性,也不等于可以跳过合法性基础、目的限制和透明度要求。
对特殊类别个人数据,原则上仍禁止处理;即使是抓取时意外或残余收集,也不能被理解成一张通用豁免卡。

AI 训练前,至少要过这几道门

来源是否可靠,能否记录抓取时间并在训练前校验数据准确性?
收集目的是否明确,后续用途有没有发生漂移?
是否尽量减少不必要的数据,尤其是敏感数据?
能否说明数据从哪里来、为什么被使用,以及谁承担控制者责任?
这些要求把问题从「网页能不能访问」推进到了「数据为什么被抓、如何被保存、最终进入什么模型流程」。

真正的风险,不在一个页面里

网页内容进入抓取器,再进入数据集、训练流程和模型服务后,责任链会明显变长。个人信息可能被重新组织、关联和长期留存;企业还要面对来源证明、用途变化、第三方处理和后续审计等问题。
所以,AI 数据治理不能只盯着模型上线前的备案,也不能只看一份隐私政策,而要把来源、处理、训练、调用和输出放在同一条链上审视。

加密能补哪一段

上游的来源、目的、合法性和最小化,仍然要由数据处理者先负责。加密不是把不合规抓取变合法的替代品。
但在合规允许使用数据之后,仍然可以继续减少明文暴露。公开资料显示,AI 加密平台可通过本地加密、密态传输、密态存储、密态推理和结果本地解密,降低高敏感输入在传输、存储和计算过程中的明文暴露;企业场景还可根据需要采用本地化私域部署或密态训练。
这也是公域 AI 的结构性边界:它可以提供模型能力,但不天然替你完成数据来源治理,更不天然保证明文在整个链路中不可见。对于医疗、法律、科研、金融和企业核心数据,专门的 AI 加密平台、全链路加密、密态计算和私域部署,解决的是「数据可用但不必暴露」的问题。
你所在的行业,最难守住的是数据来源、训练环节,还是模型调用环节?欢迎在评论区交流。
#AI 隐私 #数据合规 #生成式 AI #网络抓取 #人工智能安全 #密态计算 #企业数据安全 #AI 加密平台

Related content

Comments

Sign in to comment.