
转载自公众号戎戎熊智讼
文 | 戎朝
目 录
人工智能合规的价值底座与制度坐标
算法备案、大模型上线与安全评估的全流程合规地图
从训练数据“输入端”到生成物“输出端"的双向著作权版图
训练语料来源合法性、个人信息保护与数据出境
深度合成、AI标识双轨制与虚假信息全链条治理
平台连带责任、生成内容侵权与AI致害的归责路径
算力芯片、模型技术出境与中美博弈下的贸易合规
规从伦理委员会到专家复核清单的可落地审查制度

本篇导读:
数据者,AI 之米粮也。无米则模型不成,米不洁则模型染疾。本篇所论,正是"米从何来、来得合法否"——训练语料的来源合法性、其中个人信息的处理、跨境流动的合规。所谓取之有道,一在来源洁净(不侵权、不违法获取),二在处理有据(个人信息有合法性基础),三在出境合规(过三大制度之关)。三者环环相扣,缺一即生风险。
风险等级速览
风险点 | 等级 | 现行规范支点 |
训练语料来源不合法(违规爬取、越权使用) | 高风险 | 暂行办法第七条、数据安全法 |
训练数据含个人信息无合法性基础 | 高风险 | 个人信息保护法第十三条、第二十七条 |
重要数据识别缺位、违规处理 | 关注项 | 数据安全法第二十一条 |
数据出境未过三大制度之关 | 高风险 | 促进和规范数据跨境流动规定 |
三法一体:数据合规的规范底座
数据合规之规范底座,由三部法律共同搭建:《中华人民共和国网络安全法》〔2025 修正,2026-01-01 施行〕、《中华人民共和国数据安全法》〔2021-09-01 施行〕、《中华人民共和国个人信息保护法》〔2021-11-01 施行〕。此三法者,分工有别:网安法管网络运行与信息安全,数安法管数据分类分级与数据安全,个保法管个人信息处理之全流程。三法叠加,构成 AI 数据活动的合规天花板——故 AI 企业的数据治理,不能只盯暂行办法一隅,须以三法为底座统筹。
输入端再访:训练语料来源合法性三问
第二篇已论训练数据的著作权风险,此处自数据合规角度补足"来源合法性"三问:
爬取之问:以爬虫获取的数据,是否突破网站robots协议、是否抓取受限或受保护数据?违规爬取既可能涉著作权(见第二篇),亦可能违反数据安全法与反不正当竞争法。
采购之问:向第三方采购的语料,其上游来源是否合法、是否取得必要授权?务必审查数据供应商的来源合法性承诺与凭证,切忌只看合同不问来源。
用户数据二次利用之问:将用户在本平台产生的数据用于模型训练,是否超出原告知的处理目的?此即个人信息"目的限制"原则的核心张力(见下节)。
暂行办法第七条要求"使用具有合法来源的数据和基础模型",正是此三问的规范出口。盖来源合法,是数据治理的第一道闸——闸守不严,后续处理愈精细,风险愈深。
个人信息保护:告知—同意在大模型训练中的适配难题
训练语料一旦含个人信息,即触发《个人信息保护法》的全套义务。然大模型训练之"海量、间接、再利用"特性,与个保法"告知—同意"的传统架构,存在结构性张力。
个保法第十三条列举处理个人信息的合法性基础:取得个人同意、为订立履行合同所必需、履行法定职责或义务、应对突发公共卫生事件、新闻报道舆论监督、处理已公开个人信息等。须明者:同意只是合法性基础之一,而非唯一。企业不应一律困于"逐一取得同意"之不可能,而应辨明训练场景可援用何种合法性基础。
训练语料常含网络已公开的个人信息。个保法第二十七条设了通道:可在合理范围内处理个人自行公开或已合法公开的个人信息,但个人明确拒绝的除外;处理已公开个人信息对个人权益有重大影响的,仍须取得同意。故"数据已公开"非"可任意使用"之通行证——"合理范围"与"重大影响"二要件,是企业必须自行研判的边界。
训练语料若含敏感个人信息(生物识别、医疗健康、金融账户、行踪轨迹等),须取得单独同意并具特定目的与充分必要性。此为高压线,企业宜在语料清洗阶段即识别并特别处理。
合规要点:① 建立训练语料的个人信息识别与分级机制;② 对不同场景匹配恰当的合法性基础,留存判断依据;③ 敏感个人信息与公开个人信息分别按第二十七条、敏感信息规则特别处置。
数据分类分级:重要数据与核心数据
《数据安全法》〔2021-09-01 施行〕确立数据分类分级保护制度,对关系国家安全、国民经济命脉的核心数据实行更严格管理,对重要数据实施重点保护。
此处之辨(崔式概念厘清):所谓"重要数据",是针对国家而言(关系国家安全、公共利益),而非针对企业商业价值而言——企业自认"重要"的商业数据,未必是法律意义上的"重要数据"。且依现行规则,在未被相关部门、地区告知或公开发布为重要数据之前,数据处理者无需就该数据主动申报出境安全评估。故重要数据识别,应以"是否被官方告知或目录公布"为准,而非企业自行臆断从严。
数据出境:三大制度与 2024 年的放宽
AI 模型的跨境训练、跨境部署、跨境调用,均可能触发数据出境合规。其制度有三:数据出境安全评估、个人信息出境标准合同(SCC)、个人信息保护认证。
《数据出境安全评估办法》〔国信办令第 11 号,2022-09-01 施行〕;
《个人信息出境标准合同办法》〔国信办令第 13 号,2023-06-01 施行〕;
《促进和规范数据跨境流动规定》〔国信办令第 16 号,2024-03-22 发布并施行〕——此规定放宽条件、收窄安评范围,与前两办法不一致的,适用本规定。
依《促进和规范数据跨境流动规定》第七条,须申报数据出境安全评估者:① 关键信息基础设施运营者(CIIO)向境外提供个人信息或重要数据;② 非 CIIO 向境外提供重要数据,或自当年 1 月 1 日起累计向境外提供 100 万人以上个人信息(不含敏感)或 1 万人以上敏感个人信息。
此为2024 年放宽的核心,企业宜善用:合同确需、跨境人力资源管理确需、紧急情况保护自然人生命健康财产确需而向境外提供个人信息,以及非 CIIO 自当年 1 月 1 日起累计向境外提供不满10 万人非敏感个人信息(且不含重要数据)的,免予申报安评、免订 SCC、免认证。此外,自贸试验区可制定"负面清单",清单外数据出境亦可免三制度。
合规要点:① 先判定数据出境的数量与类型,对照触发线与豁免情形选择路径;② 善用豁免与自贸区负面清单降低合规负担;③ 重要数据出境一律审慎,未公布为重要数据者亦应做内部研判留痕。
本篇合规清单(Checklist)
来源合法性
- ☐ 爬取数据核查 robots 协议与受限数据边界
- ☐ 采购语料审查供应商上游来源合法性凭证
- ☐ 用户数据二次利用核查是否超出原告知目的
个人信息保护
- ☐ 建立训练语料个人信息识别与分级机制
- ☐ 对不同训练场景匹配合法性基础(第十三条),留存判断依据
- ☐ 已公开个人信息按第二十七条 研判"合理范围"与"重大影响"
- ☐ 敏感个人信息单独同意、特定目的、充分必要
分类分级
- ☐ 以"官方告知/目录公布"为准识别重要数据,勿自行从严臆断
- ☐ 核心数据按最严格要求管理
数据出境
- ☐ 判定出境数据数量与类型,对照安评触发线
- ☐ 善用豁免情形与自贸区负面清单
- ☐ 重要数据出境审慎,研判留痕


rongchao@boss-young.com
戎朝律师,邦信阳律师事务所合伙人、知识产权及文化体育产业部负责人,擅长知识产权领域,涉及文化、体育、影视、娱乐、艺术品等行业,尤其在体育产业及影视娱乐领域深耕多年。在诉讼领域,戎律师曾经代理过多个业内影响力极大的案件,包括2008年北京奥运会系列维权案、新浪诉凤凰网中超赛事体育作品第一案、慧鱼模型作品案、“黑猫警长”著作权转换性使用案等典型案例,多年连续获得各级法院评选的十大案例、全国律协知产委、各地版权局等官方评选的十大案例,拥有较为专业和丰富的知识产权前沿疑难纠纷处理和出庭经验。在非诉领域,戎律师曾担任央视国际、CBA公司、中超公司、新浪网、PPTV等知名企业的顾问律师,并处理多个重大商业项目的专项顾问律师。
执业期间,戎朝律师获得多个权威奖项,被评为2011年上海市第四届优秀青年律师,2007-2008年度静安区优秀青年律师。目前是中国法学会体育法学研究会理事、上海律协知识产权专业委员会委员。戎朝律师先后在2021年被评为2021年ALB十五佳知识产权律师;2022-2024连续三年被评为商法“A-list 法律精英”;2023年被评为2023年度Legalband娱乐法律师十五强,2023-2026连续四年荣登钱伯斯大中华区域指南:媒体娱乐律师榜单,2023-2026连续四年入选Legalband中国顶级律师排行榜:体育娱乐;2024-2025连续两年ALB年度亚洲争议解决律师;2025-2026连续两年荣登钱伯斯大中华区域指南:知识产权律师榜单;2026年荣登钱伯斯全球指南:媒体娱乐律师榜单。
Boss & Young Since 1995
法治兴邦·知行于信·大道向阳
使 命:让律师成为法治社会的重要助推
愿 景:法治天下·诗意栖居
价值观:可靠、高效、富有创造力,守正、相与、永葆进取心
来源:邦信阳律师事务所
编辑:鱼仔
责任编辑:高兴、陈默
声明:本文仅代表作者本人观点,不得视为邦信阳律师事务所及律师出具的正式法律意见或建议。转载请注明来自“邦信阳律师事务所”公众号。如您有意就相关议题进一步交流或探讨,欢迎与我们联系,电话:+8621 23169090,邮箱:shanghai@boss-young.com

点击“阅读原文”,登录邦信阳律师事务所官网了解更多资讯。