跨国科企要在中国和美国两套合规规则中寻求突破,这绝非易事。智慧芽的合规负责人葛梦莹认为,只要构建精准的数据架构,依然可以打破僵局,实现合规落地
企业的AI数据合规正在被两套互不承认的规则同时约束。中国监管者问的是:你的数据出境,或者模型上线,都是基于何种依据?而美国监管者和交易对手则问的是:为什么你在中国团队还能接触到这些数据,以及你的模型是在谁的机器上训练出来的?
双方的关注点全然不在一个维度。前者着眼于数据流转与服务的市场准入,而后者则关注谁有访问权限以及服务器部署在何处。企业若只遵从其中一套逻辑搭建体系,一定会在某个环节遭到另一套规则的阻拦。
在AI语境下,“数据集存储在哪里”这一单点问题被延展成多个问题组成的链条,包括:训练语料从哪来、模型在哪台机器上训练出来、哪些人能登进该系统、推理阶段输入的数据流向何处。链条上的任何一节出问题,前面的合规投入都可能功亏一篑。无论是自研模型还是采购AI服务的企业,都在面临同样的考验。
美国:从数据离境到权限可及

美国初期的数据限制措施以供应链为重点,2019年5月的第13873号行政令授权商务部审查涉及“外国对手”的信息通信技术与服务交易,管控对象是设备、网络、云服务这类产品与服务本身,并未直接限制数据流动。真正的转变出现在2024年2月的第14117号行政令,以及司法部随后出台的执行规则。自此,管控重点不再是数据是否出境,而是谁能够访问到这些数据。规则对“访问”作广义界定,同时涵盖物理访问与逻辑访问。换言之,即使数据留在美国境内,亦没有拷贝的副本出境,但只要中国境内工程师具备读取权限,整个交易仍可能落入管辖范围。
这一转变对涉AI企业的冲击远大于传统业务。AI系统的迭代依赖跨时区团队随时排查线上问题并检查真实数据,日常的研发运维恰恰建立在广泛的权限之上。新规出台后,合规的杠杆从“控制出境通道”变成了重新划定权限边界,而这势必会打破既有的研发与运维流程。
类似的监管逻辑还在投资审查与数据交易等场景中反复上演,并指向同一目标:限制中国主体访问美国数据。依据2022年9月的第14083号行政令,美国外国投资委员会(CFIUS)强化了涉数据交易审查,即便放行也常附加“数据留美,中方不得远程访问”的条件。2024年4月生效的法令则禁止数据经纪商向关切国家出售美国人的敏感个人身份信息。AI企业应密切关注这一点,因为采购训练语料库的行为可能被纳入受禁数据交易的范畴。
中国:调整监管颗粒度
中国对数据跨境规则也在持续调整,这些调整有时被误读为逐步放宽尺度。实则不然,《个人信息保护法》第38条设定的三条出境路径——安全评估、保护认证、标准合同——依然是主干;2024年3月的《促进和规范数据跨境流动规定》则是把大量低风险场景从评估义务中豁免出来,把监管资源集中到重要数据和大规模个人信息上,但从未撤销把关。
向境内公众提供AI服务的企业还需承担额外的一层合规责任。《生成式人工智能服务管理暂行办法》对训练数据来源的合法性、标注规则、内容安全提出了具体要求,而算法备案与安全评估是能够提供服务的前置条件。这层义务的客体不是数据的传输,而是输出结果的模型。
更关键的则是《个人信息保护法》第41条与《数据安全法》第36条:未经主管机关批准,中国境内的组织和个人不得向外国司法或执法机构提供存储于境内的数据。这些通常被视作阻断性法规,日常工作中比较少接触到,但在中美双重规则叠加的场景下恰恰最容易被触发。
三层挤压
第一层是训练数据的来源与流向。训练AI的语料通常来自公开抓取、第三方采购、客户授权与自有积累,四条路径的法律性质不同,但在数据集里往往已混在一起。一旦某个市场要求说明特定语料的合法来源,或要求证明训练数据中不含该国的敏感个人数据,企业就会面临无法按来源拆分数据集的无解命题。语料被投入训练的过程具有事实上的不可逆性,一条数据是不能从已经收敛的模型权重中剔除出去的,因此入口审查是唯一有效的控制点。不自行训练模型的企业亦不能置身事外,在采购阶段即需将语料来源说明、按司法管辖区隔离的承诺、审计权与违约救济措施等都事项写进合同。
第二层是开发与运维的权限。这也是两国监管规则最直接冲突的地方。美国规则要求隔离中国境内人员访问特定数据的权限,而中国的重要数据规则要求境内数据留在境内,出境需履行规定程序。两边的压力下,传统的“人动、数据不动”方法已经失效,实际要实现的是“数据和人都不动”,即需按法域拆分研发与运维边界,在当地配置具备完整权限、能够独立排查故障和调优的团队。
算力也遵循类似的逻辑。跨境使用算力的真正判断依据在于受控物项所在地、接触受控技术的人员的所属司法管辖区,以及最终用途与最终用户的。企业需要注意的是,把用途描述为训练而非推理,未必能构成有效抗辩理由;且网络路径的安排属于一种存取方式而非控制措施,亦不足以作为减轻责任的论据。实践中,更直观的约束往往来自供应商合同中的地域与人员限制,这导致合同违约往往比监管警示更早触发。
第三层是推理端的数据。这是AI区别于传统软件之处。输入的提示词与上传的文档实时流经模型,可能触达日志、缓存、评测集与人工审核环节。企业需要能回答,单次调用的数据在哪里存储、保留多久,以及有没有用于后续训练。
企业应对思路
第一,建立训练数据来源台账。企业可针对上述四条路径分别记录数据来源、授权范围与地域属性,并在准入环节做好合法性筛查。
第二,把访问权限作为一级合规管理对象。建立人员所属法域、权限级别与数据类型之间的映射关系,确保随时能回答:“哪些法域的哪些人,可以查看哪一类数据”。
第三,清晰描述推理端的数据流转。梳理单次调用的完整路径,明确数据在日志、缓存、评估和人工审核各个阶段的存储位置及留存期限,并默认关闭训练使用(若开启则保留记录)。
第四,保持双向数据分类分级。对同一份数据,分别按照中国与目标市场的监管框架进行标记,并定期比对两者的差异。
第五,建立统一的外部请求响应通道。涉及境内数据的境外审查、取证与审计请求,应统一受理,并履行审批程序。
实践参考
笔者所在的智慧芽是专注于用AI技术支持企业知识产权和研发创新能力的的科技创新信息服务商。基于服务多法域客户累计的经验,我们较早把突破两国AI数据规则夹缝视作架构设计问题,而非仅作个案处理。
这种方式在于建立双轨的合规底线,即源于中国境内的数据存境内,源于境外的数据存境外;境外部署欧盟与美国专区,将客户数据写入其管辖区对应的区域。
AI数据合规在本质上已经从遵守单一司法管辖区的法律法规,演变成了面向多方规则的结构设计问题。企业能做的是厘清每项法规的真正指向——也就是究竟谁在监管什么、在哪个层面监管——然后用架构(而非纸面承诺)去满足这些要求。只要将这一矛盾视为工程问题来处理,狭缝中的生存空间往往比乍看起来更加宽裕。























