大模型应用场景下数据安全治理机制研究

期刊: 环球科学 2026年第9期 DOI: PDF下载

申泽宇 范田宇 杭永旺 田鼎钰 徐桉迪

山西晋信安科技有限公司,山西省太原市,邮编030006

摘要

大模型训练与运行全链路各环节均潜藏差异化的数据安全风险,当前治理工作存在全生命周期各环节衔接断层、合规要求与技术特性适配错位的问题,需从数据管控规则、安全技术应用、多方权责划分三个维度搭建适配技术发展规律的系统性治理体系。


关键词

大模型;数据安全治理;隐私计算;多主体协同

正文


引言:通用人工智能技术落地进程加快,大模型在政务、金融、医疗等多个垂直领域的商业化应用规模持续扩张。数据作为大模型训练迭代的核心基础要素,其安全防护水平直接决定大模型的合规性与应用价值。当前大模型数据安全风险事件频发,现有治理体系难以匹配技术发展需求,梳理风险点与现存治理瓶颈,探索可行的治理路径,对推动大模型产业健康有序发展具有重要的现实意义。

一、大模型应用场景下数据安全风险的多维解析

大模型的训练与运行全程贯穿数据采集、存储、处理、输出全链路,各环节均潜藏不同类型的数据安全风险。数据采集阶段,部分主体为扩充训练数据集,未经授权把用户个人信息、公开发布的原创内容归集到训练素材当中,容易引发版权纠纷与个人隐私泄露。数据存储阶段如果加密防护不到位,不法分子可直接窃取批量敏感数据。数据处理阶段如果训练数据本身存在偏向性内容,会让大模型输出结果带有歧视性导向,加剧数据不公问题。数据输出阶段如果没有设置合理的敏感内容过滤机制,很容易把训练过程中接触到的涉密信息、个人隐私直接对外输出,给相关主体带来不可逆的权益损失。

二、大模型数据安全治理的现存困境与瓶颈

(一)数据全生命周期治理的断层问题 当前多数大模型开发主体的数据治理动作都按环节独立推进,各环节之间没有建立联动校验机制。采集阶段很少做前置权属核验,直接把公开渠道爬取的各类内容纳入素材库,训练阶段不会同步留存数据来源的对应标识,无法对问题数据做精准溯源,推理阶段的输出审核又和前端的训练数据脱敏要求脱节。此前就有面向信贷场景的金融大模型,因为训练环节未对录入的客户咨询记录做脱敏标记,用户诱导其查询相关信息时,模型直接输出了完整的客户手机号与贷款记录,导致上万名用户的个人金融信息泄露,给相关运营主体带来了极大的合规风险与声誉损失。

(二)合规性与技术适配性的冲突矛盾 现行的数据安全相关法规对数据收集使用的要求,与大模型本身的技术特性存在较为明显的错位。现行法规要求数据收集遵循最小必要原则,仅能收集与服务目的直接相关的少量数据,但大模型的训练效果直接与数据规模挂钩,需要覆盖多领域的海量数据作为支撑。部分开发主体为了符合合规要求,对训练数据做了严格的脱敏与范围限制,反而导致模型的识别精度大幅下降。此前就有面向临床辅助诊断的医疗大模型,为了符合个人信息保护的相关要求,把训练数据中的患者病程、既往病史等关键信息做了模糊化处理,最终模型对罕见病的识别准确率下降了近三成,无法满足实际临床使用需求。

三、大模型数据安全治理机制的构建路径

(一)建立数据分类分级的动态治理体系 开发主体要先锚定数据敏感度维度划定统一的分类分级基准,按照数据泄露后的影响范围、侵害程度把训练涉及的所有数据划分为一般数据、敏感数据、核心涉密数据三个层级,再针对大模型不同的落地场景匹配差异化的治理策略。政务场景下的大模型,要把公民户籍信息、社保缴纳记录、不动产登记信息等划入核心涉密数据层级,采集环节就做前置权属核验,存储阶段单独部署加密存储模块,训练阶段全程屏蔽原始数据的明文展示环节,仅授权运维人员走专门审批流程后才能调取接触。金融场景下的大模型,要把用户交易记录、信贷授信信息划入敏感数据层级,处理环节增加二次脱敏校验。后续还要结合大模型的迭代方向、应用场景的拓展进度,每季度调整一次分类分级的判定标准,保证治理规则始终适配大模型的实际运行需求。

(二)引入隐私计算技术的落地应用 开发主体要把隐私计算技术作为平衡数据利用效率与安全防护要求的核心载体,结合大模型的训练链路特征选择适配的技术路径。联邦学习可以支撑多个训练数据持有方在不传输原始数据的前提下共同完成模型训练,差分隐私可以在训练及推理阶段对数据添加微量噪声,既避免不法分子反向推导原始数据,又不会过度影响模型输出的准确度。国内某头部电商平台搭建面向用户消费偏好预测的大模型时,就采用联邦学习技术联合上游品牌商、线下零售终端共同完成训练,训练过程中各参与方只向训练平台输出模型参数的加密计算结果,不会向外传递任何用户的原始消费记录、个人身份信息,最终训练得到的大模型相比单主体训练的版本,预测准确率提升了21%,全程没有出现任何数据泄露的风险,也符合现行数据安全法规的所有要求。

(三)构建多主体协同的治理闭环机制 各地要牵头搭建覆盖全主体的大模型数据安全治理协调框架,明确不同参与方的权责边界,形成全链路的治理闭环。政府监管部门负责牵头制定大模型数据安全治理的统一标准与合规判定规则,定期面向行业主体开展合规培训与隐患排查。大模型开发运营企业要严格落实数据安全防护的主体责任,按照监管要求完善内部治理流程。第三方技术机构要负责为监管部门和企业提供技术支撑,开展安全漏洞检测、风险评估等专业服务。普通用户可以随时向监管部门反馈大模型使用过程中发现的隐私泄露、违规输出等问题。国内某新一线城市上线的大模型统一治理平台就采用这种协同模式,企业上线大模型前先向平台提交安全评估申请,第三方机构完成检测后出具评估报告,监管部门按照规则判定是否允许上线,用户后续反馈的问题也会通过平台同步到对应企业完成整改,形成全流程的闭环管理。

结语

大模型数据安全治理是技术落地推广过程中需解决的核心问题,需兼顾安全底线与产业发展需求,避免出现防护过度或治理缺位的极端倾向。后续治理工作可结合技术迭代方向持续优化调整,逐步形成可复制、可推广的成熟治理模式,为大模型产业的长效发展提供坚实的安全支撑。

参考文献

[1]裴雷,陈晓宇.大模型赋能可信数据空间:数据安全治理与信任机制构建[J].文献与数据学报,2025,7(02):15-27.

[2]万敏.面向广播电视行业的生成式人工智能大模型数据安全治理框架构建研究[J].广播与电视技术,2025,52(10):16-19.

[3]冯明昱.数据安全风险治理:保险机制介入的范式设想[J].南方金融,2024,(10):74-86.

 

作者简介:申泽宇(199808-)男,山西省长治市人,本科,研究方向:网络安全等级保护测评。


...


阅读全文