陈纯 任奎:生成式人工智能安全治理法治化路径

来源:区块链与数据安全全国重点实验室 时间:2026-09-11 阅读量:11


以下文章来源于中国网信杂志,作者陈纯 任奎


以大模型为代表的生成式人工智能,正在从技术突破走向规模化应用。文本、图像、音频、视频、代码和多模态内容可以被低成本生成、编辑、传播,智能体、工具调用和行业模型进一步推动人工智能嵌入政务、金融、教育、医疗、工业、交通、媒体等重要场景。人工智能由“辅助工具”向“生产系统”和“治理对象”双重角色演进,既为发展新质生产力,推进网络强国、数字中国建设提供重要支撑,也对网络空间治理、公共安全、社会信任和国家安全提出新的挑战。

生成式人工智能安全治理进入体系化推进新阶段

生成式人工智能安全风险具有明显的复合性和传导性。一是内容真实边界被不断模糊。深度伪造、虚假图片、仿真音视频和机器批量生成文本,可能造成身份冒充、舆论误导、网络诈骗和社会恐慌。二是算法决策影响从线上信息分发扩展到线下资源配置。模型训练数据、参数权重、提示词策略和输出过滤机制共同塑造服务结果,传统的单点监管难以覆盖模型全链条。三是数据安全和个人信息保护压力上升。训练语料、用户输入、交互日志、插件调用和行业知识库均可能包含敏感数据,若缺乏有效治理,容易形成泄露、滥用和跨境流动风险。四是责任链条更为复杂。模型研发者、服务提供者、内容传播平台、应用集成方和终端用户共同参与内容生成与传播,若缺乏备案、标识、留痕、审计和处置机制,风险发生后就难以精准定位责任。

我国人工智能治理的基本方向是在鼓励创新中守住安全底线、在包容审慎中强化依法治理。党的二十届三中全会通过的《中共中央关于进一步全面深化改革、推进中国式现代化的决定》提出培育全国一体化技术和数据市场,明确要求提升数据安全治理监管能力。2025年2月28日,习近平总书记在中共中央政治局第十九次集体学习时强调,要完善公共安全体系,推动公共安全治理模式向事前预防转型,加强网络安全、人工智能安全等方面工作。生成式人工智能安全治理正是事前预防理念在网络空间和智能空间中的重要实践:不是等风险外溢后被动处置,而是通过规则、标准、技术和平台能力前置嵌入,使可知、可管、可控、可追责成为人工智能应用的基础条件。

近年来,我国已经形成较为清晰的制度演进。《互联网信息服务算法推荐管理规定》明确具有舆论属性或者社会动员能力的算法推荐服务提供者应履行备案手续;《互联网信息服务深度合成管理规定》对深度合成服务的数据安全、技术管理、标识提示、安全评估等提出刚性约束;《生成式人工智能服务管理暂行办法》进一步规定生成式人工智能服务提供者在训练数据、生成内容、个人信息保护、安全评估、算法备案等方面的合规义务;《人工智能生成合成内容标识办法》及配套强制性国家标准,对生成合成内容显式标识、隐式标识和传播环节管理作出制度化安排。由此,算法备案、内容标识与风险防控共同构成生成式人工智能安全治理的三项关键抓手。

以算法备案夯实治理底座,推动人工智能服务可知可管

算法备案的核心价值,是把影响公共传播和具有社会动员能力的算法系统纳入可见、可查、可评估的治理框架。生成式人工智能的算法机理复杂、迭代速度快,单纯依赖事后执法难以适应模型快速上线、能力持续扩展和应用场景频繁变化的现实。通过备案制度,监管部门能够掌握服务主体、算法类型、应用领域、服务形式、安全自评估报告和拟公示内容等基本信息,为分级分类监管、风险研判和应急处置提供基础数据。

生成式人工智能场景下,算法备案应从“上线前合规动作”拓展为全生命周期治理机制。一是备案应覆盖模型研发、训练、微调、部署、更新、下线等关键节点。大模型能力并非一次性固定,数据更新、参数调整、安全策略变更和插件扩展都可能改变风险形态。对具有舆论属性或者社会动员能力的服务,重大功能变化和风险等级变化应及时纳入备案更新。二是备案应与安全评估、模型测评和内容治理联动。备案材料不能停留在形式填报,而应通过安全自评估报告、红队测试结果、数据来源说明、敏感场景防护措施、未成年人保护机制等内容,反映服务真实风险状况。三是备案应强化主体责任。服务提供者应对算法机制机理、训练数据合规性、输出内容安全性、用户权益保护和投诉处置承担直接责任,应用集成方和传播平台也应在其控制范围内履行相应义务。

备案治理还应服务于创新发展。对于科研探索、内部测试、垂直行业应用和公共服务平台,应在风险可控前提下形成差异化合规路径,避免用单一规则约束不同风险等级的应用。特别是在人工智能赋能科学研究、工业制造、城市治理和数据要素流通的场景中,应鼓励可信数据空间、隐私计算、区块链存证、安全沙箱和模型测评平台等技术支撑合规创新。备案不是技术创新的阻断点,而是把创新活动纳入清晰预期和责任边界的制度接口。

2025年11月8日,2025年世界互联网大会乌镇峰会人工智能技术创新与治理论坛在浙江乌镇举行。供图/世界互联网大会


以内容标识重建信任机制,提升生成合成内容透明度

生成式人工智能最直接、最广泛的社会影响,体现在内容生产方式的变化。普通用户难以仅凭经验识别图像、音频、视频和文本是否由人工智能生成或合成,内容平台也面临海量传播环境下的识别和追溯压力。内容标识制度以“显式提示+隐式嵌入”为基本路径,既为公众提供可感知的真实性提示,也为监管、平台治理和责任追溯提供技术线索,是生成式人工智能治理从主体管理走向内容流通管理的重要制度创新。

显式标识的重点是保障公众知情权和传播秩序。对可能导致公众混淆或者误导的生成合成内容,应在合理位置、以合理方式作出明确提示,使用户在接收、转发和再加工内容前能够知晓其人工智能生成属性。显式标识并不意味着否定人工智能生成合成内容价值,而是为其进入公共传播空间提供透明条件。只有当公众能够清楚区分事实记录、人工编辑和机器生成内容时,人工智能才能在新闻传播、文化创作、教育培训和公共服务中获得更稳定的社会信任。

隐式标识的重点是实现可追溯、可核验和可处置。通过在文件元数据、数字水印、模型输出特征或平台编码中嵌入不影响用户正常使用的信息,可以在内容被二次传播、下载、剪辑或跨平台扩散后保留必要线索。隐式标识要兼顾安全性、鲁棒性和隐私保护,既要防止被轻易删除、篡改或伪造,也要避免过度收集个人信息和商业敏感信息。对于文本、图片、音频、视频等不同模态,应根据内容载体和传播方式选择适当标识方案,形成多模态、全链条、可互操作的技术体系。

内容标识制度的实施,关键在于打通服务提供者、内容传播服务平台、检测机构和公共服务平台以及监管部门之间的协同链路。生成合成服务提供者应在内容生成环节主动添加标识;内容传播服务平台应在发布、展示、下载和分发环节核验、保留和提示标识;检测机构和公共服务平台应提供便捷的标识检测、验证和争议处理能力;监管部门应推动标准统一、编码互认和执法衔接。浙江大学等科研机构参与建设的人工智能生成合成内容标识服务平台,正是在政策标准宣贯、技术验证和社会公共服务之间搭建桥梁的有益探索。未来应进一步推动公共服务能力开放,使中小企业、媒体机构、教育机构和普通用户都能以低成本方式理解、检测和使用标识。

以风险防控推动事前预防,构建全链条安全能力

生成式人工智能风险防控不能只盯住输出端的“有害内容”,还要覆盖数据、模型、系统、应用和传播全过程。事前预防的关键,是把风险识别、评估、缓释和处置能力前置到研发部署阶段,并通过持续监测实现动态治理。

在数据层面,应强化训练数据和知识库数据治理。数据来源应合法合规,个人信息和重要数据处理应符合相关法律要求,涉及版权、商业秘密、未成年人信息和敏感行业数据的,应建立授权、脱敏、最小必要、访问控制和留痕审计机制。面向数据要素流通和行业模型建设,还应发展隐私计算、可信执行环境、零知识证明、区块链存证等技术,推动数据在“可用不可见、可控可计量、可追溯可审计”的条件下安全流通。

在模型层面,应建立面向大模型的安全测评和攻防验证体系。生成式人工智能可能出现幻觉、偏见、越狱、提示注入、后门攻击、隐私记忆、工具滥用和多智能体协同失控等问题。应围绕价值对齐、鲁棒性、可解释性、可控性和隐私保护构建测试基准,开展红队测试和持续评估。浙江大学网络空间安全团队在大模型安全评测、越狱攻击机理、防御技术和安全后训练方面开展了系统研究,形成了输入检测、推理监控、输出过滤和价值对齐训练等多层次方案,为模型可信可控提供了技术支撑。

在系统层面,应把人工智能安全纳入软件供应链安全、云平台安全和应用安全统一考虑。模型服务依赖算力平台、开源框架、插件工具、向量数据库、应用接口和内容分发网络,任何环节被攻击都可能导致数据泄露、模型劫持或内容投毒。应完善身份认证、权限隔离、密钥管理、模型调用审计、异常行为检测和应急响应机制,尤其要防范模型被用于自动化网络攻击、恶意代码生成、网络诈骗和黑灰产规模化活动。

在场景层面,应坚持分级分类、重点保护。政务服务、新闻传播、金融投资、医疗健康、教育考试、公共安全、智能网联汽车、工业控制等场景,对社会秩序和公共利益影响大,应实行更严格的安全评估、人工复核和责任留痕。一般创作、办公辅助和个人娱乐等低风险场景,可以更多采用提示、告知和平台自律机制。通过风险分级,可以把监管资源集中到关键领域和高风险应用场景,形成既有力度又有温度的治理格局。

完善协同治理体系,形成法治、技术和产业良性循环

生成式人工智能安全治理是一项系统工程,需要政府、企业、科研机构、行业组织和社会公众共同参与。政府部门应发挥规则供给、标准制定、监管执法和公共服务作用,推动算法备案、内容标识、安全评估、数据治理和应急处置制度衔接。企业是人工智能服务安全的第一责任主体,应把合规要求转化为产品设计、工程流程和内部控制,不断提升安全投入和透明度。科研机构应面向国家重大需求开展原创性、系统性研究,突破模型安全测评、深度伪造检测、隐私保护计算、可信数据空间、区块链追溯和智能治理平台等关键技术。行业组织应推动标准宣贯、能力评估和实践沉淀。社会公众应提升人工智能素养和内容辨识能力。

在国家战略需求层面,生成式人工智能安全治理要与网络强国、数字中国、数据基础制度建设和公共安全治理现代化同向发力。区块链与数据安全全国重点实验室围绕“维护国家数据安全、促进数据合规高效流通使用”的使命定位,布局下一代高可信区块链网络、基于数据智能的社会安全治理平台、人工智能数据安全等重大任务,体现了网络安全、数据安全和人工智能安全交叉融合的发展趋势。未来,面对人工智能广泛嵌入经济社会运行的现实需求,应进一步建设面向社会安全治理的数据智能平台,提升风险感知、态势研判、追踪溯源、协同处置和辅助决策能力,推动公共安全治理模式向事前预防转型。

在国际层面,人工智能治理已成为全球数字治理的重要议题。我国提出《全球人工智能治理倡议》,主张坚持以人为本、智能向善、尊重主权、发展安全并重、公平普惠和共同治理。算法备案、内容标识和风险防控制度的不断完善,不仅服务于国内人工智能健康发展,也为全球人工智能治理提供可参考的中国方案。应在坚持我国网络主权和数据安全底线的基础上,积极参与国际标准制定和治理规则对话,推动形成开放、公平、有效的人工智能治理国际合作机制。

生成式人工智能是新一轮科技革命和产业变革的重要驱动力,也是网络空间治理和公共安全治理必须直面的重大变量。面对技术快速演进,法治化治理既不能滞后缺位,也不能简单替代技术创新和产业实践。应坚持发展和安全并重,以算法备案增强主体可见性和责任可追溯性,以内容标识提升生成合成内容透明度和社会信任,以风险防控构建覆盖数据、模型、系统、应用和传播的全链条安全能力。通过制度规则、技术标准、公共平台和产业生态协同发力,推动生成式人工智能始终在法治轨道上安全、可靠、可控、公平地发展,为建设网络强国、数字中国和更高水平的平安中国提供坚实支撑。



原标题:生成式人工智能安全治理法治化路径

作者:陈纯系中国工程院院士,浙江大学教授;任奎系浙江大学区块链与数据安全全国重点实验室常务副主任

来源:《中国网信》2026年第8期