2026 年 9 月,全国网络安全标准化技术委员会在国家网络安全宣传周正式发布《人工智能安全治理框架 3.0》,这是继 1.0、2.0 之后的第三次重要迭代,标志我国人工智能安全治理,正式从 “大模型问答时代” 迈向智能体自主执行时代的治理体系。三年三版框架,体现国内 AI 治理 “小步快跑”,跟随技术演进持续更新风险认知与治理手段。
一、版本迭代:1.0‑2.0‑3.0 核心演进逻辑
1.0 版本:搭建基础风险分类体系,聚焦模型内生安全、生成内容安全,重点解决大模型 “输出什么” 的风险问题。
2.0 版本:引入分级分类,建立模型‑应用‑场景三级测评,关注 AIGC 溯源、就业伦理、衍生社会风险,落脚于 AI 应用层面治理。
3.0 版本:技术环境发生本质变化,AI 不再只是回答问题,智能体具备任务规划、记忆存储、调用工具、自主执行操作的能力,风险从虚拟内容向外传导、影响现实世界。因此框架将治理对象,由模型输出内容扩展到具备自主行动能力的智能系统,风险类别由 8 类细化扩充至 14 类,新增智能体、具身智能、认知供应链、AI 自主攻击等全新风险模块。
重要提示:该框架属于指导性技术框架文件,并非强制国标,为企业、科研机构提供风险图谱、应对措施参考,作为合规建设的重要指引依据。
二、3.0 版本五大核心变化
1. 将智能体、具身智能作为治理重点对象
本次最大亮点,智能体风险独立作为重点附件。智能体可自主调用工具、执行任务,风险不再仅仅是文本生成的错误内容,而是越权操作、行为失控、工具被投毒劫持,风险可以直接传导至现实业务与物理场景。框架明确提出约束要求:智能体需要唯一身份标识、最小权限原则、高危行为强制人工审批、行为全程可审计追溯,防范自主行为带来的失控风险。具身智能(机器人、实体智能设备)的物理安全风险,也被纳入正式风险清单。
2. 提出 “认知供应链安全”,不止管控训练数据
旧版本主要管控模型训练阶段数据集;3.0 把风险延伸到模型运行全过程信息来源:外挂知识库、联网搜索结果、工具返回数据、智能体长期记忆全部纳入管控,提出 “认知供应链” 概念。重点警惕 GEO 投毒风险:攻击者通过批量污染网络公开信息、虚假评测,污染 AI 联网检索获取的外部信息,间接篡改模型推理判断结果。同时新增记忆安全风险,包括记忆被窃取、污染、失真篡改等风险点。
3. 强化开源生态与供应链安全
当前大量行业 AI 应用基于开源模型二次开发,开源组件后门、模型篡改、分发下载环节风险突出。3.0 强化开源模型全生命周期安全管理,对开源下载、二次微调、部署分发明确安全红线,要求企业做好组件溯源、漏洞监测、版本管理,堵住供应链安全漏洞。
4. 风险导向:安全与创新采取动态平衡
框架摒弃静态固定平衡点,倡导动态平衡治理思路:风险等级越高,对应的安全管控措施就越严格;低风险创新应用,保留充分发展空间,避免 “一刀切”,实现促创新和防风险并举。坚持技术手段 + 管理制度并行,技术上完善检测、测评、溯源;管理上压实开发方、部署方、运营方多方主体责任,落实全流程风险管控。
5. 关注 AI 自主网络攻击新型风险
过去版本主要关注 “人利用 AI 做攻击”;3.0 进一步预判风险:警惕 AI 系统自主生成攻击方案、主动实施网络攻击的风险,把 AI 自主攻击行为纳入风险识别,为网络安全防御提前布局。
三、全链条治理思路:覆盖 AI 完整生命周期
框架将安全治理贯穿从源头到落地的完整链路:
数据层:训练数据、合成数据、外挂知识库、外部检索信息、智能体记忆存储;
算法模型层:模型训练、微调、开源二次开发,防范后门、偏见、漏洞;
运行执行层:重点管控智能体规划、工具调用、权限管理、行为审计;
供应链层:芯片、框架、开源组件、第三方工具;
应用场景层:面向不同行业做分级风险处置,高风险场景提升防护等级。
四、现实意义与行业启示
对企业:AI 开发不再只调模型效果,必须建立覆盖认知供应链、智能体行为审计、开源组件安全的合规体系;测评从单纯测 “输出内容”,升级为评估系统行为边界、权限管控、异常行为处置能力。
对产业:适配 “人工智能 +” 的产业落地,给快速发展的智能体、机器人、行业大模型提供一套可落地的风险检查清单,推动创新不脱离安全底线。
治理趋势:随着 AI 从生成内容走向执行任务,我国 AI 治理完成从 “管输出” 向 “管行为” 的范式切换,为全球人工智能治理输出实践参考。
从 1.0 到 3.0,框架迭代背后,是 AI 技术能力的跃迁。当人工智能可以自主规划任务、调用工具、作用于现实世界,安全边界就不再局限于文字内容。《人工智能安全治理框架 3.0》回应智能体时代全新挑战,以风险分类分级为抓手,兼顾发展与安全,引导产业走向可信可控的人工智能发展道路。



经营性网站备案信息
ICP经营许可证
营业执照副本
不良信息举报中心