工信部发布“可靠AI”测评体系:面向Agent时代的全链路标准,企业智能体选型有了“标尺”

浩轩云智选

事件背景

9月22日,在2026人工智能计算大会(AICC 2026)上,工业和信息化部电子第五研究所联合北京智源研究院、浪潮信息、摩尔线程、沐曦、百度智能云、阿里云等20多家产业链单位,正式发布面向 Agent 时代的”可靠AI”测评体系。它覆盖芯片、整机与互联、框架与系统、模型、数据、应用全环节,从可靠性、安全性、稳定性等维度做全链路评测。对正准备上马智能体的企业来说,这是第一把”可验证的标尺”——以后再选智能体平台,不再是看谁 Demo 炫,而是看谁经得起测。

“可靠AI”测评体系到底是什么?

一句话:把”这个智能体靠不靠谱”从主观感受变成可量化、可验证的评价。体系聚焦智能体应用带来的新能力、新场景、新要求,覆盖从底层芯片到上层应用的六个环节,每个环节都从可靠性(稳不稳)、安全性(会不会出事)、稳定性(长时间跑会不会崩)三个维度打分,并配套场景构建、风险评估、能力优化。它不是一份认证文凭,而是一套”你宣称的能力,我能在真实负载下复现并验证”的方法论。对采购方,价值在于把选型从”信厂商PPT”变成”看测评报告”。

为什么是”面向Agent时代”,而不是”面向大模型”?

因为风险变了。问答式大模型的风险主要在输出内容(幻觉、违规),而智能体要调工具、访问数据、连接业务系统、甚至多智能体协同,攻击面和失效面都指数级扩大。电子五所把体系明确命名为”面向Agent时代”,说明监管与产业已达成共识:下一代AI安全的重心,从”模型说什么”转移到”智能体做什么、做没做越界”。这也解释了为什么近两年安全事件集中在智能体——从沙箱逃逸到自主入侵,根子都在”行动力”。

测评覆盖哪些环节?安全维度怎么评?

六个环节:芯片、整机与互联、框架与系统、模型、数据、应用。最该企业关注的是”应用”和”模型”两层——应用层测智能体在真实业务流里的权限、安全和运维表现;模型层测对齐与鲁棒性。安全维度的评测思路,与 https://haoxuanyun.com/google%e5%bc%80%e6%ba%90agent-substrate%ef%bc%9a%e9%bb%98%e8%ae%a4%e5%ae%89%e5%85%a8%e7%9a%84%e6%99%ba%e8%83%bd%e4%bd%93%e6%89%a7%e8%a1%8c%e8%bf%90%e8%a1%8c%e6%97%b6%ef%bc%8c%e6%b2%99%e7%ae%b1/ 里 Google 开源 Agent Substrate 强调的”默认安全执行运行时”一致:不看模型宣发,看它在受限环境里能不能被隔离、能不能被观测。一家平台若连基础的沙箱隔离、出网白名单都拿不出测评证据,就不该进生产。

这套体系和等保测评、框架3.0是什么关系?

互补。等保测评管”系统边界、认证、审计”,框架3.0 把智能体风险单列成章、要求分级治理与一键熔断;”可靠AI”测评体系补的是”智能体能力本身是否可靠”这一层——相当于在等保的”门”和框架3.0的”规矩”之外,再加一把”能力体检”。企业实操上,三者该合并成一张上线检查表:等保过边界、框架3.0定策略、可靠AI测评验能力。详见 https://haoxuanyun.com/%e3%80%8a%e4%ba%ba%e5%b7%a5%e6%99%ba%e8%83%bd%e5%ae%89%e5%85%a8%e6%b2%bb%e7%90%86%e6%a1%86%e6%9e%b63-0%e3%80%8b%e6%ad%a3%e5%bc%8f%e5%8f%91%e5%b8%83%ef%bc%9a%e4%bc%81%e4%b8%9aai%e5%ae%89%e5%85%a8/ 里《人工智能安全治理框架3.0》正式发布的内容,三者目标一致、口径不同。

对”安全性、稳定性”维度,国安部预警与护栏怎么对应?

直接对应。体系把”安全性”列为独立维度,而 https://haoxuanyun.com/%e5%9b%bd%e5%ae%89%e9%83%a8%e9%a2%84%e8%ad%a6ai%e8%a0%95%e8%99%ab%e4%b8%8e%e6%99%ba%e8%83%bd%e4%bd%93%e8%b6%8a%e6%9d%83%e3%80%81%e8%9a%82%e8%9a%81%e5%bc%80%e6%ba%90singprobe%e6%8a%a4%e6%a0%8f%ef%bc%9a/ 里国安部预警 AI 蠕虫与智能体越权、蚂蚁开源 SingProbe 护栏,给出的正是”权限最小化加全程留痕加异常即停”的工程实现——这正是测评”安全性”维度要查的硬指标。企业可以把它当自检清单:平台是否最小权限?是否全链路留痕?异常能否一键熔断?能答”是”的,才扛得住测评,也才扛得住真实攻击。

企业怎么用这套体系做”选型标尺”?

四步:第一,要报告——让供应商提供可靠AI测评或等同类测评结果,别只看Demo;第二,看环节——重点核”应用加模型”两层的可靠性与安全性分;第三,对边界——把等保、框架3.0、可靠AI测评三项并列为上线前置;第四,留证据——选型过程留档,后续审计可追溯。浩轩云智选在帮企业做智能体选型时,会把这套标尺作为交付项,而不是凭经验拍板。

身份码国标(GB/Z 185-2026)和可靠AI测评怎么叠加?

一个管”身份”,一个管”能力”,天然互补。https://haoxuanyun.com/%e6%99%ba%e8%83%bd%e4%bd%93%e5%bc%80%e5%a7%8b%e5%8f%91%e8%ba%ab%e4%bb%bd%e8%af%81%ef%bc%9a%e5%9b%bd%e6%a0%87gb-z-185-2026%e4%b8%8eaip%e5%8d%8f%e8%ae%ae%e8%90%bd%e5%9c%b0%ef%bc%8c/ 里智能体”身份证”国标 GB/Z 185-2026 解决”你是谁、能进哪”,可靠AI测评解决”你靠不靠谱、会不会出事”。企业落地时,先给智能体发身份码(防冒名、控权限),再用可靠AI测评验证能力(防失控、防欺骗),两者叠加才是完整的”可信智能体”底座。政务、国企采购高合规场景,这套叠加会成硬门槛。

模型欺骗、越权这类对齐问题,测评能兜住吗?

能兜一部分,不能全兜。可靠AI测评可设计对齐与鲁棒性测试用例(如诱导欺骗、越权指令),把”已知套路”测出来;但对 https://haoxuanyun.com/openai%e6%8a%ab%e9%9c%b2%e5%85%ad%e8%b5%b7%e6%a8%a1%e5%9e%8b%e6%ac%ba%e9%aa%97%e8%a1%8c%e4%b8%ba%ef%bc%9a%e9%9a%90%e7%9e%92%e9%94%99%e8%af%af%e3%80%81%e4%bc%aa%e9%80%a0%e6%95%b0/ 里 OpenAI 披露的六起模型”欺骗”行为(隐瞒错误、伪造数据)这类认知层欺骗,测评只能覆盖已发现的模式,无法预言未知。所以正确姿势是:测评当上线门槛,失配监控当运行安全带,人工批准当关键动作刹车——三层叠加,而非指望一次性测评解决全部对齐。

郑州本地企业怎么借标准红利?

三步:第一,对齐标准——做智能体前先读框架3.0与可靠AI测评体系,把”可靠性、安全性、稳定性”写进需求;第二,安全兜底——最小权限、出网白名单、沙箱隔离、人工批准,私有化或混合部署优先;第三,合规落地——做等保测评、走身份码、必要时内容标识与备案。郑州本地服务商(如浩轩云智选)可帮企业把标准翻译成可执行的选型表与上线检查单,响应快、沟通成本低。

浩轩云智选能提供什么?

我们提供从智能体方案设计、私有化或混合部署、等保测评协助到上线交付的全链路服务,让企业的智能体”自主可控、合规、可验证可靠”。具体方案与报价以咨询为准。

关于浩轩云智选

浩轩云智选(郑州市金水区浩轩云智选软件工作室,统一社会信用代码 92410105MAK42FNA7Q)专注企业级 AI 智能体开发、云服务代理、等保测评协助与数字化转型全链路服务。如需智能体安全评估、等保测评或合规方案设计,欢迎联系:

我们作为腾讯电子签等产品的正规合作服务商,提供从咨询、方案设计到上线交付的服务,具体折扣与报价以咨询为准。

标签:

热门标签

企业数字化 AI大模型 AI Agent 云服务器 等保测评 腾讯云 阿里云 华为云 电子签 企业服务 企业上云 腾讯电子签 ICP备案 信创 腾讯云CVM 电子签名 电子合同 workbuddy 企业AI 智能体开发

联系我们

有任何问题欢迎随时联系,我们将竭诚为您服务

13723241722
89016332@qq.com
河南省郑州市金水区国基路与花园路御府3号院
微信二维码

扫码添加微信

微信同手机号