科睿观察

【科技观察】智能体AI评估困境:不能衡量,何以治理?
日期:2026-05-05 作者/来源:科睿研究院
1.jpg

图自unsplash


科技观察



这是科睿研究院第747篇原创内容。

字数4224字,阅读全文大约需要10分钟。


当下,智能体人工智能已经不再停留于实验室中的概念演示,而是开始进入企业流程、产业系统和日常应用场景。与传统静态人工智能模型不同,智能体 AI 更强调自主交互、动态规划、工具调用、环境适配和开放式目标执行。它不仅能够回应用户指令,还可以在一定程度上拆解任务、选择路径、调用外部资源,并在较长时间跨度内推进复杂目标。


然而,技术能力的快速扩展,也让一个基础性问题变得日益紧迫:我们究竟如何评估智能体 AI?如果一个系统能够持续行动、调用工具、改变策略,并在真实环境中与用户和外部系统互动,那么,仅仅依靠传统模型测试中的准确率、问答表现或静态基准分数,已经很难判断它的真实能力、稳定性与风险边界。


行业治理中有一句常被引用的话:无法衡量,便无法治理。 对智能体 AI 而言,这句话尤其关键。合规落地、风险管控、责任界定和社会信任,都依赖于科学、可复现、可解释、可持续更新的评估体系。当前的挑战在于,传统人工智能评估方法大多面向静态、单轮、封闭任务设计,而智能体 AI 的运行方式却是动态的、交互的、长周期的,甚至带有一定开放性。评估体系的滞后,正在让政策制定者、技术开发者、部署企业和公众都面临同一个难题:在智能体 AI 加速进入现实世界时,我们还没有足够成熟的方法去判断它究竟能做什么、会带来什么风险,以及是否真正值得信任。


2.jpg

knowledge.wharton.upenn.ed



概念认知模糊,

智能体AI缺乏统一界定标准


在人工智能领域,技术概念的标准化是搭建评估体系与治理框架的基础,但目前全球行业内尚未形成统一、公认的智能体AI定义。技术迭代速度持续领先于行业规范的制定进度,不同领域从业者对智能体核心特征的认知存在明显差异,这也从根源上阻碍了评估标准的统一落地。


不同研究视角对智能体AI的界定侧重点各不相同。部分观点将工具使用能力作为智能体AI的核心判定标准,认为能否联动外部工具、调用外部资源完成任务,是区分普通AI模型与智能体AI的关键。传统技术视角则更关注系统本身的基础能力,强调感知环境、自主规划、主动执行动作的核心属性。还有部分研究体系认为,持续自主学习、动态迭代适配场景,是智能体不可或缺的核心特质。多元的定义维度,让整个行业始终无法形成统一的评判基准。


从治理和落地的实用角度来看,强行统一单一的官方定义,并非当下最优的解决方案,也难以适配快速迭代的技术形态。任何文字化的静态定义,都会随着人工智能技术的升级逐渐滞后,一旦治理框架绑定固定定义,就会出现规则滞后于技术的问题,导致评估和治理机制失效。相比于纠结智能体AI的标准化文字定义,将智能属性视作连续的能力谱系,而非非黑即白的二元属性,具备更高的实践价值。


简单来说,无需判定一套系统是否属于“合格的智能体AI”,而是从自主性、学习能力、目标导向性、环境适配性等多个维度,量化描述系统的综合能力。这种维度化的评估思路,能够适配不同阶段、不同层级的智能体产品,不会因为技术迭代快速失效。同时,这种认知方式能够引导行业跳出概念之争,聚焦更具备实际价值的问题,包括系统的功能边界、落地价值、运行漏洞、潜在风险、影响范围,以及如何搭建通用、可靠、可落地的评估模式,为后续的技术迭代、场景部署、合规管控提供清晰依据。


3.jpg

图自unsplash


概念模糊带来的影响是全方位的。对于开发者而言,没有统一的能力评判维度,导致产品迭代缺乏明确标准;对于部署企业而言,难以精准判断不同智能体产品的适配性与风险;对于监管方而言,概念的多元化让治理规则难以精准落地,无法实现标准化的行业监管。可以说,概念认知的不统一,是智能体AI评估与治理需要解决的首要基础性问题。



多重短板叠加,

传统评估体系适配性不足


依托于传统大模型搭建的人工智能评估体系,经过多年发展已经形成了相对成熟的基准测试模式,但这套体系完全无法适配智能体AI的运行特性。智能体AI具备交互式运行、长周期作业、开放式目标、动态适配环境的特征,让传统评估方法的结构性缺陷被全面放大,形成了明显的行业评估差距,覆盖技术测试、场景适配、成本管控、落地验证等多个维度。


传统的静态基准测试,无法衡量智能体AI的运行稳定性与行为一致性。普通人工智能模型的运行模式相对固定,输出结果具备较强的确定性,单一的准确率数据可以基本反映模型性能。但智能体AI在不同时间段、不同环境、不同用户交互场景下,会呈现出随机性、非确定性的行为。实验室中优异的基准测试成绩,无法保证系统在真实场景中稳定运行。


4.jpg

图自unsplash


目前行业整体仍处于技术探索阶段,受控环境下的演示效果,和复杂真实场景下的持续落地能力存在巨大差距,尤其是在医疗、金融等高风险领域,静态测试的参考价值极低。


封闭的基准测试场景,也无法替代真实落地场景的评估。智能体AI的核心价值,在于持续与用户、外部环境、工作流程交互并自主完成目标,其运行效果高度依赖落地场景。封闭、标准化的测试环境剔除了场景中的变量与突发情况,无法模拟真实应用中的各类意外问题。这就要求行业必须依托受控试点、红队演练、真实用户持续监测等方式开展实地测试,同时对已部署的智能体系统进行长期监控,捕捉系统随环境变化、用户交互产生的行为变动。如果仅依靠基准测试,就无法发现系统的结构性漏洞,也会导致智能体AI的安全认证、合规审查缺乏可靠的证据支撑。


除此之外,通用基准测试无法适配细分领域的落地需求。不同行业的工作流程、风险标准、场景规则差异极大,智能体AI在通用场景中的优异表现,无法平移到高风险、专业化的细分场景。通用测试只能验证基础技术能力,无法衡量系统在特定行业中的实用性、安全性与可靠性,想要实现精准评估,必须结合行业专家,搭建定制化的场景评估方案。


同时,传统大模型评估存在的固有问题,在智能体AI体系中被进一步放大。训练数据污染会导致模型测试成绩虚高,很多基准任务早已被纳入模型训练语料,测试结果只能体现模型的记忆能力,而非泛化适配能力。而智能体AI需要应对全新的环境与用户需求,泛化能力是核心能力,这也让数据污染带来的评估失真问题更加严重。不仅如此,行业竞争机制容易催生基准拟合问题,开发者为了提升测试成绩针对性优化模型,却无法提升系统真实落地能力,掩盖了系统在复杂场景下的安全漏洞。


传统以准确率为核心的单一评估指标,也存在明显的局限性。智能体AI提升任务完成准确率,往往需要消耗更多的算力、更长的推理时间,产生更高的运营成本。单一的性能指标,无法体现性能、成本、效率之间的权衡关系,会导致企业的部署决策出现偏差。


5.jpg

图自unsplash


与此同时,专业的智能体评估工作成本高昂,实地测试、定制化基准搭建、长期系统监测都需要大量的技术与资金投入,这也限制了第三方评估行业的发展,让智能体AI评估难以实现规模化、常态化落地。




跨学科协同发力,

构建可持续的评估与治理体系


智能体AI的评估并非单纯的技术问题,而是覆盖技术、场景、社会、法律、管理的综合性社会技术问题。想要破解当前的评估困境,需要跳出传统以模型为核心的单一评估框架,整合技术研发、场景落地、社会影响、监管治理等多个维度,依托跨学科、跨领域的协同合作,搭建完善、可持续、可迭代的评估体系,这也是当前行业核心的研究与发展方向。


在技术评估层面,行业需要借鉴成熟的测量科学原理,重构智能体AI的评估方法论。政治学、医学、心理学等学科早已形成成熟的复杂事物评估体系,包含构念效度、内容效度、预测效度等完善的评判标准。人工智能行业无需从零搭建评估体系,而是可以借鉴成熟的测量理论,替代临时性、碎片化的测试方法,让智能体评估拥有扎实的理论支撑。


同时,行业需要持续攻克多项技术评估难题,包括搭建更贴合真实场景的人机交互模拟系统,适配个性化智能体的差异化评估标准,搭建长周期任务的可靠性测试体系,完善多智能体交互系统、分布式系统的评估方法,分层检测智能体系统的安全漏洞,精准追踪漏洞的传播路径与影响范围。


6.jpg

图自unsplash


在场景落地与社会价值层面,评估体系需要摆脱纯技术导向,聚焦真实部署效果与综合影响。一方面,针对医疗、金融、关键基础设施等高风险领域,搭建定制化、场景化的评估标准,平衡标准化测试与行业特殊风险管控需求。


另一方面,适配智能体高自主运行的特性,优化人机协同评估机制,重点评估智能体高速运行状态下的人工监督、风险干预能力,避免人工智能自主化运行导致人类监管失效。除此之外,评估范围需要进一步延伸,覆盖企业组织适配能力、行业就业影响、经济效应、环境成本等维度,全面衡量智能体AI落地的综合价值与潜在隐患。


在治理与制度层面,需要搭建适配智能体特性的问责机制、评估生态与政策框架。人工智能系统不具备法人资格,所有运行风险的最终责任需要由人类与相关机构承担,但智能体自主交互、跨平台运行、分布式作业的特性,让开发者、部署者、平台方、用户之间的责任边界变得模糊。


行业需要持续研究分层、清晰的责任划分机制,完善对应的法律法规与监管规则。同时,搭建标准化的日志审计机制,完整记录智能体的决策过程、备选方案与执行逻辑,为合规审查、风险溯源、事故调查提供依据。针对评估成本过高的问题,行业也需要探索可持续的资金模式与第三方评估生态,保障独立评估、安全审计工作常态化开展。


为持续推进智能体AI评估体系的完善,各大研究机构也制定了长期规划。布鲁金斯学会、卡内基梅隆大学、加州大学伯克利分校将持续举办系列研讨会,汇聚全球多领域专家,收集行业意见,完善研究路线图。后续还将搭建跨学科专家网络,开发开源评估工具、标准化基准体系与技术沙箱,通过持续的跨部门合作,搭建适配技术迭代速度的循证治理框架,平衡技术创新、产业落地、安全管控与公共利益。


7.jpg

brookings.edu


人工智能技术的迭代往往快于规则的更新,而智能体 AI 更是把这一矛盾进一步放大。它不再只是一个被动回应问题的模型,而是在越来越多场景中成为能够规划、调用、执行和调整行动的系统。正因如此,对智能体 AI 的评估也不可能是一套一次性完成的标准表格,而必须成为一个随着技术演进、场景变化和社会反馈不断更新的长期工程。


未来,智能体 AI 的竞争不仅是模型能力的竞争,也是评估科学、治理能力和制度建设的竞争。谁能够更准确地衡量智能体系统的能力边界、风险路径、实际成本和社会影响,谁就更有可能在创新与安全之间建立可持续的平衡。对于企业而言,评估决定了能否放心部署;对于监管者而言,评估决定了能否有效治理;对于公众而言,评估则关系到技术是否值得信任。


智能体 AI 的核心价值,在于帮助人类更高效地解决复杂问题、赋能产业发展、拓展知识与行动的边界。但这种价值不能建立在盲目信任之上,而必须建立在可靠测量、持续审计和责任清晰的基础之上。只有真正看清智能体 AI 的能力与限制,才能让它在创新迭代与安全可控之间找到平衡。也只有当行业建立起更加科学、公正和可持续的评估体系,智能体 AI 才能从令人兴奋的技术愿景,走向真正可信、可用、可治理的现实应用。



Reference List

https://www.brookings.edu/collection/agentic-ai-evaluation/

https://www.brookings.edu/articles/how-can-we-best-evaluate-agentic-ai/

https://knowledge.wharton.upenn.edu/article/whats-the-real-value-of-ai/


【本文中包含的图片均来源于网络,仅用于信息传播和新闻报道目的。我们尊重并保护所有版权拥有者的权利。若有任何版权问题,或版权拥有者不希望图片被使用,请与我们联系,我们将在收到通知后立即处理并删除相关图片。】

 往期推荐 

鲍威尔时代落幕、沃什接棒:分裂的美联储,与悬而未决的全球货币未来

被低估的海洋:行星边界框架为何需要重写?

特朗普解职美国国家科学委员会全体成员:美国基础科研体系为何震荡?

同样的感染,为何有人只是鼻塞,有人却会重症甚至死亡?藏在人体里的免疫真相


Copyright © 科睿研究院