2026-07-01 14:09
随着国产算力建设加速,如何让芯片与算力真正“跑”出效率,成为行业关注焦点。近日在京举行的“众智”大模型开放智算生态协同高级别研讨会上,中国信通院发布AISHPerf-智算运维智能体评测基准,率先将国产芯片集群运维场景纳入评测体系,填补了国产智算运维智能体评测领域的空白。
当前,人工智能发展已进入以“Token(词元)效能”为核心的新阶段。算力与电力是基础,而高效率的运维则是决定产出的关键变量。然而,业内对运维智能体的评估长期停留在语言问答能力层面的“纸上谈兵”,往往更像是“笔试”,侧重考察知识记忆与标准答案复述,而缺乏针对真实运维场景的“实战考核”,无法反映智能体能否解决实际问题。
此次发布的评测基准,则是一套基于真实生产场景的实操型评测体系,其依托无问芯穹积累的近百亿条真实运维数据,主要考核智算运维智能体在真实生产场景中解决实际问题的“实战”落地能力。评测流程不明确指出故障根因,只提供真实的集群环境和问题现象描述,要求智能体完成自主探索、排查与修复。评测覆盖5大技术栈、44种问题现象、22个故障领域及3种难度等级,最终通过时延、Token消耗等量化指标,全面评估智能体解决问题的能力。
作为我国智算产业自主可控的核心底座,国产芯片近年来实现了从 “跟跑” 到部分领域 “并跑” 的关键跨越,已成为全国算力基础设施体系的核心组成部分。但相较于成熟的通用GPU生态,国产芯片在硬件架构、驱动体系、通信协议及框架适配等层面存在显著技术差异,运维复杂度与难度更大,直接制约国产算力的Token 产出效率与投产效益,成为国产算力从“规模落地”向“效能释放”进阶的核心瓶颈。
据悉,由国内AI原生基础设施服务商无问芯穹及清华大学团队作为重点技术支持方参与建设的这一评测基准,在设计之初便融入了对国产化生态的考量。其率先在评测基准中纳入包括“天数、壁仞、沐曦、摩尔、昇腾”5种国产芯片集群运维的特定场景及典型问题,覆盖了国产GPU(图形处理器)硬件故障、驱动适配、框架兼容、通信协议等典型运维痛点,首次为国产智算运维智能体建立起统一、可量化的评估标尺。