国产AI算力抢占首发窗口,超大模型发布首日多芯适配
北京日报客户端 | 记者 孙奇茹

2026-08-13 19:49 语音播报


8月13日,阿里巴巴开源超大规模模型Qwen3.8-2.4T-A95B,这款总参数达2.4万亿的模型,是阿里巴巴开源模型系列中规模最大、能力最强的一代。模型发布当天,基于北京智源人工智能研究院牵头研发的开源系统软件栈FlagOS,Qwen3.8-2.4T-A95B模型已实现在平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、清微智能、燧原等9款AI芯片上的适配,其中8款为国产芯片。

相比于此前的Qwen3.5-397B,本次开源的Qwen3.8-2.4T-A95B模型参数规模扩大了6倍。为了让当下已经部署的主流AI芯片能“跑”起来这一超大模型,Flag OS需要解决因参数规模巨大带来的系统优化挑战。基于众智Flag OS已构建的从编译器、算子库、多芯片框架统一插件等技术,研发团队得以快速完成了模型压缩量化、跨芯适配及验证、精度对齐评测、开源版本发布等重要步骤。

对国内云厂商、智算中心和新兴词元算力服务商而言,每一次大模型发布都意味着新一轮的模型迁移与底层适配。用户希望第一时间在各种国产AI算力上使用最新模型,但不同芯片的适配链路相对独立,往往需要重复投入大量工程资源。上线速度因此不仅关乎技术能力,更直接决定了云服务商能否抓住新模型发布后的市场窗口。

智源相关人士表示,这一痛点对中小型词元算力服务商尤为突出。由于采购规模和技术资源有限,它们往往难以推动芯片厂商针对单一模型开展专项适配,也难以长期维持完整的底层适配团队,因而更加需要Flag OS这样的开源第三方平台提供公共技术支撑。目前,Flag OS将新模型从发布到多芯可用的周期压缩至24小时以内,使中小型算力服务商能够基于国产芯片快速上线推理API(应用程序编程接口)和MaaS服务,无需重复投入大量人力进行底层开发。

从今年2月首次开展MiniCPM4.5-o模型的多芯片当日适配,到今天实现Qwen3.8-2.4T模型在9款芯片上的当日适配,Flag OS已累计完成来自7大头部模型团队、12款主流开源模型、覆盖多达10款芯片的跨芯适配,也向AI芯片与大模型产业验证了:基于统一、开放的国产系统软件栈,实现前沿模型“一次开发、多芯快速适配”已具备规模化落地的能力。

AI进化论

编辑:孙奇茹

打开APP阅读全文
APP内打开