Arm Everywhere China大会举办:全栈技术发布,打造面向智能体时代无处不在的计算平台
【小熊在线】2026年9月8日上海 — Arm控股有限公司(纳斯达克:ARM)今日举办Arm Everywhere China年度大会,大会以“赋能AI计算的未来”为主题,近2000名产业链领袖、开发者与生态伙伴参会。结合此前Arm Tech Day三场技术沟通会披露的底层技术细节,Arm集中发布覆盖移动端边缘AI、物理AI、云端AI基础设施的全套技术与生态计划,构建横跨云‑边缘‑物理世界的统一计算连续体,迎接智能体AI时代到来。

Arm执行副总裁兼首席商务官Will Abbey表示:“Arm全球合作伙伴累计出货基于Arm技术的芯片已经超过3500亿颗,中国创新者是这一全球创新历程中的关键力量。面向智能体时代,Arm依托统一计算平台与软件生态,携手国内伙伴加速技术落地,为新一代AI应用筑牢计算底座。”
当前AI正从生成式AI演进至智能体阶段,智能体不仅完成推理,还需要维护上下文、调用工具、自主执行任务,计算负载走向分布式、异构化。智能体体验并非依靠单一加速器实现,而是需要CPU、GPU、各类专用加速器的系统协同调度。Arm本次发布多项硬件IP、计算子系统与生态协作框架,分别在边缘移动终端、物理实体世界、云端数据中心三大场景补齐能力。
边缘移动:CSS for Mobile 2 AI原生计算平台,赋能端侧智能体与神经图形
大会正式推出第二代移动终端计算子系统CSS for Mobile 2,该平台由原Lumex 2更名而来,采用简化命名体系,清晰定位移动场景;平台整合全新CPU集群、GPU、系统IP(SI L2)与完整软件套件,助力芯片厂商快速打造差异化产品,降低开发者AI应用开发门槛。SI L2互联子系统除支持LPDDR6之外,同时向下兼容LPDDR5、LPDDR5X内存标准;合作伙伴即便不选用SI L2,也需要自行完成系统级优化,释放整套平台的完整性能。

全新Mali G2‑Ultra NX GPU是首款集成专用神经网络加速器NX的Mali GPU,NX单元深度集成于着色器内核,空闲状态支持电源门控,芯片面积开销可控,图形运算与神经网络计算可在同一管线协同执行。神经网络场景每瓦性能最高提升4倍;传统游戏性能相比上代提升14%,搭载第三代光线追踪单元RTUv3,依靠更加紧凑的三角形数据结构,光追场景最高降低13% DRAM带宽占用,支撑移动端接近桌面级的光追与神经图形应用。
硬件配套NSS神经超级采样、NSSD神经超分降噪、NFRU神经帧率提升技术,当前NFRU可实现两帧之间生成一帧AI插帧,未来将迭代支持更多倍数帧生成;为规避帧生成带来的延迟升高、操作跟手性变差的问题,可通过降低原始渲染分辨率、多档质量模型选择,配合帧步调(Frame Pacing)机制做动态平衡。在高复杂度Demo《光影新生》场景下,整套神经图形方案最高可降低70% DRAM流量。Arm的神经图形基于卷积CNN网络对原始渲染画面做细节重建,并非大模型式内容生成,模型对外开放,芯片厂商可根据设备功耗散热条件做二次定制,同时Arm正联合腾讯游戏探索神经动态全局光照等下一代技术。

目前,网易《燕云十六声》、腾讯《暗区突围:无限》、叠纸《无限暖暖》等游戏正在落地神经超级采样(NSS)、神经超级采样与降噪(NSSD)技术;Unity团结引擎、腾讯Magic Dawn游戏中台完成技术适配,vivo等终端厂商也已开启相关技术预研与产品适配。G2‑Ultra NX以软IP形式交付,合作伙伴可以自主配置着色器核心、NX单元数量、频率与工艺节点,实现SoC差异化定制。

同步亮相的C2 CPU集群包含旗舰C2‑Ultra、能效优化C2‑Pro,搭载双SME2单元。C2 CPU集群承担智能体的系统编排核心角色,依靠私有L2缓存+大容量共享L3缓存的拓扑架构,有效缓解端侧内存密集型工作负载瓶颈;集群硬件最高支持14核灵活配置,芯片厂商可根据智能体负载需求选择核心规模。对比上代C1‑Ultra,C2‑Ultra在GeekBench 6.3单线程基准测试提升15%;面向语音、推理等AI负载,实现AI性能最高1.7倍提升,同等性能条件功耗降低38%;翻倍的SME2算力可将轻量级小语言模型运行速度提升最高70%。两组数据差异源于测试场景不同:前者代表通用CPU能力,后者针对矩阵运算密集的AI推理任务。
Arm并未对“轻量级模型”设置硬性参数门槛,行业典型代表为20‑30亿参数区间模型,如Gemma‑2B、腾讯混元HY‑1.8B‑2Bit。SME2硬件架构延续前代,支持2nm先进工艺,如今几乎全部安卓、iOS旗舰手机均已搭载该技术。SME2生态持续扩张,依托KleidiAI软件库新增大量内核与查找表指令,支付宝、OPPO、vivo、阿里巴巴通义千问等企业已经完成技术适配,实现语音大模型等AI能力高效端侧运行。硬件仅提供算力缓存资源,智能体短期、长期记忆的管理逻辑依赖上层软件框架实现,端侧智能体规模扩大后,内存往往优先于算力成为系统瓶颈。
在异构分工层面,CPU更聚焦低延迟任务,而非单纯追求峰值算力;超高计算密集负载更适合交给GPU或NPU。手机端Arm不主推自研NPU IP,将手机NPU差异化创新交给合作伙伴,自研NPU重点布局物联网市场。第一方应用对NPU适配成熟,第三方开发者更倾向使用通用性更强的CPU、GPU开发;CPU/GPU/NPU的任务调度逻辑由SoC厂商软件层完成,Arm不提供统一调度层,仅输出硬件与优化工具。软件层面,Arm提供 KleidiAI、神经图形开发套件,以及全新AI Portal,该工具同时面向人类开发者与AI智能体,支持智能体自主检索调用优化模型,为开发者和AI智能体提供统一入口获取优化模型与工具资源。
物理 AI:扩展全面设计生态,发布机器人能力分级框架
为推动智能从数字世界走向现实物理世界,Arm将Arm全面设计生态项目拓展至物理AI领域,集结亚马逊云科技、Hugging Face、通义千问、西门子等超过80家行业伙伴,覆盖AI模型、传感器、硬件、数字孪生完整技术栈,降低机器人、自动驾驶、工业自主系统的集成难度,挖掘物理AI每年约2000亿美元的计算市场机遇。

生态首个核心成果为机器人能力分级框架(Robotics Capability Framework),对标自动驾驶SAE分级体系,建立机器人行业通用“能力语言”。框架划分RL0‑RL5六个等级,从RL0应激反应,逐步演进至RL5自我迭代优化,从系统行为、典型输出、算力功耗安全约束多维度定义机器人能力。Arm将联合傅利叶、银河通用、联想、Anaxi Labs等企业持续迭代完善这套框架,解决行业标准碎片化难题,加速具身智能规模化落地。多家生态伙伴表示,统一分级框架将简化机器人产品设计、系统集成,推动整个价值链高效协同。
云端基础设施:Neoverse CSS N4与AGI CPU,构建智能体AI云底座 根据IDC数据,Arm架构机架级服务器市场规模已经超越x86,成为加速计算领域主流平台。针对智能体AI多样化算力诉求,Arm提供两条技术路线:可高度定制的Neoverse CSS N4计算子系统,以及量产就绪的Arm AGI CPU,二者共享统一Neoverse软件生态。
Neoverse CSS N4是Arm迄今为止可配置性最强的CSS平台,单裸片最高支持128核,兼容LPDDR6内存、PCIe Gen7互连。对比前代N3,整体性能最高翻倍,每瓦性能提升1.25倍,内存带宽提升1.75倍,面向横向扩展高吞吐场景,帮助合作伙伴缩短定制芯片开发周期,鸿钧微电子成为首批采用该平台的企业。

Arm AGI CPU面向高响应智能体工作负载,OpenAI、Meta、Oracle等全球企业基于该平台开发解决方案。国内,火山引擎推出首批基于Arm AGI CPU的智能体沙箱,提供安全弹性的大规模智能体运行环境;联想打造Token驱动的AI基础设施方案。同时Arm宣布与新紫光集团深化战略合作,计划共建联合通用人工智能创新中心,聚焦智能体编排、CXL内存池化、机架级系统架构、边缘AI等关键方向,打造适配中国市场的AI基础设施体系。
生态协同,推进智能无处不在
从云端诞生智能,到边缘实现个性化体验,再到物理世界执行行动,Arm构建起完整统一的计算底座。面向超过2200万开发者,Arm通过AI Portal打通模型、工具、智能体的访问通路,让开发者能够跨云‑边缘‑物理设备便捷部署AI应用。跨设备智能体完全无缝迁移目前还无法完全实现,Arm致力于打造统一底层计算基座,完整体验仍需要整个上下游生态协同演进。
Arm表示,智能体时代的性能不再由单一加速器定义,而是依靠系统级协同。未来 Arm 将持续联合国内芯片厂商、终端企业、游戏引擎、云服务商、机器人企业,打通软硬件全链条,推动智能体 AI、神经图形、物理 AI 的规模化产业落地。
大家都在看
重磅推荐

鸿蒙7重磅上线!看剧有疑问?华为视频专属AI随叫随到

Arm 为智能体时代打造无处不在的计算平台

TCL实业IFA 2026“灵感栖居”展区亮相:屏显到家庭全场景,“AI Inspired Life”启迪未来生活灵感

TCL实业IFA 2026冰洗旗舰新品重磅首发,以AI重塑智慧锁鲜与洁净体验

TCL 实业携小蓝翼 P7 Ultra 亮相IFA 2026,“AI 安寝之眼”睡眠科技定义健康睡眠新体验

Vertiv宣布达成收购UtilityInnovation Group的协议,加速AI数据中心供电速度

马瑞利携手微芯科技率先推出面向软件定义汽车的开放标准显示连接解决方案

海信IFA2026发布AI伴侣套系,加速从智能设备到智能伴侣升级
官方微博






