高通第六代骁龙8至尊版携Hexagon NPU亮相,为终端AI智能体注入新动力

   时间:2026-09-11 11:18 来源:快讯作者:沈瑾瑜

高通近日在其官方平台发布消息,正式推出专为下一代AI智能体设计的全新一代神经网络处理单元(NPU)——Hexagon NPU。这款创新芯片被集成于第六代骁龙8至尊版系列中,通过架构升级与关键技术突破,为终端侧AI应用带来革命性提升。

核心升级之一是全新设计的Element Accelerator模块。该模块针对生成式AI和智能体AI中广泛使用的Transformer架构进行优化,通过向量计算单元与标量计算单元的深度协同,显著加速大模型中的矩阵运算与逻辑控制。高通技术团队透露,这一设计使智能体在移动端实现毫秒级响应,同时将推理能效提升至行业领先水平,为实时语音交互、多模态内容生成等场景提供硬件支撑。

内存系统的革新同样引人注目。Hexagon NPU配备的超大容量共享内存,将多模型状态、上下文信息及KV-cache数据存储位置向计算核心大幅靠近。这项改进有效解决了传统架构中的内存带宽瓶颈,使得智能体在处理超长文本、调用复杂工具链或执行多任务并发时,仍能保持流畅运行。实测数据显示,在处理10万token以上的上下文时,系统延迟降低达40%。

协同架构的构建是本次升级的另一亮点。Element Accelerator、扩展计算单元与共享内存形成闭环系统,不仅优化了Transformer工作负载的处理流程,更通过数据本地化策略减少内存访问次数。高通工程师举例说明,在执行复杂决策任务时,该架构可将中间数据保留在计算单元周边,避免传统架构中频繁的数据搬运,从而提升整体运算效率。

面向未来模型架构的兼容性设计,彰显了高通的战略前瞻性。通过与头部内存厂商及AI模型开发者深度合作,Hexagon NPU率先支持混合专家模型(MoE)的终端部署。这种创新架构允许300亿参数的MoE模型在运行时仅激活约30亿相关参数,较传统密集模型减少90%的计算负载。配合智能的内存管理机制,终端设备可在低功耗条件下实现百亿级参数模型的实时推理。

隐私保护与能效优化的双重突破,为消费电子市场注入新动能。基于MoE架构的终端侧AI方案,使所有数据处理均在本地完成,彻底消除云端传输的隐私风险。同时,动态参数激活技术将内存带宽需求降低65%,配合先进的缓存策略,使得智能手机等移动设备能够持续运行复杂AI应用而无需频繁充电。这项突破或将重新定义生成式AI在消费领域的落地方式。

 
 
更多>同类内容
推荐图文
推荐内容
点击排行
 
智快科技微信账号
ITBear微信账号

微信扫一扫
加微信拉群
电动汽车群
科技数码群