高通公布新一代 Hexagon NPU:强化端侧 AI 推理与大模型支持

Hasu | 2026-09-10 21:01

高通公布了新一代 Hexagon NPU 的部分技术细节。新 NPU 将应用于下一代骁龙顶级移动平台,主要围绕大模型运算、共享内存以及混合专家模型进行优化,以提升端侧生成式 AI 和智能体应用的响应速度与运行效率。

新一代 Hexagon NPU 首先引入了 Element Accelerator,可以理解为一组专门面向大模型关键运算的加速单元。它主要针对当前生成式 AI 和智能体 AI 广泛采用的大模型架构进行优化,并配合向量和标量计算单元,提高模型推理中的关键计算效率,从而改善智能体的响应和推理速度,同时兼顾移动设备的功耗需求。

内存系统也是此次 Hexagon NPU 升级的重点,其大容量共享内存较上一代增加 50%。更大的片上共享内存可以让模型的上下文信息,以及生成过程中需要反复调用的关键数据更多地保留在 NPU 内部,减少频繁访问系统内存的次数,从而降低数据读取延迟,并为其他任务释放更多内存带宽。

这一变化主要面向越来越复杂的端侧 AI 工作负载。随着本地模型需要处理更长的对话和文本内容、更复杂的推理过程、更多工具调用以及多个并发任务,减少 NPU 与外部内存之间的数据交换,可以让更多计算资源集中用于模型推理本身。

在模型运行速度方面,高通公布的数据显示,新一代 Hexagon NPU 面向 40 亿参数模型的输入预处理性能提升 50%。这一阶段主要负责读取和理解用户输入及已有上下文,处理速度提升后,可以缩短模型正式开始生成回答前的等待时间。在 40 亿参数模型下,高通给出的首个生成内容响应时间低于 1.5 秒。

新一代 Hexagon NPU 同时支持更多不同的计算精度,包括 INT2、INT4、INT8、FP8 和 FP16。简单来说,开发者可以根据不同模型和应用需求,选择不同的数据精度,在运行速度、内存占用、模型效果和功耗之间进行更灵活的调整。

除了传统端侧大模型,高通还针对 MoE,也就是“混合专家模型”进行了优化。这类模型内部包含多个擅长不同任务的“专家”,运行时可以根据当前需求,只调用其中一部分参与计算。例如,一个拥有 300 亿参数的混合专家模型,在执行特定任务时可以只激活约 30 亿参数,同时保持其他专家随时可被调用。

为了让更大规模的混合专家模型能够在移动设备运行,高通还加入了面向闪存和运行内存的专家模型管理机制。系统可以根据当前任务,从闪存中调取需要使用的专家,并利用专门的缓存方式管理相关数据,从而减少大模型长期占用运行内存的需求,在较低内存占用和功耗下支持更大规模的模型能力。

高通希望借此将更复杂的推理和规划能力进一步放到端侧。例如在行程规划等智能体任务中,本地模型可以根据日程进行任务拆解,协调交通、住宿等不同工具完成连续操作。混合专家模型的意义也在于,让手机可以在有限的内存和功耗条件下获得更接近大规模模型的推理与规划能力。

关于高通下一代旗舰移动平台的更多信息,可持续关注锋潮科技后续在高通骁龙峰会上为大家带来的报道。

 

喜欢数码科技资讯的你,就记得点击订阅啦。
关注「锋潮评测室」微信公众号【微信号:fengchaopingceshi】,还会送上更多你想要的哦~

相关标签: 高通 骁龙
71