塔斯娱乐资讯网

高通公布了下一代骁龙旗舰平台的NPU,它主要是解决手机跑大模型真正遇到的几个问题:速度、内存、功耗,以及怎么把更大的模型塞进手机。 新的Hexagon NPU加入了Element Accelerator,主要针对Transformer工作负载进行加速。现在的大语言模型、生成式AI,包括未来更复杂的Agent,基本都绕不开Transform ​

高通公布了下一代骁龙旗舰平台的NPU,它主要是解决手机跑大模型真正遇到的几个问题:速度、内存、功耗,以及怎么把更大的模型塞进手机。

新的Hexagon NPU加入了Element Accelerator,主要针对Transformer工作负载进行加速。现在的大语言模型、生成式AI,包括未来更复杂的Agent,基本都绕不开Transformer。以前手机NPU更多处理拍照、语音识别、图像识别这些相对固定的AI任务,现在已经开始直接为大模型和Agent设计专门的硬件。

第二NPU内部的大容量共享内存最高增加了50%,现在NPU内部可以留下更多数据,减少访问DDR的次数。尤其手机AI需要处理更长的上下文、多轮推理、工具调用甚至多个任务同时运行,这部分提升带来的实际体验会越来越明显。

高通给出的数据新的Hexagon NPU运行INT4模型时,预填充速度提升50%,首个Token生成时间已经低于1.5秒。预填充可以简单理解成,AI正式回答之前,先把你的问题以及前面的上下文读完。

高通还给出了一个方案MoE,也就是混合专家模型,再结合闪存动态加载。比如一个300亿参数的MoE模型,虽然总参数量达到300亿,但每生成一个Token,并不需要让所有参数同时参与运算,可能只需要激活其中大约30亿参数。剩下的专家模型可以放在手机闪存里,需要哪个,就动态加载哪个。

再配合缓存和智能调度,就有机会在有限的内存和功耗下,让手机拥有过去只有更大算力平台才能运行的模型规模。

最终落到新手机上,最大的变化会是Agent。之后可能是我只需要给它一个目标,它自己理解当前屏幕、照片、文件和对话,再进行多轮推理、调用不同工具和App,最后把事情直接做完。而长上下文、更快的推理、更大的端侧模型、更低的内存占用和功耗,这些恰恰都是Agent真正落地手机需要解决的问题。

这一代Hexagon NPU就是在给下一阶段的手机AI打基础了,从运行AI功能,开始走向真正运行一个端侧Agent,确实很有前瞻性了可以说。