2026年,智能体AI正从概念走向落地。与传统的“你问它才答”的对话式AI不同,智能体需要持续感知、持续规划、持续调用工具,芯片必须在长时间内稳定输出性能。骁龙新一代旗舰平台正是为智能体时代的用户需求而设计,在CPU、GPU、NPU三大核心模块上同时发力,用实打实的技术升级回答了一个核心问题:智能体时代的芯片,应该长什么样?

CPU:智能体的“总调度官”
全新Qualcomm Oryon CPU最高主频达到5GHz,成为首个迈过这一门槛的移动CPU。但比频率更值得关注的是高通给这颗CPU的定位——智能体AI的“总调度官”。智能体不是执行单一指令,而是一连串任务的协同。用户发出一条指令,背后可能转化为多个步骤:理解意图、拆解任务、调用工具、跨应用操作。5GHz确保单步任务极速响应,FlexCache缓存架构则确保任务在核心间切换时数据不丢失、不重载。
FlexCache的核心逻辑是:将L2缓存统一为所有核心都能直接访问的共享缓存池,并可动态调整资源分配。当高负载任务需要更强算力时,超级内核可以充分利用整个缓存池,更大的工作集能够驻留在缓存中,无需频繁回写至系统内存。高通在博客中明确表示,即便在内存受限的情况下,也能维持性能表现。

GPU:AI第一次住进图形管线
新一代Adreno GPU延续三切片架构,频率从1.2GHz提升至1.45GHz。但真正改变游戏规则的是三个层面的架构重构。
18MB Adreno HPM片上高速显存,让渲染过程中的中间数据直接存在片上,无需反复前往系统内存,带来约12%的功耗改善。Adreno Matrix Cores首次将AI专用矩阵核心引入GPU,神经网络计算不再需要离开图形渲染管线即可完成。Adreno Neural Fusion则将AI超级分辨率和帧生成融入渲染流程,与上一代方案相比功耗最高可节省40%。
NPU:让300亿参数模型住进手机
新一代Hexagon NPU引入了两项关键特性:Element Accelerator,专为Transformer工作负载打造,结合向量计算单元和标量计算单元,让NPU同时处理“重计算”和“轻调度”两类任务;共享内存最高提升50%,让模型状态、上下文信息和KV缓存数据存储在更靠近加速器的位置。
在模型层面,新一代NPU支持在终端侧运行300亿参数的混合专家(MoE)模型,每次生成一个词元仅激活约30亿个被路由选中的参数。高通与内存和模型厂商合作,构建了从闪存到内存的智能模型加载机制,让庞大的MoE模型存储在闪存中,用到哪个“专家”再临时加载。
性能数据同样具体:对于INT4精度的模型,预填充性能提升最高50%,40亿参数模型首个Token生成时间低于1.5秒。端侧AI不再是“小模型跑着玩”,而是真正具备承载智能体复杂推理任务的能力。

三个模块,同一个设计逻辑
值得一提的是,高通并没有把CPU、GPU、NPU当作三个独立的升级项目来推进,三个模块的技术方案背后贯穿着同一个设计原则——让数据离计算更近。
CPU的独立时钟域解决“算力精准分配”,FlexCache解决“数据就近驻留”;GPU的18MB HPM让渲染中间数据留在片上,Matrix Cores让AI计算不再离开图形管线;NPU的共享内存扩容让模型状态和KV缓存更靠近加速器,MoE架构用“按需激活”的方式让大模型的计算量只发生在真正需要的那部分参数上。三个模块,三种技术路径,但底层逻辑一致——让智能体在手机上的每一次推理、每一次响应、每一次任务切换,都能以最低的功耗代价完成。
智能体时代的芯片应该长什么样?骁龙新一代旗舰平台给出的答案不是某一项参数的领先,而是一套贯穿三大模块的设计逻辑——不是让某个模块跑得更快,而是让整个平台的数据流转更高效、能效更可控。当AI从“工具”进化为“伙伴”,芯片的价值不再由跑分峰值定义,而是由它能支撑智能体在手机上做多少事、做得多快、做得多省心来定义。
推荐阅读: