高通推出2nm旗舰芯片第六代骁龙8超级至尊版。该平台针对端侧AI智能体彻底重构CPU、GPU和NPU架构,突破5GHz主频,支持端侧运行300亿参数MoE大模型,标志着移动计算全面迈入智能体时代。
“我们正在从以手机为中心的模式,转向以智能体为中心的新体验。手机、PC、眼镜、可穿戴设备以及汽车,都将成为智能体的终端入口。”在 2026 骁龙峰会上,高通公司总裁兼 CEO 安蒙指出。

过去二十年,智能手机始终围绕 App 运转。而 AI 智能体则需要全天候感知环境、理解上下文,并在无需用户实时操作的情况下自主执行复杂任务。这种全新的工作流要求计算架构彻底重构:CPU 负责智能体编排调度,NPU 高效处理 AI 推理,GPU 承载并行渲染与计算,协同通信能力也提升到了前所未有的高度。
为此,高通首次同时推出两款 2nm 制程移动旗舰平台——第六代骁龙8超级至尊版和第六代骁龙8至尊版。

其中,位于产品序列顶端的超级至尊版集成了多项突破性规格:最高主频达到 5GHz 的 Oryon CPU、首次引入 Matrix Cores(矩阵核心)的 Adreno GPU,以及支持在端侧运行 300 亿参数 MoE(混合专家)模型的 Hexagon NPU。

第六代骁龙8超级至尊版最惹眼的参数是 5GHz 的 CPU 主频。

但端侧 AI 智能体真正的痛点在于“内存墙”与续航限制,而非单纯的峰值算力。模型推理需要高频读取权重、上下文、KV-cache 及中间计算结果。数据若在片上存储与系统内存间频繁搬运,会造成极大的延迟与功耗浪费。
为了打破内存墙,高通对整套 SoC 展开了系统级重构:



结合对 LPDDR6 内存与 UFS 5.0 闪存的支持,大模型权重能够常驻高速闪存,并按需快速调入内存,从片上到系统各层级缓解数据搬运压力。
AI 智能体需要全天候执行“感知—理解—规划—执行”的闭环,单靠某个特定计算单元无法承载这一复杂的异构负载。

在第六代骁龙8超级至尊版上,各模块达成了明确分工:

这一架构最直观的落地成果,是手机端侧成功跑通 300 亿参数的 MoE(混合专家)模型。
该模型在推理生成每个 Token 时仅激活约 30 亿参数,在模型知识容量与移动设备的功耗、内存上限之间找到了极佳的平衡点。

高通联合阶跃星辰、无量火、江波龙,成功将 StepEdge-Omni 30B-MoE 部署在手机端。得益于异构调度与存算协同,该方案使模型运行内存占用降低逾 50%,预填充速度突破 330 Token/s,解码速度超过 28 Token/s。NPU 与 GPU 双引擎协同使预填充吞吐量提升了 30% 以上,能够顺畅处理邮件理解、行程规划、日历同步及酒店航班推荐等一连串复合任务。

配合升级的第二代 AI-ISP 架构,手机不仅实现了 8K 60fps 视频拍摄,还能将高帧率视觉数据实时转化为多模态大模型可理解的连续上下文。

AI 智能体的边界绝不仅限于一部智能手机,它还将延展至 PC、XR 眼镜与智能座舱。但手机因其随身性、情境感知能力和连接枢纽地位,依然是离用户最近的个人 AI 入口。
在这一演进路径下,旗舰芯片的评判维度已发生根本性转变:行业不再单纯追逐 CPU 或 GPU 的短时峰值跑分,而是聚焦在严苛的发热与续航边界内,能否支持 AI 智能体实现全天候感知、持续推理与多设备端云协同。
5GHz 频率与 30B MoE 模型的端侧落地只是外在显现,底层对内存墙的系统级攻克与异构协同调度,才是第六代骁龙8超级至尊版交出的答卷。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断