前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
洞察/09.23 · 16:06/4 MIN/编译自 节点财经/0 阅读

端侧AI爆发前夜:芯片、模型与终端的落地之战

云端大模型狂飙之后,端侧AI正借助NPU成熟与模型能力密度的跃升突破功耗与成本瓶颈。随着手机、PC和智能座舱集体入局,芯片、模型与系统级Agent的生态战已全面打响。

过去几年,AI 行业的核心叙事始终围绕云端算力的 Scaling Law 展开。数据中心堆满 GPU,千亿乃至万亿参数模型层出不穷。然而,这些庞然大物只能运行在机房内,与离消费者最近的终端设备隔着一道物理鸿沟。

如今,一股去中心化的力量正在崛起。AI 手机、AI PC、智能汽车乃至具身智能设备密集推向市场。Gartner 预计,到 2026 年全球 AI PC 出货量将占据 PC 市场的半壁江山;Counterpoint 同样预测,具备生成式 AI 能力的智能手机将在同年拿下 45% 的市场份额。最顶级的超级大脑依旧坐镇云端,但高频、低延迟且深度绑定用户隐私的任务,正全面下沉至终端。

为什么模型必须下沉到本地?

云端与端侧的核心差异,本质上是“外包”与“内置”。

调用云端模型,推理必须通过网络将请求发送至数据中心,计算完成后再传回结果。而端侧 AI 参数规模通常在几 B(数十亿)级别,推理过程直接在本地离线运行。

尽管小参数模型的绝对能力不及云端大模型,但轻量化与本地部署带来了无法替代的三大优势:

  1. 响应延迟:未来的 AI Agent(智能体)往往涉及多步复杂拆解,若每一步操作都与云端往返通信,延迟将严重破坏交互体验;
  2. 调用成本:长周期、高频次调用的云端 Token 会转化为高昂的算力账单,本地推理则能大幅分摊运营成本;
  3. 数据隐私:当 Agent 深度介入操作系统,触及的是个人照片、私聊记录与账号权限。敏感数据离开设备不仅带来合规风险,更是阻碍用户信任的最大门槛。

因此,本地小模型负责隐私感知与高频任务、云端大模型负责复杂逻辑的端云协同,成为产业界的共识架构。

突破“不可能三角”:为什么发生在当下?

将模型塞进物理空间逼仄、散热与续航极度敏感的消费级设备,历来面临性能、功耗与成本构成的“不可能三角”。端侧 AI 之所以在当前节点迎来突破,依托于底层硬件与算法的协同演进:

  • 异构算力成熟:芯片厂商不再单纯堆砌通用算力,而是将 NPU 打造为消费电子的标准配置。高通、华为、瑞芯微等厂商针对推理场景展开极致优化,通过共享内存降低数据搬运功耗,甚至针对长上下文与 MoE 架构改造底层硬件。
  • 能力密度飞跃:模型蒸馏、量化压缩与稀疏注意力等工程手段,大幅拉高了小参数模型的性能上限。清华大学与开源社区 OpenBMB 提出的“密度定律”表明,大模型的能力密度约每百天翻一番。以面壁智能开源的 MiniCPM5-2B 为例,仅 2B 参数便具备了工具调用与代码生成能力。
  • 操作系统重构:若端侧 AI 局限在独立应用内,它便无法调用底层能力。阶跃星辰的 Step AOS 以及主流手机厂商的自研大模型,正将操作系统的原子权限转化为可被 Agent 调用的标准化工具。

产业链分化:四类核心玩家入场

随着端侧技术闭环跑通,不同商业路线的竞争也逐渐显现:

  1. 横向模型供应商:以面壁智能为代表,核心路径是将模型做到极小极强,并跨平台适配不同硬件。其 MiniCPM 系列已渗透至三星手机、长安马自达智能座舱及园区巡检机器人中。科大讯飞也开源了星火 X2.5 端侧模型,强化其办公与语音生态。
  2. 芯片与计算平台玩家:瑞芯微通过 SoC、NPU 与工具链向硬件厂商赋能;地平线则更进一步,基于征程系列芯片打通算法与软件栈,以软硬一体平台构筑车端壁垒。
  3. Agent 入口争夺者:如字节跳动与努比亚合作打造的豆包手机。其核心逻辑并非单纯造硬件,而是借助手机作为物理载体,通过端侧 MCP 调度跨应用权限,在移动操作系统上争夺 Agent 时代的超级入口。
  4. 纵向全栈整合者:阶跃星辰推出了终端品牌 STEPX,同时布局汽车生态与 Step AOS,试图完成从基座模型、Agent 系统到硬件终端的纵向贯通,掌控交互感知与工具调用的全链条。

在这四类核心角色之外,如德赛西威这类系统交付集成商也在快速兴起,负责针对不同算力规格与成本预算,组合出最具性价比的软硬件落地方案。

云端竞赛证明了 AI 智力的极限,而端侧战争考量的则是如何在功耗、成本与体验的严苛约束下,把智能无缝嵌入真实硬件之中。

标签:AI手机

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

Transformers 直接跑 GGUF:Python 追平 llama.cpp
置顶

Transformers 直接跑 GGUF:Python 追平 llama.cpp

tokenizers v1 最高快 30 倍,中文却只快 6.8 倍
置顶

tokenizers v1 最高快 30 倍,中文却只快 6.8 倍

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
亚马逊封杀 Meta Muse:问题不在 AI 购物,在浏览器跑在谁的机器上
置顶

亚马逊封杀 Meta Muse:问题不在 AI 购物,在浏览器跑在谁的机器上

//

24小时热榜

Expedia 接入 Meta Muse 智能体:可直接预订行程
TOP1

Expedia 接入 Meta Muse 智能体:可直接预订行程

NVIDIA 发布 Isaac ROS 5.0:引入智能体工作流
TOP2

NVIDIA 发布 Isaac ROS 5.0:引入智能体工作流

3

OpenAI公布第三方AI安全评估的四大重点与七项原则

11小时前
OpenAI公布第三方AI安全评估的四大重点与七项原则
4

OpenAI升级GPT-6提示词缓存:最高立减90%成本

11小时前
OpenAI升级GPT-6提示词缓存:最高立减90%成本
5

安全公司 Trail of Bits:SAML 是设计上的失败,该退役了

18小时前
安全公司 Trail of Bits:SAML 是设计上的失败,该退役了
6

工程师用 gzip 做语言模型:靠压缩长度打分生成文本

18小时前
工程师用 gzip 做语言模型:靠压缩长度打分生成文本
7

OpenAI 发布 GPT-6 Sol 与 Luna:性能比肩旗舰,API 降价 50%

11小时前
OpenAI 发布 GPT-6 Sol 与 Luna:性能比肩旗舰,API 降价 50%
8

OpenAI 发布 Astra for Law:法律专属 AI 基础平台

18小时前
OpenAI 发布 Astra for Law:法律专属 AI 基础平台
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断