前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
产品/09.28 · 09:21/4 MIN/编译自 雷锋网/0 阅读

Imagination发布E系列GPU:端侧AI提速4.7倍

Imagination发布最新E系列GPU IP架构,强化矩阵运算并引入低精度格式MXFP8/MXFP4,大模型Prefill阶段性能提升4.7倍;结合神经核与分块延迟渲染技术,AI超分使画面分辨率翻倍仅需2.3毫秒,大幅优化端侧AI与图形渲染效率。

越来越繁重的 AI 计算正加速涌向消费电子、智能汽车和机器人等终端设备。运行本地大语言模型与 AI 智能体、同时处理多模态感知数据,成为底层芯片必须直面的核心负载。

面对算力整合,芯片架构通常有两种选择:引入专用 NPU,或是扩展既有处理器的计算边界。在经历过专用硬件因模型与算子迭代过快而导致软件维护成本高企后,GPU 架构老牌厂商 Imagination 选择将重心全面收拢回通用性更强的 GPU,正式推出全新 E 系列(E-Series)GPU IP。

E 系列架构强化了矩阵乘法、低精度运算和卷积能力,将图形计算与 AI 负载深度整合至统一可编程架构中,致力于减少片上数据搬运并降低跨架构适配的软件成本。

Imagination E系列性能展示

植入神经核,AI 超分仅需 2.3 毫秒

在 3A 桌面游戏场景中,四核配置的 E 系列可使部分游戏帧率突破 60FPS。这一提升的关键在于引入了专用 Neural Core(神经核)进行 AI 超分辨率重建。

传统异构方案往往由 GPU 负责原生低分辨率渲染,再将画面写入 DDR 内存交由独立 NPU 超分并回写,内存带宽开销极大。E 系列将矩阵计算能力深度嵌入原有微架构着色器管线中,使图形数据可就近接入神经网络处理。配合自研的神经超分辨率算法与压缩技术,模型存储和读取数据量大幅精简。

测试数据显示,单核 E 系列将画面从 540p 提升至 1080p 仅耗时 2.3 毫秒;在拉升至 4K 分辨率的场景中,带宽消耗最高降低 54%,帧率达到基准对比的 2.5 倍。

AI超分辨率与分块延迟渲染表现

此外,E 系列沿用了经典的 TBDR(基于分块的延迟渲染)架构。相比整帧展开渲染,TBDR 将屏幕拆解为密集 Tile 逐块渲染,中间数据得以驻留片上,再结合 Tile 级的 AI 超分处理,大幅抑制了高频外部访存。微架构层面对 ALU 执行机制的重组亦进一步减少了寄存器交互,带来最高 39% 的每瓦性能提升。

ALU执行机制与每瓦性能优化

引入低位宽计算,Prefill 吞吐跃升 4.7 倍

除图形场景外,E 系列的矩阵算力重点瞄准了端侧大语言模型推理及 AI 智能体任务。在推理全流程中,Prefill 阶段决定了首 Token 延迟(TTFT),而 Decode 阶段则制约着单 Token 生成速度(TPOT)。

大模型推理Prefill与低精度计算支持

E 系列首次引入了面向大模型推理的 MXFP8 和 MXFP4 等微缩浮点格式。依靠硬件级低精度吞吐优势,Prefill 阶段性能相比上一代提升达 4.7 倍。同时,低精度量化大幅缩减了模型权重占用的显存空间,减轻了 Decode 阶段对总线带宽的争抢。系统层面,E 系列通过 AXI 总线接口支持接入 LPDDR、GDDR 及 HBM,最高可支撑 768GB/s 的读取带宽。面向端侧视觉与感知需求,E 系列的卷积运算性能亦达到了前代的 4.4 倍。

统领统一软件栈与异构协同

在软件生态方面,E 系列允许开发者通过 OpenCL、Vulkan 编写底层 Kernel,同时支持直接对接 Llama.cpp、ONNX 和 PyTorch 等主流框架。统一的跨代软件栈保证了算子与精度调优成果能够直接复用,部分嵌入式芯片客户已开始评估用具备通用 AI 能力的 GPU 替代独立 NPU,从而精简驱动与工具链维护。

不过,异构协同仍然是复杂终端的核心形态。例如在 Agent PC 体系中,CPU 依然负责任务流分发与工具调度,密集模型计算则卸载给 GPU;在自动驾驶和机器人领域,GPU 同样需要与专门的控制及感知核心协同。为此,E 系列在硬件层面支持 Mailbox 状态通信,并凭借低开销共享内存技术,进一步压低了跨处理器任务切换的上下文延迟。

标签:GPU芯片架构端侧AI

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误
置顶

把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
解码快 3 倍,端到端只快 1.5 倍:VLM 推测解码 DSpark 的账怎么算
置顶

解码快 3 倍,端到端只快 1.5 倍:VLM 推测解码 DSpark 的账怎么算

//

24小时热榜

Anthropic旗下Claude自主发现类CRISPR新酶系统
TOP1

Anthropic旗下Claude自主发现类CRISPR新酶系统

奥特曼联合国演讲:警惕AI失控,呼吁建立全球监管标准
TOP2

奥特曼联合国演讲:警惕AI失控,呼吁建立全球监管标准

3

匿名模型Space Bunny登顶双榜 实测代码表现亮眼

18小时前
匿名模型Space Bunny登顶双榜 实测代码表现亮眼
4

Anthropic AI发现新酶系统引争议:被指非独立发现

3小时前
Anthropic AI发现新酶系统引争议:被指非独立发现
5

谷歌Gemini 4 Pro现身盲测平台,或于10月发布

3小时前
谷歌Gemini 4 Pro现身盲测平台,或于10月发布
6

OpenAI智能体意外访问美政府网站引发争议

3小时前
OpenAI智能体意外访问美政府网站引发争议
7

特朗普私会Anthropic CEO,白宫AI峰会前夕关系解冻

3小时前
特朗普私会Anthropic CEO,白宫AI峰会前夕关系解冻
8

年产值426亿:长江边小镇拿下全国近四成特种电缆

4小时前
年产值426亿:长江边小镇拿下全国近四成特种电缆
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断