Imagination发布最新E系列GPU IP架构,强化矩阵运算并引入低精度格式MXFP8/MXFP4,大模型Prefill阶段性能提升4.7倍;结合神经核与分块延迟渲染技术,AI超分使画面分辨率翻倍仅需2.3毫秒,大幅优化端侧AI与图形渲染效率。
越来越繁重的 AI 计算正加速涌向消费电子、智能汽车和机器人等终端设备。运行本地大语言模型与 AI 智能体、同时处理多模态感知数据,成为底层芯片必须直面的核心负载。
面对算力整合,芯片架构通常有两种选择:引入专用 NPU,或是扩展既有处理器的计算边界。在经历过专用硬件因模型与算子迭代过快而导致软件维护成本高企后,GPU 架构老牌厂商 Imagination 选择将重心全面收拢回通用性更强的 GPU,正式推出全新 E 系列(E-Series)GPU IP。
E 系列架构强化了矩阵乘法、低精度运算和卷积能力,将图形计算与 AI 负载深度整合至统一可编程架构中,致力于减少片上数据搬运并降低跨架构适配的软件成本。

在 3A 桌面游戏场景中,四核配置的 E 系列可使部分游戏帧率突破 60FPS。这一提升的关键在于引入了专用 Neural Core(神经核)进行 AI 超分辨率重建。
传统异构方案往往由 GPU 负责原生低分辨率渲染,再将画面写入 DDR 内存交由独立 NPU 超分并回写,内存带宽开销极大。E 系列将矩阵计算能力深度嵌入原有微架构着色器管线中,使图形数据可就近接入神经网络处理。配合自研的神经超分辨率算法与压缩技术,模型存储和读取数据量大幅精简。
测试数据显示,单核 E 系列将画面从 540p 提升至 1080p 仅耗时 2.3 毫秒;在拉升至 4K 分辨率的场景中,带宽消耗最高降低 54%,帧率达到基准对比的 2.5 倍。

此外,E 系列沿用了经典的 TBDR(基于分块的延迟渲染)架构。相比整帧展开渲染,TBDR 将屏幕拆解为密集 Tile 逐块渲染,中间数据得以驻留片上,再结合 Tile 级的 AI 超分处理,大幅抑制了高频外部访存。微架构层面对 ALU 执行机制的重组亦进一步减少了寄存器交互,带来最高 39% 的每瓦性能提升。

除图形场景外,E 系列的矩阵算力重点瞄准了端侧大语言模型推理及 AI 智能体任务。在推理全流程中,Prefill 阶段决定了首 Token 延迟(TTFT),而 Decode 阶段则制约着单 Token 生成速度(TPOT)。

E 系列首次引入了面向大模型推理的 MXFP8 和 MXFP4 等微缩浮点格式。依靠硬件级低精度吞吐优势,Prefill 阶段性能相比上一代提升达 4.7 倍。同时,低精度量化大幅缩减了模型权重占用的显存空间,减轻了 Decode 阶段对总线带宽的争抢。系统层面,E 系列通过 AXI 总线接口支持接入 LPDDR、GDDR 及 HBM,最高可支撑 768GB/s 的读取带宽。面向端侧视觉与感知需求,E 系列的卷积运算性能亦达到了前代的 4.4 倍。
在软件生态方面,E 系列允许开发者通过 OpenCL、Vulkan 编写底层 Kernel,同时支持直接对接 Llama.cpp、ONNX 和 PyTorch 等主流框架。统一的跨代软件栈保证了算子与精度调优成果能够直接复用,部分嵌入式芯片客户已开始评估用具备通用 AI 能力的 GPU 替代独立 NPU,从而精简驱动与工具链维护。
不过,异构协同仍然是复杂终端的核心形态。例如在 Agent PC 体系中,CPU 依然负责任务流分发与工具调度,密集模型计算则卸载给 GPU;在自动驾驶和机器人领域,GPU 同样需要与专门的控制及感知核心协同。为此,E 系列在硬件层面支持 Mailbox 状态通信,并凭借低开销共享内存技术,进一步压低了跨处理器任务切换的上下文延迟。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断