Imagination发布首批E系列GPU基准,展示AI超分辨率2.3毫秒双倍提升与LLM预填充加速4.7倍的性能数据
Imagination全新E系列GPU实现2.3毫秒AI超分辨率将图像分辨率翻倍,并在LLM预填充阶段提供4.7倍速度提升,数据来自雷峰网和Jon Peddie Research。

Imagination公司近日公开了其即将面世的E系列图形处理器的首批公开基准数据。独立测试机构雷峰网(LeiPhone)和Jon Peddie Research提供了测试结果,重点聚焦于两大核心能力:用于图像放大的神经超分辨率(Neural Super Resolution,简称NSR)以及在同一芯片上运行的大语言模型(LLM)预填充阶段的速度提升。
NSR技术由Imagination自行品牌化,声称能够在仅2.3毫秒的时间内将源图像的分辨率翻倍。该测量在受控实验环境下完成,使用雷峰网和Jon Peddie Research的标准化4K‑to‑8K超分辨率工作负载进行。除2.3毫秒这一数字外,报告未披露其他时延或对比数据。
与此同时,基准显示,E系列在LLM的预填充步骤——即在推理前将模型权重加载到GPU显存的内存密集型操作——的执行速度比Imagination前一代的D系列快4.7倍。雷峰网和Jon Peddie Research在不同模型规模的实验中均观察到相同的加速比例,但未列出具体使用的模型名称或批量配置。
矩阵加速器架构
性能提升的核心要素之一是E系列GPU内部嵌入的专用矩阵加速器。该加速器支持多种低精度数据格式,包括MXFP8、MXFP4、BF16和FP4。这些格式通过降低张量运算的位宽,实现矩阵乘法和卷积核的吞吐量提升,从而满足AI工作负载对计算密度的需求。
Imagination指出,矩阵加速器与着色引擎紧密耦合。通过将矩阵单元直接嵌入基于瓦片的延迟渲染(Tile‑Based Deferred Renderer,TBDR)管线,显著减少了图形光栅化单元与AI计算块之间的数据搬移。雷峰网的分析将此集成归因于高达39%的能效提升,但未公开具体的测量方法。
统一软件栈
Imagination还声称,E系列能够通过单一软件栈进行编程,覆盖传统图形API(OpenCL、Vulkan)以及AI框架(Llama.cpp、ONNX、PyTorch)。公司认为,这种统一能够降低所需驱动数量,并缩短系统级芯片(SoC)设计者在同时支持渲染与AI推理时的认证周期。
统一栈的目标是简化嵌入式平台的开发,因为这些平台往往受限于内存、功耗和硅面积。通过共用同一套驱动基础设施,OEM厂商有望避免为图形和神经网络加速器分别维护独立的验证套件,从而降低研发成本。
带宽与压缩优势
Imagination同样强调了NSR模型的压缩特性。公司称,NSR网络的体积约压缩至原始大小的65%,这意味着在使用NSR的渲染路径上,内存带宽需求可降低约50%,相较于不使用NSR的原生渲染路径。
带宽需求的降低对面向高分辨率显示但受限于内存接口的SoC尤为重要。Imagination列出了E系列平台的最大内存带宽为768 GB/s,但实际性能取决于该带宽在图形与AI工作负载之间的分配比例。
尽管压缩降低了带宽压力,Imagination仍承认NSR放大后帧的视觉质量仅“接近”参考原生渲染输出。报告中未提供PSNR、SSIM等定量质量指标。
限制与异构架构
Imagination坦诚,E系列GPU并不能取代专用神经处理单元(NPU)在所有AI任务中的角色。对超低延迟或高度特化算子的工作负载,仍可能需要专门的NPU。因此,公司将E系列定位为更广泛异构计算体系中的一环,搭配CPU、NPU及其他加速器共同构成完整计算布阵。
基准文档还强调,真实世界的性能表现取决于软件工程师的采纳程度以及SoC的内存配置。例如,4.7倍的LLM预填充加速假设内存子系统能够提供宣传的768 GB/s带宽,带宽低于此值的系统可能只能实现部分增益。
同样,2.3毫秒的NSR放大延迟是在理想测试条件下测得的。文档提醒,工业部署可能因驱动成熟度、热节流或与其他系统组件的集成而出现波动。
- Neural Super Resolution在2.3毫秒内实现分辨率翻倍
- LLM预填充速度比D系列快4.7倍
- 矩阵加速器支持MXFP8、MXFP4、BF16、FP4格式
- 统一软件栈降低OpenCL、Vulkan、PyTorch等驱动数量
上表概括了Imagination及独立测试机构公开的四项核心数据。其余的性能观察均为相对提升或定性描述,未提供绝对数值。
从实际应用角度看,评估E系列用于嵌入式或边缘设备的组织需要在这些已记录的加速与基准报告中标注的不确定因素之间进行权衡。矩阵单元与基于瓦片渲染的能效提升暗示每帧功耗下降,这对电池供电产品尤具吸引力。
然而,统一软件栈的依赖意味着开发团队必须验证其与现有工具链的兼容性。如果企业已经在关键推理任务上使用专用NPU,E系列更可能是补充而非替代,需要细致划分工作负载的分配。
内存带宽仍是决定因素。无法提供完整768 GB/s带宽的系统可能无法实现报告中提到的39%能效提升或4.7倍的LLM预填充加速。因此,设计人员应在SoC规划的早期阶段就评估内存子系统的规格。
最后,基准数据本身并不保证行业的广泛采纳。软件供应商必须将新的NSR模型和矩阵加速器API集成到其渲染引擎和AI框架中,终端用户才能真正受益。直到这些集成工作完成,当前的性能数字仍停留在受控实验室环境下的最佳案例。
信息来源
- Imagination E系列性能首秀:用AI把分辨率翻倍仅需2.3毫秒,Prefill性能提升4.7倍 | 雷峰网LeiPhone · 2026年9月28日
- Imagination’s E-Series unifies graphics and AI – Jon Peddie ResearchJon Peddie Research · 2026年9月21日


