

关键词
#神经渲染,#高斯泼溅,#光栅化引擎,#三维高斯点云渲染,#AI加速器,#协同设计
原文信息
Yan X K, Ji K W, Mai S L, et al. A fusion flexible implementation rasterization engine for neural rendering on AI accelerators. Sci China Inf Sci, 2026, 69(9): 192102, https://doi.org/10.1007/s11432-025-4968-x
研究意义
论文提出一条面向全局光照神经渲染的混合表示渲染流水线(网格 + 3D 高斯泼溅),并设计可在AI加速器上落地的广义光栅化流水线与指令/微结构扩展(DMA、V-Core、控制核等),在 RTX 3090 / 4090 / H100及仿真平台上显著加速3D-GS与高斯–网格融合场景,画质可保持不变(像素级一致),硬件综合开销约<2%。
1. 渲染范式变化
从传统网格+局部光照,走向NeRF/3D-GS等神经表示与全局光照;老流水线对新高斯类原语支持不自然。
2. AI 加速器的重要性
高能效、低成本、偏张量/向量的架构适合图形 + 神经网络类的混合负载,但AI加速器缺少 GPU 式光栅化专用硬件,把整条渲染链搬上去需要算法与ISA/数据通路协同一起改。
3. 3D-GS 瓶颈
本文用实验说明:总时间里光栅化 + 像素/神经渲染占比极高;光栅化子阶段中 duplicate、sortPairs(及排序相关)是主要瓶颈,且光栅化阶段更受限于访存带宽而非单纯算力。
4. 融合场景的应用价值
绒毛类用高斯、硬表面或背景部分用网格,再加统一神经全局光照,可在图像质量与渲染速度之间取得更好折中。

本文工作
1. 混合表示的全局光照神经渲染流水线
提出 Gaussian–mesh 混合流水线(图1):前端统一投影/特征 → 通用光栅化 → 神经推理着色(重光照与合成),面向毛绒+硬边缘共存场景。

图1 高斯泼溅-网格混合流水线
2. 3D-GS瓶颈分析和光栅化算法级优化
首先从渲染阶段耗时(图2)、子阶段分解(图3、图4)、硬件影响(图5)三方面论证瓶颈与优化方向。

图2 不同场景下高斯泼溅渲染时间的各阶段分解

图3 不同场景下高斯泼溅光栅化阶段时间的子阶段分解

图4 不同场景不同视角下各阶段需要处理的高斯球平均数量

图5 不同硬件平台对混合流水线中光栅化阶段和神经推理着色阶段时间的影响
针对瓶颈提出通用光栅化优化算法,将部分排序/建 tile 逻辑前移或局部化,缓解duplicate / sort瓶颈。

图6 算法对比
3. 面向AI加速器的通用流水线与软硬件接口扩展
面向AI加速器提出对象处理-屏幕空间处理-像素处理的三阶段通用流水线结构(图7)以及流水线到AI加速器的映射(AI Core、SPM、DRAM)(图8)。

图7 通用流水线结构及硬件映射

图8 AI加速器对通用流水线光栅化阶段的映射分析
针对当前AI加速器映射瓶颈提出指令级和数据通路级的扩展:增加新DMA类型支持混合格式与多播分发(图9);新增raster指令接口支持批量图元边函数与插值调度(10)。

图9 AI加速器优化支持的四种DMA类型及对应数据流

图10 支持raster指令的向量核心控制单元结构

实验结果

图11 实验评估数据集

图12 多种硬件平台下两个代表性场景中duplicate阶段和sort-tile阶段性能优化对比

图13多种硬件平台下多种场景的渲染时间性能优化对比

图14 在多种平台与多种场景下原始3D高斯溅射与优化策略的对比








