科研成果

Platform constructio

首页>平台建设成果
省工程研究中心丨技术简介:面向VVC压缩360度视频帧级质量增强的脉冲—小波融合网络
时间:2026-07-30 14:58      


一、研究背景

随着虚拟现实、全景直播、沉浸式文旅和六自由度交互快速发展,360度视频正从消费级体验走向超高清、低时延与移动化应用。全景内容通常以等距柱状投影(ERP)形式存储和传输,一帧4K或8K图像包含海量像素。VVC/H.266虽然能够显著降低码率,但在较强量化下会产生块效应、振铃、边缘断裂和纹理丢失,直接影响头戴显示中的清晰度与沉浸感。

ERP并非普通平面图像:球面内容映射到矩形平面后,靠近两极的区域被明显拉伸并形成过采样,不同纬度的结构尺度、纹理密度和压缩退化程度差异较大。因此,全景内容的压缩后增强需要同时处理两类互相牵制的任务:一类是跨大范围的结构与几何一致性恢复,另一类是字符、材质、细边缘等局部高频细节重建。

现有CNN方法具有较强的局部归纳偏置,但其有效感受野限制了全局依赖建模;标准Transformer能够聚合远距离信息,却在超高分辨率输入上产生高昂计算与内存开销;混合CNN—ViT方案仍以密集浮点运算为主,难以在高保真与低复杂度之间取得理想平衡。SWFNet的研究目标,是构建一种既能感知ERP空间非均匀性,又能在4K/8K输入上保持较好可扩展性的恢复网络。

二、问题分析

2.1 全局结构与局部细节的目标冲突

全景画面中的建筑轮廓、地平线和大尺度物体需要长距离结构建模;车牌文字、织物网格和细小支撑杆则依赖高频纹理恢复。单一路径往往需要在扩大感受野与保留局部精度之间折中,容易出现结构正确但细节过平滑,或纹理锐化但全局几何不稳定的问题。

2.2 ERP空间非均匀性带来的冗余计算

ERP极区像素被拉伸、过采样,若网络对所有位置采用相同的密集计算模式,会在高畸变区域投入大量重复运算。理想的增强模型应根据内容显著性和纬度畸变自适应分配计算资源,而不是对整幅超高清画面做均匀处理。

2.3 超高分辨率输入的资源瓶颈

随着分辨率由1080p提升至4K、8K,中间特征图的内存占用和注意力计算量迅速增长。论文的复杂度实验显示,多种CNN、ViT和混合架构在8K输入时出现显存不足或延迟显著上升。因此,网络不仅需要轻量参数设计,更需要降低实际激活与中间张量开销。

 

1  SWFNet的生物视觉启发与恢复效果概览。

三、技术方案

3.1 总体架构:M-P启发的全局—局部双通路

SWFNet受灵长类视觉系统大细胞—小细胞(Magnocellular-Parvocellular,M-P)双通路理论启发。大细胞通路倾向于快速传递全局结构和运动相关信息,小细胞通路负责精细空间分辨。论文借鉴这种功能分工,但不涉及跨帧时序建模:全局通路以Transformer-SNN结构捕获长距离结构依赖,局部通路以残差小波融合块恢复多尺度高频细节。两条通路并行提取特征,并在重建端进行融合,输出增强结果。

 

2  SWFNet总体架构。TransSNN提取稀疏全局结构先验,RWFB恢复局部纹理,SCAtten在解码阶段抑制压缩噪声。

3.2 全局通路:Transformer-SNN(TransSNN)

全局通路采用U形编码—解码结构。编码端堆叠TransSNN模块,通过脉冲域的查询—键—值交互扩大有效感受野;解码端在融合跳跃连接与上采样特征后,先由SCAtten进行通道选择,再由TransSNN细化结构。与标准连续激活Transformer相比,TransSNN用稀疏突触累加操作(AC)替代部分高能耗乘加操作(MAC),只对被脉冲事件激活的显著响应进行重点处理。

 

3  TransSNN模块结构:在脉冲域完成高效全局依赖建模。

这种稀疏性具有内容自适应特征。论文的中间激活可视化显示,低畸变赤道区域包含复杂物体和纹理,网络产生较密集、较局部的放电;高畸变极区存在明显拉伸和过采样,网络响应更稀疏,并集中于突出结构边缘。由此,TransSNN无需显式球面投影校正,即可对ERP不同纬度区域采用差异化计算。

 

4  不同ERP纬度的TransSNN激活:赤道区域响应较密集,极区响应更稀疏。

3.3 解码选择机制:脉冲通道注意力(SCAtten)

SCAtten通过全局平均池化聚合空间信息,再利用包含IE-LIF神经元的瓶颈结构建立通道依赖。与依赖连续激活的传统SE模块不同,SCAtten依据稀疏放电率动态调整通道权重,使与结构恢复相关的特征得到增强,并抑制由VVC压缩引入的噪声响应。该模块位于全局通路解码阶段,承担“先筛选、后重建”的门控作用。

 

5  SCAtten模块:基于脉冲放电的通道选择与噪声抑制。

3.4 局部通路:残差小波融合块(RWFB)

局部通路以RWFB为核心。每个RWFB由三个级联的混合卷积块(HCB)组成,通过多阶段小波分解将特征划分为不同频带,在空间域与频率域联合建模。低频分量维持主体结构,高频分量聚焦边缘、文字和材质纹理;残差连接则有助于保留原始信息并稳定训练。该设计还能补偿脉冲量化可能带来的连续像素信息损失,使全局稀疏建模与局部精细恢复相互补充。

 

6  RWFB模块:三级HCB逐步完成多尺度小波分解、细节提炼与残差融合。

四、实验验证

4.1 数据与评测设置

实验使用标准JVET全景视频序列,并采用互不重叠的5:5划分:5个序列用于训练,其余序列用于测试。压缩数据由VTM 10.0在All-Intra配置下生成,量化参数QP取22、27、32和37。训练阶段每隔5帧采样,并裁剪为互不重叠的256×256图像块,样本量超过20万;同时使用随机旋转、水平翻转和Mixup增强鲁棒性。模型以AdamW优化300个epoch,实验平台配备NVIDIA RTX 4090 GPU。

4.2 恢复质量与资源开销

SWFNet在4K、8K及总体平均结果上均取得领先的PSNR与MS-SSIM。尤其是在8K测试集上,模型以1.48M参数和10.30 GFLOPs取得39.89 dB PSNR、0.9493 SSIM和0.9744 MS-SSIM。总体平均PSNR为37.18 dB,较NAFNet、MHNet和MDDA-former分别提高0.04 dB、0.11 dB和0.12 dB;平均SSIM为0.9212,与最佳结果0.9213非常接近。

1  SWFNet在4K与8K测试集上的核心定量结果


在资源指标方面,SWFNet的峰值内存占用为185.2 MB,论文依据MAC与AC理论运算成本估算的能耗为44.8 mJ。相较NAFNet、Restormer和MIRNet,估算能耗分别降低约6.5倍、14.5倍和80.8倍。需要强调的是,该能耗为理论估算值,并非在神经形态芯片上的实测功耗。

 

7  不同QP压缩强度下的率失真曲线。SWFNet在PSNR与SSIM上保持稳定竞争力。

4.3 超高分辨率可扩展性

3840×1920输入上,SWFNet推理时间为2.35秒/帧,较NAFNet、TSAN和RDEN分别获得约1.7倍、8.5倍和24.5倍加速。在8192×4096输入上,多数基线出现显存不足;SWFNet仍能运行,耗时50.99秒/帧。另一种可运行方法DEANet需要263.06秒/帧,SWFNet约快5.1倍。该结果说明稀疏空间处理有助于缓解极端分辨率下的资源压力,但50.99秒/帧也表明当前实现距离实时8K增强仍有明显差距。

4.4 主观视觉质量

4K序列中,SWFNet能够恢复DrivingInCity的车牌字符边缘,并重建PoleVault落地区域的织物纹理;8K序列中,模型较好地修复GasLamp的窗框直线与砖墙纹理、KiteFlite标牌的内部文字,以及Trolley场景中的屋顶细线和斜向支撑结构。与部分CNN或ViT方法相比,结果更少出现过度平滑、振铃和线条断裂。

 

8  4K测试序列的主观质量对比。

 

9  8K测试序列的主观质量对比。

4.5 消融实验

移除RWFB、TransSNN或SCAtten后,平均PSNR分别由37.18 dB降至36.86 dB、36.87 dB和36.99 dB,表明三个模块分别在高频细节、全局依赖和通道选择方面发挥作用。将脉冲机制替换为普通浮点Transformer后,估算能耗由44.82 mJ升至50.47 mJ,PSNR降至37.02 dB;将小波机制替换为普通CNN后,PSNR降至37.06 dB。与Linformer、Longformer等稀疏注意力方案相比,SWFNet在保持或提升恢复质量的同时具有更低的估算能耗和内存占用。

五、技术创新与贡献

5.1 面向全景内容恢复的SNN—ANN混合范式

论文将脉冲神经网络作为内容自适应的全局建模组件引入360度内容质量增强,并通过连续小波分支弥补像素级回归中的信息精度需求,形成适合超高清ERP输入的混合计算范式。

5.2 仿生双通路实现结构—纹理解耦

M-P启发的全局—局部设计把长距离结构建模与高频细节恢复分配给不同路径,降低单一网络同时处理两类目标的冲突,并使TransSNN、SCAtten和RWFB形成清晰的功能协同。

5.3 稀疏脉冲响应适配ERP纬度差异

TransSNN依据内容和畸变程度形成不同放电密度,对过采样极区减少冗余激活,对细节丰富区域保留有效响应。该机制无需显式球面卷积或投影变换,即可实现具有纬度感知特征的高效处理。

5.4 高保真、低复杂度和可扩展性的综合权衡

SWFNet以1.48M参数和10.30 GFLOPs取得4K/8K基准上的领先恢复指标,并保持较低内存占用,在8K输入上仍可运行,为资源受限的沉浸式媒体增强提供了具有实践潜力的方案。

六、应用前景与后续方向

SWFNet可为VR/AR内容传输、全景直播、远程文旅、超高清监控、车载环视和云端沉浸式媒体中的VVC解码全景内容提供压缩后质量增强能力。其轻量参数规模和稀疏计算特征,也适合进一步探索边缘GPU、神经形态芯片或异构计算平台部署。

当前工作仍存在三方面边界:其一,方法按帧处理,尚未显式利用相邻帧的运动与时序冗余;其二,能耗优势基于理论MAC/AC成本估算,需要在真实神经形态或边缘硬件上验证;其三,在纹理极度密集、压缩较轻或只强调单一结构指标的场景中,脉冲稀疏性的收益可能减弱。后续研究将重点拓展视频级时序建模、真实设备能效评测和自然场景全景数据上的泛化能力。