首页>平台建设成果随着虚拟现实、全景直播、沉浸式文旅和六自由度交互快速发展,360度视频正从消费级体验走向超高清、低时延与移动化应用。全景内容通常以等距柱状投影(ERP)形式存储和传输,一帧4K或8K图像包含海量像素。VVC/H.266虽然能够显著降低码率,但在较强量化下会产生块效应、振铃、边缘断裂和纹理丢失,直接影响头戴显示中的清晰度与沉浸感。
ERP并非普通平面图像:球面内容映射到矩形平面后,靠近两极的区域被明显拉伸并形成过采样,不同纬度的结构尺度、纹理密度和压缩退化程度差异较大。因此,全景内容的压缩后增强需要同时处理两类互相牵制的任务:一类是跨大范围的结构与几何一致性恢复,另一类是字符、材质、细边缘等局部高频细节重建。
现有CNN方法具有较强的局部归纳偏置,但其有效感受野限制了全局依赖建模;标准Transformer能够聚合远距离信息,却在超高分辨率输入上产生高昂计算与内存开销;混合CNN—ViT方案仍以密集浮点运算为主,难以在高保真与低复杂度之间取得理想平衡。SWFNet的研究目标,是构建一种既能感知ERP空间非均匀性,又能在4K/8K输入上保持较好可扩展性的恢复网络。
全景画面中的建筑轮廓、地平线和大尺度物体需要长距离结构建模;车牌文字、织物网格和细小支撑杆则依赖高频纹理恢复。单一路径往往需要在扩大感受野与保留局部精度之间折中,容易出现结构正确但细节过平滑,或纹理锐化但全局几何不稳定的问题。
ERP极区像素被拉伸、过采样,若网络对所有位置采用相同的密集计算模式,会在高畸变区域投入大量重复运算。理想的增强模型应根据内容显著性和纬度畸变自适应分配计算资源,而不是对整幅超高清画面做均匀处理。
随着分辨率由1080p提升至4K、8K,中间特征图的内存占用和注意力计算量迅速增长。论文的复杂度实验显示,多种CNN、ViT和混合架构在8K输入时出现显存不足或延迟显著上升。因此,网络不仅需要轻量参数设计,更需要降低实际激活与中间张量开销。
图1 SWFNet的生物视觉启发与恢复效果概览。
SWFNet受灵长类视觉系统大细胞—小细胞(Magnocellular-Parvocellular,M-P)双通路理论启发。大细胞通路倾向于快速传递全局结构和运动相关信息,小细胞通路负责精细空间分辨。论文借鉴这种功能分工,但不涉及跨帧时序建模:全局通路以Transformer-SNN结构捕获长距离结构依赖,局部通路以残差小波融合块恢复多尺度高频细节。两条通路并行提取特征,并在重建端进行融合,输出增强结果。
图2 SWFNet总体架构。TransSNN提取稀疏全局结构先验,RWFB恢复局部纹理,SCAtten在解码阶段抑制压缩噪声。
全局通路采用U形编码—解码结构。编码端堆叠TransSNN模块,通过脉冲域的查询—键—值交互扩大有效感受野;解码端在融合跳跃连接与上采样特征后,先由SCAtten进行通道选择,再由TransSNN细化结构。与标准连续激活Transformer相比,TransSNN用稀疏突触累加操作(AC)替代部分高能耗乘加操作(MAC),只对被脉冲事件激活的显著响应进行重点处理。
图3 TransSNN模块结构:在脉冲域完成高效全局依赖建模。
这种稀疏性具有内容自适应特征。论文的中间激活可视化显示,低畸变赤道区域包含复杂物体和纹理,网络产生较密集、较局部的放电;高畸变极区存在明显拉伸和过采样,网络响应更稀疏,并集中于突出结构边缘。由此,TransSNN无需显式球面投影校正,即可对ERP不同纬度区域采用差异化计算。
图4 不同ERP纬度的TransSNN激活:赤道区域响应较密集,极区响应更稀疏。
SCAtten通过全局平均池化聚合空间信息,再利用包含IE-LIF神经元的瓶颈结构建立通道依赖。与依赖连续激活的传统SE模块不同,SCAtten依据稀疏放电率动态调整通道权重,使与结构恢复相关的特征得到增强,并抑制由VVC压缩引入的噪声响应。该模块位于全局通路解码阶段,承担“先筛选、后重建”的门控作用。
图5 SCAtten模块:基于脉冲放电的通道选择与噪声抑制。
局部通路以RWFB为核心。每个RWFB由三个级联的混合卷积块(HCB)组成,通过多阶段小波分解将特征划分为不同频带,在空间域与频率域联合建模。低频分量维持主体结构,高频分量聚焦边缘、文字和材质纹理;残差连接则有助于保留原始信息并稳定训练。该设计还能补偿脉冲量化可能带来的连续像素信息损失,使全局稀疏建模与局部精细恢复相互补充。
图6 RWFB模块:三级HCB逐步完成多尺度小波分解、细节提炼与残差融合。
实验使用标准JVET全景视频序列,并采用互不重叠的5:5划分:5个序列用于训练,其余序列用于测试。压缩数据由VTM 10.0在All-Intra配置下生成,量化参数QP取22、27、32和37。训练阶段每隔5帧采样,并裁剪为互不重叠的256×256图像块,样本量超过20万;同时使用随机旋转、水平翻转和Mixup增强鲁棒性。模型以AdamW优化300个epoch,实验平台配备NVIDIA RTX 4090 GPU。
SWFNet在4K、8K及总体平均结果上均取得领先的PSNR与MS-SSIM。尤其是在8K测试集上,模型以1.48M参数和10.30 GFLOPs取得39.89 dB PSNR、0.9493 SSIM和0.9744 MS-SSIM。总体平均PSNR为37.18 dB,较NAFNet、MHNet和MDDA-former分别提高0.04 dB、0.11 dB和0.12 dB;平均SSIM为0.9212,与最佳结果0.9213非常接近。
表1 SWFNet在4K与8K测试集上的核心定量结果

在资源指标方面,SWFNet的峰值内存占用为185.2 MB,论文依据MAC与AC理论运算成本估算的能耗为44.8 mJ。相较NAFNet、Restormer和MIRNet,估算能耗分别降低约6.5倍、14.5倍和80.8倍。需要强调的是,该能耗为理论估算值,并非在神经形态芯片上的实测功耗。
图7 不同QP压缩强度下的率失真曲线。SWFNet在PSNR与SSIM上保持稳定竞争力。
在3840×1920输入上,SWFNet推理时间为2.35秒/帧,较NAFNet、TSAN和RDEN分别获得约1.7倍、8.5倍和24.5倍加速。在8192×4096输入上,多数基线出现显存不足;SWFNet仍能运行,耗时50.99秒/帧。另一种可运行方法DEANet需要263.06秒/帧,SWFNet约快5.1倍。该结果说明稀疏空间处理有助于缓解极端分辨率下的资源压力,但50.99秒/帧也表明当前实现距离实时8K增强仍有明显差距。
4K序列中,SWFNet能够恢复DrivingInCity的车牌字符边缘,并重建PoleVault落地区域的织物纹理;8K序列中,模型较好地修复GasLamp的窗框直线与砖墙纹理、KiteFlite标牌的内部文字,以及Trolley场景中的屋顶细线和斜向支撑结构。与部分CNN或ViT方法相比,结果更少出现过度平滑、振铃和线条断裂。
图8 4K测试序列的主观质量对比。
图9 8K测试序列的主观质量对比。
移除RWFB、TransSNN或SCAtten后,平均PSNR分别由37.18 dB降至36.86 dB、36.87 dB和36.99 dB,表明三个模块分别在高频细节、全局依赖和通道选择方面发挥作用。将脉冲机制替换为普通浮点Transformer后,估算能耗由44.82 mJ升至50.47 mJ,PSNR降至37.02 dB;将小波机制替换为普通CNN后,PSNR降至37.06 dB。与Linformer、Longformer等稀疏注意力方案相比,SWFNet在保持或提升恢复质量的同时具有更低的估算能耗和内存占用。
论文将脉冲神经网络作为内容自适应的全局建模组件引入360度内容质量增强,并通过连续小波分支弥补像素级回归中的信息精度需求,形成适合超高清ERP输入的混合计算范式。
M-P启发的全局—局部设计把长距离结构建模与高频细节恢复分配给不同路径,降低单一网络同时处理两类目标的冲突,并使TransSNN、SCAtten和RWFB形成清晰的功能协同。
TransSNN依据内容和畸变程度形成不同放电密度,对过采样极区减少冗余激活,对细节丰富区域保留有效响应。该机制无需显式球面卷积或投影变换,即可实现具有纬度感知特征的高效处理。
SWFNet以1.48M参数和10.30 GFLOPs取得4K/8K基准上的领先恢复指标,并保持较低内存占用,在8K输入上仍可运行,为资源受限的沉浸式媒体增强提供了具有实践潜力的方案。
SWFNet可为VR/AR内容传输、全景直播、远程文旅、超高清监控、车载环视和云端沉浸式媒体中的VVC解码全景内容提供压缩后质量增强能力。其轻量参数规模和稀疏计算特征,也适合进一步探索边缘GPU、神经形态芯片或异构计算平台部署。
当前工作仍存在三方面边界:其一,方法按帧处理,尚未显式利用相邻帧的运动与时序冗余;其二,能耗优势基于理论MAC/AC成本估算,需要在真实神经形态或边缘硬件上验证;其三,在纹理极度密集、压缩较轻或只强调单一结构指标的场景中,脉冲稀疏性的收益可能减弱。后续研究将重点拓展视频级时序建模、真实设备能效评测和自然场景全景数据上的泛化能力。