点击上方“小白学视觉”,选择加"星标"或“置顶” 重磅干货,第一时间送达在计算机视觉领域,图像复原一直是经久不衰的研究方向,从手机摄影的画质增强到监控图像的清晰化,再到医学影像的细节还原,都离不开这项技术的支撑。近年来,Transformer凭借强大的表征能力在图像复原任务中崭露头角,但现有基于Transformer的方法(如SwinIR)仍存在两大核心痛点:一是利用输入信息的空间范围有限,二是跨窗口信息交互不足导致中间特征出现块状伪影。
针对这些问题,来自腾讯、港中文等机构的研究团队提出了混合注意力Transformer(HAT),通过创新的注意力机制设计和高效的预训练策略,不仅激活了更多输入像素用于高质量重建,还在经典超分辨率、真实世界超分辨率、图像去噪、JPEG压缩伪影减少等多个图像复原任务上达到SOTA,甚至大幅提升了超分辨率任务的性能上限。今天,我们就来深度解读这篇发表于TPAMI 2026的重磅研究!
论文信息
题目: HAT: Hybrid Attention Transformer for Image Restoration
用于图像恢复的混合注意力Transformer
作者:Xiangyu Chen, Xintao Wang, Wenlong Zhang, Xiangtao Kong, Yu Qiao, Jiantao Zhou, Chao Dong
一、现有方法的“致命短板”
在深入了解HAT之前,我们先搞清楚:为什么当红的SwinIR还不够好?
研究团队通过局部归因图(LAM)分析发现,尽管SwinIR在超分辨率任务上的定量性能优于传统CNN(如RCAN),但它实际利用的输入像素范围反而更小(见图2)。这意味着SwinIR的优势仅来源于更强的局部信息建模能力,而非大家默认的“长程依赖建模优势”,在需要广泛上下文信息的场景中表现拉胯。
同时,研究团队还观察到SwinIR的中间特征存在明显的块状伪影(见图4),这是因为其移位窗口机制未能充分实现跨窗口信息交互——窗口划分导致特征被“割裂”,最终影响重建效果。
图2:不同超分辨率网络的LAM分析结果,可见SwinIR利用的输入像素范围(热力图覆盖区域)远小于RCAN
图4:SwinIR(左)与HAT(右)中间特征对比,SwinIR存在明显块状伪影,HAT伪影显著缓解
二、HAT核心设计:三大创新破解痛点
为了突破现有方法的局限,HAT从网络架构、核心模块、训练策略三个维度进行了全方位创新,先来看HAT的整体架构(见图5),这是理解所有细节的基础:
图5:HAT整体架构图。(a)(b)分别为超分辨率/等分辨率复原任务的网络结构;(c)残差混合注意力组(RHAG);(d)混合注意力块(HAB);(f)通道注意力块(CAB)
1. 混合注意力块(HAB):全局+局部,激活更多像素
HAB是HAT的核心基础模块,它将通道注意力(CAB)与基于窗口的自注意力(W-MSA)并行结合,既解决了自注意力信息范围有限的问题,又保留了其局部表征优势:
扩大窗口大小:将传统的8×8窗口扩大到16×16,无需堆叠更多层就能覆盖更广的局部区域,且计算成本仅小幅增加(参数从11.9M增至12.1M,乘加运算增加19%),但在Urban100数据集上PSNR直接提升0.36dB(见图7);
引入通道注意力:通过CAB捕捉全局信息,尤其适用于存在大量相似纹理的场景。为了避免卷积带来的高计算成本,CAB通过压缩因子β减少卷积层通道数,再结合通道注意力模块自适应缩放特征,最后用小权重因子α(默认0.01)与自注意力特征融合,避免优化冲突。
图7:不同窗口大小的定性对比,16×16窗口(右)重建的纹理比8×8窗口(左)更清晰
2. 重叠交叉注意力块(OCAB):打通跨窗口“信息壁垒”
为了彻底解决块状伪影问题,HAT设计了OCAB模块(见图6),核心思路是让查询(Q)、键(K)、值(V)使用不同大小的窗口划分:
Q仍采用16×16的非重叠窗口,保证计算效率;
K和V则采用更大的重叠窗口(重叠率γ默认0.5),让每个查询窗口能捕捉到相邻窗口的信息,实现更直接的跨窗口交互。
相比SwinIR的移位窗口机制,OCAB无需依赖多层堆叠就能实现跨窗口信息融合,从根源上缓解了块状伪影。实验证明,仅OCAB模块就能让Urban100数据集的PSNR提升0.1dB。
图6:重叠交叉注意力(OCA)的窗口划分方式,Q为非重叠窗口,K/V为重叠窗口,实现跨窗口信息交互
3. 同任务预训练:大规模数据才是关键
此前的预训练方法(如IPT、EDT)要么做多任务预训练,要么做多退化级别预训练,而HAT提出同任务预训练策略:直接在ImageNet(128万张图像)上对单一任务(如×4超分辨率)进行预训练,再在DF2K等小数据集上微调。
研究团队验证了这一策略的优越性(见图9):
所有网络(CNN/Transformer)都能从该策略中受益,且模型容量越大,增益越明显;
HAT作为大模型,从预训练中获得的性能提升最多,证明Transformer对大规模数据的需求远高于CNN;
对比多任务预训练,同任务预训练能避免“泛化有余、专精不足”,在特定复原任务上表现更优。
图9:不同网络在预训练前后的性能增益对比,HAT的增益最为显著
三、实验结果:全方位刷新SOTA
1. 消融实验验证模块有效性
在Urban100 ×4超分辨率任务上的消融实验(表3)显示:
CAB和OCAB分别带来0.1dB的性能增益,两者结合后增益达0.16dB;
CAB中通道注意力模块的引入能提升0.05dB,α=0.01时性能最优;
OCAB的重叠率γ=0.5时效果最好,过小或过大都会导致性能下降。
2. 复杂度与性能平衡
HAT在保证性能的同时,还兼顾了计算效率:
通过调整CAB的压缩因子β,可灵活权衡性能与复杂度(β=3时为默认设置,性能和计算量达到最佳平衡);
对比SwinIR,HAT-S(轻量化版本)在参数更少、计算量相当的情况下,性能显著超越原版SwinIR;即使将SwinIR扩大到与HAT同等计算量,HAT仍以最低成本实现最佳性能。
3. 多任务SOTA表现
HAT不仅在经典超分辨率任务上表现优异,还扩展到真实世界超分辨率、图像去噪、JPEG压缩伪影减少等任务:
经典超分辨率:在Set5、Set14、Urban100等数据集上,PSNR/SSIM全面超越SwinIR、EDT等现有方法;
真实世界超分辨率:基于BSRGAN/Real-ESRGAN退化模型训练的HAT,在真实图像上的重建效果更接近真实纹理;
图像去噪/压缩伪影减少:在高斯去噪、JPEG伪影减少任务上,定量和定性指标均达到当前最优。
四、总结:不止于SOTA,更定义新方向
HAT的成功并非偶然,它的核心价值在于:
首次通过可解释性分析(LAM、因果效应图)揭示了现有图像复原Transformer的核心短板,为后续研究提供了明确的优化方向;
提出的混合注意力机制,为融合CNN与Transformer的优势提供了新范式,既保留Transformer的局部表征能力,又弥补了其全局信息建模的不足;
验证了“大规模同任务预训练”对Transformer的重要性,为大模型在低级视觉任务中的应用奠定了基础。
从实际应用角度,HAT构建的模型系列(HAT、HAT-S、HAT-L)兼顾了轻量化和高性能,既可以部署在移动端实现实时图像增强,也能在服务器端通过HAT-L突破性能上限。相信这一研究不仅会推动图像复原领域的发展,也能为其他低级视觉任务的Transformer设计提供参考。
如果你也关注图像复原或Transformer在计算机视觉中的应用,这篇论文绝对值得精读——它不仅给出了优秀的解决方案,更教会我们如何从可解释性分析出发,找到现有方法的核心痛点,进而提出真正有价值的创新。
下载1:OpenCV-Contrib扩展模块中文版教程
在「小白学视觉」公众号后台回复:扩展模块中文教程,即可下载全网第一份OpenCV扩展模块教程中文版,涵盖扩展模块安装、SFM算法、立体视觉、目标跟踪、生物视觉、超分辨率处理等二十多章内容。
下载2:Python视觉实战项目52讲
在「小白学视觉」公众号后台回复:Python视觉实战项目,即可下载包括图像分割、口罩检测、车道线检测、车辆计数、添加眼线、车牌识别、字符识别、情绪检测、文本内容提取、面部识别等31个视觉实战项目,助力快速学校计算机视觉。
下载3:人工智能0基础学习攻略手册
在「小白学视觉」公众号后台回复:攻略手册,即可获取《从 0 入门人工智能学习攻略手册》文档,包含视频课件、习题、电子书、代码、数据等人工智能学习相关资源,可以下载离线学习。
交流群
欢迎加入公众号读者群一起和同行交流,目前有SLAM、三维视觉、传感器、自动驾驶、计算摄影、检测、分割、识别、医学影像、GAN、算法竞赛等微信群(以后会逐渐细分),请扫描下面微信号加群,备注:”昵称+学校/公司+研究方向“,例如:”张三 + 上海交大 + 视觉SLAM“。请按照格式备注,否则不予通过。添加成功后会根据研究方向邀请进入相关微信群。请勿在群内发送广告,否则会请出群,谢谢理解~