news 2026/9/26 19:35:56

TPAMI 2026 | 腾讯 上海 AI Lab 联合出品 HAT:融合通道与窗口注意力,激活图像复原更多像素

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
TPAMI 2026 | 腾讯 上海 AI Lab 联合出品 HAT:融合通道与窗口注意力,激活图像复原更多像素
点击上方“小白学视觉”,选择加"星标"或“置顶” 重磅干货,第一时间送达

在计算机视觉领域,图像复原一直是经久不衰的研究方向,从手机摄影的画质增强到监控图像的清晰化,再到医学影像的细节还原,都离不开这项技术的支撑。近年来,Transformer凭借强大的表征能力在图像复原任务中崭露头角,但现有基于Transformer的方法(如SwinIR)仍存在两大核心痛点:一是利用输入信息的空间范围有限,二是跨窗口信息交互不足导致中间特征出现块状伪影。

针对这些问题,来自腾讯、港中文等机构的研究团队提出了混合注意力Transformer(HAT),通过创新的注意力机制设计和高效的预训练策略,不仅激活了更多输入像素用于高质量重建,还在经典超分辨率、真实世界超分辨率、图像去噪、JPEG压缩伪影减少等多个图像复原任务上达到SOTA,甚至大幅提升了超分辨率任务的性能上限。今天,我们就来深度解读这篇发表于TPAMI 2026的重磅研究!

论文信息

题目: HAT: Hybrid Attention Transformer for Image Restoration
用于图像恢复的混合注意力Transformer
作者:Xiangyu Chen, Xintao Wang, Wenlong Zhang, Xiangtao Kong, Yu Qiao, Jiantao Zhou, Chao Dong

一、现有方法的“致命短板”

在深入了解HAT之前,我们先搞清楚:为什么当红的SwinIR还不够好?

研究团队通过局部归因图(LAM)分析发现,尽管SwinIR在超分辨率任务上的定量性能优于传统CNN(如RCAN),但它实际利用的输入像素范围反而更小(见图2)。这意味着SwinIR的优势仅来源于更强的局部信息建模能力,而非大家默认的“长程依赖建模优势”,在需要广泛上下文信息的场景中表现拉胯。

同时,研究团队还观察到SwinIR的中间特征存在明显的块状伪影(见图4),这是因为其移位窗口机制未能充分实现跨窗口信息交互——窗口划分导致特征被“割裂”,最终影响重建效果。

图2:不同超分辨率网络的LAM分析结果,可见SwinIR利用的输入像素范围(热力图覆盖区域)远小于RCAN

图4:SwinIR(左)与HAT(右)中间特征对比,SwinIR存在明显块状伪影,HAT伪影显著缓解

二、HAT核心设计:三大创新破解痛点

为了突破现有方法的局限,HAT从网络架构、核心模块、训练策略三个维度进行了全方位创新,先来看HAT的整体架构(见图5),这是理解所有细节的基础:

图5:HAT整体架构图。(a)(b)分别为超分辨率/等分辨率复原任务的网络结构;(c)残差混合注意力组(RHAG);(d)混合注意力块(HAB);(f)通道注意力块(CAB)

1. 混合注意力块(HAB):全局+局部,激活更多像素

HAB是HAT的核心基础模块,它将通道注意力(CAB)与基于窗口的自注意力(W-MSA)并行结合,既解决了自注意力信息范围有限的问题,又保留了其局部表征优势:

  • 扩大窗口大小:将传统的8×8窗口扩大到16×16,无需堆叠更多层就能覆盖更广的局部区域,且计算成本仅小幅增加(参数从11.9M增至12.1M,乘加运算增加19%),但在Urban100数据集上PSNR直接提升0.36dB(见图7);

  • 引入通道注意力:通过CAB捕捉全局信息,尤其适用于存在大量相似纹理的场景。为了避免卷积带来的高计算成本,CAB通过压缩因子β减少卷积层通道数,再结合通道注意力模块自适应缩放特征,最后用小权重因子α(默认0.01)与自注意力特征融合,避免优化冲突。

图7:不同窗口大小的定性对比,16×16窗口(右)重建的纹理比8×8窗口(左)更清晰

2. 重叠交叉注意力块(OCAB):打通跨窗口“信息壁垒”

为了彻底解决块状伪影问题,HAT设计了OCAB模块(见图6),核心思路是让查询(Q)、键(K)、值(V)使用不同大小的窗口划分:

  • Q仍采用16×16的非重叠窗口,保证计算效率;

  • K和V则采用更大的重叠窗口(重叠率γ默认0.5),让每个查询窗口能捕捉到相邻窗口的信息,实现更直接的跨窗口交互。

相比SwinIR的移位窗口机制,OCAB无需依赖多层堆叠就能实现跨窗口信息融合,从根源上缓解了块状伪影。实验证明,仅OCAB模块就能让Urban100数据集的PSNR提升0.1dB。

图6:重叠交叉注意力(OCA)的窗口划分方式,Q为非重叠窗口,K/V为重叠窗口,实现跨窗口信息交互

3. 同任务预训练:大规模数据才是关键

此前的预训练方法(如IPT、EDT)要么做多任务预训练,要么做多退化级别预训练,而HAT提出同任务预训练策略:直接在ImageNet(128万张图像)上对单一任务(如×4超分辨率)进行预训练,再在DF2K等小数据集上微调。

研究团队验证了这一策略的优越性(见图9):

  • 所有网络(CNN/Transformer)都能从该策略中受益,且模型容量越大,增益越明显;

  • HAT作为大模型,从预训练中获得的性能提升最多,证明Transformer对大规模数据的需求远高于CNN;

  • 对比多任务预训练,同任务预训练能避免“泛化有余、专精不足”,在特定复原任务上表现更优。

图9:不同网络在预训练前后的性能增益对比,HAT的增益最为显著

三、实验结果:全方位刷新SOTA

1. 消融实验验证模块有效性

在Urban100 ×4超分辨率任务上的消融实验(表3)显示:

  • CAB和OCAB分别带来0.1dB的性能增益,两者结合后增益达0.16dB;

  • CAB中通道注意力模块的引入能提升0.05dB,α=0.01时性能最优;

  • OCAB的重叠率γ=0.5时效果最好,过小或过大都会导致性能下降。

2. 复杂度与性能平衡

HAT在保证性能的同时,还兼顾了计算效率:

  • 通过调整CAB的压缩因子β,可灵活权衡性能与复杂度(β=3时为默认设置,性能和计算量达到最佳平衡);

  • 对比SwinIR,HAT-S(轻量化版本)在参数更少、计算量相当的情况下,性能显著超越原版SwinIR;即使将SwinIR扩大到与HAT同等计算量,HAT仍以最低成本实现最佳性能。

3. 多任务SOTA表现

HAT不仅在经典超分辨率任务上表现优异,还扩展到真实世界超分辨率、图像去噪、JPEG压缩伪影减少等任务:

  • 经典超分辨率:在Set5、Set14、Urban100等数据集上,PSNR/SSIM全面超越SwinIR、EDT等现有方法;

  • 真实世界超分辨率:基于BSRGAN/Real-ESRGAN退化模型训练的HAT,在真实图像上的重建效果更接近真实纹理;

  • 图像去噪/压缩伪影减少:在高斯去噪、JPEG伪影减少任务上,定量和定性指标均达到当前最优。

四、总结:不止于SOTA,更定义新方向

HAT的成功并非偶然,它的核心价值在于:

  1. 首次通过可解释性分析(LAM、因果效应图)揭示了现有图像复原Transformer的核心短板,为后续研究提供了明确的优化方向;

  2. 提出的混合注意力机制,为融合CNN与Transformer的优势提供了新范式,既保留Transformer的局部表征能力,又弥补了其全局信息建模的不足;

  3. 验证了“大规模同任务预训练”对Transformer的重要性,为大模型在低级视觉任务中的应用奠定了基础。

从实际应用角度,HAT构建的模型系列(HAT、HAT-S、HAT-L)兼顾了轻量化和高性能,既可以部署在移动端实现实时图像增强,也能在服务器端通过HAT-L突破性能上限。相信这一研究不仅会推动图像复原领域的发展,也能为其他低级视觉任务的Transformer设计提供参考。

如果你也关注图像复原或Transformer在计算机视觉中的应用,这篇论文绝对值得精读——它不仅给出了优秀的解决方案,更教会我们如何从可解释性分析出发,找到现有方法的核心痛点,进而提出真正有价值的创新。

下载1:OpenCV-Contrib扩展模块中文版教程

在「小白学视觉」公众号后台回复:扩展模块中文教程,即可下载全网第一份OpenCV扩展模块教程中文版,涵盖扩展模块安装、SFM算法、立体视觉、目标跟踪、生物视觉、超分辨率处理等二十多章内容。

下载2:Python视觉实战项目52讲

在「小白学视觉」公众号后台回复:Python视觉实战项目,即可下载包括图像分割、口罩检测、车道线检测、车辆计数、添加眼线、车牌识别、字符识别、情绪检测、文本内容提取、面部识别等31个视觉实战项目,助力快速学校计算机视觉。

下载3:人工智能0基础学习攻略手册

在「小白学视觉」公众号后台回复:攻略手册,即可获取《从 0 入门人工智能学习攻略手册》文档,包含视频课件、习题、电子书、代码、数据等人工智能学习相关资源,可以下载离线学习。

交流群

欢迎加入公众号读者群一起和同行交流,目前有SLAM、三维视觉、传感器、自动驾驶、计算摄影、检测、分割、识别、医学影像、GAN、算法竞赛等微信群(以后会逐渐细分),请扫描下面微信号加群,备注:”昵称+学校/公司+研究方向“,例如:”张三 + 上海交大 + 视觉SLAM“。请按照格式备注,否则不予通过。添加成功后会根据研究方向邀请进入相关微信群。请勿在群内发送广告,否则会请出群,谢谢理解~

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/26 19:32:33

Z-Image-GGUF自动化运维:基于Shell脚本的模型服务监控与重启

Z-Image-GGUF自动化运维:基于Shell脚本的模型服务监控与重启 你有没有遇到过这种情况?一个跑得好好的AI文生图服务,突然就卡住了,或者直接崩溃了。尤其是在生产环境里,半夜三更收到告警,爬起来重启服务&am…

作者头像 李华
网站建设 2026/8/23 9:41:16

量化交易开源项目Veighna与VNPY纠纷始末:法院判决详解与开发者避坑指南

量化交易开源项目法律纠纷启示录:技术社区运营的合规边界与风险防范 在量化交易这个技术密集型的领域,开源项目已经成为开发者们共享智慧、推动行业进步的重要平台。Veighna与VNPY这两个知名开源项目之间的法律纠纷,为技术社区运营者敲响了警…

作者头像 李华
网站建设 2026/8/23 9:41:16

AI Agent 避坑指南:框架选型、代码规范与企业安全部署

AI Agent 避坑指南:框架选型、代码规范与企业安全部署 2026年,AI Agent 迎来规模化落地爆发期,越来越多企业从“概念验证”转向“生产部署”,试图通过智能体替代重复性人工、提升业务效率。但多数团队在落地过程中,都会…

作者头像 李华
网站建设 2026/8/23 9:41:16

【超分辨率】SRCNN实战:从PyTorch复现到TensorBoard可视化调优

1. 超分辨率与SRCNN基础入门 当你用手机拍了一张模糊的照片,或者看老电影时画面不够清晰,这时候超分辨率技术就能派上用场了。简单来说,超分辨率就是让低分辨率图像变清晰的技术。SRCNN(Super-Resolution Convolutional Neural Ne…

作者头像 李华
网站建设 2026/8/23 9:41:17

ST7735 Arduino驱动库:硬件适配与帧缓冲图形开发指南

1. 项目概述1.1 库定位与工程价值ST7735_LTSM 是一款面向 Arduino 生态系统的 C 驱动库,专为 ST7735 系列 SPI 接口 TFT LCD 显示屏设计。其核心价值不在于简单点亮屏幕,而在于提供工业级嵌入式显示子系统能力:支持硬件/软件双 SPI 模式、全功…

作者头像 李华