新芽专题介绍(22):基于深度学习的图像压缩
选择此专题并在新芽系列课程中获得优秀的同学,可进入后续选拔环节。
一、专题介绍
1.1 研究背景
随着移动互联网、高清视频、云计算与人工智能技术的快速发展,图像与视频数据已成为信息传播、存储和智能分析的主要载体。从智能手机拍照、社交媒体分享,到自动驾驶、遥感观测与医学影像分析,海量视觉数据每天都在被产生、传输、存储和处理。
然而,原始图像数据体量巨大,不仅对存储空间提出了很高要求,也对网络带宽和实时传输能力构成挑战。图像压缩因此成为现代信息系统不可或缺的基础模块:其核心目标是在尽可能降低数据量的同时,最大程度保留图像的视觉质量和语义信息。
传统图像压缩标准,如 JPEG、JPEG2000、HEVC 和 VVC,依赖人工设计的变换、量化与熵编码策略,在过去几十年中取得了巨大成功。但随着应用场景日益复杂,以及人工智能任务不断涌现,这类以人眼感知为中心的压缩范式逐渐显现出性能与适应性的瓶颈。
近年来,深度学习在表示学习和端到端优化方面展现出强大能力,推动基于深度学习的图像压缩快速发展,并使其成为计算机视觉与多媒体领域的重要前沿方向。
1.2 研究意义
基于深度学习的图像压缩,正在重塑我们对“压缩”这一经典问题的理解,其重要意义主要体现在以下几个方面:
突破传统压缩框架的性能上限:深度神经网络能够自动学习更高效、更贴合数据分布的表示形式,在相同码率下提升重建图像质量,或在相同质量下实现更高压缩率。
服务智能感知与下游任务:在自动驾驶、目标检测、遥感分析等场景中,压缩图像不仅要“好看”,更要“好用”。深度学习压缩可以与下游任务联合优化,实现面向机器视觉的任务感知压缩。
推动端侧与低算力设备应用:通过模型轻量化与自适应码率控制,深度学习压缩有望在移动端、无人机、卫星等资源受限平台上实现高效的视觉数据处理。
促进多学科交叉融合:这一方向融合信息论、信号处理、深度学习、优化理论与视觉感知,是适合开展系统科研训练的交叉研究课题。
因此,基于深度学习的图像压缩既具有重要工程价值,也在学术研究中展现出持续的创新潜力,是进入视觉与表示学习领域的良好切入点。
1.3 当前主要挑战
尽管深度学习为图像压缩带来了新的可能性,这一方向仍面临多方面挑战:
挑战一:高压缩率与高视觉质量的矛盾
在极低码率条件下,图像容易出现模糊、块效应或结构失真。
深度模型可能生成“看起来合理”的纹理,却偏离原始图像内容,影响真实感与一致性。
如何在压缩率、失真度和感知质量之间取得平衡,仍是核心难题。
挑战二:熵建模与码率控制复杂
相比传统压缩中成熟的熵编码机制,深度学习模型中的概率建模更为复杂。
准确、可训练且高效的熵模型,直接决定压缩性能的上限。
多码率与自适应压缩仍难以在单一模型中高效实现。
挑战三:计算开销与部署限制
深度压缩模型通常包含大量卷积或 Transformer 结构,对算力和内存要求较高。
在实际应用中,如何在压缩性能、处理速度与功耗之间权衡,是模型落地的重要障碍。
挑战四:评价标准与任务导向差异
传统指标,如 PSNR、MS-SSIM,不能完全反映人类主观感知或下游任务性能。
如何建立更合理、任务导向的评价体系,是当前研究热点之一。
总体而言,基于深度学习的图像压缩仍处于快速发展阶段,理论与实践中都存在大量值得探索的问题,非常适合开展循序渐进的研究训练。
二、学习资料与参考文献
为了引导新芽学子逐步进入研究,本专题结构分为以下四部分:
2.1 基础教材与学习材料
在开始探索之前,你需要掌握一些基础的“内功心法”。以下书籍与教程可作为学习的起点:
《Deep Learning》(Ian Goodfellow 等)——深度学习入门经典教材
PyTorch 官方教程 / PyTorch 中文文档——深度学习实践工具
CS231n: Convolutional Neural Networks for Visual Recognition——计算机视觉与卷积神经网络公开课
《数字图像处理》(Rafael C. Gonzalez 与 Richard E. Woods)——图像处理基础教材
此外,你也可以使用一些入门工具:
Google Colab:免费云平台,无需本地配置即可运行 PyTorch 代码。
Kaggle 平台:提供公开数据集、Notebook 环境与竞赛资源。
Tips:不必等到所有基础都打好再进入下一阶段。建议在实践中学习,遇到不明白的问题再有针对性地回溯补足基础。
2.2 入门文献(学习式图像压缩经典方法)
学生第一阶段的阅读训练,旨在建立率失真优化、概率熵模型和端到端学习式压缩的整体认识。仅用于入门,不可选择此部分文献汇报。
End-to-End Optimized Image Compression(ICLR 2017)
Variational Image Compression with a Scale Hyperprior(ICLR 2018)
Joint Autoregressive and Hierarchical Priors for Learned Image Compression(NeurIPS 2018)
High-Fidelity Generative Image Compression(NeurIPS 2020)
Checkerboard Context Model for Efficient Learned Image Compression(CVPR 2021)
2.3 进阶文献(学习式图像压缩前沿方法)
学生可在此部分选择进阶文献进行专题汇报,或自行查找最新的同类重要文献。
Learned Image Compression with Mixed Transformer-CNN Architectures(CVPR 2023)
Generative Latent Coding for Ultra-Low Bitrate Image Compression(CVPR 2024)
Towards Backward-Compatible Continual Learning of Image Compression(CVPR 2024)
Learned Image Compression with Dictionary-based Entropy Model(CVPR 2025)
2.4 基于深度学习的图像压缩领域相关方向
结合本专题的研究背景,建议从“图像如何被表示、哪些信息应被保留、如何与应用任务协同”三个问题逐步深入。学生可围绕以下方向选择进阶文献进行专题汇报,或自行查找最新的重要工作。
率失真优化与熵建模
重点理解端到端学习式压缩的基本框架:编码器将图像映射为潜变量,量化与熵模型控制码率,解码器负责重建图像。可进一步关注超先验、自回归上下文模型、分组上下文模型等如何提升概率估计精度。
感知质量与生成式压缩
在超低码率下,仅以像素误差为目标常会导致图像过于平滑。该方向关注如何利用感知损失、对抗学习或生成模型,在码率受限时获得更符合人眼感知的重建结果,同时避免虚构关键内容。
高效编码与端侧部署
学习式压缩的性能提升往往伴随更高的推理开销。该方向研究轻量化网络、并行上下文建模、快速熵编码以及可变码率机制,以支持移动端、无人机和卫星等资源受限设备。
任务感知与语义压缩
面向自动驾驶、目标检测、遥感分析等任务时,压缩系统需要保留对下游模型真正有价值的信息。该方向可研究压缩与检测、分割、检索等任务的联合训练,以及适用于机器视觉的评价指标。
三、结语与期望
图像压缩是一个“老问题、新方法”并存的研究方向。深度学习的引入,不仅带来了性能上的突破,也促使研究者重新思考:什么信息值得被保留,怎样才能以更少的比特表达更有价值的视觉内容。
希望通过本专题,新芽学子能够:
建立对图像压缩问题的整体认知;
掌握端到端深度学习建模思路;
学会在工程需求与理论分析之间寻找平衡;
在经典问题中发现创新空间。
我们期待在最终汇报中,看到大家对这一专题的深入思考与大胆尝试,让经典问题焕发新的生命力!