视频编解码是压缩与解压缩数字视频的技术,其中「编解码器」(codec)一词由编码器(encoder)和解码器(decoder)组合而来[1]。编码器把原始视频转换成适合存储或传输的紧凑表示,解码器再把它还原成可以观看的形式,两者可以合在一起,也可以分开实现[2]。由于未经压缩的数字视频数据量极大,这项技术成为网络流媒体、数字广播、视频会议和手机拍摄等功能得以实现的前提。
定义
视频编解码指对数字视频进行压缩编码与解压缩解码的技术,其英文「codec」是 encoder(编码器)与 decoder(解码器)的合成词;只做压缩的设备通常称为编码器,只做还原的设备称为解码器[1]。压缩后的数据格式一般遵循某种标准的视频编码格式,由具体软件、固件或硬件实现对该格式的编解码[1]。
这种压缩通常是有损的,压缩后的视频会丢失原始视频中的部分信息,还原后清晰度低于原始视频[1]。视频质量、表示视频所需的数据量(由码率决定)、编解码算法的复杂度、对数据丢失和错误的敏感程度、可编辑性、随机访问能力以及端到端延迟之间,存在相互制约的复杂关系[1]。
原理
视频编码的基本思路是利用视频数据在空间、时间和色空间上的冗余与不相关性[3]。编码器把图像划分为互不重叠的块(如宏块或编码树单元)逐一处理,预测与变换通常在块一级进行[3][2]。彩色视频一般先由 RGB 转换为 YUV,把亮度分量与两个色度分量分开编码,因为人眼对亮度信息比色度信息更敏感。
预测分为两类:利用同一帧内已编码相邻样本的帧内预测,用来消除空间冗余;利用先前已解码帧进行运动补偿的帧间预测(也称时间预测),用来消除时间冗余[3]。编码器用原块减去预测块得到残差,再对残差做离散余弦变换(DCT)等变换、量化,最后做熵编码,把出现频率高的符号映射为较短码字[2][4]。整个流程中只有量化不可逆,它是信息损失的主要来源;解码端依次做熵解码、逆量化、逆变换,再加上预测块重建图像[4]。
编码器常按率失真代价在多种编码模式间取舍。代价函数把传输所需码率与重建视频相对原始视频的失真加权求和,$\mathcal{L}=D(x,\hat{x})+\lambda R(\hat{x})$,其中 $\lambda$ 为拉格朗日乘子,失真用均方误差(MSE)或结构相似度等指标衡量,码率以每秒比特数(bps)计[5]。
flowchart LR
A[输入视频帧] --> B[分块]
B --> C[帧内/帧间预测]
C --> D[残差]
D --> E[变换 DCT]
E --> F[量化]
F --> G[熵编码]
G --> H[码流]
H --> I[熵解码]
I --> J[逆量化]
J --> K[逆变换]
K --> L[加预测块重建]
发展历程
1974 年,纳西尔·艾哈迈德(Nasir Ahmed)、T. Natarajan 与 K. R. Rao 提出了离散余弦变换压缩方法[1]。20 世纪 80 年代后期,一批公司开始试验用 DCT 有损压缩处理视频编码,日立、PictureTel、NTT、英国电信、东芝等企业参与其中,最终促成了 H.261 标准;H.261 是第一个实用的视频编码标准,此后各主要视频编码标准都沿用了 DCT 压缩[1]。
H.264/AVC 由国际电信联盟电信标准化部门(ITU-T)的视频编码专家组(VCEG)与国际标准化组织(ISO)和国际电工委员会(IEC)下属的运动图像专家组(MPEG)组成的联合视频组(JVT)制定,同时以 ITU-T H.264 建议书和 ISO/IEC 14496-10 国际标准发布,又称 MPEG-4 第 10 部分,自 2003 年前后发布以来成为视频领域广泛应用的标准[6][7]。H.265/HEVC 由 VCEG 与 MPEG 的联合协作组 JCT-VC 制定,2013 年发布,以 ITU-T H.265 与 ISO/IEC 23008-2 发布,目标是在同等主观质量下比 H.264 降低约 35% 至 50% 的比特率[6][7]。
开放媒体联盟(AOMedia)由英特尔、AMD、ARM、英伟达、思科、谷歌、Netflix、亚马逊、微软、Mozilla 等硬件厂商、内容分发商和浏览器维护者组成,目标是推出免版税的视频编解码器[8]。AV1 于 2018 年正式发布,整合了谷歌 VP10、Mozilla Daala、思科 Thor 等技术积累,在同等质量下码率平均比 HEVC 和 VP9 小约 30%[7]。此外,中国数字音视频编解码标准工作组开发了 AVS 系列标准[9]。
timeline
1974 : DCT 压缩方法提出
1980s : H.261 标准形成
2003 : H.264/AVC 发布
2013 : H.265/HEVC 发布
2018 : AV1 正式发布
应用
H.264/AVC 是蓝光光盘、互联网高清流媒体、智能手机高清录像以及欧洲地面高清电视广播等场景的常见格式,其压缩比远高于 MPEG-2 与 MPEG-4,代价是解码复杂度更高、编码开销明显增大[10]。H.265/HEVC 支持 10 位色深,对高动态范围内容支持较好,是超高清蓝光(4K Ultra HD Blu-ray)的强制性视频编码标准,也被新一代数字电视广播标准如 ATSC 3.0 用于传输 4K 内容,苹果等厂商的智能手机以其作为默认录像格式[7]。
AV1 针对互联网应用优化,被 Netflix、YouTube 等对带宽成本敏感的大型流媒体服务商采用,并用于视频监控等场景[11]。许多现代处理器以固定功能硬件提供 H.264 编解码支持,例如英特尔自 Sandy Bridge 起通过 Quick Sync 提供硬件编解码,操作系统则通过 DirectShow、DirectX、AVFoundation 等接口向应用开放这些能力[10]。
局限
视频编解码一般为有损压缩,压缩本身会丢弃原始视频中的信息,还原后的画面质量低于未压缩的原始视频[1]。压缩效率的提升往往以计算复杂度为代价:H.264/AVC 相比此前的标准需要更高的解码复杂度和显著更高的编码成本,H.265/HEVC 相对 H.264 又需要更多处理能力[10][7]。
标准本身通常只规定码流如何被解码,并不规定编码器如何实现,因此不同实现可以在同一格式下取得不同的压缩效率与速度[10]。H.265/HEVC 存在多个专利池,许可费用偏高且不确定,影响了它在网页与开源领域的普及;AV1 编码速度较慢,硬件解码支持仍在普及过程中[7][11]。此外,码流在传输中发生错误或丢失时,解码器需要依靠错误检测与隐藏机制用相邻画面内容替代受损区域,这本身也是实现中的难点[12]。
不同编码标准在块尺寸、预测模式和帧结构上的能力存在差异,例如 AV1 支持 56 个帧内预测方向,而 H.265 为 35 个、H.264 仅 9 个[13]。B 帧因参考后续帧而引入解码延迟,注重低延迟的直播和视频会议场景则需要采用按显示顺序编码的配置[13][14]。
参见
参考资料
- epfl.ch 上的网页 . epfl.ch [引用日期2026-10-04]
- google.com 上的网页 . google.com [引用日期2026-10-04]
- google.com 上的网页 . google.com [引用日期2026-10-04]
- iacr.org 上的 PDF 文件 . iacr.org [引用日期2026-10-04]
- TheseDEF_Marwa_TARCHOULI(PDF) . hal.science [引用日期2026-10-04]
- google.com 上的网页 . google.com [引用日期2026-10-04]
- expreview.com 上的网页 . expreview.com [引用日期2026-10-04]
- zhihu.com 上的网页 . zhihu.com [引用日期2026-10-04]
- [0037] 各种视频编解码技术可用于压缩视频数据 . googleapis.com [引用日期2026-10-04]
- Example video . cmu.edu [引用日期2026-10-04]
- 效率与兼容性的终极权衡——解析H.264, HEVC, AV1及VP9 . ctyun.cn [引用日期2026-10-04]
- US9788018(PDF) . googleapis.com [引用日期2026-10-04]
- wp_av1_codec_in_video_surveillance_t10242426_zh_2607(PDF) . axis.com [引用日期2026-10-04]
- TheseDEF_Charles_BONNINEAU(PDF) . hal.science [引用日期2026-10-04]
浏览次数:1 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-10-03T17:43:21Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。