畅联云平台丨新一代 AV2 视频编码标准发布,压缩效率提升约 30%,将带来哪些改变?

2026年8月10日
畅联云平台丨新一代 AV2 视频编码标准发布,压缩效率提升约 30%,将带来哪些改变?

干安防集成这行多年,从 H.264 熬到 AV1 大规模落地,亲眼见过每一代编码标准出来时的行业热闹,也踩过不少 “追新翻车” 的坑。今年 5 月 28 日 AOMedia 把 AV2 v1.0.0 规范正式定稿,6 月初官方官宣之后,同行群和朋友圈直接炸了,好多开发商、集成商上来就问:码率省 30%,是不是下个月就能把项目全换成 AV2 降成本?

说实话,我第一反应不是兴奋,是心里咯噔一下 —— 得,又得挨个跟客户解释 “为啥不能明天就全量切换” 了。

先给大伙交个底:AOMedia 官方的说法是,同画质下 AV2 比 AV1 省约 30% 的码率,屏幕内容、HDR、8K 这类特定场景能接近 40%;Netflix 的工程师 Norkin 放出的实测数据,PSNR-YUV 下 BD-rate 改善约 28.7%,VMAF 下约 32.6%,和官方口径基本对得上。但公道话得说在前头,独立第三方的全场景验证还在推进,真实业务里的收益会跟着画面场景浮动,别被厂商宣传里的 “暴降 30%” 带跑了节奏。

今天就跟同行说点实在的:这 30% 到底是从流水线哪一环抠出来的,落到咱们做 AIoT、做智慧安防的项目里,到底是红利还是坑,架构上该怎么准备。尽量说人话,不绕没用的术语。

先掰扯最容易被炒歪的一点:AV2 不是 “AI 编码器”

这两天刷到不少自媒体喊 “AV2 用上 AI 编码了!”—— 别闹,真不是这么回事。

AV2 v1.0 的底层仍然是传统混合块编码的老路子:画面切块、预测、变换、量化、熵编码、环路滤波,和三十多年来所有主流编解码器的核心框架没区别。规范本身没有把 AI / 机器学习放进核心编码流程里,核心目的就是保证解码器足够轻,普通消费级芯片就能跑,不用额外搭 NPU。

它所谓的 “数据驱动”,是离线用机器学习训练出变换核、预测矩阵这些参数,把训练好的固定结果固化到标准里。解码的时候跑的还是经典流水线,不会实时跑神经网络。说白了,是用 AI 辅助制定标准,不是让设备跑 AI 编码,这俩完全是两码事。

当然它也适合和外部 AI 模块搭配,比如在编码器前面挂个 AI 降噪、超分的预处理层,喂给 AV2 更干净的源画面,整体压缩效果还能再往上提一截。但这是两套独立的东西,别混为一谈。

先泼完冷水,再讲更现实的代价:按照 VideoLAN 负责人 Jean-Baptiste Kempf 对参考软件的实测,AV2 软件解码的复杂度大概是 AV1 的 5 倍,编码器复杂度只会更高。眼下没有任何量产芯片带 AV2 硬件解码能力,行业普遍预期硬件解码器要到 2027-2028 年才会出现在商用芯片里,真正大规模普及得等到 2028 年之后。也就是说,未来三五年里,AV1 和 AV2 一定是长期共存的状态,这点做技术选型的心里得先有数。

30% 的码率节省,到底是怎么抠出来的

很多人只记住了 30% 这个数字,不知道收益是散在整条编码流水线的每一个环节里,每一处改动都带着明确的取舍。挨个拆开说,都是做工程的,看懂了底层逻辑,才好算自己项目里的真实收益。

块划分:超级块翻一倍,大块省比特、小块保细节

AV1 的最大超级块是 128×128,AV2 直接拉到了 256×256。

做安防的都懂,监控画面里大半是天空、墙面、停车场这种大面积平滑区域,用小块切的话,块边界多、额外开销大;换成 256×256 的大块,一整块平滑区域可能就一个划分,开销直接降下来。遇到文字、人脸、移动物体这种细节密集的地方,再逐级往下拆成小块。

光做大块还不行,容易把解码端的带宽和算力拉爆。所以 AV2 加了个半解耦划分(SDP),搭配好几种非对称划分模式:大尺寸块里亮度和色度共享划分策略,省掉重复计算;到 64×64 及以下的小块,又允许各自独立划分,保住细节。

做过边缘设备优化的都懂,这种 “编码端使劲卷、解码端能省则省” 的设计有多重要 —— 直接关系到边缘网关的硬件成本,不是纸面参数那么简单。

预测:参考帧变多,预测越准残差越小

压缩的核心逻辑就是预测:当前这块画面,能不能用旁边的块、或者前面几帧的画面拼出来。拼得越准,剩下的残差就越小,要编码的数据就越少。

帧内预测这边,AV2 用了数据驱动帧内预测(DIP),不是老一套的几何角度插值,而是用海量真实画面离线训练出投影矩阵,面对墙面、纯色背景这种重复单调的纹理,预测精度提升很明显。CfL 亮度推导色度也做了优化,夜视低照度的 HDR 画面适配性更好。

帧间预测的改动更实在,参考帧上限从 AV1 的 2 帧拉到了最多 7 帧,还加了时间插值、光流运动微调、简化多参考帧这些工具。像慢云台、移动车辆这类画面,运动补偿能贴得更准,残差进一步收缩。还有帧内块拷贝(IBC)的优化,对监控里反复出现的标牌、围挡这类静态图案,压缩效率提升很直观。

当然代价也有,编码器的搜索空间变大了,复杂度又涨了一截。但解码端只是按语法解析,不用做复杂搜索,咱们做平台、做终端的,解码侧压力不会因为预测工具变多就暴涨,这点还算厚道。

变换:数据驱动变换,是这代最核心的改动

这块我得多说两句,个人觉得这是 AV2 和以往所有编码标准最不一样的地方。

传统编码用的 DCT 离散余弦变换,变换核是固定的数学公式。AV2 引入了 DDT 数据驱动变换 —— 提前用 KLT 算法,拿海量真实视频的残差数据离线训练出多套变换核,直接固化到标准里。

说人话就是,这个变换核是 “从真实视频里学出来的”,不是凭空推导的数学公式,所以对真实场景残差的能量集中能力比 DCT 强得多。同样一块残差,过一遍 DDT,大部分能量都会塌缩到少数几个低频系数上,后面量化的时候就能放心扔掉更多高频细节,又不怎么影响主观画质。

配合 DDT 的还有两个辅助工具:IST 二次变换,给低频系数再做一次降维,进一步挤掉无效信息;CCTX 跨色度分量变换,利用色度之间的相关性做联合编码。三者搭配下来,残差能量的集中程度比 AV1 高一大截,这也是 30% 总收益里贡献最大的单项技术之一。

顺带提一句,AV2 还把原生 64 点 DCT 给砍了,换成 32 点逆变换加残差上采样。看着像是 “减配”,实际上 256×256 大块普及之后,大尺寸变换的需求本身就在减少,用极小的画质损失换来了硬件实现难度的大幅下降 —— 标准制定的人是真懂芯片设计的难处。

量化:扔掉查找表,用网格找最优解

AV1 的量化靠好几张查找表映射步长,维护起来繁琐。AV2 直接换成统一的指数公式做步长映射,逻辑干净了很多。

真正的升级是 TCQ 网格编码量化。它搞了 Q0、Q1 两个子量化器,重建电平错开半个步长。编码器用 Viterbi 动态规划,在 8 个状态的网格里找率失真最优的路径 —— 说白了就是把 “每个系数量化用 Q0 还是 Q1” 变成了一个最短路径问题,找全局最优解,而不是逐系数单独决策。

单个系数看差别不大,整帧算下来,码率和失真的平衡能做得更精细。同样,复杂度涨在编码端,解码端只需要按语法查表重建,感知不到 TCQ 的存在。

熵编码:三个毫米级优化,积少成多

熵编码是压缩的最后一公里,单个工具提升幅度都不大,但几个小优化叠起来,对总收益的贡献不容小觑。AV2 底层还是沿用 MS-AC 多符号算术编码器,没换引擎,只在 “怎么把数据喂给编码器” 上做了三处微调。

PARA 概率自适应率调整,通过偏移参数动态调节 CDF 概率表的收敛速度,监控画面经常有场景突变、光线切换,这个工具能让概率模型更快贴合新画面的符号分布,少浪费比特。

FSC 前向跳过编码,专门针对屏幕内容。电脑屏幕、工控界面这类有大量锐利文字边缘的画面,走频域变换反而会打散能量,AV2 干脆跳过变换,直接对空间残差做旁路编码 —— 这也是 AV2 在屏幕内容场景能省近 40% 码率的核心原因,做指挥大厅大屏、工业 HMI 的同行可以重点关注。

还有个很巧的 PH 奇偶校验隐藏:当 AC 系数不少于 4 个时,编码器微调这些系数的奇偶性,让它们和 DC 系数的符号位保持一致。解码端只要算一下 AC 系数的奇偶,就能隐式推出 DC 的属性,直接省掉一个比特的显式信令。

这三项单个可能也就贡献 0.5%-1% 的收益,但架不住多。干过编解码优化的都懂,到了 AV1 这个成熟度,再想抠 30% 不可能靠某一项黑科技,全是几百个 0.1% 的优化堆出来的,AV2 干的就是这个笨功夫。

环路滤波:统一链路,给解码端减负

AV1 的环路滤波是多级串联,去块、CDEF、环路恢复一路算下来,模块多逻辑杂。AV2 换成了统一的通用去块滤波器,新增 GDF 导向细节滤波器和 CCSO 跨分量采样偏移。CCSO 用亮度信息校正色度误差,对安防常用的 4:2:0 采样格式特别友好,夜视画面的色度噪声能压得更干净。

整体思路和块划分的设计一脉相承:编码端可以使劲堆复杂度,解码端能省就省,尽量控制硬件实现的门槛。

落到安防场景:红利和坑各占一半

讲完技术原理,还是得落回咱们的老本行。AV2 对智慧社区、园区安防、高空抛物这类项目的影响,得拆开四个维度看,不能只盯着码率下降瞎乐。

带宽侧的利好最直观。比如 4K 高空抛物摄像头,单路上行码率原本 4-8Mbps,几十路同时回传的话,公网带宽是一笔不小的固定开销。同画质下码率约降 30%,跨公网的带宽成本、4G/5G 的流量成本都能明显压缩。但要注意,这是理想场景的均值,夜间低照度、车流密集的路口这类画面,实际节省会打折扣,做预算别直接按 0.7 倍硬套。

存储侧的收益也很实在。边缘 NVR、云端冷存储、取证片段归档的占用量都会同步收缩,同样的硬盘容量,录像留存周期能拉长一截。对有明确合规留存要求的项目,成本压力会小很多。但同样,别直接拿 30% 去做存储规划,拿自己项目的真实样本跑一遍实测最稳妥。

最容易踩坑的是边缘侧,甚至有点反直觉:码率是降了,但智能分析网关的整体算力压力反而可能涨。

原因很简单 —— 现在没有硬件解码,全靠 CPU 软解,复杂度是 AV1 的 5 倍。如果网关既要做 AV2 解码,又要并行跑高空抛物轨迹识别、周界入侵检测这类 AI 推理,很容易出现解码把 CPU 占满,AI 推理算力不够、延迟飙升的情况。我当年 H.265 刚普及的时候就踩过类似的坑,软解吃满处理器,智能分析直接卡成 PPT。所以智能分析网关的硬件选型必须重新评估算力余量,不能看见 “码率降 30%” 就盲目乐观。

平台侧的改动相对可控。GB28181、RTSP 这些传输协议本身不用变,但 AIoT 平台的多媒体接入层、转码流水线、解码库都要做升级,必须支持 AV1/AV2 双栈兼容,向下还要兼容 HEVC。毕竟未来三五年新老设备混装是常态,不可能一刀切全换成 AV2。

物联底座的价值:把编码迭代的成本收到底层

编码标准是隔几年就迭代一次的东西,如果每个项目、每代标准都从零重写解析、转码、调度逻辑,时间长了全是技术债。成熟的做法是把多媒体底层能力做抽象,让业务层专心做告警、做流程、做 AI 应用,不用跟着编码标准反复改底层。

像美畅智能物联中台UCC,核心定位就是设备层和业务层之间的抽象层。向下把不同厂商的设备协议做归一,把 AV1、AV2、HEVC 多格式解析、转码调度都封装到底层;向上输出标准化的事件和媒体接口,还能给分布式的智能分析网关统一调度媒体处理任务。开发团队不用每一代编码都重做一遍底层适配,能省不少重复劳动。

但边界也得说清楚:这类中台能解决软件层面的格式适配、调度管理问题,解决不了芯片没有硬解单元的硬件短板。软解带来的高算力消耗,平台再优化也绕不开,最终还是得等芯片厂商的硬件生态跟上来。别指望买一套中台就能抹平硬件代差,那不现实。

给集成商的话:Codec 升级避坑指南

踩了这么多代编码的坑,总结几条落地建议,都是实打实的经验,大伙当个参考。

第一,双栈兼容,渐进迁移,别搞一刀切。未来 3-5 年 AV1 和 AV2 必然共存,架构上一定要做 Codec 抽象层,把编解码模块和业务逻辑解耦。后续不管是 AV2 迭代还是再出更新的标准,改动都收拢在底层,不用动业务代码。边缘设备的固件也要支持动态加载双解码库,根据码流自动切换。

第二,边缘算力账要重新算,别想当然。AV2 软解复杂度是 AV1 的 5 倍,边缘网关如果既要解码又要跑 AI 推理,算力配比要重新评估。个人建议,实时分析类的边缘节点,等 2027-2028 年硬件解码器普及了再规模化上 AV2,现阶段用 AV1 过渡最稳妥。

第三,纯存储、纯转发的场景可以先吃红利。比如云端冷存储、跨机房备份这类不需要实时解码的场景,AV2 的压缩收益可以直接兑现,风险也低。这类后端存储环节可以先迁,前端实时分析环节暂缓,分阶段来最稳。

第四,别信 “AV2 立即可用” 的宣传。规范发布不等于设备就绪,不等于生态成熟。官方自己都承认第三方验证还在进行中。咱们做落地的,把它当成 2-3 年后的技术储备就行,先做 POC 验证,别急着上生产。

第五,做屏幕内容、工业 HMI 的团队可以提前布局。FSC 工具对屏幕类画面的优化是实打实的,接近 40% 的码率节省不是虚的,这类场景可以早做 POC,收益会比普通监控场景更明显。

写在最后

干了这么多年 codec,越来越觉得,每一代编码标准的迭代,从来不是什么颠覆性革命,都是工程上一点点抠出来的进步。AV2 这 30% 的增益,是 256×256 大块打底,DDT 主攻残差压缩,TCQ 优化量化,PARA/FSC/PH 在熵编码里抠每一个比特,再加上环路滤波给解码端减负,几百个小优化堆出来的结果。

它的长期潜力毋庸置疑,免专利费的特性也让它对商用项目很友好。但落地这件事,从来不是纸面参数说了算,得看芯片、固件、终端、平台整条链的成熟度。

对咱们做 B 端项目的人来说,最理性的做法就是:架构上提前留好 AV2 的位置,现阶段用 AV1 扛住业务,等硬件解码成熟了再逐步切换。技术是用来解决问题的,不是用来追新的。真正的工程智慧,从来不是选最新的标准,是选最合适的标准。

AV2 是未来,但未来还没到。咱们做落地的,总得在前沿和务实之间,给自己留一条稳妥的路。

美畅美畅物联畅联畅联云平台视频监控云平台云视频监控视频云平台视频开放平台视频感知云视频接入网关AIoT综合接入网关视频中台物联网中台视频上云网关EhomeI连锁行业智慧交通AI算法