你正在看一段AI修复的4K老电影。画面里,一辆红色轿车驶过街道——车身的漆面光泽被还原得纤毫毕现,但就在它转弯的瞬间,车门边缘开始诡异地"呼吸":前一帧还锐利的线条,后一帧突然模糊,再后一帧又回来了。
这不是幻觉。这是单步扩散视频超分辨率模型特有的"时间抖动"——一项让AI视频增强"跑得快却站不稳"的技术顽疾。所谓视频超分辨率(简称超分),就是把低清视频放大、补出高清细节。2026年7月,AMD和维尔茨堡大学的团队给这个问题找到了一个反直觉的解法:不是少压缩,而是更聪明地压缩。 他们提出的TRaM-VSR框架,在相同计算量下,画面不仅没有崩,反而比不压缩时更稳定。
一步到位,画面为什么反而抖?
要理解这个解法,得先搞清楚"一步到位"为什么比"慢慢来"更容易抖。
传统的扩散模型做视频超分,像画家反复修改画布:先生成模糊底稿,再一遍遍去噪、修正、补细节,通常迭代几十到上百次。每一次迭代都是纠错机会——上一轮把边缘画歪了,这一轮可以拉回来。代价是慢:处理几秒钟的视频可能要好几分钟。
2025年,DOVE等模型把这套流程压成一步——"单步扩散"。画家不再反复修改,而是看一眼低清画面,一笔画完。推理速度最高提升28倍,但代价同样明显:一笔画完,没有涂改的机会。 任何一笔画歪了,就永远歪在那里。视频里,这就表现为帧与帧之间的闪烁、鬼影、边缘抖动。
更糟的是,为了让这一笔画得够快,工程师们往往会用Token合并技术来"减负"。Token是什么?你可以把它理解为模型眼中的"图像像素块"——每个token代表画面中一小块区域的视觉信息,包括纹理、颜色和运动轨迹。扩散变换器(DiT)——一种用Transformer做扩散模型主干的架构——需要对所有token两两计算注意力。token数量一多,计算量就呈平方级暴涨。一段4K视频,token数轻松突破十万。
现成的加速方案叫ToMeSD,策略很简单:把相似的token两两合并,用平均值代替。这就像把全班学生按身高分组,每组只留一个代表。问题在于,这个"平均身高"既不代表姚明,也不代表你。 当合并发生在运动物体或精细纹理上时,关键的运动信息和边缘细节一起被平均掉了。在多步扩散里,后续迭代还能补救;在单步扩散里,一步错、步步错,抖动反而加剧。
给Token"分班":怎么判断谁该进精品班?
TRaM-VSR的核心思路,是把"一刀切"的合并,换成一次"分班考试"。
想象一所学校要精简教学资源。传统做法是随机合并班级——好学生和差生混在一起,所有人的进度都被拖慢。TRaM-VSR的做法是:先给每个学生打分,按分数分班——高分进"精品班"(小班教学,资源拉满),低分进"大班"(合并上课,保证基本覆盖),最后再把所有人"无缝合回来"。
打分是这场分班考试的灵魂,需要两个维度的评分,缺一不可。
第一维:谁在动,而且动得复杂? 这是TRaM-VSR最巧妙的设计——时间曲率引导(TCG)。它不看一个物体"移动了多远"(一阶速度),而是看"移动方式有多复杂"(二阶曲率)。匀速直线行驶的汽车,曲率很小;突然急转弯或加速的车,曲率很大。为什么曲率重要?因为越复杂的运动,越容易在超分时产生闪烁和伪影——汽车匀速前进,模型很容易预测它下一帧的位置;突然转向,模型就容易"猜错",导致边缘抖动。

TCG的做法并不复杂:先计算每个token在相邻帧之间的"速度"(位置变化),再计算速度的"变化率"(曲率)。曲率越大,token就越有可能被送入精品班。
第二维:谁在语义上更重要? 运动不是全部。如果画面里有一辆红色的车,而提示词恰好是"一辆红色汽车在道路上行驶",那么跟"红色""汽车"相关的token就该获得更高优先级。TRaM-VSR通过计算每个图像token与文本提示的语义相似度来捕捉这个维度。
两个维度加权融合——文本占六成、时序占四成——形成最终的重要性分数。消融实验揭示了为什么必须两者搭配:单独用文本评分,模型会忽略运动物体;单独用TCG,帧间抖动低至0.9068(全场最低,数值越小画面越稳),但画面纹理变差。以0.6比0.4融合后,感知质量和时间一致性双双拿下最优——既没有在运动物体上掉链子,也没有牺牲画面细节。
最后一步:在哪些"层"做分班? TRaM-VSR并不会在网络的每一层都做token压缩。它先用一个离线规划器,拿少量校准视频跑一遍,观察每一层被压缩后对最终输出的扰动有多大——扰动小的层就是"安全区",适合做路由;扰动大的层保持全分辨率,一个token都不丢。这个规划只需做一次,推理时直接复用,几乎零额外开销。
一张"快照",守住所有被丢弃的细节
分班之后,token进入路由区间,兵分两路:
本地流(精品班):得分最高的token以全保真度处理,负责恢复精细纹理和结构边缘。全局流(大班):得分低的token被合并成少量紧凑的全局token,以极低成本提供"大背景"信息。
但这里有一个致命隐患。在大班里,被合并的token会互相"污染"——一个背景token的特征混入了运动物体的信息,反之亦然。在传统ToMeSD里,这种污染合并后就固化了,原本的细节再也找不回来。
TRaM-VSR的解法堪称"耍赖"——但极其有效。
在每个路由区间的入口,所有token的特征都被"拍了一张快照"存档。区间内的计算照常进行,但到了区间出口,那些被合并的token位置,不采用全局流的输出,而是直接把入口处保存的原始特征贴回去。
这意味着什么?被压缩的token其实根本没有"参与"这段复杂计算——它们只是被原封不动地传递了过去。精品班的学生享受了最好的教育,大班的学生也没有丢失任何信息。计算量大幅下降——原来要对全部token两两配对计算,现在只需要对精品班的少数token和大班的几个代表分别计算——但信息完整性零损失。

这个"安全网"是整个框架的点睛之笔。它让模型敢于在更大范围内进行更大比例的token压缩,而不用担心细节崩塌。对比实验中,当DOVE模型直接应用均匀合并(ToMeSD)时,汽车边缘和建筑纹理出现了严重断裂和模糊;而TRaM-VSR在相同压缩比下,结构完整、纹理清晰。
定量结果同样硬核。衡量帧间抖动程度的指标,数值越低画面越稳。在SPMCS测试集上,TRaM-VSR的抖动指标低至0.97,而多步扩散模型MGLD-VSR是1.68,STAR是1.01。在YouHQ40数据集上,单步模型DOVE的同一指标高达2.05——TRaM-VSR的抖动不到DOVE的一半,画面几乎看不到闪烁。
4K超分,离跑在游戏显卡上还有多远?
TRaM-VSR的出现,不只是学术圈的一次指标刷新。它回答了一个更实际的问题:视频超分能不能从云端落到消费级硬件上?
答案正在变得乐观。TRaM-VSR通过token路由大幅降低了计算量,工程师可以通过调节一个"丢弃比率"参数,在速度和精度之间灵活滑动——想快就多丢几个token,想精就多保留一些。同一套框架,既能跑在云端数据中心的高端GPU(如NVIDIA A100)上做极致画质,也能在消费级显卡上跑得动。
AMD在这篇论文中的参与本身就传递了一个信号。长期以来,NVIDIA凭借其CUDA计算生态在AI推理领域占据绝对优势,但AMD正通过自家的ROCm计算平台和开源工具链迎头追赶。TRaM-VSR的代码已完全开源,且方法不依赖特定DiT架构——理论上可以迁移到任何基于Transformer的视频生成或修复任务中。对于手握24GB大显存消费级显卡的用户来说,这是一个值得关注的动向。
市场也在加速。AI视频增强市场正以每年近四成的复合增长率扩张,AWS已上线云端超分服务,微软Teams的实时视频超分功能也已向普通用户开放。从老电影修复到视频通话画质增强,从安防监控的模糊车牌识别到手机夜景视频提亮,"又快又稳"的超分正在成为数字生活的基础设施。
但这套方案并不完美。它最大的软肋是离线规划对校准集的依赖——如果部署场景的视频类型与校准集差异过大,比如校准用的是城市街景,实际跑的却是体育赛事的高速运动,最优路由区间可能就不再最优。论文虽然在多种场景下验证了鲁棒性,但"即插即用"的通用性仍是一个开放问题。此外,被压缩进全局流的token毕竟信息量打了折扣,对于需要极度精确全局语义的任务,可能存在微小的性能天花板。
不过,方向已经清晰了。TRaM-VSR证明了一件事:扩散模型的效率瓶颈不在"参数多少",而在"信息密度"——同样的算力,投给那些真正决定画面质量的token,远比均匀撒网划算。
视频超分不再只是"放大像素",它正在学会"看重点"——就像你看一部电影时,眼睛自动追踪主角的脸,而不是背景里的每一片树叶。