![]()
你有没有想过一件事:让AI在一张照片里圈出"那只戴帽子的猫",可能只要零点几秒。但如果换成一段视频,让AI持续跟踪"那只戴帽子的猫"跑过整个画面,同样的AI可能要磨蹭三十多秒才能给出答案。
这不是错觉。这是这篇论文一开始就抛出来的问题:视频里的目标定位,为什么天然就比图片慢这么多。
答案其实很直接。图片定位只需要预测一个框,四个坐标数字。视频定位不一样,它得先判断"这件事发生在哪个时间段",然后在这个时间段的每一帧里都画一个框。如果这段视频横跨五秒、按每秒两帧采样,那就是十个框,四十个坐标。而现在主流的做法,是让AI像写文章一样一个字一个字地把这些坐标"念"出来。
念得越多,等得越久。这篇论文要解决的,就是这件事。
**问题出在哪:一步一步来的代价**
要理解这篇论文的贡献,得先搞清楚现在的AI是怎么干这活的。论文里管这个任务叫时空视频定位
时空视频定位(STVG):给一段视频和一句话描述(比如"递三明治的小贩"),AI需要说出这件事发生在视频的哪个时间区间,并且在这个区间里的每一帧都框出那个人或物体。
多模态大语言模型现在是干这活的主力,因为文字描述可能很抽象,像"正在把牌翻过来的那张扑克牌",这种需要理解和推理的任务,天然适合语言模型。
多模态大语言模型(MLLM):能同时理解文字和图像/视频的AI模型,比如市面上常见的Qwen、Gemini这类模型,都属于这个范畴。
但问题来了。这些模型的输出方式,继承自它们最擅长的事情:写文章。写文章讲究前后文一致,后面写的字要参考前面写过的字,这叫自回归。
自回归解码:模型每生成一个词,都要看着前面已经生成的所有词,一个接一个往下写,不能跳步,也不能同时写多个词。
写作文这么做没问题,因为句子确实需要前后呼应。但把这套逻辑搬到画框上,就出事了。论文里详细拆解了四种解码方式,一步步揭示问题出在哪。
最原始的做法,叫非量化令牌解码。时间戳"3.0秒"和坐标"512"这些数字,直接当成普通文字来生成。麻烦的是,分词器可能把"512"拆成"5""1""2"三个独立的token,一个坐标就要三步才能写完。整段视频的定位轨迹写下来,轮次多到论文用"许多轮"来形容,直接导致31.6秒的完成延迟。
第三种做法叫序列化区块解码,这是论文借鉴此前一篇工作(LocateAnything)的思路做的适配。它把"一个完整的框"打包成一个原子单位一次性预测出来,而不是坐标一个一个念。这一步把轮次砍到了1+T,效率明显提升,延迟降到1.0秒。
但这里藏着一个致命的没解决的问题:虽然每个框内部是并行生成的,框和框之间,依然是排队等着来的。第二个框要等第一个框生成完才能开始,第三个框要等第二个框。轨迹有多长,排队就有多长。
**多米诺骨牌式的错误传递**
这个"排队"的设计,表面上看只是慢一点,但论文用实验揭示了一个更深层的代价:它还会让错误像多米诺骨牌一样传下去。
设想你在玩一个传话游戏,十个人排成一队,每个人只能听前一个人转述的话再往下传。如果第三个人听错了一个字,那么从第四个人开始,所有人传的话都会带着这个错误往下滚,越传越离谱。如果换成十个人同时听一段原始录音各自转述,第三个人听错了,不影响第四个人,因为第四个人压根不听第三个人说的,他自己听的是原始录音。
序列化区块解码就是那个传话游戏。每个框在生成时,不仅要看视频和文字描述,还要"回头看"前面已经生成的框。论文里的一张图直接把这个问题可视化了:随着解码轮次推进,AI对视频画面的注意力权重逐渐下降,对自己刚生成的文字的注意力权重反而越来越高。换句话说,AI开始更相信自己编的历史,而不是眼前的画面。
论文还专门做了一个验证实验,叫历史修正分析。研究者故意把某一帧预测错的框,替换成正确答案,然后看后面的框会不会因此变准。结果发现,离这个"修正点"越近的框,改善幅度越大,随着距离拉远,这个改善效果逐渐衰减。这恰好证明了错误确实是沿着轨迹传播的,而不是每帧独立犯错。
这也解释了为什么正确的框不应该依赖前面的框:一个时间点上目标该出现在哪个位置,是由视频画面和文字描述本身决定的,跟AI自己之前猜过什么框,没有任何逻辑关系。让后面的预测依赖前面的预测,纯属选错了参照系。
**并行生成整条轨迹:把排队变成同时开工**
搞清楚问题出在"排队"之后,这篇论文给出的方案听起来简单到有点意外:既然每一帧该画在哪里只取决于视频内容和查询文字,那干脆让所有帧的框同时生成,谁都不用等谁。
论文把这个方法叫做并行管道解码
并行管道解码(PTD):先用一轮生成时间区间(这件事从几秒到几秒发生),再用一轮把这个区间里所有帧的框全部同时生成出来。整个过程固定是1+1轮,不管这段轨迹有多少帧。
这里的关键设计,是让每一个时间点上的空间预测块,都能看到完整的视频和文字描述,但彼此之间互相看不见。论文管这个机制叫解耦区块注意力
解耦区块注意力:让每个位置的框预测,都能访问共享的视频和文字信息,包括已经生成的时间区间,但绝对无法访问其他位置生成的框,靠这个设计实现真正的并行生成。
这个设计打的比方,有点像一个班级同时做同一套试卷。三十个学生共享同一份题目和参考资料,每个人独立答题,谁也看不到旁边人写了什么。如果换成传统做法,相当于让学生排队进考场,后一个学生进去之前必须先看一眼前一个学生的答卷再答题。听起来荒谬,但这正是序列化解码在做的事:每道题(每一帧的框)的答案,本不该依赖别人怎么答,只取决于题目本身(视频画面)。
要让这套机制真正跑起来,模型还得同时保留原来的写作能力。论文用了一种双轨训练法,每个训练样本会用两种目标序列同时监督,一种是保持标准的逐词生成能力,另一种是这套区块并行的生成方式,两者在同一次前向传播里一起优化。这么做的好处是,模型既没丢掉原生的自回归能力,又学会了新的并行技能。
如果不这么设计会怎样?论文的实验数据给出了答案:并行管道解码不仅没有牺牲精度,反而全面超过了前面三种解码方式的准确率,同时把完成延迟从31.6秒压到0.4秒,吞吐量从每秒0.5个框提升到45.9个框。79倍的延迟压缩,92倍的吞吐量提升,这个数字差距不是优化细节能解释的,而是整个解码结构被重新设计带来的。
论文还专门测了轨迹长度增加时,各种方法的延迟变化曲线。结果非常直观:当框的数量从8个增加到64个,也就是翻了8倍,序列化区块解码的延迟从0.72秒暴涨到6.18秒,而并行管道解码的延迟几乎纹丝不动,只从0.33秒微增到0.40秒。这说明轨迹变长时,并行方法增加的只是"同时处理的宽度",而不是"要排队的轮数",这正是这套设计最核心的价值。
**光有并行还不够:得让框和时间点都精准**
生成快了不代表生成准了。监督学习用的是逐词交叉熵损失,本质上是让模型模仿标注数据里的每一个token,但它并不直接优化"这个框到底套没套准目标"这种几何层面的质量。
论文在监督微调之后,又加了一轮强化学习式的训练,用的是一种叫GRPO的策略优化方法。
GRPO(组相对策略优化):一种强化学习训练方式,让模型针对同一个问题生成多个候选答案,再根据这些答案彼此之间的相对好坏来调整模型,不需要额外训练一个独立的打分模型。
针对视频定位这个任务,论文专门设计了两种互补的奖励信号。第一种是时间定位奖励,用来衡量预测的时间区间和真实区间重合度有多高,专门解决"事件发生的时间段找错了"这类问题,比如把整个人物一直在场的时间段都框进去,而不是精确框出真正发生的那个动作片段。第二种是空间定位奖励,结合了广义交并比和坐标层面的误差惩罚,专门纠正框画得歪、画得太松,或者随着时间推移逐渐飘向背景或别的物体这类问题。
论文做了消融实验验证这两种奖励各自的作用。只用时间奖励训练,视频整体交并比从34.9提升到37.4;只用空间奖励训练,提升到37.2;两个奖励一起用,提升到38.3,是最好的结果。这说明两种奖励解决的是不同维度的问题,合在一起才能覆盖完整的轨迹质量。
这套组合拳打完之后,论文用一个只有40亿参数的相对小模型,在VidSTG和HC-STVG这两个主流的时空视频定位基准测试上,拿到了和70亿参数模型持平甚至更好的成绩。而且这个模型没有依赖任何额外的空间定位模块,是纯粹靠语言模型自己生成完整的时间区间加空间轨迹做到的。相比之下,不少同类方法还得靠外部的检测器或者跟踪算法来补齐空间定位这一块。
**这套本事能不能用在别的地方**
一个模型学会了一件事之后,能不能不经过额外训练,直接迁移到没见过的任务上,这通常是检验一个方法是不是真的学到了"本质能力"而不是"死记硬背"的试金石。
论文测试了三个完全没有专门训练过的场景。第一个是纯时间定位,也就是只需要说出"这句话描述的事发生在几秒到几秒",不需要画框。在Charades-STA这个基准上,模型的平均表现比之前最强的零样本方法高出4.7分;在ActivityNet这个视频更长、内容更杂的基准上,优势更明显,高出9.1分。第二个是有依据的视频问答,模型不仅要回答问题,还得指出"我是看了视频的哪一段才得出这个答案的"。第三个是指代视频目标跟踪,模型要在整段视频里持续定位同一个被描述的物体。
这三个任务模型都没专门训练过,但表现都相当能打。这恰恰说明,这套并行生成时空轨迹的能力,本质上是一种通用的"理解视频里发生了什么、发生在哪里"的能力,而不是针对某个特定任务硬调出来的技巧。
**没解决的问题也不少**
论文也很坦诚地列出了几个还没搞定的坑。
一类是空间定位本身的困难场景:目标被遮挡后重新出现,身份要重新确认;或者目标又小又快,框很容易画歪。另一类是时间定位的困难场景:事件的状态转换本身就很短暂、边界模糊,导致预测的时间区间要么拖得太长,要么提前结束了。
更深一层的限制是,现有的时空视频定位这个任务设定本身就比较窄。它假设一句话描述对应一个连续的时间段和一条轨迹,但现实里,一个查询可能对应视频里好几个不连续的片段,或者摄像机移动导致目标暂时消失又出现,再或者同一句描述可能同时匹配好几个目标。这些情况,目前的数据集和方法都还没顾上。另外,可供训练的高质量数据集也就那么两三个,规模有限,这也限制了模型能学到多广的场景。
Q&A
Q1:并行管道解码是什么?
A:这是论文提出的一种生成方式,先用一轮生成事件发生的时间区间,再用一轮把这个区间里所有帧的目标框同时并行生成出来,整个过程固定只需要两轮,不会随视频轨迹变长而增加解码轮数。
Q2:为什么之前的AI给视频画框那么慢?
A:因为主流做法是把时间戳和坐标当文字一个词一个词生成,还得让后面的框排队等前面的框生成完,轨迹越长排队越久,论文测出来延迟能到31.6秒。
Q3:这种方法生成快了会不会牺牲准确率?
A:不会,论文的实验显示并行管道解码不仅把延迟降低了79倍、吞吐量提升92倍,反而在多个数据集上准确率还超过了原来一步步排队生成的方式。




京公网安备 11011402013531号