要解决的问题
- 现有视频时序定位模型依赖特定数据集进行训练,数据收集成本高,并且在跨数据集和分布外(OOD)场景下泛化能力较弱。
- 大多数VLM很难理解同一视频中多个事件之间的关系并区分其时间边界以及理解事件的动态变化,并对这种变化保持敏感。
作者的方案
- 通过training-free的方式来减少模型对特定数据集的依赖,要理解这里的training-free不是真的不用训练,而是文中使用的LLM(GPT-4Turbo)和VLM(BLIP-2)都是已经经过预训练的了,模型只是不需要在Charades-STA和ActivityNet Captions这种特定数据集上进行训练
- 作者主要是通过LLM给出时序关系来建模多事件的关系,然后使用dynamic score和static score来建模事件之间的动态变化与静态变化。
模型方法

首先我们拿到一个query,先交给LLM,LLM输出只有两个东西,第一个是query中的子事件,第二个是不同子事件存在的时序关系(如sequentially),然后进入子事件进入VLM(BLIP-2)中,子事件就换变成特征向量与预训练好的视频特征(也是用BLIP-2训练过的)进行余弦相似度的计算,然后对于相似度曲线,我们具体选取的方法是选取dynamic score和static score加起来更高的,dynamic score是衡量曲线上升的幅度与变化的,static score更看重内部平均相似度高于外部平均相似度,选取加起来更高的就能够涵盖事件的变化到完成一整个过程。每个子事件保留 top-k 个 proposal。随后,系统组合各子事件的 top-k proposal,依据 LLM 给出的顺序和关系进行硬筛选,在合法组合中选择总 VLM 分数最高者,并按关系合并为最终预测边界。对于 sequentially,论文取并集;对于 simultaneously,论文公式取交集。
实验分析

上图并没有说明TFVTG在性能上是最好的,但是说明从IID到OOD-1,该模型性能下降幅度最小,而且(b)显示在多事件处理性能相比单事件处理下降较小。

从上述性能对比图可以看到,在zero-shot这个领域之内,TFVTG几乎做到了SOTA,虽然相比于全监督(fully)的一些模型来看并不算最好,但是在自己的零样本领域做出了成绩。

上述是一些泛化实验,OOD1和OOD2分别是在视频前面加了10s和15s的随机特征干扰,test-ood是在视频开头插入随机生成的视频片段,novel-composition是文本包含训练词汇的新组合,novel-word是加入新词,可以看到词汇的新组合让模型性能下降更多,加入新词却下降的没那么多,这说明预训练大模型的语义知识很可能帮助它处理“目标训练集里没见过的词”,但新词识别不等于组合泛化。当 query 要求把多个已知概念按新方式组合,并同时满足动作、对象和时序关系时,TFVTG 的 LLM 分解 + VLM 匹配还不如专门为组合泛化设计的方法。

、
上述图片说明这张表的事实很清楚:传统模型在 ActivityNet 上训练后迁移到 Charades,性能很低;TFVTG 的 R1@0.5 是 49.97,远高于 Debias-TLL 的 21.45。





以上是一系列消融实验,证明模型设计的LLM,VLM和融合组织架构是有效的,还有动态静态得分机制是有效的,然后选取什么LLM和选取什么VLM都是经过测试的。

最后是一个模拟例子,本篇论文到此结束。
怎么阅读论文
写在最后,这一次的论文体会我没有加入太多冗杂的公式,我需要搞清楚这篇论文解决了什么问题、用了什么方法、还有什么不足,还有行文的总架构,更多的细枝末节的东西详细记录也没有太大意义,所以相比于上一版精进了不少,思路也清晰了不少,之后可能还是会依循这样的模式,从问题-方法-问题,形成一套研究思路的脉络。