TimeLens模型-论文阅读
本文核心创新
**数据方面:**文章否定了之前常用的benchmark(例如Charades-STA,ActivityNet Captions,QVHighlights)的有效性,提出了新的benchmark也就是TimeLens-Bench。并且使用自动标注的方式提出了新的数据集,TimeLens-100K。
**算法方面:**文章比较了几种时间戳编码方式,探讨了SFT与RLVR以及RLVR中显示思考的必要性,还针对RLVR设计了早停机制、训练数据难度取样等配方。
需要说明的是,TimeLens并不是一个全新的模型,而是一种后训练框架,它是基于初始模型Qwen3-VL-8B进行了后训练的操作(这一点与Time-R1尤其相似),在我看来,更像是对Time-R1的后训练框架基础上做了不少改进得到的。
下图是核心创新点的简单概括。

数据方面

如上图所示,作者认为当前数据集存在以上的错误,包括事件多次出现、事件未出现、同一视频中查询重复、查询不清晰以及标注不准确。接着作者设定了一套输入与输出准则。输入准则(Input Criteria)。 输入视频和查询应满足:
- Query clarity and specificity(查询的清晰性与具体性)。 查询必须清楚、准确且无歧义,以便进行准确而确定的定位。反例如“比赛继续进行”。
- Event existence(事件存在性)。 文本查询描述的事件必须确实存在于视频内容中。
- Query uniqueness(查询唯一性)。 同一视频中的所有查询都必须是唯一的。多个几乎相同的查询若描述同一事件,就等价于复制某些样本或增加它们的权重,从而使评价指标产生偏差。该问题在 Charades-STA 中尤其严重。
- Avoid information leakage in queries(避免查询中的信息泄漏)。 “片尾字幕”一类查询会泄漏自身的时间位置,使模型能够通过 shortcut(捷径)作答,而不需要真正地在整个视频中定位该查询。但是,由于这类查询容易识别,标注者往往倾向于标注它们。
输出准则(Output Criteria)。 时间区间应满足:
- Annotation precision(标注精确性)。 事件边界应当精确,不应包含任何不符合查询描述的子区间。
- Annotation exhaustiveness(标注完备性)。 在已标注区间之外,不应存在其他同样符合查询描述的时间区间。

作者认为当前常用的benchmark中大量存在这样的问题,所以又设计了一套人工标注的流程方法,对现有benchmark进行重新标注,并且组建了新的benchmark,对于数据集因为数据量过大,则是采用了自动标注的方式,具体标注方式这里就不做详细介绍。

如上图,在重新标注之后,闭源模型在VTG任务上性能普遍提升,而开源模型在VTG任务性能普遍降低。作者想以此进一步说明新的benchmark更加符合真实用户体验。而右边图可以看到,在使用了改良的训练数据之后,模型性能得到了大幅度的提升。
算法设计
时间戳编码


如上图,可以看到在作者的实验条件之下,交错文本编码比视觉文本重叠和基于位置编码的时间编码效果要好,不过也只能说明在作者的实验条件下这个较好。
SFT vs RLVR

对于SFT和RLVR作者提出了三个疑问:RLVR一定优于SFT吗?显示思考对于RLVR来说是必要的吗?在RLVR前置SFT有好处吗?其实在VTG领域都没有明确的答案,作者只是在自己设置的条件下得出了无需前置SFT和无需显示思考的RLVR效果较好且训练时间较低这一结论。
RLVR训练配方

如上图,作者对于RLVR训练设置了早停机制以及难度采样机制。
一些收获
这篇文章对我来说比较重要的启发,主要是它颠覆了以往常用的benchmark,那么在未来的工作中就不得不考虑使用它所应用的数据,对于算法方面的创新倒更多是基于以往工作的改进或者是在自己设置的条件下的对比实验,还不能证明是VTG领域通用的规则。
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!







