本文核心创新
作者认为SFT(supervised fine-tuning),也就是监督微调,在解决VTG任务时泛化能力有限,于是引入RLVR,也就是可验证奖励的强化学习,使用这种后训练方式代替SFT,从而提升模型的泛化能力,并且能够提升模型性能。
SFT
先来理解一下SFT,SFT是一种后训练策略,我们知道大模型输出token是按顺序的,在SFT的训练策略之下,假如大模型正在输出第t个token,那么它会事先知道第1个到第t-1个正确答案的token,然后期望输出的第t个token能够接近于正确答案的第t个token,SFT利用交叉熵损失,以此进行训练。
RLVR
RLVR是可验证奖励的强化学习,先讲强化学习,强化学习会设置奖励函数,模型在事先不知道答案的情况下给出多个候选的预测,然后每个预测会根据奖励设置的方式生成奖励分数,通过GRPO将奖励分数相对更高的候选生成概率提高,降低奖励分数相对更低的候选的生成概率。在本文中,可验证奖励设置为两个,其一,就是模型输出的候选片段相对于真实片段的tIoU,具体是作者对于IoU进行了改造,减少了IoU虚高而开头结尾相差甚远的情况,不展开细讲;其二,作者认为带显示思考的答案输出对于预测有帮助,所以作者设置了期望模型输出的格式,所以第二个奖励就是对于模型输出格式的奖励函数。

故事链条
作者认为大家常用的SFT式后训练泛化能力不好,因为模型事先知道答案,在真实训练过程中可能会出现死板对照答案的情况,比如当真实时间戳为[2,4]的时候,如果模型预测时间为[1.9,3.9],那么自回归损失还是很高。所以使用RLVR这种强化学习的后训练方式,模型事先不知道答案,通过奖励函数进行训练,进一步提升模型的泛化能力。
本文主要工作
核心工作是把RLVR这种后训练模型引入了VTG领域,而使用RLVR又会引入一系列问题,因为对于RLVR来说,模型训练事先是不知道答案的,需要根据奖励函数进行训练,那么如果训练样本太过简单,模型能够轻易预测正确,那么模型就学习不到什么东西,而如果样本过于难,模型给出的预测全是低分,那么奖励函数普遍很低,模型也无法学习到东西,因为GRPO是根据候选样本之间奖励函数的相对大小进行更新的,所以合适的样本应该难度是较难,而且样本之间需要存在区分度,于是引出了作者对数据处理以及训练模型的一系列工作。在数据处理上,利用高斯过滤拿到中等难度的样本,过滤掉太简单与太难的;在训练模式上,采用多轮训练方式,让模型对于较难样本多次训练,而且每一轮训练后会将模型已经认为简单的样本(IoU>0.7)过滤掉;使用思维链数据对模型进行冷启动,这是为了使小模型一开始也能够输出符合数据输出格式的输出。
可能存在的不足
- 从数据上看,作者融合了常用的benchmark从而构建了自己的benchmark,但是作者的benchmark只有800个数据,数据量过于少了。
- 显式思考是否有必要存在存疑,作者给出的论证不足,而且这会增加计算量。
本次阅读体会
这一次的阅读体会相对于前几次更为简略,没有采用之前通篇阅读将论文脉络从头到尾进行梳理的过程,也没有讲解具体实验,关键着眼于作者做的开创性成果以及相关工作。所以可以说这不是一篇标准的论文总结,而是精简了80%细节,剩下20%对我研究有价值的核心思想提炼,一方面是减少撰写工作量,另一方面,通过20%的关键的东西,也足以让我引申出剩下的80%。