Time-R1模型-论文阅读
《Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding》是25年发表在NeurIPS上的文章,是RLVR融入VTG任务的开山之作。
《Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding》是25年发表在NeurIPS上的文章,是RLVR融入VTG任务的开山之作。
浮世繁华,喧嚣声不绝于耳,一片心灵的净土是现代社会最奢侈的东西,而从“讨厌自己”到“喜欢自己”,是我认为幸福的第一步,因为唯先爱己才能爱人。希望我们都能有被讨厌的勇气。
《VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding》是25年发表在AAAI的文章,将时间戳知识融入视频大模型,集合了VTG方向的四个任务以及已被验证有效的多个模块,并做出创新。
《VTimeLLM: Empower LLM to Grasp Video Moments》是一篇24年发表在CVPR上的论文,是早期使用LLM研究TSGV方向的论文。
《Training-free Video Temporal Grounding using Large-scale Pre-trained Models》是一篇24年发表在ECCV上的论文,致力于通过traing-free的大模型进行时序定位。
《QVHIGHLIGHTS: Detecting Moments and Highlights in Videos via Natural Language Queries》这篇论文在2021年发表于NeurIPS,为TSGV方向构建了数据集,提供了baseline,对后续的研究有重大影响。
健康的身体离不开合理的饮食,民以食为天,可见“吃”实在是一门学问,这篇博客记录自己减脂期间的自制食谱,追求极致偷懒+营养全面+可持续性。
打开求职网站,眼花缭乱的信息蜂拥而至,但职场是筛选,没有学生时代明晰的学习路线与老师的循循善诱,那么谁来告诉我们,下一步该怎么走?
人生中有很多第一次,每一个第一次或是对困难的挑战,又或是对新鲜的探索,不论如何,这些第一次构成了无数个跳出舒适圈的时刻,也是迈向成长的一步步。