
E2074 - TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
Published: July 22, 2026
Duration: 17:21
🤗 Upvotes: 144 | cs.CV
Authors:
Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang
Title:
TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
Arxiv:
http://arxiv.org/abs/2607.17423v1
Abstract:
Video multimodal large language models (MLLMs) can describe what happens in a video, but rarely identify when the supporting evidence occurs. We study generalist video temporal grounding, in which one model predicts a variable-cardinality set of evidence int...