![]()
这项由卡内基梅隆大学联合多伦多大学的研究团队共同完成的研究,发表于2024年的计算机视觉与模式识别顶级会议CVPR(IEEE/CVF Conference on Computer Vision and Pattern Recognition),论文编号为arXiv:2403.18839。有兴趣深入了解的读者可通过该编号在学术数据库中查询完整论文。
一、当AI开始"看"视频,问题也随之而来
你有没有试过用手机的AI助手问它:"刚才那个视频里,那个人是先拿起杯子,还是先说话?"大多数AI助手会让你失望。不是因为它没有"看"视频,而是因为它根本没有真正理解视频里事件发生的先后顺序。
这正是这项研究的出发点。随着人工智能技术的飞速发展,能够同时处理视频和语言的模型(研究者把它们叫做"视频语言模型",Video-Language Models,简称VLMs)已经遍地开花。这些模型看起来很聪明,能描述视频画面,能回答关于视频内容的问题,但当你问它们关于"顺序"的问题时——谁先谁后,哪件事发生在哪个时间点——它们往往会露出马脚。
研