其他
RefCaptioner:提升VLM视频描述中参考图对应精度的新方法
近年来,多模态大模型在视频理解领域已能生成详尽描述,但在多参考图场景下(如人物、服装、场景),模型难以准确建立视频语义与参考图的对应关系。实验表明,几乎所有多模态大模型都存在对应能力下降问题,当参考图增多时,模型可能误识别或漏选参考图,导致无法正确关联同一主体的不同视角或排除干扰项。现有视频描述范式仅要求文本忠实于视频,未解决参考图选择与对应关系构建的挑战。针对此问题,研究团队提出RefCaptioner方法,通过后训练强化模型对参考图的识别和感应能力,并对输出caption进行结构化构建(如场景、人物、物体),以提升参考图与视频语义的精准对应。该方案旨在解决多参考图场景下的核心问题,即如何在生成描述的同时建立可用的视频对象与参考图对应关系。
多来源证据
事件时间线
- 微信公众号 WeWe-RSSVLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应