MMRC实验室博士生王妍、博士毕业生李象贤在视频-文本检索领域的研究成果近日被CCF T1类期刊《电子学报(英文)》(Chinese Journal of Electronics,CJE)录用,该工作得到腾讯犀牛鸟项目支持。
论文名称:Generative Text-to-Video Retrieval via a Chain-of-Thought Reasoning Paradigm
论文作者:王妍(山东大学);鲁亚楠(腾讯);孟雷(山东大学);李象贤(山东大学);林芬(腾讯);孟祥旭(山东大学)
Paper链接:https://doi.org/10.23919/cje.2025.00.412
论文简介:随着短视频内容持续增长,文本-视频检索旨在依据自然语言查询从大规模视频库中返回语义匹配的内容,是智能搜索、内容理解与多媒体推荐的重要基础。现有方法多采用端到端判别式模型直接学习文本与视频特征的相似度,虽然计算高效,却容易依赖训练数据中的统计相关性,在视觉线索不完整、含有干扰信息或数据分布变化时产生错误匹配,且难以解释其检索判断。针对上述问题,论文提出生成式思维链检索框架CoT-Ret,将文本-视频检索由单一相似度估计转化为可解释的逐步推理过程。该框架包含候选池构建、视觉特征提取和生成式思维链推理三个模块:首先从语料库中筛选相关候选视频;随后提取包含时空语义的视觉特征;最后引导多模态大模型依次进行“查询理解—视频理解—匹配逻辑”推理,生成检索相关的判断依据与最终结论。该设计使模型能够更关注对象、动作和场景等真正影响匹配的语义线索,降低由背景或表面相似造成的误判。论文在英文MSR-VTT和中文视频数据集上开展了系统实验,结果显示CoT-Ret在多项检索指标上优于已有方法,R@1相比基线提升6%至19%;消融、案例与误差分析进一步验证了生成式推理机制对于提升匹配可靠性、可解释性和跨分布泛化能力的有效性。

图1:CoT-Ret框架图
《电子学报(英文)》(Chinese Journal of Electronics,CJE)由中国电子学会主办,面向电子与信息技术前沿领域发表具有创新性和学术价值的研究成果,涵盖人工智能、图像与信号处理、通信与网络、信息安全等方向。该刊被Science Citation Index Expanded(SCIE)收录,并在中国计算机学会2025年发布的《计算领域高质量科技期刊分级目录》中列为T1类期刊。CJE采用英文出版,服务国内外电子信息与计算领域的学术交流,鼓励兼具理论意义和应用价值的原创研究,是展示我国电子信息领域科研成果的重要国际化学术平台。
