2026年7月15日,国际人工智能会议(CICAI'26)论文录用结果公布,MMRC实验室在开放环境室内场景生成、冷启动推荐、跨模态因果表示、视频压缩感知等方向的四项成果被录用。
论文名称:Tree2Layout: Human-Behavior-Aware Hierarchical Semantic Reasoning for Indoor Scene Layout Generation
论文作者:张立慧(山东大学);孙玮琳(山东大学);孟雷*(山东大学);李曼祎(山东大学);王馨颉(山东大学);王鹏(山东大学);孟祥旭(山东大学)
Paper链接:
https://github.com/tobetheonly/Tree2Layout/Tree2Layout_Human_Behavior.pdf
Code链接:
https://github.com/tobetheonly/Tree2Layout
论文简介:开放词汇室内场景生成(Open-vocabulary Indoor Scene Generation)旨在根据用户输入的自然语言描述自动生成符合语义要求的三维室内场景,在数字孪生、虚拟现实、人机交互以及机器人仿真等领域具有广阔的应用前景。近年来,大语言模型(LLM)的发展显著提升了文本理解能力,使基于自然语言生成三维场景成为研究热点。然而,现有方法更多关注家具之间的几何关系和空间布局,缺乏对真实人类行为需求的建模,容易生成虽然几何合理但实际使用体验较差的场景,例如家具之间操作空间不足、通行受阻以及交互距离不合理等问题。针对上述问题,该论文提出了一种面向人类行为的层次化室内场景布局生成框架Tree2Layout。该方法首先利用多粒度推理,将自然语言描述转换为包含场景、功能区域和家具对象的层次化语义树,同时显式建模通行空间、可达性、操作空间等人类行为约束,并自适应推理家具放置顺序;随后结合行为约束与空间关系生成初始布局,并通过优化算法进一步满足碰撞约束、边界约束以及人体工学约束,从而获得更加合理、可用的室内场景布局。实验结果表明,Tree2Layout在SceneEval数据集3D-FUTURE家具模型库上的综合性能优于多种代表性方法,实现了Zero Collision和Zero Out-of-Boundary的布局效果,生成的室内场景更加符合真实人类生活和使用习惯,同时在场景丰富度、家具操作可用性以及语义布局合理性等指标上均取得明显提升。

图1:框架图
论文名称:Text-Prior Guided Hierarchical Causal Modeling for Image Classification
论文作者:吴畏(山东大学);孟雷*(山东大学);李子璇(山东大学);闫晓硕(山东大学);齐壮(山东大学);孟祥旭(山东大学)
Paper链接:https://github.com/ww01911/TPHCM/blob/main/cicai-133.pdf
Code链接:https://github.com/ww01911/TPHCM
论文简介:围绕复杂视觉场景下图像分类模型容易受到背景信息、物体共现以及视觉相似区域等“虚假相关性”干扰的问题,提出了一种文本先验引导的层次化因果建模方法(Text-Prior guided Hierarchical Causal Modeling,TP-HCM)。该方法将图像中的局部视觉区域、视觉模式与类别语义信息进行层次化组织,并引入类别级文本语义作为先验知识,帮助模型识别真正具有类别判别作用的视觉特征,减少对背景等不稳定信息的依赖。具体而言,研究首先从图像中提取具有语义意义的局部视觉区域,并进一步组织形成视觉模式;随后,通过融合视觉类别特征与文本语义信息,对不同视觉模式的因果重要性进行评估,从而区分与目标类别密切相关的关键视觉因素和容易造成误判的干扰因素。在此基础上,研究进一步构建由视觉区域、视觉模式和类别语义组成的层次化图结构,通过因果引导的语义传播增强稳定的视觉语义信息,抑制误导性信息的传播。
实验结果表明,该方法在VireoFood-172和NUS-WIDE等图像分类数据集上均取得了优于现有代表性因果去偏方法和视觉语言学习方法的性能。其中,在VireoFood-172数据集上,模型Top-1分类准确率达到92.62%,Top-5分类准确率达到98.90%;在NUS-WIDE数据集上,各项评价指标同样取得最佳结果。研究表明,将文本语义先验与因果表示学习、层次化图结构推理相结合,能够有效提升模型对关键视觉信息的识别能力和对复杂场景的鲁棒性,为构建更加可靠、可解释的视觉智能模型提供了新的思路。

图2:TP-HCM的整体框架图
论文名称:Cross-Modal Conditioned Diffusion for Discriminative
Item Representation in Cold-Start Recommendation
论文作者:杨一萌#(山东大学);王馨颉#(山东大学);孟雷*(山东大学);马浩凯(新加坡国立大学);齐壮(山东大学);孟祥旭(山东大学)
Paper链接:
https://github.com/wang1008zb/CMDRec/blob/main/CMDRec.pdf
Code链接:
https://github.com/wang1008zb/CMDRec
论文简介:围绕冷启动推荐中用户交互稀疏、协同信号难以与用户语义偏好充分对齐的问题,本文提出跨模态条件扩散推荐框架CMDRec(Cross-Modal Conditioned Diffusion for Discriminative Item Representation)。现有视觉感知推荐方法虽然能够利用物品图像等多模态信息增强物品表示,但往往未能充分利用冷启动用户有限的交互反馈,同时容易受到噪声或不完整语义信息的影响。CMDRec由两个模型无关的模块组成。跨模态偏好学习模块首先从视觉特征中推断物品语义表示,并结合潜在的用户—语义交互筛选与用户偏好相关的语义知识;随后,用户偏好引导的冷启动扩散模块将视觉偏好、语义偏好和有限的行为信息作为条件,引导扩散模型重构更具判别性的物品表示,从而加强内容偏好与协同信号之间的对齐。该框架可以灵活集成到不同的视觉感知推荐模型中。
在MovieLens 1M和Amazon CDs等真实数据集上的实验表明,CMDRec能够在多种推荐骨干模型上稳定提升整体用户和冷启动用户的推荐性能。消融实验、参数敏感性分析和表示可视化进一步验证了各模块的有效性、兼容性与可解释性。

图3:CMDRec的整体框架图
论文名称:Multi-Scale Neural Compressive Sensing for Efficient Video Classification
论文作者:王冉#(山东大学);王子骏#(山东大学);孟雷*(山东大学);齐壮(山东大学);李祥(山东大学),黄海北(浪潮),孟祥旭(山东大学)
Paper链接:
https://github.com/tobetheonly/Tree2Layout/Tree2Layout_Human_Behavior.pdf
论文简介:视频压缩感知在扩展现实(XR)场景中发挥着关键作用,其目标是在降低视频数据维度和体积的同时,保留其中的关键信息。现有方法主要侧重于压缩源图像或特征,以满足下游视频分类任务的需求。然而,在单一尺度上压缩特征无法弥补压缩所带来的分类性能损失。此外,压缩和分类过程相互分离,使得压缩过程难以针对视频分类需求进行优化。为应对这些挑战,本文提出了一种创新方法,利用解码端的多尺度特征融合来满足分类任务的需求。具体而言,所提出的方法名为VC-MFC,包含两个主要模块:上下文生成与视频帧压缩(CG-VFC)模块,通过整合运动矢量和参考视频帧获取上下文信息,以辅助视频编码;多尺度特征融合与分类(MFFC)模块,融合重建的特征向量、特征图和视频帧,利用局部信息、空间信息和全局信息的协同效应,从而增强模型对视频内容的理解,并保留分类所需的关键信息。该方法采用端到端的联合训练策略,使压缩模型能够更好地适应分类任务。我们在MSR-VTT和UCF101数据集上进行了全面的评估,包括对比实验、消融研究、详细分析和案例研究。结果表明,VC-MFC创新的多尺度特征融合机制能够最佳地在压缩帧中保留判别性特征,在实现最先进的分类精度的同时,满足XR系统对关键延迟和效率的严苛要求。

图4:VC-MFC框架图
国际人工智能会议(CAAI International Conference on Artificial Intelligence)由中国人工智能学会(CAAI)主办,是学会推荐的A类会议。会议聚焦机器学习、计算机视觉、多模态大模型、自然语言处理、可信人工智能、智能机器人等前沿方向,汇聚海内外高校、科研院所与产业界专家学者,搭建高水平学术交流与产学研融合平台。会议设置主旨报告、口头论文宣讲、海报展示、前沿讲习班、专题竞赛等多元学术活动,录用论文收录于Springer论文集并被EI检索,持续推动人工智能领域学术创新、技术互通与国际合作。
