MMRC实验室博士毕业生马浩凯在大模型推荐方向的研究成果近日被数据挖掘领域CCF A类期刊IEEE知识与数据工程汇刊(IEEE Transactions on Knowledge and Data Engineering)录用。
论文名称:Large Language Model Empowered Recommendation Meets All-domain Continual Pre-Training
论文作者:马浩凯(新加坡国立大学);马云山(新加坡管理大学);谢若冰(腾讯);孟雷(山东大学);沈佳烈(伦敦大学城市学院);孙兴武(腾讯);康战辉(腾讯);蔡达成(新加坡国立大学)
Paper链接:https://ieeexplore.ieee.org/document/11623729
Code链接:https://github.com/hulkima/CPRec
论文简介:随着大语言模型在推荐系统中的应用不断深入,如何将其通用语义理解能力有效迁移至个性化用户偏好建模,成为大语言模型推荐研究中的重要问题。现有方法通常直接利用特定领域的用户行为数据对预训练大语言模型进行监督微调,然而,大语言模型所学习的通用语言知识与推荐场景中的用户协同偏好之间存在显著差异,同时还面临用户行为建模碎片化以及跨领域泛化能力不足等问题。针对上述问题,论文提出全域持续预训练推荐框架CPRec,构建“预训练大语言模型 → 全域持续预训练 → 下游推荐微调”的新型推荐学习范式。CPRec将多个领域的用户行为组织为领域内行为序列和全域混合行为序列,通过统一的自然语言提示模板对用户行为进行结构化建模,并进一步提出Warmup-Stable-Annealing学习率调度策略,分阶段将不同复杂程度的协同偏好知识注入大语言模型,使其逐步学习具有跨领域迁移能力的通用用户偏好表示。论文基于7个领域的百万级用户行为数据开展持续预训练,并在来自Amazon和Bilibili两个平台的5个持续预训练阶段未见过的推荐数据集上进行验证。实验结果表明,CPRec能够持续提升不同大语言模型在下游推荐任务中的性能,并表现出良好的跨领域、跨平台泛化能力与鲁棒性,验证了将持续预训练引入大语言模型推荐系统的有效性。

图1:全域持续预训练推荐框架(CPRec)
IEEE Transactions on Knowledge and Data Engineering(简称IEEE TKDE) 是IEEE计算机学会(IEEE Computer Society)主办的国际顶级学术期刊,创刊于1989年。该刊为中国计算机学会(CCF)推荐A类期刊、中科院SCI一区Top期刊,JCR Q1区,是数据工程、数据挖掘、知识工程与人工智能交叉领域的权威核心刊物。期刊聚焦数据库系统、大数据分析、知识发现、机器学习、数据安全与隐私保护等前沿方向,刊发原创研究论文、综述评述,实行严格同行评审,在全球计算机与人工智能学术界拥有极高影响力,是该领域重要的高水平学术交流平台。
