论文主题内容介绍

研究背景

推荐系统在电商、流媒体、消费电子等平台中扮演着重要角色,但无论是传统小型推荐模型还是近年来兴起的大语言模型(LLM)推荐方案,均面临一个共同挑战:训练数据的质量问题。在实际场景中,用户交互数据往往包含大量噪声和冗余样本,不仅削弱模型性能,也显著增加计算开销,对 LLM 微调场景尤为突出。现有方法(如影响函数、梯度指标)依赖静态评分机制,难以自适应地捕捉样本的全局重要性,且均未在推荐系统场景中得到充分验证。

解决方案

论文提出了 RLWORec 框架,将数据子集选择问题重新建模为序列决策问题,通过强化学习对每个训练样本的重要性权重进行动态优化。在 Proximal Policy Optimization(PPO)框架下,RLWORec 利用策略梯度方法持续迭代更新一组全局权重向量,并以验证集上的推荐性能提升作为奖励信号。该机制能有效识别并过滤噪声样本、保留最具信息价值的训练实例,同时兼容小型推荐模型训练与大语言模型的少样本微调两类场景。

设计概述

RLWORec 框架的整体架构如图 1 所示。

Fig 1. RLWORec 整体框架图

框架的核心运行流程分为四个阶段:

状态构建:对每个训练样本,将由 SASRec 提取的特征嵌入与当前重要性权重拼接,构成当前状态表示。

动作生成与权重更新:策略网络接收样本状态,输出连续的权重调整量,更新后的权重被裁剪至 $[w_{\min}, w_{\max}]$ 区间内,确保数据多样性。

数据采样与性能评估:基于更新后的权重通过伯努利采样生成训练子集,在该子集上训练代理推荐模型并在验证集上评估,以性能提升量作为奖励信号。

PPO 策略更新:利用 PPO 的裁剪目标函数更新策略网络,防止策略更新过激,保障训练稳定性。

对于大语言模型微调场景,框架完成权重优化后,采用分层采样策略从高权重区间选取高质量样本,用于 LLM 的少样本微调。

图 2 展示了权重在优化过程中的动态演化过程。

Fig 2. 权重分布演化图

从均匀初始化出发,权重迅速分化,随后逐渐收敛,最终呈现双峰分布——权重为 1 的样本构成基础训练集,其余样本的差异化权重则实现了细粒度的重要性区分。

实验结果

论文在 Games、MicroLens-50k 和 Baby 三个真实数据集上进行了大量实验,主要结论如下:

  • 小模型场景:RLWORec 是唯一能在所有评估指标上一致超越全数据集训练性能的方法,分别利用 95%(Games)、85%(MicroLens-50k)和 95%(Baby)的数据达到最优表现。
  • 大模型微调场景:仅使用 2% 的训练数据(1024 个样本),RLWORec 使大语言模型达到了接近乃至超越全数据集微调的性能,同时大幅优于随机选择及其他基线方法。
  • 计算效率:相比 DEALRec,RLWORec 在 Games 数据集上选择时间从 13.3 小时缩短至 3.5 小时,GPU 峰值内存占用从 15.73 GB 降低至 0.47 GB。
  • 模型无关性:RLWORec 在 SASRec 和 BERT4Rec 两种不同骨干架构上均取得最佳或接近最佳的推荐性能,验证了其模型无关性。

王士铨个人介绍

本科毕业院校:上海财经大学
研究方向:推荐系统