type
Post
status
Published
date
Sep 19, 2026 05:31
slug
rec-weekly-2026-W38
summary
本周推荐系统研究围绕三条主线展开:工业界把生成式范式迁移到已有排序/召回链路、用户语义信号(自然语言理由、推理轨迹)进入推荐特征空间、长序列压缩与记忆的自演化。 主线一:生成式升级走"平滑迁移"路线。 Meta 的 LIGE-GR 把成熟的 pointwise 排序泛化为 listwise 生成与评估,在 Instagram Reels 提升 time spent 1.14%、Facebook Video 0.72%,且只需适度额外推理资源。阿里巴巴国际数字商业的 LazFormer 用生成式预训练为排序同时提供稀疏与稠密参数初始化,再用可迁移残差适配器解决稠密参数负迁移。两条路线的共同指向是——不替换服务基础设施,只改写表征与优化目标。 主线二:用户语义信号成为一等文本信号。 快手的 SARA 把用户自然语言偏好解释(AURs)从 86,564 位作者扩展到 10M 作者空间,并把正负 rationale 送进生产排序。阿里巴巴的 CoFree 针对 LLM embedding 中的 reasoning collapse,用 embedding-oriented 与 reasoning-oriented 双奖励做端到端耦合优化,CoFree-4B 在 MTEB 与 BRIGHT 共 22 个数据集上相对 Qwen3-Embedding-4B 平均绝对提升 2.8 nDCG@10。 主线三:长序列压缩与记忆隔离。 腾讯的 ChronicleRec 把超长行为序列一次性压成时间锚定的 Chronicle Tokens,按用户缓存,解耦超长序列建模与在线候选打分。LION 则指出持续演化会引发 evolution conflict——异构偏好漂移在共享自回归参数空间内互相冲突,主导行为模式会压制长尾模式,解法是以稀疏 Key-Value 记忆层做参数隔离。
tags
推荐系统
周报
论文
category
推荐技术报告
icon
📚
password
priority
1
本周概览
本周推荐系统研究围绕三条主线展开:工业界把生成式范式迁移到已有排序/召回链路、用户语义信号(自然语言理由、推理轨迹)进入推荐特征空间、长序列压缩与记忆的自演化。
主线一:生成式升级走"平滑迁移"路线。 Meta 的 LIGE-GR 把成熟的 pointwise 排序泛化为 listwise 生成与评估,在 Instagram Reels 提升 time spent 1.14%、Facebook Video 0.72%,且只需适度额外推理资源。阿里巴巴国际数字商业的 LazFormer 用生成式预训练为排序同时提供稀疏与稠密参数初始化,再用可迁移残差适配器解决稠密参数负迁移。两条路线的共同指向是——不替换服务基础设施,只改写表征与优化目标。
主线二:用户语义信号成为一等文本信号。 快手的 SARA 把用户自然语言偏好解释(AURs)从 86,564 位作者扩展到 10M 作者空间,并把正负 rationale 送进生产排序。阿里巴巴的 CoFree 针对 LLM embedding 中的 reasoning collapse,用 embedding-oriented 与 reasoning-oriented 双奖励做端到端耦合优化,CoFree-4B 在 MTEB 与 BRIGHT 共 22 个数据集上相对 Qwen3-Embedding-4B 平均绝对提升 2.8 nDCG@10。
主线三:长序列压缩与记忆隔离。 腾讯的 ChronicleRec 把超长行为序列一次性压成时间锚定的 Chronicle Tokens,按用户缓存,解耦超长序列建模与在线候选打分。LION 则指出持续演化会引发 evolution conflict——异构偏好漂移在共享自回归参数空间内互相冲突,主导行为模式会压制长尾模式,解法是以稀疏 Key-Value 记忆层做参数隔离。
生成式推荐与排序范式升级
这一章的共性是同一命题的不同切面:生成式范式怎么进入已有工业推荐栈,而非另起炉灶。
SARA(快手)— 把用户自然语言偏好解释(Articulated User Rationales, AURs)当作极性感知、原因级文本信号。流程分三段:数据引擎从 2.4 亿快手直播用户中采集并筛选 AURs,产出以作者为中心的质量受控数据集 SARA-HQ;通用 MLLM 经大规模 SFT 与 Quality-Refining DPO 对齐为 SARA-7B,把 rationale 覆盖从 86,564 位 AUR 覆盖作者扩展到完整的 10M 作者空间;SARA-Ranker 通过 rationale-aware interaction modeling 与 rejection-memory modeling 把生成的正负 rationale 接入生产排序。线上部署超过 30 天、每日刷新,A/B 显示互动提升、负反馈下降。这条路线延续了 S²GR 在快手短视频上用思考令牌做语义引导的思路,但把监督信号从语义 codebook 换成了用户自己写下的理由;同源的 EASQ 用问卷信号做满意度对齐,SARA 则可视为把问卷稀疏性进一步放大到全作者空间的一次尝试。值得注意的工程点:rationale 天然稀疏、质量参差、只覆盖少量物品,SARA 的价值在于证明"低覆盖但高语义密度"的信号可以经 MLLM 放大后反哺排序。
LIGE-GR(Meta)— 直接把已有 pointwise 排序系统泛化为 listwise 生成与评估系统,不重建推荐栈。论文点出两个现实约束:序列级生成与优化如何嵌入推荐,以及成熟系统围绕产品、业务约束、服务基础设施和组织归属迭代多年、整体替换的组织与技术风险过高。LIGE-GR 保留既有模型、价值函数与服务基础设施的兼容性,只在列表级目标上做生成与评估。Instagram Reels time spent +1.14%、Facebook Video +0.72%。同一条"迁移而非重写"的路线此前有 RelayGR 用跨阶段接力推理把长序列长度提升 1.5 倍、吞吐提升 3.6 倍,以及 GRLM 用结构化 Term IDs 做原生推荐潜力释放。LIGE-GR 的意义不在算法新颖度,而在于给出一个可复制的最小侵入升级模板。
LazFormer(阿里巴巴)— 生成式预训练 + 排序统一框架,针对既有预训练方案的三个痛点设计。其一,可迁移残差适配器以残差方式注入排序特有特征,缓解预训练与排序输入特征不一致导致的稠密参数负迁移;其二,请求感知排序模块整合长序列压缩、混合稀疏注意力与 request-aware 范式,高效建模用户长序列;其三,非对称多轮训练策略在轮次间重置稀疏参数、持续累积稠密参数,缓解稀疏参数过拟合。在阿里国际数字商业的工业推荐系统部署并取得线上收益。历史上 DSIN 用 session 划分 + Bi-LSTM 建模兴趣演化,RAT 用检索增强 Transformer 补足长尾特征,LazFormer 的差异在于把参数初始化本身当作迁移对象。
GESE(百度)— 面向 1 亿+ DAU 商业平台的头条生成,把个性化标题生成解耦为"生成探索"与"选择利用"两段。生成端把 LLM 当概率探索器,用 Group Sequence Policy Optimization(GSPO)配分层奖励生成候选集合,最大化潜在用户兴趣的语义覆盖;选择端用轻量实时反馈感知选择器从候选池挑出当前上下文的最优实现。直接优化单一标题会导致 mode collapse——收敛到满足平均口味的通用模式,长尾受众需求被压制。线上 CTR +2.57%、停留时长 +0.87%。这与 HyMiRec 用轻量推荐器 + LLM 推荐器分别捕获粗细粒度兴趣的双层结构属于同一类思想:把"多样性探索"和"精度利用"拆成两个可独立优化的模块。
Verifier — 面向多阶段系统首阶段召回的后验验证器。问题定义清晰:首阶段候选列表的实际消费前缀受下游更昂贵排序阶段的算力约束,相关物品可能排在检索列表更深处但没进消费前缀。做法是冻结检索器当 drafter,训练一个轻量生成式验证器,按候选标识符 token 的似然打分,仅对 top-K 候选推理,训练用 next-token 交叉熵、无需负采样或候选池,且兼容任意固定 tokenization。在 Amazon 与 YaMBDa 上,同一套训练配方对 SASRec、GRU4Rec、NextItNet、MiniOneRec 四种检索器统一提升 Recall@10,消融显示提升并非仅来自把内容特征注入检索器。接口极简是它的工程卖点——检索器只提供 query state 与候选物品,检索器本身不重训。
Preference-Drift — 长序列生成式推荐的效率与噪声问题。实验观察有两条:全序列建模随长度增长计算成本持续上升,而精度增益快速饱和甚至因噪声退化;目标感知上下文检索虽缩短输入,却易受"语义一致但偏好不一致"的噪声和不完整上下文干扰。方法上用多维偏好漂移信息学习可微软子序列边界,以线性注意力加软分配权重把子序列内物品聚合成偏好一致的表示,规避全序列注意力的开销;再用交叉注意力捕捉近期交互与相关子序列上下文的依赖,最后门控融合近期与全局子序列上下文。与 xGR 在服务侧做分阶段计算、分离 KV 缓存的思路互补——一个改服务调度,一个改输入组织。
LION — 首次命名生成式推荐中的 evolution conflict:异构用户的偏好漂移在完全共享的自回归参数空间内被一起优化,主导行为模式逐步主导模型演化,欠代表模式被持续忽视。框架以稀疏 Key-Value 记忆层为核心,用稀疏记忆激活隔离不同行为模式的演化,用 consolidation loss 强化持续适配中欠代表偏好动态的学习。论文给出三条设计原则:isolated memorization、reinforced evolution、scalable application。实验在真实数据集上覆盖逐期评估、用户/物品分组评估与演化收敛性分析。相比 RelayGR 解决长序列推理延迟、OneLoc 解决地理感知语义 ID,LION 处理的是时间维度上的参数竞争,属于此前被忽视的一类问题。
生成式检索与召回优化
这一章的核心分歧是:语义 ID 到底该由 LLM 生成还是由 LLM 的文本表示替代。
VARG(阿里巴巴)— 面向天猫 App 搜索的生成式检索,直接把生成的物品候选送入现有精排器。VARG-ID 用 RQ-VAE 构建语义前缀,通过双向 query-item 对比学习增强搜索相关性,再拼接一个按价值排序的第三 token,同时提供细粒度物品地址与业务价值先验。训练分三段:三阶段 SFT 依次学习物品到标识符映射、query 语义检索、个性化检索;个性化训练结合价值感知与层级对齐监督,用 LO-SFT(local ordinal supervision)学习第三 token 编码的簇内局部序;Prefix-GRPO 用输出合法性、用户行为、ranker advantage、搜索相关性构成的门控奖励,配前缀感知 token 加权,把候选生成对齐到业务价值与排序目标。协同日更在保留既有物品地址的同时纳入新品与行为反馈。14 天、20% 流量的 A/B:GMV +1.45%、per-user IPV +0.22%、PCTR +0.31%。这条路线承接 DualGR 的长短期兴趣双分支与基于搜索的 SID 解码,但把第三 token 从纯语义地址扩展成了价值先验载体。
ANGLE(腾讯)— 赞助搜索广告的实时检索,与 VARG 走相反方向:用 LLM 生成的层级文本表示替代离散 SID。层级表示由 commercial intent(高层概览)和 ad abstract(细粒度细节)两层构成。论文对 SID 路线的批评具体——SID 不由基座 LLM 学习,SFT 阶段需记忆大量 SID-to-ad 映射,对未见广告泛化差、维护更新成本高,SID 与广告一对一映射导致解码低效,且依赖小奖励模型(如 pCTR)评估相关性限制了 LLM 对商业价值的完整判断。ANGLE 把检索、相关性、排序整合进单一 LLM。线上消耗 +1.81%、GMV +2.16%,离线在 HR、ACR 等指标上优于 7 个 baseline。与 Gryphon 联合训练 SID 生成与物品级打分以缓解"似然与相关性目标不一致"的思路相比,ANGLE 干脆放弃了 SID 这一层抽象。
MIMA(阿里巴巴)— 多兴趣召回中的兴趣坍缩问题。论文把单正样本范式指为重要成因:每个实例只提供一个正样本,兴趣独立优化,同一个最佳匹配兴趣被反复朝不同正样本更新,其余兴趣监督不足;同时现有方法很少建模用户对每个兴趣的激活强度,推理时跨兴趣通道路由分数不可比。MIMA 把同一请求内共现物品编成正样本集合,用因果 Transformer 解码器生成互补兴趣,通过匈牙利匹配把每个正样本排他性分配给一个不同兴趣,使兴趣分化由训练目标本身产生而非依赖辅助正则;再加轻量路由模块估计用户-兴趣激活概率以校准跨通道分数。三个公开数据集加一个工业数据集上超越 MIND、ComiRec、SINE、PIMIRec,线上 A/B 有业务收益。这与 SetMIR 把多兴趣召回建模为集合预测、用匈牙利匹配训练并动态决定 ANN 查询数量的思路同源。
CoFree(阿里巴巴)— 针对 LLM embedding 学习中的 reasoning collapse,即面向 embedding 目标的专门化会抑制有效推理生成或产生与检索无关的文本。两阶段:第一阶段 reference-guided SFT 恢复基础 embedding 模型的推理能力并保留表征强度;第二阶段引入 embedding-oriented 与 reasoning-oriented 双奖励,在强化学习中保证对相关性目标的细粒度推理。这种端点耦合优化把 embedding 学习从静态对齐变成高质量推理引导的检索搜索过程。CoFree-4B 在 MTEB 与 BRIGHT 共 22 个数据集上平均绝对提升 2.8 nDCG@10,真实检索系统在线实验一致增益。邻居工作 ReinPool 用 RL 把多向量 embedding 压成单向量,压缩比 746–1249 倍,恢复 76–81% 的多向量检索性能,两者都在回答"embedding 训练目标怎么和多阶段下游对齐"。
InitGen(OPPO)— 智能助手交互发起阶段的候选生成。核心难点是反馈不完整:生成器产出的候选多于最终曝光量,经下游过滤排序后只有子集被用户看到,观测反馈是部分的、无法可靠归因到单个 query。InitGen 联合生成候选查询集合,用加权偏好优化对齐用户反馈,权重来自用户活跃度与下游排序分数——活跃度权重降低高活跃用户在训练中的主导性,排序分数作为反馈可靠性的实用估计;另用滚动窗口更新把近期交互数据纳入周期性模型更新。线上 A/B 对强生产基线:CTR 从 0.95% 提升到 1.61%(相对 +69.1%),同流量分配下 query 曝光 +17.9%,180 ms 内生成完整候选集,服务超 1.5 亿 MAU。CTR 翻倍相对提升在本周所有工业论文中最高,但基数较低(0.95%),需结合场景理解。相关历史工作 DualGR 用曝光感知的下一 token 预测损失处理类似问题。
PCap(Meta)— 把个性化多样性约束从排序阶段前移到检索阶段。PCap 用 Shannon 熵建模用户级多样性偏好并分桶,在多源候选检索时施加个性化类目 cap;针对每桶 cap 构成的高维参数空间,用自动化在线优化方法 Parameter Tuning Sequence 导航。Facebook Marketplace 大规模 A/B 显示互动指标统计显著提升。与 Disaggregated Multi-Tower 用拓扑感知建模换取大规模效率不同,PCap 的贡献在检索阶段引入了用户粒度的"配额"这一约束形式。
ReWAM — 通用多模态 embedding 的检索落地问题。论文指出显式 CoT 的 UME 方法有两处阻碍 corpus-scale 部署:GRPO 给所有 CoT token 相同 advantage,无法区分哪些是输入支持的、能区分正样本与难负样本的证据;每次 embedding 前生成完整 CoT 带来大量延迟,即便部分轨迹已提供足够检索证据。ReWAM 用 Retrieval-aware Self-Distillation 从输入支持的证据中构造特权指导,用 on-policy self-teacher 把轨迹级反馈细化为 token 级监督;用 Retrieval-adaptive Inference 的检索置信度头估计部分 CoT 的剩余检索效用,提前停止无产出的轨迹,并用投机解码加速有效延续。MMEB-V2 与 MRMR 上达到 SOTA,推理吞吐最高为显式 CoT UME 方法的 5 倍。同源工作有快手的 DAS 用双对齐语义 ID 优化量化与对齐。
精排系统与广告电商优化
这一章的共性是全页/全链路视角——不再只优化单个物品的分数。
PinDCO(Pinterest)— 生产级动态创意优化系统。生成式 AI 大幅加速广告创意生产,单个 campaign 的候选变体数量急剧膨胀,对 DCO 系统提出延迟与成本约束下的匹配要求。核心是 Creative Component Fusion Network(CCFN):对每个创意组件(图片、标题、布局)用独立塔建模,组件级超参反映不同建模复杂度;组件表示融合后预测以广告级预测为条件的创意级分数。训练数据质量靠 exploration-exploitation 策略改进。针对 Pinterest 的瀑布流网格布局——创意渲染尺寸会影响邻近内容与 session 级互动——引入 Pixel-aware Adjustment Module,按创意尺寸调分以鼓励屏幕空间的高效利用和更好的整页结果。支撑大候选量的是轻量预选模型早期剪枝,加上缓存与动态批处理。线上 A/B 广告 CTR +3.09%,整页指标为正,已在 Pinterest Ads 上线。
UVR(Wolt)— 按需配送场景的商家排序。与纯数字域不同,候选商家是本地化的,受实时可用性和配送运营约束。核心张力是给新商家曝光以试探、同时保持有复购意图 session 的排序质量。Universal Venue Ranker 把双向 Transformer 序列编码器与整合上下文、用户、商家特征的 GBDT 排序器配对,训练覆盖一国所有商家与域,推理时施加本地配送约束。标签平滑与 trial 偏置样本加权把模型推向新商家,离线 trial MRR 相对生产提升 +12% 到 +30%,代价是六个国家中五个的 reorder MRR 回归——但 Global CVR(混合 trial 与 reorder session 的核心在线指标)统计上不变。三次连续 A/B:V1 带来 +5.5% Merchant Trial Rate 与 +0.16% Global CVR,V2 再增 +0.45% MTR,V3 跨域统一餐饮与零售排序器再增 +1.31% Retail MTR,同时替换了此前三个餐饮模型加一个零售模型共四个独立排序器。这里的取舍值得记录:离线指标的部分回归被线上混合指标的持平所接受,属于典型的系统级目标替代。
ChronicleRec(腾讯)— 终身用户建模的预训练-迁移框架。已有终身兴趣方法为每个候选检索目标相关行为,把长序列建模与候选打分耦合,在线成本重复;近期的目标无关压缩方法支持缓存用户摘要,但常在序列末尾追加 query token 并用双向编码,产出的摘要无序且冗余,忽略时间结构。ChronicleRec 把超长行为序列一次性压成按时间排序的 Chronicle Tokens:recency-aware 多粒度合并在保留近期行为的同时粗化远期历史;把 query token 与合并序列交错,用因果编码器让每个 query 只概括其时间锚点之前的历史;多 horizon 设计在并行分支上掩码不同的近期历史窗口以学习互补的长程兴趣;压缩器用 mask-and-predict 目标预训练,从压缩的旧历史重建留出的近期行为,把历史信号对齐到近端意图。由于 Chronicle Tokens 目标无关,可按用户缓存,解耦超长序列建模与在线候选打分。KuaiRand 与 Tencent AdLive 上优于 recent-window 与 single-pass 压缩基线、接近 full-attention 性能,七天线上 A/B 确认收益。这与 CASE 分离物品级节奏学习与跨物品交互的思路都在回答"长期历史如何不丢时间结构地压缩"。
Single-Token(Indeed)— 冷启动候选排序的序数打分原语。场景约束很具体:招聘 sourcing 平台流量低、利基,无法产生传统深度神经排序器所需的数百万次记录交互;零样本 LLM 的分数不稳定、非确定性且排序精度不足;可用的是几十万条序数相关性标注。方法把候选-职位相关性建模为对等级 token {1,...,5} 的序数分类,相关性分数取首 token 概率分布的期望。因为分数来自单次解码步而非开放式生成,它是模型 logits 的确定性函数,无需输出解析,延迟低。为从这种监督中学习异构招聘标准的非线性相互依赖,用 MSE 项(保留序数距离)与分类交叉熵项(锐化类别边界)组成的混合序数回归损失微调小语言模型,沿 Jobseeker Relevance 与 Employer Relevance 两个维度用 NDCG@10 和低相关率评估。离线优于启发式基线与零样本 LLM;端到端仿真方向一致且幅度更大(Jobseeker NDCG@10 +54.2%,低相关率 -46.7%);线上实验降低 employer 低相关 27.3%、提升 keep rate 7.07%。序数回归与单步解码的组合在推荐侧并不常见,对低流量冷启动场景有直接参考价值。
Query Suggestion(阿里巴巴)— 生成式查询建议双阶段优化。中心挑战是生成的 slate 既要单个 query 有用、又要覆盖不同意图。第一阶段意图感知多样性建模:构造意图对齐的 SFT 数据,用 Intent-Aware Diversity Reward 优化意图覆盖,多样性在语义意图空间而非文本层面建模。第二阶段 query 级信用分配:把个体质量信号路由到对应的 query token,slate 级多样性信号在整个 slate 上共享。大规模生产数据集上的离线评估与线上 A/B 显示 CTR、query 质量、意图覆盖均提升。与 AdaGRPO 在生成式推荐中做自适应损失门控处理奖励噪声相比,这里的重点是奖励的分配粒度而非幅度。
LLM Agent 与检索增强生成
这一章的三篇都在把固定流程换成自适应决策,共同点是"中间决策层"。
AURA — 面向生产推荐系统的端到端 agentic 诊断与代码级改进系统。动机直白:聚合指标(AUC、NDCG、precision/recall、diversity、coverage)提供的是高层且不完整的图景,推荐系统在何处、对哪些用户失败,需要带领域理解的规模化推理才能看清。AURA 的专用 agent 读取生产 engagement 日志(从数千到数百万 session),浮现推荐失败真实用户的模式与样例;下一步用这些诊断加上推荐系统自身代码、数据、训练管线的上下文,提出并实现扎根于代码库的改进。论文报告了系统设计、在一家大型媒体流媒体公司两个大型消费平台生产数据上的初步测试、防护措施与运营经验。作者强调架构可迁移——所有领域特定元素都通过配置层注入,该层已在两个平台间完成移植,并给出到电商与在线零售的映射。此前 DualAgent-Rec 用 LLM 作为协调器调度开发/探索双 agent 优化多目标约束,RES 用 Reasoner-Executor-Synthesizer 三层架构把意图解析、确定性检索、叙述生成分离以消除数据幻觉。AURA 走得更远一步:诊断之后直接改代码。需要保留的判断是——论文为 workshop 论文,报告的是早期结果而非完整 A/B,缺乏量化提升。
MemRetriever — 把长期记忆访问建模为多步搜索过程。论文批评静态 top-k 记忆检索的三类失败:单次查询、固定返回数量、直接送下游,会漏掉跨 session 分散的证据、引入无关内容、浪费上下文,对多跳、时间性和知识更新型问题尤其严重。MemRetriever 每步在现有证据上推理,选择并行搜索做广度探索、串行搜索做定向补全、或反思与去噪做过滤和证据评估,并在保留证据足够回答下游时停止。训练用 ReAct 风格搜索-记忆轨迹做监督热启动,再用 GRPO 优化,奖励设计鼓励证据覆盖、噪声削减、答案充分性与高效终止。LOCOMO、LongMemEval、HotpotQA、MuSiQue、2WikiMultiHopQA 上一致优于静态检索与仅监督基线;MemRetriever-4B-RL 在相同管线下的 LongMemEval 主检索指标上超过 DeepSeek-v4-Flash。决策逻辑与存储后端无关,可运行在外部知识库与向量数据库之上。相关的 LLM 推荐对齐工作有 ITPO 从稀疏结果信号推导轮次级过程奖励,以及 WPAUC 证明 GRPO 优化 LLM 推荐器等价于最大化 AUC 并据此改进目标。
Pre-retrieval Query Clustering(Amazon)— RAG 系统的查询自适应检索深度。固定 top-k 的脆弱性在于:简单查询过度检索(引入噪声与成本),复杂查询检索不足(召回失败级联到错误答案)。方法分离线在线两段。离线估计每查询的检索难度,在默认检索器下测量 NDCG 并从 NDCG-k 曲线推导查询特定的"饱和点" k*;由于在线计算这些信号昂贵,把大规模查询在 embedding 空间聚类,用 mean-plus-variance 规则给每个簇总结出面向高覆盖(约 95%)的推荐检索深度。运行时把入站查询分配到簇并常数时间选出对应 top-k。与依赖聚类已检索文档的后验置信方法相比,这是预检索、查询中心的做法,在异构、案例式语料上更稳健,可迁移到法律、医疗、金融、企业搜索。全流量查询测试中 F1 提升超 36%,低复杂度簇 token 用量降低 14% 且无精度损失。同一"自适应停止"母题在 ReRec 与 Rank-GRPO 中分别以难度课程调度和排名单元奖励的形式出现。
值得关注的方向
生成式排序的"最小侵入升级"会不会成为标准工程范式。 本周 Meta 的 LIGE-GR、阿里的 LazFormer、腾讯的 ChronicleRec 都选择了同一策略——保留现有服务基础设施,只替换表征层或输出组织形式,而不是重建推荐栈。这与 RelayGR 在服务侧做分阶段推理优化、GRLM 用结构化 Term IDs 释放原生推荐潜力的路线汇聚。三个团队给出的线上增益都在 0.7%–3% 量级,量级不高但风险可控。如果这种"平滑迁移"持续产出稳定的小幅正收益,工业界对生成式推荐的采纳路径可能与当年 DLRM 的替换路径不同——更接近渐进式重构。
用户语义信号与推理信号正在分化成两条技术支线。 一条是显式理由,如 SARA 用 10M 作者空间的 rationale 和 rejection-memory 建模负反馈,同源有 EASQ 的问卷满意度对齐和 TagLLM 的细粒度标签生成。另一条是推理轨迹,如 CoFree 用双奖励保住 embedding 的推理质量、ReWAM 用检索反馈做 token 级信用分配并自适应提前终止 CoT。两条支线都要回答同一个工程问题:额外的语义/推理计算如何定价。ReWAM 给出 5 倍推理吞吐、CoFree 给出 2.8 nDCG@10,是目前较明确的定价参照。
稀疏记忆与参数隔离在持续学习场景中的位置。 LION 提出的 evolution conflict 是一个此前未被明确命名的问题——生成式推荐的自回归参数空间天然共享,异构偏好漂移会互相竞争。稀疏 Key-Value 记忆层把隔离粒度从"任务"细化到"行为模式",配合 consolidation loss 强化欠代表动态。这个方向与 SetMIR 用集合预测 + 匈牙利匹配强制兴趣分化、MIMA 用排他性分配驱动兴趣差异化,共享"让监督目标本身产生结构性分离"的设计哲学。对于有持续演化需求且长尾重的场景(直播、短视频、本地生活),这条线的落地空间值得跟踪。
本周论文速览
生成式推荐与排序范式升级
SARA — 快手构建 240M 用户数据引擎产出 SARA-HQ,经 SFT + Quality-Refining DPO 对齐 SARA-7B 把 rationale 覆盖从 86,564 作者扩展到 10M 作者,SARA-Ranker 生产排序线上提升互动、降低负反馈,每日刷新部署超 30 天。
LIGE-GR — Meta 将成熟 pointwise 排序泛化为 listwise 生成与评估,Instagram Reels time spent +1.14%、Facebook Video +0.72%,仅需适度额外推理资源。
LazFormer — 阿里巴巴国际数字商业提出生成式预训练 + 排序统一框架,可迁移残差适配器解负迁移、请求感知排序模块建模长序列、非对称多轮训练缓解稀疏参数过拟合,已部署取得线上收益。
GESE — 百度在 1 亿+ DAU 平台解耦标题生成的探索与利用,LLM + GSPO + 分层奖励做语义覆盖,实时选择器做精度利用,CTR +2.57%、停留时长 +0.87%。
Verifier — 提出冻结检索器 + 轻量生成式验证器的后验方案,按标识符 token 似然对 top-K 打分,无需负采样,在 Amazon 与 YaMBDa 上统一提升 SASRec、GRU4Rec、NextItNet、MiniOneRec 的 Recall@10。
Preference-Drift — 用多维偏好漂移学习可微软子序列边界,线性注意力聚合偏好一致表示,交叉注意力 + 门控融合结合近期与长期偏好,长序列生成式推荐准确率与效率同时提升。
LION — 首次命名生成式推荐的 evolution conflict,以稀疏 Key-Value 记忆层做参数隔离,consolidation loss 强化欠代表偏好动态,多数据集验证持续演化有效。
生成式检索与召回优化
VARG — 阿里巴巴天猫搜索用 RQ-VAE 语义前缀加 value-ordered 第三 token 构建 VARG-ID,三阶段 SFT(含 LO-SFT)+ Prefix-GRPO 门控奖励,14 天 20% 流量 A/B 中 GMV +1.45%、IPV +0.22%、PCTR +0.31%。
ANGLE — 腾讯用 LLM 生成的层级文本表示(commercial intent + ad abstract)替代离散 SID,统一检索/相关性/排序于单一 LLM,线上消耗 +1.81%、GMV +2.16%。
MIMA — 阿里巴巴国际数字商业把多兴趣学习改为多正样本排他性分配,匈牙利匹配驱动兴趣分化,轻量路由校准跨通道分数,三公开数据集加工业数据集超 SOTA,线上 A/B 有业务收益。
CoFree — 阿里巴巴用 reference-guided SFT 加 embedding/reasoning 双奖励 RL 解决 reasoning collapse,CoFree-4B 在 MTEB 与 BRIGHT 共 22 数据集上平均 +2.8 nDCG@10,真实检索系统在线一致增益。
InitGen — OPPO 小布助手用加权偏好优化(活跃度 + 下游排序分数)生成交互发起候选,线上 CTR 0.95%→1.61%(相对 +69.1%)、曝光 +17.9%,180 ms 内完成,服务 1.5 亿+ MAU。
PCap — Meta 在 Facebook Marketplace 检索阶段施加个性化类目 cap,Shannon 熵建模多样性偏好并分桶,Parameter Tuning Sequence 在线调参,大规模 A/B 互动指标显著提升。
ReWAM — 用 Retrieval-aware Self-Distillation 把 GRPO 轨迹级反馈细化为 token 级监督,Retrieval-adaptive Inference 提前终止低效 CoT 并投机解码加速,MMEB-V2 与 MRMR 上 SOTA,推理吞吐最高 5 倍。
精排系统与广告电商优化
PinDCO — Pinterest 生产级 DCO 系统,Creative Component Fusion Network 做组件级建模,Pixel-aware Adjustment Module 针对瀑布流整页调分,线上 CTR +3.09%,已上线 Pinterest Ads。
UVR — Wolt 用双向 Transformer + GBDT 混合排序器替换四个独立模型,trial 偏置样本加权平衡试探与复购,三次 A/B 累计 +5.5% Merchant Trial Rate、+0.16% Global CVR、+1.31% Retail MTR。
ChronicleRec — 腾讯把超长行为序列一次性压成时间锚定 Chronicle Tokens,recency-aware 多粒度合并 + 因果编码器 + 多 horizon 掩码 + mask-and-predict 预训练,支持按用户缓存,七天线上 A/B 确认收益。
Single-Token — Indeed 把候选-职位相关性建模为 {1..5} 序数分类、取首 token 概率期望为分数,MSE+CE 混合损失微调 SLM,线上 employer 低相关 -27.3%、keep rate +7.07%。
Query Suggestion — 阿里巴巴用意图感知多样性奖励与 query 级信用分配做生成式查询建议,query 级质量信号路由到对应 token、slate 级多样性信号共享,线上 CTR、query 质量与意图覆盖提升。
LLM Agent 与检索增强生成
AURA — 端到端 agentic 系统读取生产 engagement 日志诊断推荐失败模式,再基于代码库上下文生成代码级改进,在某大型媒体流媒体公司两个消费平台生产数据上完成初步测试,架构可通过配置层跨平台迁移。
MemRetriever — 把长期记忆检索建模为 agentic 多步搜索,每步选并行/串行搜索或反思去噪并自适应终止,ReAct 轨迹热启动 + GRPO,MemRetriever-4B-RL 在 LongMemEval 主检索指标上超越 DeepSeek-v4-Flash。
Pre-retrieval Query Clustering — Amazon 用 NDCG-k 曲线估计每查询饱和点 k*,embedding 聚类加 mean-plus-variance 规则给出簇级推荐检索深度,在线常数时间选 top-k,全流量 F1 提升超 36%、低复杂度簇 token 用量 -14%。