推荐算法日报 - 2026-09-18
2026-9-18
| 2026-9-18
字数 2676阅读时长≈ 7 分钟
type
Post
status
Published
date
Sep 18, 2026 05:15
slug
daily-report-2026-09-18
summary
生成式推荐从"重建"转向"平滑升级":Meta LIGE-GR 与腾讯 ANGLE 都强调不推倒现有工业栈,而是在成熟排序/检索系统上做 listwise 生成或统一生成-判别-排序的兼容式改造,降低组织与技术风险,这正成为大厂落地生成式推荐的主流路径。; 用户显式语义信号成为一等公民:快手的 AURs(用户自然语言偏好解释)与 Indeed 的单 token 期望值打分,都在把"用户为什么喜欢"这类原因级、极性感知的文本信号引入排序,弥补隐式行为"只知 what 不知 why"的短板。; ⚙️
tags
推荐系统
日报
category
推荐技术报告
icon
📚
password
priority
1

Section 1: 📊 Trend Analysis

  • 🔥 生成式推荐从"重建"转向"平滑升级":Meta LIGE-GR 与腾讯 ANGLE 都强调不推倒现有工业栈,而是在成熟排序/检索系统上做 listwise 生成或统一生成-判别-排序的兼容式改造,降低组织与技术风险,这正成为大厂落地生成式推荐的主流路径。
  • 💡 用户显式语义信号成为一等公民:快手的 AURs(用户自然语言偏好解释)与 Indeed 的单 token 期望值打分,都在把"用户为什么喜欢"这类原因级、极性感知的文本信号引入排序,弥补隐式行为"只知 what 不知 why"的短板。
  • ⚙️ 效率-效果权衡与合规遗忘并重:DRAG 的查询自适应路由、SURF 的近似机器遗忘(2% 重训练预算达全量重训效果),反映工业界在推理成本控制与 GDPR 合规删除上的双重诉求。

Section 2: 📋 今日速览

  • 快手 在直播推荐场景提出 SARA 框架,把用户自然语言偏好解释(AURs)作为极性感知文本信号,用 SFT+Quality-Refining DPO 对齐 SARA-7B 并集成到排序。将 rationale 覆盖从 8.6 万作者扩到 1000 万,线上 A/B 提升互动、降低负反馈,已日更部署超 30 天。↗
  • Meta 在 Instagram Reels 与 Facebook Video 提出 LIGE-GR,把成熟 pointwise 排序平滑泛化为 listwise 生成-评估范式,兼容现有模型与 serving 基础设施。线上停留时长 Reels +1.14%、Video +0.72%,仅需少量额外推理资源。↗
  • Indeed 针对低流量招聘冷启动排序,提出单 token 期望值打分,将候选-职位相关性建模为 {1..5} 序数分类并取首 token 概率期望,配合 MSE+CE 混合损失。线上雇主低相关率降 27.3%、keep rate +7.07%。↗
  • 腾讯 在搜索广告提出 ANGLE 一步式检索框架,用 LLM 生成层级文本表示(商业意图+广告摘要)替代离散 SID,将检索/相关性/排序整合进单一 LLM。线上消耗 +1.81%、GMV +2.16%,离线 HR/ACR 全面超 7 个基线。↗
  • Adobe、格拉斯哥大学 针对 RAG 固定检索器-生成器配置的低效问题,提出 DRAG 查询自适应路由框架,含免训练 QPP 路由与 SFT 监督路由。DRAG_QPP 效果持平强静态基线且大幅降延迟,DRAG_SFT 持续提升效果。↗
  • 罗马一大、比萨大学 针对序列推荐 GDPR 合规遗忘难题,提出 SURF 近似机器遗忘框架,通过嵌入邻域定位+局部辅助模型+推理时分数相减实现。仅需 2% 重训练时间预算,NDCG@20 最高提升 32%,效果接近全量重训。↗

Section 3: 📰 Daily Digest

1. Scaling Articulated Rationales for MLLM-based Recommendation

🔗 原文: https://arxiv.org/abs/2609.17639
🏷️ 来源: 🏭 工业界 | Kuaishou
⭐ 评分: ⭐⭐⭐⭐⭐ (5/5)
🎯 推荐理由: 快手工业级框架,将用户自然语言偏好解释作为一等文本信号,MLLM 对齐+排序集成,线上 A/B 验证。
📝 摘要: 现有推荐系统主要依赖点击、观看时长等隐式行为,只能反映用户"做了什么"而非"为什么喜欢"。本文研究 Articulated User Rationales(AURs)——用户对偏好的自然语言解释,作为一类极性感知、原因级的文本信号,但 AURs 天然稀疏、质量参差、覆盖物品有限,难以直接工业落地。作者提出 SARA 框架:先从 240M 快手直播用户构建数据引擎产出 SARA-HQ 数据集,再通过大规模 SFT 与 Quality-Refining DPO 将通用 MLLM 对齐为 SARA-7B,把 rationale 生成从 8.6 万作者扩展到 1000 万作者空间,最后用 SARA-Ranker 通过 rationale-aware interaction modeling 与 rejection-memory modeling 集成到生产排序。离线评测、人工校准与线上 A/B 均显示 SARA-7B 生成的 rationale 更具体、极性一致、有据可依,SARA-Ranker 提升互动并降低负反馈,已日更部署超 30 天,将 AURs 确立为工业推荐的一等文本信号。

2. LIGE-GR: A Smooth Leap from Ranking to Generative Recommendation in the LLM Era

🔗 原文: https://arxiv.org/abs/2609.18148
🏷️ 来源: 🏭 工业界 | Meta
⭐ 评分: ⭐⭐⭐⭐⭐ (5/5)
🎯 推荐理由: Meta 提出 LIGE-GR,将成熟排序系统平滑升级为 listwise 生成式推荐,双平台 A/B 验证有效。
📝 摘要: LLM 的成功为下一代推荐系统提供灵感,但如何把序列级生成与优化精确融入成熟工业推荐栈仍是开放问题:一方面不清楚如何引入 listwise 生成,另一方面真实系统经多年围绕产品、业务约束与 serving 基础设施定制,整体替换风险高、组织阻力大。本文提出 LIGE-GR,一个 listwise 生成与评估推荐框架,将传统 pointwise 排序系统泛化为 listwise 生成系统,在保留现有模型、价值函数与服务基础设施兼容性的同时享受 listwise 优化收益。在 Instagram Reels 与 Facebook Video 短视频推荐上验证,停留时长分别提升 1.14% 与 0.72%,仅需少量额外推理资源。其价值在于给出了一条低风险、可兼容的生成式推荐演进路径,而非推倒重来。

3. Single-Token Expected-Value Scoring for Cold-Start Candidate Ranking

🔗 原文: https://arxiv.org/abs/2609.18188
🏷️ 来源: 🏭 工业界 | Indeed
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 单 token 期望值打分实现确定性低延迟排序,线上降低低相关率 27.3%。
📝 摘要: AI 辅助招聘可减轻人工筛选负担,但把语言模型部署为生产排序器仍有挑战:零样本 LLM 打分不稳定、非确定性且排序不准,而传统深度排序器需要百万级交互日志,低流量垂直招聘平台无法提供,仅有几十万序数相关性标签。作者提出 single-token expected-value scoring,将候选-职位相关性建模为 {1..5} 序数分类,取首 token 概率分布的期望作为分数,因仅需单步解码,是 logits 的确定性函数、无需输出解析、低延迟服务。为从有限监督中学习异构招聘标准的非线性依赖,用 MSE(保序数距离)+CE(锐化类边界)混合序数回归损失微调 SLM。离线优于启发式与零样本 LLM,端到端仿真 Jobseeker NDCG@10 +54.2%、低相关率 -46.7%,线上雇主低相关率降 27.3%、keep rate +7.07%。方法本质是序数回归+单步解码的工程组合,创新偏增量,但对冷启动低流量场景有直接参考价值。

4. One-Step Retrieval Framework for Real-Time Sponsored Search Ads Using Hierarchical Text Representations

🔗 原文: https://arxiv.org/abs/2609.18296
🏷️ 来源: 🏭 工业界 | Tencent
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 腾讯搜索广告用 LLM 层级文本表示替代 SID,统一生成-判别-排序,线上消耗+1.81%、GMV+2.16%。
📝 摘要: 传统检索采用多级级联架构(MCA),各模块独立优化导致目标不一致、高潜候选被过早淘汰;近期 LLM 生成式方法虽端到端,但用离散语义 ID(SID)检索广告,SID 未被基座 LLM 学习、SFT 时需记忆大量 SID-to-ad 映射,泛化差、维护成本高,且 SID 与广告一一映射导致解码低效,还依赖小奖励模型(如 pctr)限制 LLM 评估商业价值的能力。本文提出 ANGLE 统一生成-判别-排序实时检索框架,用 LLM 生成层级文本表示(提供高层概览的商业意图 + 细粒度细节的广告摘要)替代 SID,并将检索、相关性、排序整合进单一 LLM。在真实搜索场景中消耗 +1.81%、GMV +2.16%,离线 HR、ACR 等关键指标全面超越 7 个基线。系统设计完整、线上验证充分,属对生成式检索范式的工程化改进。

5. One Size Does Not Fit All! Dynamic Retriever and Generator Selection for RAG

🔗 原文: https://arxiv.org/abs/2609.17709
🏷️ 来源: 🤝 产学合作 | Adobe, IACS, University of Glasgow
⭐ 评分: ⭐⭐⭐ (3/5)
🎯 推荐理由: RAG 检索器-生成器联合自适应路由,效率-效果权衡思路可迁移至推荐系统动态配置选择。
📝 摘要: RAG 系统通常对所有查询采用固定的检索器与生成器配置,忽视查询复杂度与信息需求的差异,造成算力分配低效;此前检索与生成的自适应被独立研究,二者对端到端 RAG 性能的联合影响尚不明确。作者系统分析检索器与生成器复杂度在 factoid 与 multi-hop QA(含 bridge、composition 推理)上的交互,发现更强检索通常比增加生成投入收益更大,但两者均呈递减且非单调回报,高复杂度配置并非普遍更优。据此提出 DRAG 查询自适应框架:DRAG_QPP 免训练路由,用 QPP 信号选检索器、用检索上下文的困惑度选生成器;DRAG_SFT 监督路由,微调 LLM 联合预测检索器-生成器配置。在 3 个 LLM 家族、4 个 QA 基准上,DRAG_QPP 效果持平强静态基线且大幅降低推理延迟,DRAG_SFT 持续优于静态与免训练自适应基线。方法属对已有自适应思路的组合扩展,创新偏增量,但其查询自适应路由与效率-效果权衡思想可迁移至推荐系统的动态配置选择。
  • 推荐系统
  • 日报
  • AI 技术日报 - 2026-09-19AI 技术日报 - 2026-09-18
    Loading...