推荐算法日报 - 2026-09-23
2026-9-23
| 2026-9-23
字数 3647阅读时长≈ 10 分钟
type
Post
status
Published
date
Sep 23, 2026 05:15
slug
daily-report-2026-09-23
summary
统一召回-排序架构成为工业界主流方向:百度 UNIQUE 用单层扁平量化 + 早融合架构打通召回与精排,LinkedIn CC Retriever 用 GPU 排序栈把深度模型下沉到粗排层,两者都在消除阶段间信息损失。传统"召回-粗排-精排"级联范式的边界正在被重新定义,端到端联合训练从学术概念走向大规模线上部署。; 长序列与多兴趣建模的工程化落地加速:百度 MuSeR 在 10⁴-10⁵ 级用户行为序列上实现层次时间压缩 + 多查询兴趣解耦 + 多模态语义对齐的系统级集成,在固定 servin
tags
推荐系统
日报
category
推荐技术报告
icon
📚
password
priority
1

Section 1: 📊 Trend Analysis

  • 🔥 统一召回-排序架构成为工业界主流方向:百度 UNIQUE 用单层扁平量化 + 早融合架构打通召回与精排,LinkedIn CC Retriever 用 GPU 排序栈把深度模型下沉到粗排层,两者都在消除阶段间信息损失。传统"召回-粗排-精排"级联范式的边界正在被重新定义,端到端联合训练从学术概念走向大规模线上部署。
  • 💡 长序列与多兴趣建模的工程化落地加速:百度 MuSeR 在 10⁴-10⁵ 级用户行为序列上实现层次时间压缩 + 多查询兴趣解耦 + 多模态语义对齐的系统级集成,在固定 serving budget 下完成部署。超长序列不再是离线实验的玩具,异步刷新 + 自适应缓存 + 异构硬件分层检索等工程实践成为关键。
  • ⚙️ SFT/RL 配比与训练策略诊断从经验走向可量化:Amazon 用教师支持度与奖励可观测空间前瞻性路由 SFT/RL 分配,Salesforce 用嵌套采样诊断多轮工具调用中的可训练状态,EvoRank 提出 headroom gate 预判进化搜索收益。训练策略的"何时该训、训哪里、训多少"正在从拍脑袋变成可测量、可预测的工程决策。

Section 2: 📋 今日速览

  • Amazon 在广告 analytics agent 场景提出 SFT/RL 配比诊断框架,用教师支持度与奖励可观测空间将特征路由到不同训练策略。GPT-OSS 120B 上 7/8 广告主技能正向,最大增益 +11.27 分,省 43% RL 算力。↗
  • 百度 在百度 APP 首页/发现页/短视频场景提出 MuSeR 长序列多兴趣召回框架,层次时间压缩支持 10⁴-10⁵ 行为序列 + LLM 蒸馏多模态语义对齐。线上 A/B DAU +0.26%、总时长 +0.89%,延迟与成本双降。↗
  • 百度 在 Mobile Baidu 三大场景提出 UNIQUE 统一召回排序框架,单层扁平量化 + 生成式检索与 target-aware 排序早融合端到端训练。线上 A/B 观看时长 +0.96%、分发量 +1.08%,P99 延迟 89ms、MFU 44.23%。↗
  • LinkedIn 在 Feed 粗排层提出 CC Retriever,用 GPU sorted-search 原语将图边亲和特征与文档特征在 5-10ms 内 join,支撑 50x 模型参数扩展。线上 A/B 内容消费时长 +2.5%,十亿级候选索引 120ms P99 内完成打分。↗
  • 百度 ERNIE 提出 RLVR² 将多维度 rubric 评分转为组内序数比较矩阵恢复潜在效用,避免异质尺度校准问题。3 个模型规模、16 个基准上一致超越 rubric-based 基线,多数基准取得最优。↗
  • 快手 & 香港城市大学 提出 Inherit4Rec 参数继承框架,支持稠密扩展(D2D)与稀疏转换(D2S),用共激活感知分区构建 SMoE。KuaiRand-1K 与工业短视频数据集上全面超越继承基线,兼顾训练效率与推理预算。↗
  • Zendesk 提出 RAILS 检索增强增量 LLM 聚类框架,将聚类转化为对增长标签池的循环分配,支持文档批处理与有界并发。六基准准确率 51.2%→59.3%、NMI 67.2%→74.8%,已替换生产 HDBSCAN 阶段。↗
  • Walmart 在电商视觉搜索场景提出 GradCIR,用 VLM 自动构建 4 级分级相关性监督 + 迭代难负样本挖掘 + 层级感知角度目标。NDCG@10 提升 4.9%-5.9%,已部署服务线上视觉搜索流量。↗
  • Netflix 将推荐可观测性建模为反事实测量问题,统一服务内容创作者与模型开发者,覆盖偏差削减、相对性与增量性三维度。框架适用于单阶段与级联推荐系统,已在多个生产系统部署验证。↗
  • Ant International & 清华 & 港中文 提出 TimEvolve 时间序列 agent,将部署中的延迟反馈转化为专家信任、路径选择与干预强度的持久策略更新。八个 Time-MMD 域上 15 种方法中平均 MSE/MAE 排名最优,七个域取得最低误差。↗
  • 未知机构 提出 Guided SID,强制 RQ-VAE 粗层编码预定义任务相关属性,trie-merge 映射高基数属性到固定码预算。匹配 A/B 中 recall@1 提升 1.36x、MRR 0.0260→0.0355,属性预测率提升 4.2x。↗
  • Salesforce 提出 Critical-State RL 诊断多轮工具调用中的可训练状态,用嵌套采样分离动作信号与延续噪声。BFCL v4 上 missing-function 任务提升约 14 个百分点,替代状态训练无增益。↗
  • 未知机构 在招聘场景对比 EmbeddingGemma 与 MPNet 在混合检索中的表现,用 Cached MNRL 微调 + RRF 融合向量与全文检索。面向已部署 AI-Match 评分流水线,提供企业级嵌入模型选型的结构化对比依据。↗
  • 阿里 & 百度 & 中科院 提出面向 AI Search 的答案导向上下文构建三阶段框架:答案支撑识别、内容可信度评估、上下文组织。检索目标从排序文档转向构建可靠生成上下文,检索侧与答案侧均一致提升。↗
  • Microsoft 提出 PSD 伪自蒸馏框架,让 0.6B-4B 小模型通过黑盒 oracle 提示蒸馏构建层次化 Agent 记忆表示。LoCoMo 上匹配或超越 GPT-4.1-mini 检索性能,且能力可 OOD 迁移至 LongMemEval。↗
  • Skoltech 提出 BT-SR 去相关正则化序列推荐框架,用 Barlow Twins 目标抑制用户表示空间中的共享低秩方向。五个基准上持续提升排序质量,去相关强度作为调控头尾曝光权衡的旋钮。↗
  • Leiden University 对生成式推荐中 Semantic ID 设计进行大规模可复现研究,统一框架下考察构造策略、码本组织与码长影响。发现 SID 设计效果非单调,无单一设计在所有数据集上最优,码本利用率是诊断指标但非充分条件。↗
  • Independent 提出 EvoRank,用 LLM 引导进化循环自动发现多目标 LTR 流水线(特征/模型/损失/集成)。Expedia 数据集上三组独立运行均超越 Optuna 调优 LambdaMART,进入原竞赛前 6%,并提出 headroom gate 预判收益。↗
  • 华为 提出 Toollery 免训练候选压缩框架,从 79K 能力库中检索 top-k 候选集替代全库提示。座舱数据集上 top-10 预算下端到端选择提升,BFCL-V4 上 AST Accuracy 持平,显著降低 token 与延迟成本。↗
  • 罗马大学 & Paradigma & Not Diamond 揭示量化对检索排序的隐性损害:分类精度不变但 top-1 检索结果变化 14%-46%。用 top-1/top-2 gap 判据指导精度分配,检索场景可回收 3/4 额外 bit 收益且仅需一半成本。↗

Section 3: 📰 Daily Digest

1. A Pinch of SFT, A Dash of RL: When Reinforcement Learning Helps Long-Horizon Advertising Agents

🔗 原文: https://arxiv.org/abs/2609.22194
🏷️ 来源: 🏭 工业界 | Amazon
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 用教师支持度与奖励可观测空间诊断 SFT/RL 配比,广告 agent 上 7/8 技能正向且省 43% RL 算力。
📝 摘要: 企业级 analytics agent 需在分布式业务数据上完成检索、推理、API 调用、代码执行等长程工具调用任务,SFT 校准工具语法而 RL 探索奖励可观测行为,但统一施加 RL 会扰动已校准技能。本文提出基于教师支持度与奖励可观测空间的前瞻性路由诊断,将 checkpoint 轨迹分为 Imitation/Lift/Discovery 三区间,据此决定特征走 SFT-only、SFT→RL、增加 RL 分配或继续环境开发。18 组后续实验中诊断预测 15/18 轨迹;GPT-OSS 120B 上 7/8 广告主技能正向,最大增益 non-disclosure +11.27 分(95% CI [+9.72, +12.82]),SME 审计显示标准泄漏 11.8%→2.9%、对抗泄漏 22.9%→6.8%。匹配对比中 targeted RL 将七技能均值 delta 从 +1.62 提升至 +3.57 且省 43% 增量 RL 算力。局限在于方法为经验性诊断而非理论保证,泛化性待验证。

2. MuSeR: Scalable Long-sequence Recommendation with Multi-interest Modeling

🔗 原文: https://arxiv.org/abs/2609.23677
🏷️ 来源: 🏭 工业界 | Baidu
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 百度工业级长序列多兴趣召回系统,线上 A/B 显著提升 DAU 与时长,工程落地参考价值高。
📝 摘要: 工业推荐系统受限于延迟与内存预算通常将用户历史截断至数百条,导致长期兴趣未被充分利用,且用户跨新闻/问答/短视频的多异构意图难以用稀疏 ID 嵌入表示。MuSeR 基于已部署 MGS 系统构建召回框架,集成三项组件:层次时间压缩(近期全分辨率 + 远期渐进池化,支持 10⁴-10⁵ 行为序列)、解耦多查询兴趣提取 + 正交正则、LLM 蒸馏文本摘要增强稀疏 ID 的多模态语义对齐。部署层面采用异步用户表示刷新 + 自适应缓存 + 异构硬件分层 beam-search 检索。三个公开基准与大规模工业数据集上 Recall@K 持续提升;百度 APP 首页/发现页/短视频线上 A/B DAU +0.26%、总时长 +0.89%(p<0.05),延迟与成本双降。论文自述贡献为系统级集成而非新建模原语,方法创新偏增量。

3. UNIQUE: A Unified Retrieval and Ranking System for Large-Scale Feed Recommendation

🔗 原文: https://arxiv.org/abs/2609.23718
🏷️ 来源: 🏭 工业界 | Baidu
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 百度 Mobile Baidu 线上统一召回排序框架,单层扁平量化 + 早融合,A/B 提升观看时长 0.96%。
📝 摘要: 工业移动 Feed 系统的召回-排序级联架构面临两大痛点:层次量化不稳定伤害长尾与冷启动推荐,以及召回与排序阶段分离导致信息损失。UNIQUE 提出单层扁平量化统一框架,将生成式 code-based 召回与 target-aware 排序集成到早融合架构中,共享表示下端到端训练,并引入平衡量化机制缓解 codebook 不平衡、改善长尾表示。离线实验从召回与排序双视角评估,codebook 分析显示资源分配比层次量化更均衡。部署于 Mobile Baidu 首页 Feed、发现页、短视频三大场景,线上 A/B 总观看时长 +0.96%、总分发量 +1.08%,新用户与高活跃用户提升尤为显著;服务端 P99 延迟 89ms、在线推理 MFU 44.23%。属工程与方法的有效结合,但摘要未披露具体方法细节与对比基线,创新性偏增量式架构整合。

4. Connected Content Retriever: Dense Graph Edge Features Powering Pre-Ranking at LinkedIn

🔗 原文: https://arxiv.org/abs/2609.22441
🏷️ 来源: 🏭 工业界 | LinkedIn
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: LinkedIn 用 GPU 排序栈将图边特征注入粗排,50x 参数扩展带来 +2.5% 线上时长提升。
📝 摘要: LinkedIn Feed 中来自用户人脉网络(关注与连接)的内容占曝光与互动 70% 以上,粗排层需在 120ms P99 内从十亿级候选索引中筛选数万条活动送入精排。CC Retriever 提出在 GPU 上以完整深度排序模型对候选打分,核心是 sorted-search GPU 原语,在 5-10ms 内完成稠密图亲和特征(viewer-author)与文档级特征的运行时 join。利用 LinkedIn 职业知识图谱的一度/二度网络边特征(含 stranger viral 信号)进行图关系建模。GPU 服务化打分使排序模型参数扩展 50x,线上 A/B 内容消费时长 +2.5%,显著高于 LinkedIn Feed 实验的典型增益。方法层面偏工程系统优化(edge feature join + GPU serving),创新性属增量式系统改进。

5. RLVR²: Reinforcement Learning with Verifiable Rubric-based Ranking

🔗 原文: https://arxiv.org/abs/2609.23457
🏷️ 来源: 🏭 工业界 | Baidu
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 将多维度 rubric 评分转为组内排序恢复潜在效用,避免异质尺度校准,16 基准全面领先。
📝 摘要: RLVR 正从数学/代码等有明确正确性信号的任务扩展到多维度 rubric 定义的多面质量要求,但策略优化每次 rollout 仅消费一个标量,rubric 流水线必须将多准则分数聚合为标量奖励。主流做法(各准则归一化后线性组合)隐含假设基数分数差跨准则可比、某准则增益可补偿另一准则失败,当准则语义异质时均不可靠。RLVR² 提出可验证排序范式:对每个准则将 rubric 分数转为组内序数结果,从比较矩阵恢复潜在效用并合并为单一训练信号,仅保留组内排序、丢弃原始分数幅度,避免异质尺度校准。还支持目标保持的属性调整,相关但非训练目标的辅助属性可进入估计而不扩展 rubric。3 个模型规模、16 个基准上一致超越代表性 rubric-based 基线,多数基准在每个规模取得最优。局限在于缺乏线上 A/B 实验和大规模系统设计细节。
  • 推荐系统
  • 日报
  • AI 技术日报 - 2026-09-24AI 技术日报 - 2026-09-23
    Loading...