推荐算法日报 - 2026-08-07
2026-8-7
| 2026-8-7
字数 2504阅读时长 7 分钟
type
Post
status
Published
date
Aug 7, 2026 05:15
slug
daily-report-2026-08-07
summary
生成式推荐全面渗透排序链路:今日多篇论文将生成式范式引入激励分配(快手 GOAL)和重排阶段(京东 DEGR),用条件序列生成替代传统打分/优化,配合强化学习或 ORPO 做偏好对齐。生成式模型正从召回/粗排向精排、重排、激励分配等更细粒度决策场景渗透,成为工业界探索的新方向。; 多目标优化与约束控制成为工业落地核心痛点:直播场景的稀疏延迟多行为建模(Twitch)、激励广告的 ROI 全局约束(快手)、重排的即时-探索价值平衡(京东),都指向同一个问题——如何在多目标、多约束下做序列级决策。M
tags
推荐系统
日报
category
推荐技术报告
icon
📚
password
priority
1
# 推荐算法日报 2026-08-07

Section 1: 📊 Trend Analysis

  • 🔥 生成式推荐全面渗透排序链路:今日多篇论文将生成式范式引入激励分配(快手 GOAL)和重排阶段(京东 DEGR),用条件序列生成替代传统打分/优化,配合强化学习或 ORPO 做偏好对齐。生成式模型正从召回/粗排向精排、重排、激励分配等更细粒度决策场景渗透,成为工业界探索的新方向。
  • 💡 多目标优化与约束控制成为工业落地核心痛点:直播场景的稀疏延迟多行为建模(Twitch)、激励广告的 ROI 全局约束(快手)、重排的即时-探索价值平衡(京东),都指向同一个问题——如何在多目标、多约束下做序列级决策。MMoE、安全约束策略优化、探索奖励模型等成为应对手段,且均以线上 A/B 为最终验证标准。
  • 💡 从"改模型"到"改数据/改基础设施"的降本思路:腾讯 Capability Pages 通过离线重写技能库文档(不修改在线模型)提升检索效果;延世大学 WatchLens 则从实验基础设施入手,用标准化日志层打通策略与行为数据。这种"不动在线模型、改造离线数据或实验平台"的思路,对工业系统落地成本友好,值得关注。

Section 2: 📋 今日速览

  • 快手 联合电子科大提出 GOAL 生成式激励分配框架,将激励幅度建模为条件序列生成,引入层次因果状态编码器和 SCPO 安全约束策略优化,实现跨 ROI 约束泛化。真实数据+疲劳感知环境实验显示长期收益与留存提升、ROI 违规率大幅下降。
  • Twitch/Amazon 针对直播稀疏延迟的多并发行为,提出延迟窗口+多模型架构+segment-aware 分群优化,并用 MMoE 联合建模多目标、参数减少 41.9%。线上 A/B 显示 DAV +0.09%、高活跃用户 ARPU +0.56%,Twitch 移动端正互动 +1.12%。
  • 腾讯 提出 Capability Pages 集群对比能力页,将技能能力建模为可执行区域,通过正触发/负边界/判别性主体离线重写技能库,无需修改在线模型。SRA-Bench 上五种检索器 Recall@10 平均提升 2.94 点,端到端任务成功率 +3.62 点。
  • 延世大学 开源 WatchLens 可配置视频推荐实验平台,UI、内容源、推荐策略独立可配,标准化日志层在记录时即关联策略与排名位置。短视频案例研究验证了 session 级策略对比能力,单服务器可部署,面向可复现研究。
  • 京东 提出 DEGR 双探索驱动生成式重排,采用监督+强化混合优化范式,用探索奖励模型自适应平衡即时与探索价值,生成器充当跨请求上下文桥。京东电商线上 UCTR 最高提升 1.22%、PV +0.20%。
  • 香港城市大学 等提出成本感知多目标 bandit 框架,将 LLM 配置评估建模为带成本的多目标 bandit,提出 hypervolume-UCB 和成本感知 gap elimination 算法。预算后悔界保持对数依赖,Pareto 识别错误概率指数衰减,实验验证高效性。

Section 3: 📰 Daily Digest

1. Generative Optimization for Incentivized Advertising with Global Level Constraints

🔗 原文: https://arxiv.org/abs/2608.04421
🏷️ 来源: 🤝 产学合作 | Kuaishou, UESTC
⭐ 评分: ⭐⭐⭐⭐⭐ (5/5)
🎯 推荐理由: 生成式激励分配新范式,约束泛化能力强,工业验证扎实。
📝 摘要: 激励广告的连续激励幅度优化受高频交互、延迟反馈和非马尔可夫用户动态(如疲劳效应)制约,现有 uplift 建模和约束 RL 方法效果有限。本文提出 GOAL 框架,将激励分配重构为条件序列生成问题,直接基于用户历史与系统全局压力自回归生成激励幅度,并用层次因果状态编码器捕捉局部行为动态与长程依赖。为灵活控制约束,引入 SCPO 安全约束策略优化,单个生成策略即可泛化到不同 ROI 约束而无需重训。大规模真实数据与疲劳感知合成环境实验表明,GOAL 在提升长期收益和留存的同时大幅降低 ROI 违规率,为激励广告的约束优化提供了生成式新解法。

2. Multi-Objective Ranking for Live-Streaming: Balancing Fresh and Delayed Signals with Segment-Aware Targeting

🔗 原文: https://arxiv.org/abs/2608.04455
🏷️ 来源: 🏭 工业界 | Twitch, Amazon
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 直播推荐多目标排序,延迟信号与分群优化,A/B 验证有效。
📝 摘要: 直播推荐面临用户行为稀疏延迟、多行为并发(观看/聊天/关注/消费)且各行为延迟不同的独特挑战,不同于电商的线性行为序列。本文提出三项关键贡献:延迟窗口扩展反馈收集、多模型架构融合新鲜与延迟信号并配合 segment-aware 分群优化、MMoE 集成联合建模相关目标且参数减少 41.9%。线上 A/B 显示 DAV +0.09%(对应数百万年活跃观看天数)、高活跃用户 ARPU +0.56%,新用户分群额外 +0.15% DAV,MMoE 贡献 +0.08% DAV 和 +0.27% 新增关注。该系统在 Twitch 移动端 feed 上验证了跨场景适用性(正互动 +1.12%),为直播多目标排序提供了低延迟可扩展的工程方案。

3. Skills Know Their Neighbors: Cluster-Contrastive Capability Pages for Skill Retrieval

🔗 原文: https://arxiv.org/abs/2608.04482
🏷️ 来源: 🏭 工业界 | Tencent
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 通过集群对比能力页提升技能检索,离线重写库无需改模型。
📝 摘要: LLM agent 技能库检索的瓶颈不仅在于检索器,还在于被检索的文档本身——文档只描述技能做什么,未说明相似请求应路由到别处。本文将技能能力形式化为"可执行区域",提出 Capability Pages 集群对比表示,包含正触发、负边界和判别性主体三部分,由离线编译器对比相邻技能自动生成。推理时索引用正触发和主体做候选召回,路由器用负边界拒绝易混淆候选,全程无需修改在线模型。SRA-Bench(26,262 技能、5,400 问题)上五种检索器 Recall@10 平均提升 2.94 点,加入负边界后端到端任务成功率平均 +3.62 点,中文场景迁移 MRR@50 达 73.07%,为技能检索提供了"重写库而非改模型"的轻量方案。

4. WatchLens: A Configurable Platform for Online Video Recommendation Experiments

🔗 原文: https://arxiv.org/abs/2608.04807
🏷️ 来源: 🎓 学术界 | Yonsei University
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 开源可配置平台,连接推荐策略与播放行为,支持在线实验。
📝 摘要: 研究推荐系统如何塑造用户行为需要在线实验同时关联播放行为与推荐条件,但现有用户研究基础设施通常只覆盖其一。WatchLens 作为开源平台填补这一空白,采用模块化架构使 UI、内容源和推荐策略独立可配置,feed 与 watch 页可分别指派策略,标准化日志层在记录时即关联推荐策略与排名位置。该设计使研究者能直接分析策略和排名如何影响播放行为、session 延续及页面间导航,无需事后重建关联。短视频案例研究通过仅变化 watch 页策略验证了 session 级对比能力,平台以单服务器可部署形式开源,为可复现的在线视频推荐研究提供了低成本基础设施。

5. DEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging

🔗 原文: https://arxiv.org/abs/2608.04809
🏷️ 来源: 🏭 工业界 | JD.com
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 双探索驱动生成式重排,自适应跨请求上下文桥接,线上提升显著。
📝 摘要: 工业推荐重排阶段受固定上游供给限制,在低质量供给下难以进一步提升效果。DEGR 提出重排应主动平衡即时价值与探索价值——在低质量供给下优先探索曝光以保留浏览潜力、促成意外转化。方法采用监督+强化混合优化范式,由探索奖励模型自适应平衡两类价值,整合监督学习、探索多样性约束和自适应奖励加权 ORPO 三个组件,使生成器成为跨请求的自适应上下文桥。京东电商系统离线与线上实验均超越 SOTA,UCTR 最高提升 1.22%、PV +0.20%,为低质量供给场景下的重排优化提供了生成式探索新思路。
  • 推荐系统
  • 日报
  • OneTrans 推荐系统对齐序列处理与特征交叉AI 技术日报 - 2026-08-07
    Loading...