推荐算法日报 - 2026-08-11
2026-8-11
| 2026-8-11
字数 2448阅读时长 7 分钟
type
Post
status
Published
date
Aug 11, 2026 05:15
slug
daily-report-2026-08-11
summary
生成式推荐进入工业化深水区:今日多篇论文围绕生成式推荐(GenRec)展开,从字节跳动的 TM20K(超长序列 + 知识蒸馏)到快手的 HD-Rec(跨域统一框架),再到 NAVER WEBTOON 的三阶段后训练对齐,标志着生成式范式正从概念验证走向大规模线上部署,核心矛盾从"能不能用"转向"如何高效落地"。; 模型内部状态成为优化新抓手:Meta 的 MISO 与 Amazon 的 BC-ICL 不约而同地利用模型内部状态(参数、激活、梯度、bootstrap 重采样)来指导优化决策,替代传
tags
推荐系统
日报
category
推荐技术报告
icon
📚
password
priority
1

Section 1: 📊 Trend Analysis

  • 🔥 生成式推荐进入工业化深水区:今日多篇论文围绕生成式推荐(GenRec)展开,从字节跳动的 TM20K(超长序列 + 知识蒸馏)到快手的 HD-Rec(跨域统一框架),再到 NAVER WEBTOON 的三阶段后训练对齐,标志着生成式范式正从概念验证走向大规模线上部署,核心矛盾从"能不能用"转向"如何高效落地"。
  • 💡 模型内部状态成为优化新抓手:Meta 的 MISO 与 Amazon 的 BC-ICL 不约而同地利用模型内部状态(参数、激活、梯度、bootstrap 重采样)来指导优化决策,替代传统的试错调参或黑盒搜索。这一趋势暗示:随着模型复杂度上升,"用模型理解模型"的系统化工作流将成为降本增效的关键路径。

Section 2: 📋 今日速览

  • ByteDance 在电商广告场景提出 TM20K 超长序列建模范式,全注意力 Transformer + 两阶段知识蒸馏,学生模型用 token merge 压缩序列至 20K。线上 ADSS +1.036%,服务延迟仅 +5.6%,训练成本基本持平。
  • Kuaishou 联合香港城大提出 HD-Rec 生成式跨域推荐框架,层次化域感知量化器 + 域自适应稀疏 MoE,统一多域语义空间。三个公开跨域基准上稳定超越 SOTA 基线。
  • Meta 提出 MISO 系统工作流,利用模型内部状态(参数/激活/梯度)生成可解释的候选编辑,指导排序模型局部优化。广告排序场景下以更少验证轮次提升归一化熵,介于人工调参与黑盒搜索之间。
  • Amazon 提出 BC-ICL 策略,将预训练表格基础模型与 bootstrap 重采样结合,实现样本高效的上下文 bandit 决策。标准 bandit 套件上早期 regret 与整体表现均优于既有基线。
  • NAVER WEBTOON 提出 LP-FFT-RFT 三阶段渐进后训练框架,显式分离下游适应与业务指标对齐,用奖励模型做强化微调。离线优于单阶段方案,大规模线上 A/B 验证有效。
  • Norly Research 首次以完整市场普查审计 AI 餐饮推荐,枚举巴厘岛 4,776 家场所评估 4 个生产系统。85.6% 场所从未被推荐,星级在入选环节无效但显著影响排名,关闭场所推荐 93 次。
  • 西南交大 提出 EAHR 精确自适应混合检索,以完整列表加权 RRF 为目标,用 PVS 量化与 Posting Block-Max 实现可恢复的精确排序。150 组查询-快照组合全部复现 Top-20,延迟加速最高 30 倍。
  • UNSW 系统评估 6 种音频编码器在内容基/序列/Semantic-ID 三类音乐推荐中的表现。音频-文本对齐与音乐域表示直接使用更优,交互式序列训练缩小编码器差异,增大 Semantic-ID 容量未必稳定增益。

Section 3: 📰 Daily Digest

1. Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling in Ad Recommendation

🔗 原文: https://arxiv.org/abs/2608.07055
🏷️ 来源: 🏭 工业界 | ByteDance
⭐ 评分: ⭐⭐⭐⭐⭐ (5/5)
🎯 推荐理由: 工业级超长序列建模新范式,全注意力+知识蒸馏,线上显著提升。
📝 摘要: 针对超长用户行为序列建模中训练效率与 serving 吞吐的瓶颈,本文提出 TM20K 范式:教师与学生模型均采用全注意力 Transformer(而非传统 target attention),学生侧通过多种 token merge 方法显著压缩序列长度,再由全量 token 训练的教师模型通过两阶段知识蒸馏补偿信息损失。该方案已在字节跳动电商广告系统部署,将序列长度扩展至 20K,线上 ADSS +1.036%,服务延迟仅增加 5.6%,训练与 serving 成本与线上 SOTA 模型基本持平。核心借鉴价值在于:token merge + 蒸馏的组合为超长序列落地提供了"效果-成本"兼得的新路径,且全注意力相对 target attention 的增益值得在自有场景验证。

2. Hierarchical Quantization with Domain-Adaptive Sparse Routing for Generative Cross-Domain Recommendation

🔗 原文: https://arxiv.org/abs/2608.06997
🏷️ 来源: 🤝 产学合作 | City University of Hong Kong, Kuaishou Technology
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 层次化量化与域自适应稀疏路由,统一生成式跨域推荐新框架。
📝 摘要: 将生成式推荐(GenRec)扩展到跨域场景面临异构物品语义与行为模式的挑战,现有全局共享表示或轻量域适配容量不足。本文提出 HD-Rec 统一生成式跨域推荐框架:层次化域感知量化器用全局共享粗粒度码本 + 自适应路由细粒度码本构建语义 ID,域自适应稀疏 MoE 结合持续激活的共享专家与动态选择的专用专家,并引入跨粒度路由一致性目标增强多 token 表示的连贯性。在三个公开跨域推荐基准上,HD-Rec 一致优于序列、生成式及跨域推荐基线。方法创新性强,但尚未报告线上 A/B 结果,工业落地效果有待验证;层次化码本 + 稀疏路由的设计思路对多域统一建模有直接借鉴意义。

3. MISO: Model-Internal-State-Guided Optimization for Ranking Models

🔗 原文: https://arxiv.org/abs/2608.07035
🏷️ 来源: 🏭 工业界 | Meta
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 利用模型内部状态指导排序模型优化,减少试错成本,工业界实用性强。
📝 摘要: 排序模型在既有模型族内反复迭代时,"该扩展/替换/淘汰哪个组件"通常依赖昂贵的试错。MISO 提出一种系统工作流:从训练好的排序模型中提取内部状态(参数、激活、梯度、归一化统计),聚合成排序/对齐/比较信号,转化为少量可解释的候选编辑;每个重训周期后重新提取 MIS,天然支持随数据分布与系统需求变化的自适应优化。在广告排序案例中,MISO 以远少于专家驱动和黑盒搜索的验证轮次提升归一化熵,为人工调参与自动化搜索之间提供了实用中间地带。该方法对大规模排序系统降本增效有直接价值,但缺乏线上 A/B 数据,验证规模有限。

4. Bootstrap-Conditioned Action Selection with Tabular Foundation Models

🔗 原文: https://arxiv.org/abs/2608.06559
🏷️ 来源: 🏭 工业界 | Amazon
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 将表格基础模型与bootstrap结合,实现样本高效的上下文bandit策略。
📝 摘要: 上下文 bandit 为样本高效个性化提供了自然框架,但稀疏有偏交互数据、不可靠的不确定性估计与严重冷启动制约实际部署。本文提出 BC-ICL:每轮对交互历史做 bootstrap 重采样,冻结的预训练 ICL 模型基于重采样结果对所有动作打分并选择最高分动作;同时引入 arm-context conditioning 架构,促进跨动作共享统计强度,规避孤立臂 bandit 的 bootstrap 失败模式。在标准上下文 bandit 套件的严格在线协议下,BC-ICL 在早期 regret 与整体表现上均优于既有基线。该方法为冷启动与探索利用平衡提供了新思路,但尚未在真实推荐系统部署验证,且依赖预训练模型质量。

5. Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training

🔗 原文: https://arxiv.org/abs/2608.06792
🏷️ 来源: 🏭 工业界 | NAVER WEBTOON
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 三阶段渐进后训练框架,有效对齐业务指标,线上验证有效。
📝 摘要: 推荐基础模型通常通过 SFT 适配下游场景,但优化点击/点赞等任务目标并不必然对齐决定推荐质量的业务指标。本文提出 LP-FFT-RFT 三阶段渐进后训练框架,显式分离下游适应与业务指标对齐:LP 在冻结表示空间稳定随机初始化的下游头,FFT 联合特化全模型,RFT 用学习到的奖励模型对齐业务目标;策略在稠密隐式反馈上训练,业务指标监督仅用于奖励建模。离线实验表明渐进框架优于单阶段方案,且基于奖励的对齐比直接用奖励模型排序产生更强策略;大规模线上 A/B 验证相对传统非基础模型基线提升生产推荐质量。参考实现已开源,对推荐基础模型落地有直接参考价值,但未披露具体线上提升幅度。
  • 推荐系统
  • 日报
  • OneTrans 推荐系统对齐序列处理与特征交叉AI 技术日报 - 2026-08-11
    Loading...