推荐周报 2026-W31
2026-8-2
| 2026-8-2
字数 10635阅读时长 27 分钟
type
Post
status
Published
date
Aug 2, 2026 03:23
slug
rec-weekly-2026-W31
summary
本周推荐系统研究呈现三条交织的技术主线:生成式推荐的工业部署密度达到新高,多家公司密集披露线上收益;LLM 推荐从显式推理转向潜在推理,推理成本成为规模化部署的首要约束;工业基础设施论文集中解决训练-服务不一致、推理计算复用和冷启动问题。三条线共同的指向是——推荐系统正从"模型能力竞赛"转向"系统工程竞赛"。 主线 1:生成式推荐进入多目标、可控的工业化阶段。 快手的 Multi-Decoder OneRec 用多解码器结构解耦共享表示与目标特化,线上 app 使用时长 +0.37%、冷启动 +2.09%;京东的 OxygenREC-v2 以 3B 参数 MoE 将判别信号内化进生成式骨干,GMV 提升 2.8%-6.8%。生成式推荐的竞争焦点从"能不能召回"转向"能不能控方向、调目标"。 主线 2:LLM 推荐的推理方式从显式 CoT 转向潜在推理。 快手的 WhisperRec 将教师 CoT 压缩为潜在 token,SID@64 提升 17.44%,在线推理吞吐量提升超 10 倍;LaRec 用个性化高斯混合分布采样推理起点,探索多路径潜在推理。显式推理的质量天花板仍在,但推理成本决定了谁能在线上活下来。 主线 3:工业推荐系统的工程深化。 Meta 的 ROCS 将请求侧计算共享从特征交互扩展到序列模型,检索模型 QPS 提升 3 倍;Memory Layer 用与模型共训的键值缓存统一训练-服务表示,NE gap 缩小 86%。训练和服务的结构性对齐,正在成为比模型结构更重要的优化杠杆。
tags
推荐系统
周报
论文
category
推荐技术报告
icon
📚
password
priority
1

本周概览

本周推荐系统研究呈现三条交织的技术主线:生成式推荐的工业部署密度达到新高,多家公司密集披露线上收益;LLM 推荐从显式推理转向潜在推理,推理成本成为规模化部署的首要约束;工业基础设施论文集中解决训练-服务不一致、推理计算复用和冷启动问题。三条线共同的指向是——推荐系统正从"模型能力竞赛"转向"系统工程竞赛"。
主线 1:生成式推荐进入多目标、可控的工业化阶段。 快手的 Multi-Decoder OneRec 用多解码器结构解耦共享表示与目标特化,线上 app 使用时长 +0.37%、冷启动 +2.09%;京东的 OxygenREC-v2 以 3B 参数 MoE 将判别信号内化进生成式骨干,GMV 提升 2.8%-6.8%。生成式推荐的竞争焦点从"能不能召回"转向"能不能控方向、调目标"。
主线 2:LLM 推荐的推理方式从显式 CoT 转向潜在推理。 快手的 WhisperRec 将教师 CoT 压缩为潜在 token,SID@64 提升 17.44%,在线推理吞吐量提升超 10 倍;LaRec 用个性化高斯混合分布采样推理起点,探索多路径潜在推理。显式推理的质量天花板仍在,但推理成本决定了谁能在线上活下来。
主线 3:工业推荐系统的工程深化。 Meta 的 ROCS 将请求侧计算共享从特征交互扩展到序列模型,检索模型 QPS 提升 3 倍;Memory Layer 用与模型共训的键值缓存统一训练-服务表示,NE gap 缩小 86%。训练和服务的结构性对齐,正在成为比模型结构更重要的优化杠杆。

生成式推荐与语义索引

语义 ID 的设计空间被重新打开

LGRID(快手)— 现有的 SID 生成框架大多是"单表示-量化"范式,异构属性纠缠导致量化信息损失和严重碰撞。LGRID 提出 Encode→Disentangle→Align→Quantize 流程:先用联合 LLM 编码保留跨属性地理-语义依赖,再用结构化解耦块将隐状态路由到属性对齐槽位,最后用双流残差量化分别离散化地理和语义因子。结果是 SID 位置有了明确的属性和语义含义,可解释性来自设计而非事后归因。在快手和 Foursquare 上相对 AUC 提升 5.44%,全 SID 碰撞率从 97.0% 降至 39.9%。延续了 DualGR 对生成式检索中信号组织的关注,但把解耦的粒度推进到了属性级。
TopoGR(学术)— 指出了生成式推荐中一个结构性问题:tokenizer 学到的是带语义邻域关系的结构化码空间,而生成器把 SID 当作独立分类符号消费。物品相关性因此被简化为精确 SID 重叠。TopoGR 用位可分解的 Binary SID 暴露显式汉明几何,在输入层保持汉明邻近性、训练时用汉明软目标注入拓扑感知监督、推理时做汉明一致性重排。这个思路的深层含义是——SID 不只是 ID,它本身是可以被生成器利用的几何结构。相比 TIGER 的固定长度离散码,TopoGR 让 SID 的几何属性参与到了生成决策中。
VaLiDRec(学术)— 挑战固定长度 SID 的另一个角度:语义复杂度不同的物品需要不同的标识符长度。VaLiDRec 直接用 LLM 原生词表中的信息 token 构建变长 SID,通过 token 重要性估计、语义质量感知剪枝和碰撞感知精炼三步完成构建。改写了推荐为 token 集预测,消除自回归解码和 beam search,推理比 LC-Rec 快 87.49 倍。当 SID 长度适配物品语义复杂度而不是统一截断时,信息保留更充分,零样本冷启动也因此受益。
三篇论文的共同指向:SID 从"可用的编码"升级为"可解释、可利用、可伸缩的结构"。编码空间的设计质量,正在成为生成式推荐效果的新上限来源。

多目标与可控性成为部署主线

Multi-Decoder OneRec(快手)— 工业推荐系统用显式配额分配给每个目标的独立检索路径,路径增多导致建模、训练和服务碎片化。Multi-Decoder OneRec 用共享用户上下文模块 + 通用解码器保持统一,每个目标加一个参数高效的 LoRA 专家。训练用梯度路由隔离更新:曝光样本 NTP 更新共享底座,目标过滤 NTP 更新事件专家,KL 正则策略优化更新时长专家。推理时显式路径配额分配固定预算,Multi-Decoder Constrained Beam Search 减少跨路径重叠。在 512 项检索预算下 Recall@512 提升 1.69%-5.62%,线上 app 使用时长 +0.37%、冷启动 +2.09%。还开源了 Kwai26 基准——13.1 亿条物品级记录、3185 万 Item-ID、2503 万有效 SID 的物品。这是少数把多目标生成式检索的完整方案和基准都公开的工作。
RGD(快手)— 生成式推荐的 beam search 由生成似然主导,高价值但低概率的候选可能被提前剪掉。RGD 将价值引导解码表述为 KL 正则化奖励最大化问题,推导出闭式解码分布,在每一步注入奖励信号重塑搜索轨迹,无需重训生成器。这等于给生成式推荐加了一个测试时控制器——业务偏好变化时只换奖励模型,不碰生成器。RGD 已在快手平台部署,带来一致提升。这种"测试时控制"的思路与 xGR 的推理时项目过滤形成互补:一个管效率,一个管目标对齐。
OxygenREC-v2(京东)— 3B 参数、1B 激活的 MoE 生成式推荐模型。核心是 IDGR(Internalizing Discrimination into Generative Recommendation):预训练阶段用行为指令(点击、加购、下单)条件化生成;后训练阶段用未来交互行为作为特权知识,在熵感知轨迹优化自蒸馏框架中实现免奖励模型策略优化。全程维持单一骨干,不额外加判别目标。线上 UCTCVR 提升 1.6%-4.4%,GMV 提升 2.8%-6.8%。与 GRLM 的结构化 Term ID 路线相比,OxygenREC-v2 走了另一条路——不换 ID 格式,把行为信号融进生成过程本身。

生成式推荐与其他任务的边界正在消融

UniR²(快手)— 将生成式召回和多目标排序统一进单一 decoder-only 序列,包含用户上下文、SID 轨迹和物品特征。生成轨迹充当召回和排序之间的表示桥。Dual-Query Prefix-Causal Attention 为两个任务提供不同信息可见性,共享注意力权重但保留独立优化边界,排序侧 LoRA 不干扰生成骨干。线上 A/B 测试长期一致正向。这个方法回应了 Gryphon 提出的生成式推荐与物品级评分联合训练问题,但用单一骨干而非编码器-解码器结构解决。
FDP(快手)— 提出 Understanding-Action Gap:LLM 的推理在语言上合理,但不一定导向有效的推荐决策。FDP 区分意图知识(用户当前需求)与策略知识(该需求下的推荐方向和拒绝边界),用反馈驱动的 Agent 框架先归纳任务导向意图,再根据增量效用发现策略。两个潜在 token 通过双空间关系蒸馏转移进轻量级 Semantic-ID 生成器,实现 LLM-free 在线推理。线上 Revenue +4.506%、ADVV +4.621%。这篇的深层价值是把 LLM 定位从"推荐者"调整为"知识蒸馏源头"——延续了 OneLoc 的地理感知 SID 路线,但把知识迁移的结构化程度从"蒸馏到模型"提升到"蒸馏到 token"。
边界消融的另一面是生成单元的重定义。 快手的 PSG 将生成原子从单个物品提升为有序物品对。给定 n 个候选,PSG 在 n(n-1) 大小的对词汇表上操作,每请求只生成 L/2 个 token。论文给出三个理论保证:与物品空间生成双射且引导等价分布族(无表达力损失);理论加速 2-4 倍、实际环境 1.83 倍;最坏情况次优性界 O((L/2)²ε̄),比物品空间生成改善约 4 倍。线上用户停留时长 +0.178%,服务超过 4 亿 DAU。生成原子从物品到对的跃迁,相当于给生成式重排换了更粗粒度的乐高积木。

生成式推荐的记忆与属性建模

LoopMemGR(学术)— 指出生成式推荐的"历史即上下文"范式的缺陷:系统记住用户做了什么,但记不住自己推荐过什么、从反馈中学到了什么。LoopMemGR 维护推荐经验日志,通过近期视图(短期交互动态)、频率视图(重复推荐模式)和全局视图(跨用户可迁移规律)三视角提取证据,压缩为固定数量经验 token。用系统的推荐-反馈闭环补上协同信号的另一半。这个框架在淘宝工业数据集上验证,是少数把"系统侧记忆"显式建模的工作。
SPARC(学术)— 工业场景里每个行为都带异构属性(品类、品牌、价格、行为类型、时间戳),直接展开会撑爆输入长度,压缩成单表示又会过早丢弃上下文相关信息。SPARC 先建模每个字段类型的序列依赖,再路由原始/上下文/身份表示到多个槽位,最后轻量级跨物品交互压缩为单 token。原则是"先上下文化再压缩"。在淘宝和 Amazon 数据集上优于传统和生成式基线。压缩时机的选择本身就是信息保留策略。
CogRec(学术)— 将推理过程锚定在 SID 拓扑上。CogRec 在垂直 SID 层级上叠加层内语义图和物品级邻域,用 SID Routing 的三种操作(Match/LateralJump/Explore)表达推荐推理:精确匹配做快速语义定位,横向跳跃和探索实现较慢的结构导航。实验显示结构锚定推理在前缀匹配不足但 SID 空间转换可学时最有效。推理和生成在同一拓扑空间里发生,而不是生成前先写一段自然语言推理——这是对显式 CoT 范式的一个方向性修正。

大模型与智能体推荐

从显式推理到潜在推理

WhisperRec(快手)— 显式 CoT 的推理行为产生冗长 rationale,固定模板难以建模多样动态的用户兴趣。WhisperRec 用 Multi-View Adaptive CoT(MV-ACoT)从互补视角构建高质量监督,对简单样本轻量分析、对困难样本做定向多因素推理。然后通过三阶段潜在推理对齐,把教师 CoT 压缩为可学习潜在 token。在快手工业数据集上 SID@64 比显式 CoT 提升 17.44%,比 No-Think 变体提升 9.33%,在线推理吞吐量超 10 倍。这是对 SCoTER 结构化 CoT 迁移路线的进一步压缩——不是蒸馏到文本,而是蒸馏到潜在空间。
LaRec(学术)— 指出潜在推理的两个难题:缺乏细粒度监督(只有最终标签反馈)和单一路径推理(确定性潜在推理无法探索多样兴趣)。LaRec 的潜在预训练用步骤级对齐和过程方向对齐提供丰富监督信号;个性化 RL 微调为每个用户构建高斯混合分布,训练时随机采样不同推理起点,引导 LLM 遍历潜在空间中的多样推理路径。多个数据集上显著优于基线,效率与现有方法相当。
HiLaR(学术)— 层次化潜在推理框架,构建时间引导的层次化用户偏好表示,与 LLM 多个潜在推理状态对齐,推理过程从宽泛偏好组织到细粒度当前意图。用层感知过程奖励(每层边际目标似然增益)优化推理轨迹,在四个 Amazon 数据集上优于多种强基线。三篇论文的共同判断:显式推理的信息量是天花板,但推理成本决定部署可能。潜在推理是压缩信息、保留决策相关性的路径。

Agent 系统的工程化:错误恢复比推理能力更关键

Melo(网易云音乐)— LLM 驱动的音乐推荐 Agent,用确定性五节点状态图编排异构工具,而非微调控制器。核心判断是:工业规模下瓶颈不是大脑多聪明,而是系统如何发现并恢复大脑犯的错。 两个生产故障模式驱动了设计——实体幻觉(Agent 承诺了目录中不存在的解释)和长尾退化(过度约束请求坍缩为通用热门兜底)。对策是推理时实体接地(把生产搜索索引作为验证原语,在实体决策传播前把关)和反思重试(把失败原因 verbalize 后喂回下一步规划,放松或修改约束而非盲目回退)。线上 A/B 测试主播放列表留存提升超 2pp,播放时长提升超 1 分钟,实体误识别降低 7.8pp,反思重试在 5.8% 的会话中触发且有 59% 的过程级恢复率。与 Autonomous Information Seeking 的 Agent 分类法对照,Melo 是"Agent 作为推荐器"的典型工业实现——用状态图约束自由度换取可控性。
ASARL(腾讯 QQ 搜索)— 社交搜索的查询-标题用非正式社区语言,与通用 LLM 的语义理解存在上下文差异。ASARL 用三个 Agent 协作数据策展:ReasonAgent 基于社交属性生成可解释相关性标签,CriticAgent 验证逻辑一致性,GenAgent 合成长尾查询-标题对。三阶段训练(Social Context Training、Preference-Guided Optimization、Social Distillation)把改进蒸馏进紧凑模型部署。离线相关性和在线用户参与度均有显著提升。

LLM 推荐的安全与可信问题

Ranked by Position(学术)— 把 LLM 列表式重排器的位置偏置重新定义为攻击面。攻击者不修改内容、标签或模型参数,仅重排候选顺序,就能把 label-0 目标推进 top-k。promo@k 量化了这一漏洞:R=50 次排序预算下 promo@5 达 0.57。更关键的是,普通排列稳定性可以预测脆弱性,无需实际攻击。缓解方案包括双向 T5 编码器、排列一致性正则化和架构不变性。当 LLM 重排器被用于工业推荐时,候选序列化顺序是一个安全相关变量——这不在大多数系统设计者的威胁模型里。
CALMRec(学术)— LLM 推荐器常把持久偏好、瞬时意图和曝光诱导行为混入单一画像。CALMRec 用冻结多模态 LLM 把物品内容和反馈转为证据锚定的语义原子,分别维护短期、长期和曝光记忆。倾向性加权减少策略诱导曝光偏差,保守离线批评器在行为支持约束下为延迟满足重排候选。三个模拟环境(电商、新闻、短视频)中折现长期价值比最强替代方法提升 6.1%-7.6%。暴露了 LLM 推荐在反馈循环中的脆弱性——重复曝光被误认为偏好,即时点击主导延迟满足。

工业级架构与全链路优化

推理计算共享:请求级复用成为新范式

ROCS(Meta)— 推荐推理有个独特性质:一个用户请求要对大量候选打分,但请求侧特征跨候选共享。ROCS 把请求-候选交互尽可能推迟,隔离候选相关表示,让模型每个请求只算一次而非每个候选算一次。三个组件:Generalized Layer Masking(GLM)在特征交互架构中强制候选隔离,Deep Cross Attention(DCA)扩展到序列架构,In-Kernel Broadcast Optimization(IKBO)加速 GPU 执行。生产规模上检索模型 QPS 提升最多 3 倍且无质量损失,短视频排序模型 0.5% LogLoss 改善伴随 50% QPS 增益。已跨广告和自然内容、检索和排序阶段部署。与 Disaggregated Multi-Tower 的数据中心局部性思路互补:DMT 优化的是通信拓扑,ROCS 优化的是计算复用结构。
OneShot(Meta)— 指数学习与排序目标的长期错位:排序优化预测与行为对齐,索引优化物品表示的结构分组。OneShot 是在模型内端到端学习索引,让索引学习与排序目标原生对齐,并用神经评分突破点积瓶颈。在 Instagram 短视频推荐全量部署,操作排量下召回 +20%,等效召回下效率提升 10 倍。与 xGR 的服务系统视角不同,OneShot 从建模角度消除了"索引是后验结构"的假设。

训练-服务一致性:从工程修补到架构内建

Memory Layer(Meta)— 早期排序阶段预先计算物品嵌入并缓存在模型内。这个缓存只存在于服务时,不在训练循环内,导致训练和服务用不同表示。Memory Layer 是一个与模型共同训练的关键值嵌入缓存:物品塔训练时写入嵌入,服务时模型读取,天然单一真相源。常开嵌入覆盖未缓存物品。在 Instagram Reels 部署后,预测覆盖率从 96% 提升到 100%,嵌入新鲜度从 O(5min) 缩到 O(20s),训练-服务 NE gap 缩小 86%,最新内容召回提升 2 倍以上,冷启动参与度提升 5-6%。训练和发布计算成本降低 30%,服务计算成本持平。这是少数直接消除训练-服务表示偏差源头的工作。
CCFormer(腾讯)— 在严格延迟约束下平衡计算开销与特征交互粒度。特征域分离交叉注意力 + 长序列子空间 token 混合,层次化序列压缩策略用渐进扩大感受野减少信息损失。在腾讯视频和广告两个场景上线,CTR +3.57%、广告收入 +1.71%,训练加速 2.21 倍(对比 HSTU)。相比 HSTU 的纯序列缩放路线,CCFormer 证明了跨域特征交互和序列建模可以在单一 Transformer 骨干内统一。

用户表示体系化

Mosaic(Meta)— 用户表示是跨检索、排序、完整性任务传播的高杠杆建模问题。Mosaic 用一组架构多样的专家模型学习用户嵌入:记忆驱动、稠密重型、序列型和 CoTrain。MRM(Multi-task Relations Mining)和 CRL(Cosine Redundancy Loss)最大化每个新专家的边际信息贡献。CoEval 和 User Tower Zero-Out 提供免日志嵌入评估框架,混合 CPU/GPU 在线离线服务栈让每个专家选匹配新鲜度、延迟和算力需求的策略。"用户模型"从单模型转向"专家舰队",用边际信息贡献而非单体性能来衡量新模型的价值。

冷启动、去偏与探索的工程答案

PinEqualizer(Pinterest)— 内容冷启动问题的全漏斗方案,覆盖召回、粗排、精排、重排,同时适用于搜索和推荐。核心是减少偏向存量内容的偏差,避免大规模显式探索带来的短期代价。配套可扩展测量框架支持快速短期实验并验证长期影响。部署两年后新鲜内容探索、用户参与度和内容生态健康度显著改善。与 Warmer for Less 的轻量冷启动策略形成对照:后者仅增 5% 参数,PinEqualizer 是系统级方案。
ConAlign(快手)— 用少量无偏随机流量做去偏的流式框架。核心是离散门控条件对齐:选择性从偏置塔向无偏塔迁移知识,而非全局修正。这避免了去偏常用的"牺牲事实推荐性能"代价,支持实时流式适配。首次在大规模工业推荐系统用少量无偏随机流量实现流式去偏,线上长期用户参与度和兴趣多样性显著提升,延迟开销可忽略。
Breaking the Loop(YouTube Music)— 对六种反馈循环干预策略做了 off-policy 在线 A/B 测试,覆盖服务、训练、架构、探索四层。三个关键发现:服务层干预会被持续训练的学习循环抵消;架构去偏(如 SNGP)显著提升新发布和多样性但带隐藏集成成本;不确定性驱动探索产生最大新发布提升但牺牲参与度或多样性。"在哪一层干预"比"用哪种干预"更重要——服务层的启发式可能被学习循环吞噬。PinEqualizer 的全漏斗方案互补:YouTube 的结论是层间权衡,Pinterest 的实践是层间协同。
SpecFormer(Alibaba)— 归因分析揭示了 Transformer 在推荐上失败的谱系原因:推荐数据的异质性和长尾特性导致严重谱坍缩,少数主奇异值主导,前后向传播形成恶性循环。SpecFormer 三个组件分别处理:可学习谱软化动态平滑奇异值分布、谱软化注意力在更均匀谱空间建模特征交互、谱残差位置编码用泰勒展开提供谱归纳偏置。已部署于商业系统,堆叠层数能持续提升注意力的有效秩和推荐性能。

部署经验与基础设施

Entity Resolution(Walmart)— 自服务实体解析系统在六个基准(864 到 5M 条记录)上的三条教训:没有单一匹配算法通吃所有数据集,应该训练多个算法族让自动 bake-off 选优;精度和召回需要分开修——精度靠硬规则否决,召回靠更多样化候选检索;一条假正链接可以静默合并不相关实体,传递闭包让单条坏链串起数百条记录,每次跨组合并都必须主动复验。这是少见的、来自生产系统的"哪些路走不通"的一手记录。
Embedding Items at Scale(Yandex)— 首次在工业规模比较 GNN 预训练物品嵌入与端到端训练嵌入,横跨 Yandex Market 和 Yandex Music 两个成熟生产系统。结论:数据有限时预训练有帮助,大规模模型在大量数据上预训练无实质收益。公开了 Yandex Lavka 低资源数据集供复现。这个结论对"预训练嵌入是否值得"的争论给出了工业级证据——取决于数据规模。
KuaiLive-M3(快手)— 多模态、多域、多反馈直播推荐数据集。2.19 万用户、3500 万直播交互、1.11 亿短视频交互、约 8800 万带时间戳的段级多模态嵌入、2.54 万问卷反馈记录。支持跨域推荐、直播高光预测和问卷增强推荐三个基准任务。问卷反馈记录桥接隐式行为和显式偏好,这是现有直播数据集普遍缺失的信号类型。

广告与出价优化

用户基础模型进入开放网络

User Foundation Model for the Open Web(Teads)— 开放网络 RTB 与封闭生态(电商、社交)的结构性差异:用户身份碎片化、不跨会话持久,历史数据稀疏且常为短会话。这篇工作用 Transformer 编码器做掩码语言建模 + 序列级对比学习预训练,然后微调到点击预测。同一编码器表示在广告出价率模型上 RIG +1.197%,CTR 排序器 RIG +1.354%;7 天线上 A/B 测试 CTR +2.13%、eCPC -1.13%。预训练流程引入 LLM-as-optimizer:在一个可审查的代码级编辑(lifters)目录上做 LLM 搜索。"LLM 作为优化器而非推理器"是这篇最值得关注的方法论,它把 LLM 用在离线的、可审查的流程优化上,规避了在线推理成本。

延迟反馈的双时钟建模

TWICE(快手)— 长时域转化预测在延迟反馈下形成双时钟双窗口问题。短基础观察窗口在点击时钟上及时释放近期点击,但转化在转化时钟上持续到达更长的目标窗口。TWICE 把长时域 CVR 分解为目标窗口转化概率 + 分组延迟 CDF。点击时钟记录训练目标窗口 CVR 头,新到达转化训练延迟模型。用固定点击时 pCVR 质量作为队列曝光量,解决不同点击队列流量和转化倾向的混合问题。单一学习 CDF 对所有请求时域产生单调预测,服务无需历史查找或卷积。线上 A/B 测试期望收入 +2.486%、收入 +1.858%、转化 +2.061%,已全量部署。相比 DFM 的延迟反馈建模,TWICE 把"两时钟"结构显式建模而非用单一时间轴近似。

自动出价:从单集优化到跨窗口规划

SWAG-Bid(AliExpress)— 现有自动出价把每天作为独立 episode,但大量广告主的价值产生足够稀疏,日级效率比统计上不可靠,平台改用 W=7 天滑动窗口评估。这创造跨 episode 耦合:每天出价影响最多 W 个重叠窗口。SWAG-Bid 用 Masked Trajectory Model 预测市场并生成候选计划,Multi-Window Model Predictive Control Sampling(MWMS)跨所有重叠窗口评分,Per-Step Gated Adaptive Layer Normalization(PSG-AdaLN)做状态自适应门控。在 AliExpress 线上验证了滑动窗口评估下的约束满足和价值获取。"平台评估方式变了,出价优化目标就得跟着变"——这是广告系统跟随业务规则演进的典型案例。
PlatformBid(快手)— 首个从统一广告平台视角(同时集成 SSP、DSP 和 Ad Exchange)设计的自动出价基准。定义三种竞争场景:同质竞争(所有广告主相同算法)、异质竞争(多样化算法策略)、促销竞争(大促期间预算激增)。系统评估经典控制、RL 和生成式方法。提出 BidFlow,基于 flow-matching 的自动出价,用表达性策略表示处理动态竞争环境。线上目标成本 +0.68%,验证了离在线一致性。基准设计本身是对问题定义的贡献——当平台同时是裁判和运动员时,出价优化的目标函数必须同时包含广告主转化和平台收入。

LLM 检索的成本门控

SMART(Snap)— 动态产品广告需要平衡重定向(重新浮现已知兴趣)和勘探(发现新品类)。受控实验揭示关键分解:规则生成查询在词法 BM25 索引上擅长重定向,LLM 生成查询在稠密 ANN 索引上擅长勘探。SMART 用轻量级质量门控识别初始关键词结果的覆盖缺口,只路由约 10% 受益于语义勘探的用户到 LLM 路径。离线评估捕获了大部分语义勘探收益,LLM 成本降低 90%。线上 A/B 测试广告转化率 +27.6%。LLM 的价值在小部分用户、大部分时刻都不是最优解——路由机制比模型本身更能决定 ROI。

值得关注的方向

方向一:生成式推荐的"系统工程"竞赛。 本周六篇部署论文(Multi-Decoder OneRec、OxygenREC-v2、FDP、PSG、RGD、UniR²)的共同特征是:不再追求 SID 生成能力的单一指标,而是解决多目标冲突、推理延迟、任务统一和业务可控性。生成式推荐已经从"能不能召回到目标物品"的阶段,进入"能不能在预算内控制多个业务目标的权衡"的阶段。值得跟踪的问题:当生成式推荐同时承担召回、排序、重排职能时,评估体系如何跟上?
方向二:潜在推理压缩 LLM 推荐成本。 WhisperRec、LaRec、HiLaR 三条路线独立收敛到同一判断——显式 CoT 的信息量值得保留,但推理成本不可接受。潜在推理把 CoT 蒸馏进连续表示,在保留决策相关信息的同时消除逐 token 生成开销。WhisperRec 的 10 倍吞吐量提升是当前最强的部署证据。这个方向与 2025 年的 SCoTERCoconut 一脉相承,但已经从"能不能收敛"推进到"能不能上线"。
方向三:训练-服务一致性的架构内建。 Memory Layer 把服务时缓存纳入训练循环,ROCS 把请求侧计算复用建进模型结构,OneShot 让索引学习对齐排序目标。这三篇来自同一家公司(Meta)的工作指向一个系统级判断:推荐系统的质量瓶颈越来越多来自训练和服务之间的结构性错位,而非单模型的能力上限。工程手段(缓存、蒸馏、索引)正在被重新设计为建模问题。

本周论文速览

生成式推荐
Multi-Decoder OneRec — 快手提出多解码器可控生成式检索,共享表示 + LoRA 专家隔离目标,线上 app 使用时长 +0.37%、冷启动 +2.09%;开源 Kwai26 基准(13.1 亿条记录)。
OxygenREC-v2 — 京东提出 3B 参数 MoE 生成式推荐,行为指令条件化 + 熵感知轨迹自蒸馏内化判别信号,GMV +2.8-6.8%。
FDP — 快手提出反馈驱动策略发现,区分意图知识与策略知识并蒸馏进潜在 token,线上 Revenue +4.506%、ADVV +4.621%。
PSG — 快手提出对空间生成重排,生成原子从物品升级为有序对,1.83 倍实际加速,线上停留时长 +0.178%。
UniR² — 快手统一生成式召回多目标排序到单一 decoder-only 序列,Dual-Query Prefix-Causal Attention + LoRA 分离优化。
RGD — 快手提出奖励引导解码,KL 正则化奖励最大化推导闭式解码分布,无需重训生成器即对齐业务价值。
Gwhere — 高德提出对比残差量化 tokenizer + EAKTO 强化学习,解决POI生成式检索的 token 冲突和异质信号融合,P-CTR +5.83%、U-CTR +6.20%。
ClockRoPE — YouTube 提出随机傅里叶旋转理论框架,改进 RoPE 的时序周期性建模,在生产级生成式检索系统部署。
Dual-purpose Semantic IDs — Google 用层次量化将连续嵌入压缩为离散语义 ID,同时承担协同身份和内容重建双重角色,替代大规模向量存储。
EGR — Snap 提出 Embedding-Native 生成式检索,共享 LLM 统一学习物品和用户表示,直接以稠密向量索引物品,线上转化率 +2.91%。
LGRID — 快手提出 LLM 驱动生成式解耦,可解释 SID 位置,碰撞率从 97.0% 降至 39.9%,AUC +5.44%。
TopoGR — 学术提出位分解 Binary SID 暴露汉明几何,三阶段保持拓扑,四个数据集上超越 SOTA。
VaLiDRec — 学术提出变长 LLM 对齐语义 ID,token 集预测消除自回归解码,推理比 LC-Rec 快 87.49 倍。
LoopMemGR — 学术提出闭环推荐经验记忆,三视角证据提取压缩为经验 token,淘宝工业数据集验证。
SPARC — 学术提出序列感知渐进属性路由与压缩,上下文化后再压缩,不增输入长度丰富历史表示。
CogRec — 学术提出结构认知快慢推理,SID 路由(Match/LateralJump/Explore)锚定推理于 SID 拓扑。
Grevo — 学术提出进化式物品索引,SID 分配作为可进化离散变量,训练好的推荐器做后验评估器。
Restoring Collaborative Signals — 学术用个性化自然语言注入层次化协同线索,不改骨干不重训 SID,恢复 SID 缺失的协同信号。
LLM 与智能体
Melo — 网易云音乐部署 LLM 音乐推荐 Agent,五节点状态图 + 推理时实体接地 + 反思重试,留存 +2pp、播放时长 +1 分钟。
WhisperRec — 快手提出潜在推理框架,MV-ACoT + 三阶段潜在对齐,SID@64 +17.44%,吞吐量超 10 倍。
ASARL — 腾讯 QQ 搜索用三 Agent 数据策展 + 三阶段训练解决社交搜索相关性。
NEXT — Meta 提出 8B 视觉语言模型,Item-to-Intent-to-Item 推理驱动视频推荐,线上观看时长 +0.53%。
HiLaR — 学术提出层次化潜在推理,层感知过程奖励优化推理轨迹。
LaRec — 学术提出潜在预训练 + 个性化 RL 微调,高斯混合分布采样推理起点,多路径探索用户兴趣。
CALMRec — 学术提出因果对齐语言记忆,区分短期/长期/曝光记忆,模拟环境折现长期价值 +6.1-7.6%。
Ranked by Position — 学术揭示 LLM 列表重排的位置偏置攻击面,promo@5 达 0.57。
JKO-RAG — 学术将 Wasserstein 梯度流引入重排序,线性响应理论解释稳定性优势,BEIR 五个基准超越交叉编码器。
REPREC — 学术提出轻量用户表示对齐,仅训练 MLP 注入器,1.51 倍训练加速保持 LoRA 85-100% 性能。
Hypothesis-Driven Shelf — Spotify 用自然语言假设替代固定模板生成个性化货架,四阶段分解规划与检索。
SharpRec — 学术提出锐度感知模型合并 + 显著性恢复,解决跨域知识冲突和融合饱和。
RecoReward — 快手用推荐器亲和度分数做奖励,RL 训练 MLLM 生成推荐导向描述,保持内容仅推理。
Two Views, One Voice — RecSys Challenge 2026 第三名方案,解耦检索与生成,PAS 框架结构化证据分配。
GGR/SAR — 小红书提出图引导检索 + 场景感知排序,数据资产发现 Hit@10 从 19.1% 提升到 96.6%。
工业级架构
ROCS — Meta 提出请求导向计算共享,延迟交互 + 候选隔离,检索模型 QPS +200%。
OneShot — Meta 端到端索引学习与排序目标对齐,Instagram 全量部署,召回 +20%、效率 10 倍。
CCFormer — 腾讯统一特征交互与长序列建模,CTR +3.57%、广告收入 +1.71%,训练加速 2.21 倍。
Memory Layer — Meta 用模型内键值缓存统一训练-服务表示,NE gap 缩小 86%,冷启动 +5-6%。
Mosaic — Meta 用户嵌入专家舰队,MRM + CRL 最大化边际信息贡献,免日志评估框架。
ConAlign — 快手离散门控条件对齐,首个流式去偏工业部署,长期参与度和兴趣多样性显著提升。
PinEqualizer — Pinterest 全漏斗内容探索与去偏系统,部署两年显著改善冷启动和生态健康度。
HA-MoE — Google 异质性自适应多门控 MoE,显式异构上下文进门控和专家表示,DL-AUC 评估指标。
Bumblebee — Meta 交错混合层块,微流水线组合序列个性化 + 注意力编码 + 特征交叉。
Breaking the Loop — YouTube Music 六种干预策略在线对比,服务层干预被学习循环抵消,SNGP 探索带来最大新发布提升。
SpecFormer — Alibaba 谱感知 Transformer,缓解嵌入和注意力坍缩,已部署商业系统。
Entity Resolution — Walmart 自服务实体解析的三大实战教训,自动 bake-off 选匹配算法。
Embedding Items at Scale — Yandex 比较 GNN 预训练与端到端嵌入,数据充足时预训练无实质收益。
KuaiLive-M3 — 快手发布多模态多域多反馈直播推荐数据集,2.19 万用户 + 8800 万段级多模态嵌入 + 2.54 万问卷反馈。
Tight Sample Complexity for LoRA — 学术首次给出 LoRA 紧样本复杂度上下界,证明秩选择二分法。
DIRECTOR — 学术提出最优传输引导并行重排,熵正则化 OT 冲突感知训练,无重复 slate 生成。
Improving Item Discoverability — Instacart 用 LLM 生成相关意图扩展召回,SLM 蒸馏覆盖尾部查询,覆盖率从 60% 到 80%。
Privileged Self-Distillation — 学术用未来交互作为特权信息自蒸馏,单阶段训练不改变部署模型。
RAGuard — 学术双层 RAG 投毒防御,对抗检索训练 + ZKIP 零知识推理补丁,攻击成功率降至 0.000。
PEA-CAE — Ontario Power Generation 从朴素 RAG 演进到深度多 Agent 检索,成本感知渐进证据获取。
IIMRec — 学术单一高质量物品-物品图复用于三阶段,NCER 降低谱噪声信号比。
Discrepancy-Rounded Fair Bandits — 学术将公平曝光约束转化为离散化问题,BDQ-UCB 确定性满足块级约束。
MAPLE — 学术多 Alpha 位置感知列表式集成,统一预测头 + 多样性正则化,参数减少 55 倍。
LOCKS — 学术页面局部谱摘要 KV 缓存选择,2048 token 预算匹配 100K+ 上下文全缓存质量。
Graph Coarsening — 学术两阶段扩散框架:图粗化 + 标签传播,电信数据集 NDCG@5 +24%-50%。
Cross-Domain OPE/L — 学术提出跨域离线策略评估与学习,CD-IPS + CD-PG 解决少样本和确定性策略问题。
广告与出价
User Foundation Model — Teads 为开放网络 RTB 训练用户基础模型,Transformer 预训练 + LLM-as-optimizer,CTR +2.13%、eCPC -1.13%。
TWICE — 快手两时钟两窗口 CVR 分解,点击时钟 + 转化时钟互补监督,收入 +1.858%、转化 +2.061%。
SWAG-Bid — AliExpress 滑动窗口感知生成式自动出价,Masked Trajectory Model + MWMS 跨窗口评分。
PlatformBid — 快手统一广告平台视角自动出价基准,三种竞争场景 + BidFlow 流匹配方法,线上目标成本 +0.68%。
SMART — Snap 语义感知自适应检索,质量门控只路由 10% 用户到 LLM 路径,转化率 +27.6%、LLM 成本 -90%。
SAGE — 学术提出约束门控 LoRA + 位置增强 + 文本对齐,少于 10% 可训练参数达到全量微调性能。
DASH — 腾讯决策感知用户模拟器,上下文工程 + 规则奖励模型,跨五域动作预测准确率 +12.4%。
  • 推荐系统
  • 周报
  • 论文
  • AI周报 2026-W31推荐算法日报 - 2026-08-01
    Loading...