推荐周报 2026-W33
2026-8-15
| 2026-8-15
字数 7292阅读时长 19 分钟
type
Post
status
Published
date
Aug 15, 2026 05:33
slug
rec-weekly-2026-W33
summary
本周推荐系统研究以工业部署论文领跑。Netflix、Yandex、Meta、LinkedIn、快手、阿里、字节各自拿出了线上 A/B 结果,密集程度在本年度少见的。如果只看一个趋势——生成式推荐正在从实验室验证阶段转向"用单一模型替换整个生产级联"的系统工程阶段。 主线 1(生成式推荐的两个方向): Yandex Music 的 Sona 用单一生成式模型替换了超过 15 个候选生成器加预排序/排序的完整级联,Active Users +4.53%。Netflix 的 GenRec 走了另一条路——不替换级联,而是用 LLM 排序器作为精排层,A/B 中相对生产排序器取得统计显著提升。同一周内两条路线并行验证,是本周论文密度最高的信号。而快手的 PushDualGen 则在解决生成式推荐的可解释性:生成 SID 后附带一段可跳过的 copy 作为解释,有效播放率 +8.50%,不满率 -37.70%。 主线 2(因果推断从理念走向部署): LinkedIn 的决策中心因果优化框架在 Feed 营销流量上实现 +7.20% 长期价值提升,把因果效应估计、贝叶斯 bandit 和线性规划分配统一到一个目标下。Meta 的 MARCO 更微观——用点击类型作为自由行为标签分解点击意图,每点击转化 +2.80%。两篇的共同指向:因果推荐不再只是论文里的去偏技巧,而是生产系统里可落地的收益来源。 主线 3(多任务与全链路优化的系统工程化): 阿里的 IntHQ 在高德部署,处理生成式推荐里多任务学习的三个 collapse 问题,UVCTR +1.60%。阿里的 DREAM 则在淘宝首页用智能体元控制架构在现有流水线之上叠加策略层,IPV +2.06%。字节的 TM20K 把电商行为序列扩展到 2 万长度,ADSS +1.036% 而服务延迟只增 5.6%。
tags
推荐系统
周报
论文
category
推荐技术报告
icon
📚
password
priority
1

本周概览

本周推荐系统研究以工业部署论文领跑。Netflix、Yandex、Meta、LinkedIn、快手、阿里、字节各自拿出了线上 A/B 结果,密集程度在本年度少见的。如果只看一个趋势——生成式推荐正在从实验室验证阶段转向"用单一模型替换整个生产级联"的系统工程阶段。
主线 1(生成式推荐的两个方向): Yandex Music 的 Sona 用单一生成式模型替换了超过 15 个候选生成器加预排序/排序的完整级联,Active Users +4.53%。Netflix 的 GenRec 走了另一条路——不替换级联,而是用 LLM 排序器作为精排层,A/B 中相对生产排序器取得统计显著提升。同一周内两条路线并行验证,是本周论文密度最高的信号。而快手的 PushDualGen 则在解决生成式推荐的可解释性:生成 SID 后附带一段可跳过的 copy 作为解释,有效播放率 +8.50%,不满率 -37.70%。
主线 2(因果推断从理念走向部署): LinkedIn 的决策中心因果优化框架在 Feed 营销流量上实现 +7.20% 长期价值提升,把因果效应估计、贝叶斯 bandit 和线性规划分配统一到一个目标下。Meta 的 MARCO 更微观——用点击类型作为自由行为标签分解点击意图,每点击转化 +2.80%。两篇的共同指向:因果推荐不再只是论文里的去偏技巧,而是生产系统里可落地的收益来源。
主线 3(多任务与全链路优化的系统工程化): 阿里的 IntHQ 在高德部署,处理生成式推荐里多任务学习的三个 collapse 问题,UVCTR +1.60%。阿里的 DREAM 则在淘宝首页用智能体元控制架构在现有流水线之上叠加策略层,IPV +2.06%。字节的 TM20K 把电商行为序列扩展到 2 万长度,ADSS +1.036% 而服务延迟只增 5.6%。

生成式推荐与 LLM 推荐

生成式推荐本周的讨论焦点从"能不能跑"转移到了"怎么跑得稳、跑得起、跑得可解释"。三篇工业部署论文从三个角度给出了不同的答案。
Sona(Yandex)— Sona 的核心设计是"一个模型干完所有事"。编码器把用户行为序列编码成隐藏状态,自回归解码器和排序模块共享这个用户表示,next-token-prediction 和蒸馏目标联合更新。这个设计和 HiGR 的分层规划思路不同——Sona 没有显式的列表级规划,而是让生成和排序通过同一用户状态耦合。结果是单一的部署模型完全替代了由 Argus 等大 Transformer 模型支撑的多级级联。线上数据:Active Users +4.53%,Total Listening Time +6.30%,Likes +11.42%。值得注意的细节是 Active Users 的提升是此前最强模型 Argus 的 2.35 倍——生成式全链路替代的收益不是小幅增量,而是量级上的区别。
GenRec(Netflix)— 和 Sona 不同,GenRec 保留了现有流水线,只替换精排层。两阶段框架:Phase 1 把开源 LLM 适配到 Netflix 内容域,Phase 2 用推荐排序数据后训练。论文最重要的贡献在serving设计——prefill-only 推理。传统 LLM 生成式排序需要 decode 步骤,GenRec 通过只做 prefill 避免自回归解码的延迟成本。这与 xGR 的分阶段计算思路一脉相承,但 GenRec 更进一步,把"生成"限制在上下文工程层面——输入是 verbalized 用户历史,输出是排序分数而非文本。论文没有透露具体提升数字,但明确说"用显著更少的 Phase-2 标注样本就取得了统计显著收益"。数据效率这个点,与 HyMiRec 中轻量推荐器压缩用户历史后降低 LLM 输入成本的设计有相通之处。
阿里系的两篇值得放在一起看。 MetaStrategy(淘宝首页猜你喜欢)的思路在生成式排序里算另类——不生成物品序列,而是生成一个可执行的 JSON 排序策略。策略控制目标权重、内容偏好、体验约束和位置策略,经过验证器后实例化成隔离的 Generator 和现有模型竞争。4B 教师蒸馏到 0.8B 学生,LLM 推理放在同步排序之外。七天的线上 A/B:点击 PV +2.11%,IPV +3.12%,交易额 +2.83%。这篇和 IntHQ(高德)形成了对照——IntHQ 解决的是生成式推荐内部的多任务结构问题(三个 collapse:源塌缩、关系塌缩、层级塌缩),MetaStrategy 则绕开了内部结构,直接让 LLM 输出策略参数来操控现有模型。前者的 UVCTR +1.60%,后者的交易额 +2.83%,两个方案在各自的场景里都成立,但哲学完全不同。
PushDualGen(快手)解决的是生成式推荐部署的另一个痛点:不可解释。OneRec-Thinking 用 CoT 解决 SID 生成不可追踪的问题,但推理成本太高。PushDualGen 的做法是先生成 SID,再生成一段 copy 作为解释——copy 可跳过,不牺牲推理成本。线上:有效播放率 +8.50%,不满率 -37.70%。这个"skippable explanation"的设计和 EviSnap 中facet cards 的思路不同——EviSnap 把解释作为推荐的核心信号之一,PushDualGen 把解释作为附带的沟通层。对工业系统来说后者更务实。
学术侧也有几个值得注意的进展。 HCGRec 处理的是语义 ID 生成式推荐的强化学习后训练里一个很具体的问题:当一个早期语义 token 进错了分支,后续 rollout 几乎不可能到达 ground-truth 物品,导致 group-relative 优化拿到全零奖励、没有有效梯度。方法是对困难样本注入最小目标前缀 hint,让模型在正确的语义分支下生成余下部分。零优势样本从 70%+ 降到 20% 以下。这个问题的本质和 TIGER 时代就存在的 SID 分层的结构风险有关,HCGRec 是第一个系统性地处理它的。 FSGR 则暴露了 SID 的一个被忽视的公平性问题——高频 token 被系统性过度预测。Gini 公平性提升超 20%,但论文更重要的贡献是指出问题存在:SID 码本的不平衡会传导到下游推荐公平性。 Centroid Initialization 是个极简干预——SID token embedding 初始化时直接用语义空间中的质心而非随机高斯,纯 SFT 下 Recall@5 提升 16%,冷启动提升 60%。这几篇学术工作指向同一个方向:语义 ID 的基础设施问题(初始化、公平性、RL 信号稀疏)正在成为生成式推荐研究的核心议题。
跨域生成式推荐本周也有一个工业侧的新框架。HD-Rec(快手与香港城市大学合作)用层次化域感知量化器解决统一模型跨域时语义粒度不匹配的问题:粗粒度码本全局共享,细粒度码本自适应路由,配合域自适应稀疏 MoE 和跨粒度路由一致性约束。这是 SID 思路的跨域延伸——此前的方法大多用全局共享表示或轻量域适应,对异构模式的建模容量不够。快手在生成式推荐上的布局比外界关注的要多。

工业级排序与全链路优化

本周的工业排序论文有一个共同点:都不在模型结构上做大的变更,而是在目标函数、训练流程和数据利用上找增量。
MARCO(Meta)的核心观察很朴素但被业内长期忽视:同一条广告的不同点击类型,实际转化率有 4 倍的差异。标准 CVR 模型把所有点击当作同一事件,导致整体校准看似完美但分意图校准存在偏差。MARCO 的做法是:用点击类型作为免费的行为标签,训练 per-intent CVR 头,服务时按预测的意图分布组合各意图的 CVR 估计。论文从理论上证明了分解不会增加总体风险。线上结果:per-intent 校准到约 100%,每点击转化 +2.80%,topline 指标 +0.98%。这篇文章对广告排序实践的参考价值在其理论严谨性——不是简单地"多任务学习 + 一个技巧",而是从校准偏差的源头推导出分解的必要性。这和 ESCM2 解决 ESMM 固有偏差的思路一脉相承,但 MARCO 用的是观测到的行为标签而非反事实正则化。
From Prediction to Incrementality(LinkedIn)处理的是一个更根本的问题:当业务目标是增量影响时,基于预测分数的分配系统会把资源浪费在"本来就会行动"的用户上。方案是决策中心的因果优化框架——Transformer 骨干的因果网络做个体治疗效果估计,贝叶斯神经 bandit 层做不确定性感知的探索,dual-based 线性规划层做全局约束下的分配。端到端政策在 LinkedIn Feed 营销流量上实现 +7.20% 长期价值提升。这篇的价值在于它把三个本属于不同方向的技术栈(因果推断、bandit、LP)统一到一个可部署的目标下。参考 uplift modeling 在 Pinterest 上做因果检索优化时类似的约束处理,LinkedIn 的方法在分配层更显式。
淘宝首页的两篇可以看作一个整体。 DREAM 是在现有流水线之上叠一个智能体元控制层——三层 Intent Engine 融合端侧信号为 L0/L1/L2 意图表示,Meta Engine 做 M1-M2-M3 分层推理(意图摘要、策略规划、参数翻译)。Reward Dual Loop 用离线模拟探索策略空间、在线反馈校准结果。重排控制一项就带来 IPV +2.06%,扩展至精排后 IPV +2.71%、GMV +1.31%。 MetaStrategy 前面已讨论——生成可执行策略而非物品序列。两篇的共同点在于:都没有替换核心排序模型,而是在其上层引入了"策略生成"的智能体层。对淘宝这样体量的系统,替换核心模型的成本太高,元控制是更现实的路径。
TM20K(字节)解决了超长行为序列建模的效率问题。SIM、ETA 等此前的方法用搜索或聚类做序列压缩,牺牲细粒度信息。TM20K 的思路是:教师用全量 2 万 token 训练,学生用 token merge 压缩序列,蒸馏弥补信息损失。线上 ADSS +1.036%,延迟只增 5.6%。"教师保留全部 token,学生高效合并"这个思路的价值在于它绕开了压缩方法本身的取舍——压缩的损失由蒸馏来补。
DrEM 处理的是集成排序里的一个隐蔽问题:上游多任务模型输出的 pxtrs 同时作为特征和监督信号,噪声会在两端传播。风险去噪鲁棒损失纠正经验风险,偏好保持排序一致性正则化提升输出稳定性。论文还配了理论分析——预测噪声的近似分布、鲁棒损失在翻转概率估计误差下的优越性。这篇和 AdaTT 的任务间融合思路形成对照——AdaTT 处理的是任务之间的关系,DrEM 处理的是上游预测噪声的传播。
NAVER WEBTOON 的 Progressive Alignment 提出了 LP-FFT-RFT 三阶段后训练框架:先冻结预训练表示做线性探测稳定随机初始化的下游头,再全量微调适配任务,最后用学习到的奖励模型做强化微调对齐业务指标。关键设计是策略在稠密隐式反馈上训练、奖励模型用业务指标监督——这样避免了稀疏业务目标直接作为训练信号的方差问题。在线 A/B 提升有效,但论文未提供具体数值。
MISO 提供了一个非模型的方法论视角——用模型内部状态(参数、激活、梯度、归一化统计)来指导"该缩放、替换还是退休哪个组件"的决策,减少试错成本。这个工作流在广告排序案例中比专家驱动和黑盒搜索的验证运行次数都少。

序列与多模态表示学习

本周序列和多模态方向的工作整体偏学术,但有几篇提出了值得关注的新问题。
PRISM 指出一个 Transformer 序列推荐的系统性问题:dot-product 注意力天然偏向相似物品,导致异质关系(heterogeneous relations)被系统性忽略。方法上用多视角注意力校准——Affinity View 精炼同质关系,Contrast View 暴露被相似性偏差压制的异质关系。7 个数据集上平均提升 Hit@10 和 NDCG@10 约 5-10%。这个问题其实在 SASRec 时代就存在,但一直没有人系统地分析和解决。
NTCF 重新审视图协同过滤里的传播深度问题:对所有节点用统一的传播层数忽略了一个事实——外围节点快速过平滑,中枢节点在其直接邻域之外探索不足。用局部度不平衡分数作为离散 Ricci 曲率代理,为每个节点分配自适应的传播深度。理论上证明 NTCF 严格泛化 NGCF,且曲率感知调度在深层保留更多判别信息。
TimeRoute 处理的是多模态融合里的时间动态:物品模态的效用随时间漂移,巧克力消费在情人节前后从文本引导移向视觉引导。时间感知模态路由为每个用户映射个性化的模态分布,扩散图重构器用 FiLM 条件化抑制过时模态边。TikTok 数据集上 Recall@K 提升最高 9.8%。这个"模态时效性"问题在跨季节、跨节日的电商场景里有实际意义。
SMD 处理多模态序列推荐里的模态缺失:训练时以概率 p 独立擦除整个行为历史的模态流,迫使模型不依赖任何单一模态。95% 缺失率下 HR@10 保留率从 22% 提升到 61%。这是个四行代码的改动,但对线上商品目录经常缺图缺文的情况非常实用。
DualSpectralCF 把显式负反馈(1 星评论、踩按钮)融入训练自由的谱协同过滤。符号输入信号编码显式不喜欢,符号 item-item 算子混合"喜欢在一起"和"不喜欢在一起"的相似度。Recall@20 提升最高 +32.6%(含调参),默认参数下 +1.9% 到 +16.0%。冷启动用户提升最明显(+29.2%)。这篇的思路简单但实用——大多数推荐系统都有负反馈信号但没被充分利用。
VisGate(IKEA 与 KTH 合作)用门控机制做自适应的多模态融合,视觉效用是潜变量而非固定属性。Learned gate 同时作为测量工具:视觉效用随交互稀疏度上升、与视觉区分度相关。
Low-Interaction-Rank 是个理论框架:定义低交互秩函数类来统一双编码器架构的理论基础。样本复杂度是编码器复杂度之和而非乘积,白化可以固定交互模式至置换和符号。这篇对理解双塔模型的表达能力边界有参考价值。
PreGress 提出 ranking-native 的图预训练框架——度中心性预测和属性重建的多任务预训练,配合轻量提示模块适配下游排序任务。这是少见的直接以排序为目标的图预训练工作,在 Yelp2018 和 MovieLens-100K 上验证。

因果推断与离线评估

本周因果推断主题的特点是:诊断性工作多,且都在回答"什么时候不能相信离线结果"这一问题。
Fast A/B/n Testing 提出了一个优雅的理论结果:树耦合反馈共享可以在保持每个策略精确轨迹分布不变的前提下,将期望奖励查询数从 JT 降到 T+o(T)。N(T)=T+ΣD_{e,t} 的路径恒等式把额外查询量归结为树边上的不匹配累积。这意味着多个自适应策略的比较不再需要每个策略各自跑完整轨迹,理论贡献清晰,实验覆盖奖励模型评估和语言模型评估。
When Offline Evaluation Misleads 来自一个部署过的推送系统(Thumbtack),结论对从业者比较有冲击力:detecting a mean effect 和 learning to act on it 是两回事。在五个臂、一个 split 的部署中,所有粒度下的 learned routing 都不比随机好,matched-moment noise placebo 能复现 oracle 的 100% 表层增益——表象的"可学习结构"只是噪声的顺序统计量。作者提出一个可操作的诊断协议:在对齐性(优化奖励是否推动北极星)和可学习性(bandit 能否识别奖励最优策略)两个维度上筛选。这个协议的价值在于它把"为什么离线评估会骗人"这个问题拆解成了可验证的步骤。
TTT-Embed 处理的是稠密检索的测试时优化:把排序奖励蒸馏进冻结模型的嵌入空间里的一个轻量向量。不访问权重、不修改索引、只需要标量排序分数。在 15 个 MTEB 检索任务上最高 +8.36 nDCG@10,且学到了 a reusable test-time state——全局/任务/查询三种共享范围的权衡由单个 scope 参数控制。当奖励预算扩展时最优共享范围从全局向查询动态漂移。
DR-CVR 从半参数理论出发重新审视 CVR 因果效应估计,提出对链式结构(点击→转化)的双重稳健估计器。理论贡献比方法本身更突出:在合成和真实数据上验证了数值稳定性,并且有个重要观察——naively combining loss debiasing with standard causal estimators 会失效,CVR 式的目标需要专门设计的估计器。

值得关注的方向

生成式推荐的全链路验证正在加速。 本周有五篇工业部署论文来自不同公司,路线各不相同:Yandex 全量替换级联、Netflix 替换精排层、快手做可解释 copy 生成、阿里(高德)做多任务结构优化、阿里(淘宝)做策略生成。共同点是都有明确的线上指标和 QPS/成本约束的工程方案。这个密度说明生成式推荐已经过了概念验证阶段,进入工程化竞赛。值得跟进的是容量与成本的权衡曲线——Sona 不依赖手工特征但需要大模型蒸馏,PushDualGen 用可跳过的 copy 换可解释性,MetaStrategy 用 0.8B 学生蒸馏 4B 教师。
"预测 vs 增量"的范式切换。 LinkedIn 从预测分转向因果效果评估,Meta 从统一 CVR 转向意图分解。这个转变的驱动因素是业务目标本身——当目标是增量而不是准确性时,预测模型系统性错配。值得观察的是这套思路是否会传导到内容推荐——抖音/快手的时长优化指标是否应该从"预测时长"转向"增量时长"。技术层面的挑战是增量估计的方差控制,LinkedIn 的贝叶斯 bandit 层的经验可能被复用。
评估方法论进入"揭穿幻觉"的阶段。 本周的组推荐 tie-breaking 审计、LLM 推荐置信度校准审计、离线评估诊断协议、reward-SNR 下限证明——这些工作不约而同地在质疑现有评估流程的有效性。对工业界的实际意义是:很多报告的"提升"可能只是评估协议的人为产物。建议对自家系统的离线评估流程做一次类似的审计,特别是注意训练时的分数压缩和评估时的确定性 tie-breaking 共同制造的虚假提升。

本周论文速览

生成式推荐
GenRec — Netflix 提出 LLM-backed 排序器,Phase 1 适配 + Phase 2 后训练,prefill-only 推理降成本;A/B 相比生产排序器统计显著提升。
Sona — Yandex Music 用单一生成式模型替换超 15 个候选生成器+排序的级联;Active Users +4.53%、收听时长 +6.30%、Likes +11.42%。
PushDualGen — 快手提出带可跳过解释 copy 的轻量 SID 生成器;有效播放率 +8.50%、不满率 -37.70%。
MetaStrategy — 阿里为淘宝首页猜你喜欢提出可执行 JSON 排序策略生成;点击 PV +2.11%、IPV +3.12%、交易额 +2.83%。
IntHQ — 阿里为高德提出双流解耦+任务交互+分层查询的多任务生成式推荐;UVCTR +1.60%。
HD-Rec — 快手与港城大提出层次化域感知量化器+域自适应稀疏 MoE 的跨域生成式推荐。
HCGRec — 上海交大与美团提出 hint-conditioned 生成式推荐恢复零奖励样本信号;零优势样本从 70%+ 降至 20% 以下。
FSGR — 首次揭示 SID 生成式推荐的 token 频率偏差;Gini 公平性提升超 20%。
Centroid Initialization — 质心初始化 SID token embedding;纯 SFT Recall@5 +16%、冷启动 +60%。
DrIG — 提出双角色标识符统一多模态生成式检索;M-BEIR 全面优于 SOTA 生成式基线。
TLCAO — 百度提出 token 级奖励分配用于生成式文档检索,显著优于序列级奖励。
REAM — 首个模型合并压缩 LLM 推荐推理框架,注意力头级细粒度合并;推理长度减少 24.3%。
工业级排序与全链路
MARCO — Meta 用点击意图分解 CVR 预测;每点击转化 +2.80%、topline +0.98%。
From Prediction to Incrementality — LinkedIn 提出决策中心因果优化(Transformer 因果网络+贝叶斯 bandit+LP 分配);长期价值 +7.20%。
DREAM — 阿里为淘宝首页提出智能体元控制架构;重排控制 IPV +2.06%,扩展至精排后 IPV +2.71%、GMV +1.31%。
TM20K — 字节提出教师全 token+学生 token merge 的两阶段蒸馏,序列扩展到 2 万;ADSS +1.036%、延迟仅 +5.6%。
DrEM — 阿里提出双端鲁棒集成排序框架,处理上游 pxtr 噪声在监督端和特征端的传播。
Progressive Alignment — NAVER WEBTOON 提出 LP-FFT-RFT 三阶段后训练框架,分离下游适应与业务指标对齐;线上 A/B 验证有效。
STAR — 腾讯 UniRec Challenge 中结合结构化 tokenization 与目标感知兴趣表示;消融显示时间上下文增益最大。
序列与多模态
PRISM — 提出多视角注意力校准(Affinity+Contrast View)缓解相似性偏差;7 个数据集 Hit@10、NDCG@10 平均 +5-10%。
NTCF — 用曲率感知传播深度重释图协同过滤;严格泛化 NGCF,三个公开数据集超越主流 GCF 基线。
TimeRoute — 时间感知模态路由+扩散图重构;TikTok、Amazon 数据集 Recall@K 最高 +9.8%。
SMD — 提出序列化模态 Dropout;95% 缺失率下 HR@10 保留率 22%→61%。
DualSpectralCF — 训练自由的符号感知谱协同过滤;Recall@20 最高 +32.6%,冷启动 +29.2%。
VisGate — IKEA/KTH 提出门控多模态融合,门控作为视觉效用测量工具。
Low-Interaction-Rank — 提出低交互秩理论框架统一双编码器架构;白化可恢复可解释概念轴。
PreGress — 首个 ranking-native 图预训练+提示框架;六个公开图+两个推荐基准验证。
因果推断与评估
Fast A/B/n Testing — 树耦合反馈共享实现精确多策略比较;期望查询数从 JT 降至 T+o(T)。
When Offline Evaluation Misleads — Thumbtack 提出延迟反馈 CMAB 的诊断协议;区分对齐性与可学习性。
TTT-Embed — 测试时优化嵌入向量;15 个 MTEB 任务最高 +8.36 nDCG@10,解决灾难性遗忘。
DR-CVR — 半参数理论推出 CVR 链式结构的双重稳健估计器;更快的收敛率+目标正则化提升稳定性。
Tie-Aware Evaluation — 揭示组推荐评估的 tie-breaking illusion;tie-aware 协议下多个先前报告的提升显著缩水。
SPACE — 用社区推断+最优传输+约束扩散生成虚拟用户;长尾 POI 曝光显著提升。
Confidence Calibration Audit — 首次联合审计 LLM 推荐的幻觉率与置信度校准;四个 LLM 系统性欠自信。
Reward-SNR Floor — 证明 reward-SNR 可检测性下限 ρ*(N)≈2.8/√N;检测效应≠学习逐实例策略。
ReliableNet — 机会约束规划直接控制联合自信错误概率;分布内+分布偏移下最低 JCW。
DrEM — 见上文工业排序部分。
其他
BOUND — 简介引导的纠正性偏好蒸馏;Bamboogle +5.6 EM、BrowseComp-Plus +4.8。
LoongReflect — 将反思形式化为记忆控制策略,结合全局蒸馏+GRPO 双通道协调。
SAGE — SLO 感知自适应检索;P95 延迟 -36%、检索成本 -51%、EM 仅 -2pp。
EAHR — 精确自适应混合检索,动态深度;150 个查询-快照组合精确复现 Top-20,延迟比 23-30。
Prof-K — 分布无关的单遍过滤 top-k;相对 PyTorch topk 加速 1.5-10 倍。
BC-ICL — Amazon 用预训练表格基础模型做 bootstrap 条件动作选择;标准 bandit 套件早期 regret 领先。
Accurate Ensembles, Fragile Narratives — 多尺度堆叠集成 ROC-AUC 0.9539,但 LLM 解释保真度审计揭示提示工程不足。
ConnectionMind — Meta 将社交图+LLM 图推理用于推荐;视频观看时长 +0.43%。
TSPORec — 偏好优化做 token 选择;性能最高 +31.25%、效率最高 +63.4%。
DistilVDR — 524M 双学生蒸馏视觉文档检索;达 8B 教师的 86.9%,索引小 15.6 倍。
CVR Decomposition — 见上。
MIJSR — 搜索推荐混合序列的结构+语义多兴趣挖掘,两个开源数据集验证。
Invisible to the Machine — 基于完整市场普查的 AI 推荐审计;85.6% 的场所从未被推荐。
RCCP — 检索校正共形预测;所有设置达到目标覆盖率,最低 Winkler 分数。
Batch Size or Negatives — 固定内存预算下 n~B, k~1 最优;四个真实数据集验证更快收敛。
AnnoIndex — 结构化物化索引+SQL 扩展执行计划;平均 F1 0.87。
  • 推荐系统
  • 周报
  • 论文
  • AI周报 2026-W33推荐算法日报 - 2026-08-15
    Loading...