type
Post
status
Published
date
Sep 12, 2026 05:31
slug
rec-weekly-2026-W37
summary
本周 14 篇工作集中在三条技术主线上:跨阶段联合优化、电商搜索的业务目标对齐、以及多模态与检索表示中的信号保真。 主线一:级联系统的联合优化取代分阶段调参。 快手的 UniRec 把粗排与精排的融合模块放进同一计算图联合训练,线上 app usage duration +0.616%;华为的 PTDG 用低秩近似按 item 动态重连任务依赖强度,线上 CVR +1.2%、eCPM +1.9%;滴滴的 ALIGN-HOLD 则把 hold 策略的奖励从手工组合换成偏好模型学出来的密集信号,28 天 A/B 覆盖日均约 10 万次请求。三篇的共同指向是——级联阶段的独立调优已经触到天花板,收益要来自阶段间的梯度流动。 主线二:电商搜索从"语义相关"转向"业务对齐"。 阿里巴巴的 SAM-D2Q 用强化学习偏好对齐替代纯文本的 Doc2Query 扩展,AliExpress 线上 GMV +3.38%、Pay Count +2.27%;华为的 IGPO 走 training-free 路线,把策略与库存事实解耦,线上 CTR 相对提升 3.17%、审核 bad case 减少 38.9%。两篇都不改模型主体,改的是优化目标与决策边界。 主线三:多模态与检索表示中的信号衰减开始被显式建模。 小红书相关团队的 LARK 提出"跨模态稀释"并给出一套潜在对齐方案;MURAL 用不确定度感知融合压制噪声模态;Embedding Surgery 则在稠密检索侧做局部嵌入修正,DL-Hard 上 nDCG@10 相对提升最高 60.64%。
tags
推荐系统
周报
论文
category
推荐技术报告
icon
📚
password
priority
1
本周概览
本周 14 篇工作集中在三条技术主线上:跨阶段联合优化、电商搜索的业务目标对齐、以及多模态与检索表示中的信号保真。
主线一:级联系统的联合优化取代分阶段调参。 快手的 UniRec 把粗排与精排的融合模块放进同一计算图联合训练,线上 app usage duration +0.616%;华为的 PTDG 用低秩近似按 item 动态重连任务依赖强度,线上 CVR +1.2%、eCPM +1.9%;滴滴的 ALIGN-HOLD 则把 hold 策略的奖励从手工组合换成偏好模型学出来的密集信号,28 天 A/B 覆盖日均约 10 万次请求。三篇的共同指向是——级联阶段的独立调优已经触到天花板,收益要来自阶段间的梯度流动。
主线二:电商搜索从"语义相关"转向"业务对齐"。 阿里巴巴的 SAM-D2Q 用强化学习偏好对齐替代纯文本的 Doc2Query 扩展,AliExpress 线上 GMV +3.38%、Pay Count +2.27%;华为的 IGPO 走 training-free 路线,把策略与库存事实解耦,线上 CTR 相对提升 3.17%、审核 bad case 减少 38.9%。两篇都不改模型主体,改的是优化目标与决策边界。
主线三:多模态与检索表示中的信号衰减开始被显式建模。 小红书相关团队的 LARK 提出"跨模态稀释"并给出一套潜在对齐方案;MURAL 用不确定度感知融合压制噪声模态;Embedding Surgery 则在稠密检索侧做局部嵌入修正,DL-Hard 上 nDCG@10 相对提升最高 60.64%。
级联推荐的多任务与全链路优化
级联推荐的核心张力在于:上游模型按自己的目标筛掉候选,下游排序器的偏好却可能落在被筛掉的集合里。本周三篇工业论文分别从融合模块联合训练、任务依赖个性化、以及匹配策略的奖励建模三个角度切这个问题。
UniRec(快手)— 解决的问题是跨阶段不一致(cross-stage inconsistency)。现有做法要么只在精排内部做多目标融合,要么在粗排打分上加一个下游分数因子,两阶段的融合模块始终缺少联合优化。UniRec 让两个融合 agent 部分共享输入 embedding,并在单个计算图里训练,任一阶段的梯度都会穿过共享表示影响另一阶段。目标函数是双轴的:垂直方向是一个跨阶段一致性项,把下游的 pairwise 偏好迁移到上游融合分数上;水平方向是一个紧凑聚合项,把几十个基于异构先验信号的 pairwise 目标整理成双向偏好证据。
论文还点出一个容易被忽略的失败模式:无约束的端到端融合优化会利用 item 属性分布的不平衡,把资源过度集中在高回报区域,牺牲其他目标。对应方案是属性组相对正则化——在同一属性组内计算优势并做归一化,这样"整体抬高一整个高回报组"不再带来任何优化增益。线下一致优于单阶段融合与跨阶段协调基线,线上 app usage duration +0.616%,已在快手全量部署。
这个思路与 DMT 的塔式拆解有承接关系:DMT 从拓扑与通信效率出发把全局 embedding 查找拆成不相交塔,UniRec 则从梯度流动出发把两阶段融合绑在一起,两者都在回答"大规模级联系统里信息该在哪一层汇总"。
PTDG(华为)— 关注的是信号侵蚀(signal erosion)。主流 MTL 方法在静态转化漏斗上施加统一的任务依赖强度,但任务相关性其实随 item 特性变化。沿固定链路做层次化消息传递会带来累积衰减,深漏斗的稀疏目标受害最重。
PTDG 的做法是在尊重物理因果约束(如 Click → Pay)的前提下,按 item 动态"重连"依赖路径的强度。实现上用低秩近似保证结构鲁棒性,用带硬因果掩码的 GCN 传播建立自适应信息捷径。配套的 Adaptive Progressive Masking(APM)按任务稀疏度解耦共享参数,稳定优化过程。在 KuaiRand1K 和工业数据集上,稀疏转化任务的 AUC 提升最多 1.45%,密集目标持平;线上 CVR +1.2%,eCPM +1.9%。
相比 RLIV-UA 用多任务 critic 学习补偿稀疏标签的思路,PTDG 直接从依赖图拓扑动手,属于同一问题域里的另一条路径——前者补信号,后者改通路。
ALIGN-HOLD(滴滴)— 场景是网约车匹配中的实时 hold 控制:有选择地延迟司机-订单配对,等待更好的匹配机会。既有生产系统 EXHOLD 从行程完成、取消、等待时间、司机付出的手工组合里学 bandit 策略,但市场偏好异质、观测行为稀疏且噪声大,手工奖励越来越难设计。
ALIGN-HOLD 转而从隐式市场偏好学奖励。它从订单轨迹、司机轨迹和同时段局部匹配图中构造互补偏好对,训练一个经验 Reward Model(RM),训练时用 balanced multi-view sampling 和 model-adaptive hard preference sampling。在基于模拟器的策略学习阶段,冻结的 RM 提供密集的、依赖上下文的奖励,并支持对低可识别性交互做 label-free 过滤——那些行为反馈难以归因到匹配质量的样本不参与学习。
系统在滴滴巴西市场上线,28 天随机 A/B 实验覆盖日均约 10 万次乘客请求,行程完成率与司机收入有统计显著提升,司机接单前后的乘客取消显著下降。论文未给出具体数值。奖励建模这条线上的相邻工作可以参考 Calibration-Gated LLM Pseudo-Observations,它用校准门控把 LLM 伪观测注入 LinUCB;ALIGN-HOLD 的差异在于伪信号来自真实轨迹构造的偏好对,而非 LLM 预测。
电商搜索与推荐的工业实践
电商场景本周的共同主题是优化目标与业务价值的对齐:语义上合理的扩展未必带来成交,共现频次高的商品未必真正互补。
SAM-D2Q(阿里巴巴)— 针对的是用户 query 与商家标题之间的词汇错配。短标题覆盖不了多样的用户表达和视觉属性。Doc2Query 通过生成伪 query 做文档扩展来缓解,但传统方法只处理文本,也没有针对电商业务目标优化,容易产出"语义上说得通、商业上没用"的扩展,还会漏掉商品图片里的关键属性。
SAM-D2Q 在布尔检索约束下做三阶段训练。阶段一是任务适配的多模态监督微调,提升对标题、图片、query 的视觉-语言理解;阶段二是多模态数据增强,改善关键视觉属性的感知和扩展覆盖率;阶段三是基于强化学习的偏好对齐,把优化方向拉向搜索业务目标,鼓励生成更匹配用户意图与商业价值的伪 query。AliExpress 生产搜索系统上线后,GMV +3.38%,Pay Count +2.27%。
IGPO(华为)— 场景是早期部署阶段的 AI 搜索:商品目录频繁更新,可用 item 及其属性无法当作稳定知识写进固定 prompt。微调、强化学习、静态 prompt 补丁都不太合适——标签稀缺、奖励随库存漂移、模型发布成本高、prompt 补丁很快过期。
IGPO 采用 training-free 路线,核心是把策略与环境事实分开:学的是如何在运行时库存证据上行动的 Policy Guidelines,而不是记住有哪些商品。线上对每个 query 探测库存、构建库存画像,再把相关 Policy Guidelines 注入检索与选择 prompt。线下用随机 rollout 按 query 分组——结果混合的组直接产生对比信号;一个库存引导的探索循环负责区分"漏掉的检索路径"和"在当前库存证据下确实没有匹配支撑"两种情况。
自 2026 年 5 月起部署在某商业智能助手 AI 搜索系统中。14 天完整处理组 A/B:CTR 相对提升 3.17%,审核 bad case 减少 38.9%。与 Airbnb 的 EBR 系统 相比,后者靠建模多阶段用户旅程和动态库存做到每秒 1 万次实时更新,IGPO 则完全不训练检索器,改在策略层做动态接地。
AlleCompanion(Allegro)— 互补推荐要回答的问题很具体:用户加了专业相机,该推镜头、通用三脚架,还是另一台机身?标准模型常常分不清"一起被买"和"真的配套"。
AlleCompanion 是 Allegro.com 的生产级检索框架,做两件事。一是用数据级过滤启发式加类别约束的双塔架构压制大规模共购流量里的噪声,其中 Category Adapter 在 embedding 空间引导模型,把候选限制在逻辑互补的边界内。二是引入 ComCat,一个多源互补类别映射——它充当翻译层,把噪声流量里的有效模式蒸馏成可维护、可控的产物,来源包括专家规则、人在回路反馈、LLM 推理和统计挖掘。
框架服务超过 2000 万月活用户,自然发现场景的归因 GMV 和赞助位收入都有提升,论文未给出具体数值。ComCat 这种"多源知识蒸馏成可维护映射"的做法和 BEATS 用多阶段 LLM 生成 + 人工验证迭代构建电商属性体系是同一类工程范式。
Distill Globally, Adapt Locally(Amazon)— 目标是 trade-up 推荐:在保留购买意图的前提下给出更高品质的替代品。LLM 能推理这类区别,但直接对数亿商品对做推理在运营上不现实。
框架分两级。Level 1 用检索增强的 few-shot LLM 教师生成结构化关系标签和自然语言理由,这些理由通过对齐与对比目标监督一个紧凑的 embedding-pair 分类器;推理时学生只用两个预计算的 768 维商品 embedding,不调用 LLM、不做文本生成。在 8352 对人工标注基准上,15.5M 参数的四分类推理蒸馏学生 AUC 0.924(95% CI [0.918, 0.929]),仅用标签的学生是 0.912。Level 2 的 product-type test-time training(PT-TTT)用 few-shot 示范在冻结学生上优化轻量类别适配器,AUC 从 0.924 提到 0.941,平均精度从 0.920 提到 0.940。在 10 万对代理目录上,单台八卡机器的蒸馏学生比直接 LLM 推理快约 5000 倍、估计成本低约 10000 倍。
PT-TTT 与 ESANS 这类检索侧负采样优化关注点不同——前者调决策边界,后者调训练分布——但都属于"不换模型主体、只改局部决策"的效率路线。
LLM 与多模态推理增强推荐
多步推理在推荐里的副作用开始被单独研究:不管是视觉信号经过 CoT 链条衰减,还是记忆被压缩成粗粒度摘要,信息损失都发生在中间层而非输入端。
AtomRec — 针对 agentic 推荐系统里的记忆机制缺陷。现有做法把用户和商品信息压缩成粗粒度摘要,再用标量协同链接相连,结果是细粒度偏好阶段保不住,用户兴趣演化时也检索不到可解释的证据。
AtomRec 把用户和商品记忆表示成结构化原子单元,在相关记忆之间建立语义链接,新交互到达时演化相关历史字段。推荐阶段检索的是链接记忆构成的多跳证据路径,而不是孤立的邻居摘要,协同信号因此能以接地的形式支撑排序。在四个公开基准上一致优于 agentic 与记忆增强基线,指标平均相对提升约 8.5%,对比对象包括 AgentRec、MemGPT、SASRec、BERT4Rec。
结构化记忆这条线上,EviSnap 用 LLM 把评论提炼成 facet cards 并构建共享概念空间,AtomRec 的差异是把记忆单元本身原子化而非摘要化——前者压缩后映射,后者保留单元结构再连边。
LARK — 提出"跨模态稀释"(cross-modal dilution):多模态 VLM 的表示经过多步推理传播时,视觉和文本信号会逐渐衰减。这是把 VLM 用于推荐时的基础性障碍。
LARK 是单 VLM 内的两阶段潜在推理框架,配两套互补对齐机制。第一阶段把可学习潜在 token 与多步 CoT 推理交错,并显式对齐到冻结的视觉编码器,充当贯穿推理链的视觉检查点,保住感知细节。第二阶段把潜在表示经 bridge MLP 投影,用 item-to-item 对比学习训练;为防止推理语义淡化,中间特征会与第一阶段的 CoT 隐藏状态对齐,把最终 embedding 锚定在模型自身的推理输出上。
在三个公开基准和一个工业数据集上,LARK 在多种推荐架构上取得 SOTA,消融实验确认了各组件的独立贡献。相比 HIVE 用查询合成与验证提升多模态推理检索(MM-BRIGHT 上 nDCG@10 从 32.2 提到 41.7),LARK 的问题设定更靠前——不是改检索流程,而是防止推理过程中的表示退化。
MURAL — 指出多模态 GNN 推荐的两个瓶颈:结构刚性,依赖静态预计算的相似度图,无法跟上偏好演化;语义脆弱,噪声模态信号被无差别融合,扭曲协同信号。
MURAL 从固定结构增强转向动态拓扑发现。针对结构刚性,Adaptive Edge Learner 结合可微检索增强策略与近似最近邻搜索,发现兼具语义自适应性与计算可扩展性(O(N log N))的潜在 item-item 关联。针对语义脆弱,Uncertainty-Aware Fusion 模块建模异构模态的偶然不确定度(aleatoric uncertainty),动态降低不可靠特征的权重,优先保留高置信信号。此外用对比式师生对齐把模态特定表示锚定到稳定的行为信号上,保证优化稳定性且无梯度泄漏。
在 TikTok、Amazon 等大规模基准上优于结构类和生成式 SOTA 基线,并提供领域特定模态主导性的可解释性分析,以及在极端数据损坏下的鲁棒性表现。和 ACARec 用注意力从艺术家目录为新曲目生成协同过滤嵌入的思路类似,两者都在补稀疏交互,MURAL 的差异是把补图这件事做成了可学习的动态过程。
稠密检索与技能召回优化
这一组工作的共同点是:检索系统的瓶颈不在模型容量,而在表示的时效性、微调带来的分布偏移,以及迁移机制放在哪里。
When Synthetic Data Hurts(Manulife)— 一个覆盖 34,396 个技能的生产级技能路由系统,以及基于有限真实监督与合成数据的大规模技能检索研究。结论直接:合成数据微调能提升分布内检索,但在真实数据和 OOD 数据上造成灾难性遗忘——OOD recall 从 0.850 掉到 0.650。
论文系统对比了几种受持续学习启发的缓解方法:embedding-anchor 正则化、Learning without Forgetting(LwF)、Elastic Weight Consolidation(EWC)、L2-initialization。这些方法在保留 OOD 技能检索性能的同时,让 0.6B Qwen 检索器与重排器在合成分布内技能上的检索再提升 13.98%。作者同时给出了一个可复现的基准和一套面向稀缺多正例监督的微调配方。
这个问题和 用小型语言模型做企业搜索相关性标注 面临同一个约束——真实标注稀缺。后者用 BM25 + LLM 标注生成合成数据把吞吐量提到 17 倍,但没有报告分布外代价;本周这篇补上了代价这一侧。检索路由的相邻工作还有 Adaptive Re-Ranking,按 utility 做查询路由换 1.15-53 倍中位延迟下降。
Embedding Surgery — 稠密检索的文档 embedding 离线计算并存入静态索引,难以响应用户反馈或演变的搜索意图。Embedding Surgery 在查询时对选中的文档 embedding 做局部、最小化的更新,更新方向由编辑反馈、用户交互或 LLM 伪标签引导。
方法被形式化为一个凸优化问题:在施加排序约束的同时,最小化对受影响文档表示的改动量。这个约束条件很关键——它保证修正不会破坏 embedding 空间的全局结构。在 TREC Deep Learning、TREC Robust、TREC CAsT 和 MS MARCO 上一致提升,编辑反馈下 DL-Hard 的 nDCG@10 相对提升最高 60.64%,且在噪声或漂移反馈下依然成立。排序修正会传播到语义相关的查询上;更新可以通过简单的原地覆写应用到可扩展的 ANN 索引,无需代价高昂的索引重建。方法与 CoRocchio 互补,联合使用有额外增益,且对噪声反馈更鲁棒。
这条路线与 Retrieval-GRPO 在淘宝搜索里用强化学习动态优化嵌入表示形成对照:后者改训练过程,前者改推理时表示,共同点是都放弃"一次训练、静态索引"的假设。
Reification as a Transferable Vocabulary — ULTRA 这类知识图谱基础模型通过专门架构硬编码迁移机制来实现零样本链接预测。这篇论文把机制从架构里搬到了表示里。
具体做法是 reify 输入图:每个事实变成一个节点,通过六种元关系的固定词汇表连到它的主语、宾语和关系类型上,关系类型作为匿名共享节点而非模型参数。在这个表示上,五种教科书级 GNN(GAT、GINE 的 sum 与 mean+max 两种聚合、GraphSAGE、R-GCN)各自在单个 4,245 三元组的知识图上、单卡 A100 训练 30 分钟,然后零样本迁移到 40 个归纳链接预测基准。最好的是现成 GAT,在 ULTRA 自己的评估套件上与之打平——而 ULTRA 是在三个图上预训练的基础模型。
同一套固定词汇表还扩展到了关系数据库:行变成实体,外键列变成关系类型。在两个未见数据库上的初步探测(不给单元值、schema 文本或上下文标签)显示,这一族模型在三个知识图上预训练后,外键目标的排序远高于随机初始化与度数控制组。相比 GravityGraphSAGE 把 GraphSAGE 扩展到有向图并设计引力解码器,这篇的着眼点更靠上游——不换 GNN,换的是喂给 GNN 的图的构造方式。
值得关注的方向
跨阶段梯度流动会继续成为级联系统的主要收益来源。 本周三篇工业论文(UniRec、PTDG、ALIGN-HOLD)给出了同一个信号:阶段内的模型结构已经相当成熟,剩余空间在阶段之间的信息传递方式上。UniRec 用共享 embedding 和单计算图,PTDG 用可重连的依赖图,ALIGN-HOLD 用可迁移的奖励模型。快手、华为、滴滴都在这一层做改动,且都拿到了线上正收益(+0.616%、+1.2% CVR、显著提升但未给数值)。对工程团队的启示是:先检查跨阶段目标是否互相抵消,再考虑加模型容量。
Training-free 与轻量适配在库存/目录频繁变动的场景会持续扩张。 IGPO 完全不训练检索器,14 天 A/B 拿到 3.17% 相对 CTR 提升和 38.9% 的 bad case 下降;Embedding Surgery 只做查询时的局部嵌入修正,DL-Hard 上 60.64% 的相对提升;Distill Globally 的 PT-TTT 只训练轻量类别适配器就把 AUC 从 0.924 推到 0.941。三篇的共同前提是:模型主体已经够用,瓶颈在时效性和决策边界。华为在 IGPO 上、Amazon 在 trade-up 上都在推这条路线。
合成数据的分布外代价正在被量化。 When Synthetic Data Hurts 给出的 OOD recall 从 0.850 到 0.650 的下降幅度值得注意——这不是边际噪声,是能力退化。同时 EWC/LwF/embedding-anchor 这一组持续学习方法的有效性说明问题有解,且解法是把分布内微调与分布外保留显式做成两个目标。伴随技能路由、企业搜索、agent 工具调用这类场景的规模化,合成监督的配比问题会从经验判断变成需要基准的工程问题。
本周论文速览
级联推荐的多任务与全链路优化
UniRec — 快手提出跨阶段多任务融合,粗排/精排融合 agent 共享 embedding 并在单计算图联合训练,配双轴偏好对齐与属性组相对正则化;线上 app usage duration +0.616%,已全量部署。
PTDG — 华为提出个性化任务依赖图,用低秩近似按 item 重连依赖强度,配 GCN 传播与硬因果掩码、自适应渐进掩码;稀疏转化 AUC 最多 +1.45%,线上 CVR +1.2%、eCPM +1.9%。
ALIGN-HOLD — 滴滴用订单/司机轨迹与局部匹配图构造偏好对训练 Reward Model,替代 EXHOLD 的手工奖励;巴西市场 28 天 A/B,行程完成率与司机收入显著提升、乘客取消显著下降。
电商搜索与推荐的工业实践
SAM-D2Q — 阿里巴巴提出业务对齐的多模态 Doc2Query,三阶段做多模态 SFT、数据增强与 RL 偏好对齐;AliExpress 线上 GMV +3.38%、Pay Count +2.27%。
IGPO — 华为提出 training-free 的库存接地策略级优化,学 Policy Guidelines 而非记忆商品,线上构建库存画像;14 天 A/B 相对 CTR +3.17%、bad case -38.9%。
AlleCompanion — Allegro 提出生产级互补推荐检索框架,类别约束双塔加 ComCat 多源互补类别映射(专家规则+人工反馈+LLM 推理+统计挖掘);服务超 2000 万月活,归因 GMV 与赞助收入提升。
Distill Globally, Adapt Locally — Amazon 把 LLM 推理蒸馏进 15.5M 参数 embedding-pair 分类器,再用 product-type test-time training 局部适配;AUC 0.924→0.941,比直接 LLM 推理快约 5000 倍、成本低约 10000 倍。
LLM 与多模态推理增强推荐
AtomRec — 提出原子协作记忆,把用户/商品记忆表示成结构化原子单元并建语义链接,检索时走多跳证据路径;四个公开基准平均相对提升约 8.5%。
LARK — 提出"跨模态稀释"问题及两阶段潜在对齐框架,用潜在 token 充当视觉检查点、中间特征对齐 CoT 隐藏状态;三个公开基准加一个工业数据集上 SOTA。
MURAL — 提出自适应边学习(可微检索+ANN,O(N log N))与不确定度感知融合,把多模态推荐从固定结构增强转向动态拓扑发现;TikTok、Amazon 基准上超越结构与生成式 SOTA。
稠密检索与技能召回优化
When Synthetic Data Hurts — Manulife 在 34,396 技能的生产路由系统上发现合成数据微调导致灾难性遗忘(OOD recall 0.850→0.650),验证 embedding-anchor/LwF/EWC/L2-init 等缓解方法;0.6B Qwen 上合成分布内检索 +13.98%。
Embedding Surgery — 提出查询时的局部嵌入修正,形式化为凸优化以在施加排序约束的同时最小化改动;DL-Hard 编辑反馈下 nDCG@10 相对提升最高 60.64%,可原地覆写到 ANN 索引。
Reification as a Transferable Vocabulary — 把零样本链接预测的迁移机制从架构搬到表示,用六种固定元关系 reify 输入图;五种教科书 GNN 在 4,245 三元组上训练 30 分钟后零样本迁移到 40 个基准,最佳 GAT 匹配 ULTRA。