type
Post
status
Published
date
Oct 10, 2026 05:31
slug
rec-weekly-2026-W41
summary
本周推荐系统研究围绕三条主线展开,工业部署论文与学术工作交替推进。 主线 1——搜索链路的重排与监督信号再分配: Airbnb 的 SIFT 把 filter ranking 从手工 ETL 特征迁移到 Transformer 序列建模,线上推荐 filter 互动 +20.0%;Elastic 的 VLM Teacher 监督研究 显示,把教师信号花在负样本判定上比增强正样本更划算,ViDoRe v2 nDCG@5 从 55.2 提到 62.6/63.0。两篇共同指向同一件事——搜索链路的收益正从"换模型"转向"监督信号怎么分配"。 主线 2——大规模训练与在线优化的算子级与框架级改进: Google AI-Hypercomputer 的 CutBCE 把多标签 BCE 的 logits 挤出 HBM,8 芯片 TPU 上训练提速 225.9%;Meta 的 Population Evolution 用跨任务共享实验账本把排序任务局部增益从 7.01% 提到 8.97%;同属 Meta 的十亿级缩略图 MAB 系统 在 O(B) 规模上把探索先验交给深度视觉质量模型。 主线 3——生成式推荐的细粒度偏好对齐: Walmart 的 QGDPO 用 DPO 过滤 Doc2Query 的幻觉与重复预测,消除 50% 无关预测;AIMS 把单条历史事件的删除干预效应转成排序 margin 监督。两篇的切入点是——训练信号正在从"整体输出好"细化到"哪一部分在起坏作用"。
tags
推荐系统
周报
论文
category
推荐技术报告
icon
📚
password
priority
1
本周概览
本周推荐系统研究围绕三条主线展开,工业部署论文与学术工作交替推进。
主线 1——搜索链路的重排与监督信号再分配: Airbnb 的 SIFT 把 filter ranking 从手工 ETL 特征迁移到 Transformer 序列建模,线上推荐 filter 互动 +20.0%;Elastic 的 VLM Teacher 监督研究 显示,把教师信号花在负样本判定上比增强正样本更划算,ViDoRe v2 nDCG@5 从 55.2 提到 62.6/63.0。两篇共同指向同一件事——搜索链路的收益正从"换模型"转向"监督信号怎么分配"。
主线 2——大规模训练与在线优化的算子级与框架级改进: Google AI-Hypercomputer 的 CutBCE 把多标签 BCE 的 logits 挤出 HBM,8 芯片 TPU 上训练提速 225.9%;Meta 的 Population Evolution 用跨任务共享实验账本把排序任务局部增益从 7.01% 提到 8.97%;同属 Meta 的十亿级缩略图 MAB 系统 在 O(B) 规模上把探索先验交给深度视觉质量模型。
主线 3——生成式推荐的细粒度偏好对齐: Walmart 的 QGDPO 用 DPO 过滤 Doc2Query 的幻觉与重复预测,消除 50% 无关预测;AIMS 把单条历史事件的删除干预效应转成排序 margin 监督。两篇的切入点是——训练信号正在从"整体输出好"细化到"哪一部分在起坏作用"。
工业搜索的召回与重排优化
搜索链路本周有三篇工作从不同环节切入:Airbnb 的 filter ranking、POI 重排、以及视觉文档检索的监督信号分配。
SIFT(Airbnb)— 把 filter ranking 从 ETL 特征迁移到序列 Transformer。生产系统此前用两层 MLP 吃手工预聚合特征,维护贵、扩展难——新增 filter 类型或上下文维度(行程长度、同行人数)都要重写 pipeline。SIFT 用 Transformer 直接从原始行为序列学统一 guest 表示,一份表示喂多个预测头:booking likelihood、filter engagement、以及 ordinal capacity threshold(如"2+ 卧室"这类数序切分)。布尔型和数值区间型 filter 走同一框架。扩展新 filter 只需加 head。为控制延迟,guest 表示按天离线计算而非请求时算。
离线 PR-AUC 上 booking 与 amenity-engagement 分别 +51.9% 和 +62.8%。线上 A/B:推荐 filter 互动 +20.0%,整体 filter 使用 +0.72%,新支持的卧室/浴室/床 filter 使用分别 +3.9% / +10.7% / +0.52%。可扩展性验证更关键——用同一份共享表示快速接入 hotel-intent filter,未取消酒店预订 +3.8%,整体 marketplace 预订 +0.76%。SIFT 已全量部署。
这条路线延续了序列建模在精排上的迁移。DSIN 用 self-attention 配 Bi-LSTM 分层建模 session 内外兴趣,RAT 用检索增强 Transformer 处理冷启动与长尾。SIFT 的差异在于把"多任务 + 多 filter 类型"作为一等公民,而非先建 CTR 模型再适配。
H2CE — POI 重排要同时处理 query 词汇语义、地理邻近、以及评分/评论数这类数值质量信号。难点是这些信号互相冲突:近的 POI 可能只部分满足 query 意图,远的可能语义和质量都更强。H2CE 对数值属性做双路表示——分桶后转自然语言描述插进 cross-encoder 输入(支持语义-数值注意力),同时精确标量值走专用 MLP 保留量级信息。两路 embedding 经潜空间聚合融合,而非标量加权和。架构分两阶段:Stage 1 pointwise 给所有候选打分做过滤,Stage 2 对 top-K 做 head-to-head pairwise 比较并用 Copeland 聚合。pairwise 成本从 O(N²) 降到 O(N+K(K-1))。
5,743 条查询测试集上 NDCG@5 达 67.48%,比 XGBoost LTR 高 +22.82%,比 zero-shot LLM reranker 高 +35.89%。pairwise 阶段单独贡献 +1.98%。H2CE 的数值双路表示和 PNN 的 product layer 特征交互一脉相承——都是把稀疏/稠密信号在 embedding 层做非线性组合而非简单拼接。区别是 H2CE 显式区分"语义可读的描述"和"保留量级的标量"。
VLM Teacher 监督(Elastic)— 视觉文档检索器用对比学习训练:每个 query 配一个标注为正的页面,其余被推远。近期方法把 VLM 教师蒸馏进检索器,方式是增强正样本(迁移教师对页面的注意力,或生成页面描述)。这篇问的是——教师花在另一侧(判定被挖掘的候选负样本)是否更值。
固定 student、数据、优化器、评测后,teacher-judged hard negatives 和 score distillation 把 ViDoRe v2 nDCG@5 从 55.2 提到 62.6 和 63.0;description alignment 只 +2.6;attention grounding 无可测收益。对比同训练算力下从同一挖掘池选四个候选的无教师规则(其中最好的是当前系统用的 positive-aware threshold),教师判断带来 v2 +4.1、v3 +1.7。
这符合标签不完整的假设——标注者认为 query 前四挖掘候选里约两个相关但都没被标注,训练实际上把检索器推离了被当作负样本的相关页面。教师信号还偏粗:贪婪解码的 0-100 评分提示下,82% 的评分落在量表两端;一个 relevant/irrelevant 二分就能保住大部分蒸馏收益。十人标注审计把教师放在人类标注者变异范围内,在 query 有唯一确定答案时可靠。作者放出代码、教师的 3.3M 判断、页面描述、挖掘池、人工审计和训练好的 adapter。
这篇和 Xiaohongshu 的 RL 相关性优化 的 Stepwise Advantage Masking、S²GR 的步进推理监督共享同一个判断——监督信号应该花在模型真正拿不准的地方。
大规模系统的训练与在线优化
三篇工作分别处理训练算子、模型设计搜索、在线探索。
CutBCE(Google AI-Hypercomputer)— 工业序列推荐在 10^5–10^7 物品的词表上做多标签 BCE。标准 BCE 会把 [B, N, V] logits 稠密物化到 HBM,O(BNV) 内存直接 OOM。LLM 领域有分块 Softmax CE 优化,但大规模多标签 BCE 没人做。CutBCE 是 JAX/Pallas 实现的精确 BCE loss 和梯度算子,四个设计:
- 稠密背景损失 + 稀疏目标修正的融合重写
- 自定义 VJP 配专用 Pallas TPU backward kernel,两趟都在片上算 logit tile,logits 及其梯度从不落 HBM
- 动态 VMEM 预算和分片感知的 collective hoisting
- 基于计数的零开销训练指标
单芯片 TPU v5e/v6e mini-benchmark 上消除 OOM 并最高 91.9% 加速。8 芯片 TPU slice 训练 876k 物品的 multi-label SASRec(Yambda-50M),峰值 HBM 降 65.7%(每芯片省 >14 GiB),训练提速 225.9%,精度相当。代码已开源。
这是算子级优化,但 65.7% 的 HBM 降幅意味着同样的芯片能塞下更大词表或更大 batch。MEMOIR 用 LLM 把交互历史分段成语义记忆,VirtualMLE 用 LLM agent 调 SASRec/HSTU,都依赖底层训练吞吐——CutBCE 这类内核优化是它们能跑起来的前提。
Population Evolution (PE) — LLM 驱动的演化能做迭代模型开发,但两个目标没被解决:找到能跨相关任务迁移的设计,以及在训练昂贵时维持改进。PE 是协同分层框架,把多个并行的局部搜索通过共享实验证据连起来。它在相关训练实例上评估代码变更并共享结果,指导后续提议和向更大训练规模的晋级。对昂贵目标,PE 搜小训练子集,用同行和中间评估筛候选,再上全目标训练。配套 RMD-Bench 覆盖排序、观看时长预测、RL 算法发现、LLM/VLM 预训练。
匹配源迭代下,PE 把排序任务平均最佳局部增益从 7.01% 提到 8.97%,观看时长从 2.84% 提到 3.85%,三个 joint-discovery 族的最佳大规模结果都改善。观看时长发现里,五个 harness 有四个、四个 proposer 全部改善。在新推荐数据集上做共享目标侧校准后,每个评估的 PE 设计都优于参考。匹配总 GPU 算力下,LLM 发现最佳相对准确率增益 2.48%(13 个成功候选)对直接演化的 0.92%(0 个);VLM 损失降低 8.78% 对 5.05%。
PE 接的是 AlphaEvolve / FunSearch 那条 LLM 演化搜索的线,但把单点搜索变成种群协同。和 GRank 的目标感知生成-排序框架、Macro Graph of Experts 的十亿级多任务专家图一样,都在回答"如何在算力受限下把模型复杂度推上去"。
十亿级缩略图 MAB(Meta)— 短表单视频里相当一部分没有人工选的封面。团队做了一个全自动端到端框架,用数据驱动的动态选帧替换静态默认帧,部署在全球 O(B) 规模。这是首个公开发表的、在 O(B) 规模未策展短视频场景成功部署的在线 MAB 框架。方案是多阶段候选生成 pipeline 配低延迟服务设施。关键设计是用深度视觉质量模型生成的图像特定先验初始化探索框架,降低探索成本,服务时动态出最优缩略图。全球部署显示核心发现和互动指标的统计显著提升(摘要未给具体数字)。
先验初始化探索这点和 Dynamic Prior Thompson Sampling 的闭式二次解先验一脉相承——都是让新臂引入时不至于从零开始试错。PBTS 处理周期非平稳 bandit 的周期重置思路,也服务于同一目标(在非平稳环境下控制累积遗憾)。
生成式推荐的偏好对齐优化
QGDPO(Walmart)— Doc2Query 用 seq2seq 生成相关 query 来缓解词汇不匹配。问题是模型会生成与文档无关的幻觉,或重复文档里已有的内容。QGDPO 用 DPO 引导生成:先微调基座 seq2seq,再用相关性模型给预测打分,基于分数构造 winning/losing 对做 DPO 训练。管线里还加了相关性模型过滤低质预测,只保留最相关的生成内容进索引。
相比 Doc2Query 基线消除 50% 无关预测,相关性过滤再去除 14.61%。已在 Walmart.com 全流量部署,相关性和用户参与度有实质提升(摘要未给具体数值)。DPO 在生成式检索上不算首创,但 QGDPO 的工程价值在于把"偏好对构造"和"索引过滤"串成可部署管线。Netflix 的 LLM 后训练做封面个性化、PROMISE 的过程奖励模型引导 beam search,都在用偏好优化或过程监督提升生成质量。
AIMS — 指令引导生成式推荐里,LLM recommender 要平衡当前请求和历史偏好。两者冲突时历史事件会压过请求。把单个历史事件的影响变成监督有两个障碍:影响推荐最深的未必是支持目标项的事件;删掉误导性事件可能抬高目标项分数,但竞争对手分数抬得更高,所以目标项分数上升不保证排名更好。
AIMS 把删除单个历史事件的效应转成排序监督。对已经排对的训练请求,一个冻结参考模型找出既提升目标项分数、又提升其对 cutoff 附近竞争对手 margin 的请求特定删除。这些 margin 当训练目标,完整历史仍作输入。训练用交叉熵加非对称辅助损失——惩罚 margin 不足,梯度只经竞争对手分数。推理不变,不需要历史编辑或删除搜索。六个 LLM 骨干、一个工业数据集和两个公开基准上 Recall 和 NDCG 都超强基线。消融支持请求特定 margin 和非对称监督,选出的删除优先移除违反约束的历史。
值得关注的方向
VLM/LLM 教师信号的再分配。 Elastic 的结果显示教师花在负样本判定上比增强正样本更划算(+4.1 vs +2.6 点)。如果这个结论在更大规模检索上复现,工业系统里"用大模型标注正样本"的常见做法可能需要重新审视。Elastic 放出了 3.3M 教师判断和相关工具链,值得跟进复现。
算子级优化打开词表天花板。 CutBCE 把峰值 HBM 降低 65.7%,意味着同样的 TPU 切片能处理更大的物品词表或更大的 batch。多标签序列推荐长期受限于 BCE 的内存开销,这类内核优化会直接影响能训多大模型。代码已开源,值得在自家训练栈上测。
生成式推荐的细粒度监督。 QGDPO 细到 token 级、AIMS 细到单条历史事件、Elastic 细到单个负样本,三篇指向同一方向——训练信号从"整体输出好"下沉到"哪一部分在起坏作用"。这类方法通常推理不变、只改训练,落地成本低。
本周论文速览
工业搜索的召回与重排优化
H2CE — 面向 POI 重排的两阶段异构 cross-encoder,数值属性双路表示经潜空间聚合;5,743 查询上 NDCG@5 达 67.48%,比 XGBoost LTR 提升 +22.82%。
SIFT — Airbnb 用 Transformer 从原始行为序列学统一 guest 表示做多任务 filter ranking;线上推荐 filter 互动 +20.0%,整体 filter 使用 +0.72%,已全量部署。
VLM Teacher 监督 — Elastic 比较 VLM 教师信号的分配位置,判定负样本优于增强正样本;ViDoRe v2 nDCG@5 从 55.2 提到 63.0。
大规模系统的训练与在线优化
CutBCE — Google AI-Hypercomputer 的 JAX/Pallas BCE 算子,8 芯片 TPU 上峰值 HBM 降 65.7%、训练提速 225.9%,消除 OOM。
Population Evolution — Meta 提出协同分层模型发现框架,排序任务局部增益从 7.01% 提到 8.97%,配套 RMD-Bench。
十亿级缩略图 MAB — Meta 首个 O(B) 规模未策展短视频在线 MAB 缩略图优化,用深度视觉质量先验初始化探索,线上指标统计显著提升。
生成式推荐的偏好对齐优化
AIMS — 把历史事件删除的干预效应转成非对称 margin 监督,梯度仅经竞争项;六个 LLM 骨干上 Recall/NDCG 超基线。
QGDPO — Walmart 用 DPO 引导 Doc2Query 文档扩展,消除 50% 无关预测、过滤再去除 14.61%,已全流量部署。