type
Post
status
Published
date
Sep 26, 2026 05:31
slug
rec-weekly-2026-W39
summary
本周工业界论文密度明显高于往常。TikTok、快手、百度、Google、LinkedIn、Meta、Spotify、Walmart 都拿出了带线上 A/B 的系统论文,覆盖从召回、粗排、精排到出价的完整链路。另一条线是评估与数据质量——Netflix 的反事实可观测性框架、Meta 的合成数据过滤,以及一篇质疑 LLM 重排评估协议的实证审计。 主线一,生成式召回的连续空间与统一级联。 X-Rec(ByteDance)放弃 semantic ID 的离散 token 路径,改在连续 item embedding 空间用 flow matching 直接学推荐分布,推理吞吐是 SID-AR 的 3.46 倍,TikTok 垂直内容互动 +4.1484%。OneTrans-V2 则把召回/粗排/精排压进一个 Transformer,GMV +9.74%、同硬件吞吐 3.2 倍。两者的共同指向是——生成式推荐的瓶颈已经从"能不能生成"转移到"生成路径的吞吐与检索精度如何兼得"。 主线二,工业系统在评测口径上的自我修正。 Recall Ceiling 发现 LLM 重排常用的 oracle 协议把 NDCG@10 高估了 92–95%,真实检索的 Recall@100 只有 2–19%,天花板直接锁死了重排的上限。FROST(Meta)则从数据侧入手,用真实数据梯度锚定合成样本效用,过滤掉 20–30% 合成数据反而提升下游效果。这类工作不产出新模型,但会改变别人怎么读别人的结果。 主线三,MoE 与参数继承成为 scaling 的工程抓手。 IntBMoE(Alibaba AMap)通过 block-conditioned 专家组合把 MoE 的参与度、执行量、物化量三者解耦,60ms 延迟下服务数亿用户,UVCTR +2.4%。Inherit4Rec(快手)则用参数继承做稠密到稀疏的平滑转换。两条路都在回答同一个问题:容量怎么涨,而延迟不涨。
tags
推荐系统
周报
论文
category
推荐技术报告
icon
📚
password
priority
1
本周概览
本周工业界论文密度明显高于往常。TikTok、快手、百度、Google、LinkedIn、Meta、Spotify、Walmart 都拿出了带线上 A/B 的系统论文,覆盖从召回、粗排、精排到出价的完整链路。另一条线是评估与数据质量——Netflix 的反事实可观测性框架、Meta 的合成数据过滤,以及一篇质疑 LLM 重排评估协议的实证审计。
主线一,生成式召回的连续空间与统一级联。 X-Rec(ByteDance)放弃 semantic ID 的离散 token 路径,改在连续 item embedding 空间用 flow matching 直接学推荐分布,推理吞吐是 SID-AR 的 3.46 倍,TikTok 垂直内容互动 +4.1484%。OneTrans-V2 则把召回/粗排/精排压进一个 Transformer,GMV +9.74%、同硬件吞吐 3.2 倍。两者的共同指向是——生成式推荐的瓶颈已经从"能不能生成"转移到"生成路径的吞吐与检索精度如何兼得"。
主线二,工业系统在评测口径上的自我修正。 Recall Ceiling 发现 LLM 重排常用的 oracle 协议把 NDCG@10 高估了 92–95%,真实检索的 Recall@100 只有 2–19%,天花板直接锁死了重排的上限。FROST(Meta)则从数据侧入手,用真实数据梯度锚定合成样本效用,过滤掉 20–30% 合成数据反而提升下游效果。这类工作不产出新模型,但会改变别人怎么读别人的结果。
主线三,MoE 与参数继承成为 scaling 的工程抓手。 IntBMoE(Alibaba AMap)通过 block-conditioned 专家组合把 MoE 的参与度、执行量、物化量三者解耦,60ms 延迟下服务数亿用户,UVCTR +2.4%。Inherit4Rec(快手)则用参数继承做稠密到稀疏的平滑转换。两条路都在回答同一个问题:容量怎么涨,而延迟不涨。
生成式推荐与统一排序架构
X-Rec(ByteDance)的核心主张是:不要再把 item 量化成一个短 token 序列。SID-AR 路线的问题有两个——量化误差,以及自回归解码的低吞吐。X-Rec 改为在连续 item embedding 空间上直接学推荐分布,用 flow matching 生成 embedding trigger,再交给 ANN 检索。三个设计支撑这个想法:anchor conditioning 把生成拆成粗粒度语义区域选择和细粒度精炼;Riemannian flow matching 让生成轨迹对齐 item embedding 的超球几何;late-interaction diffusion Transformer 只在最后一层重复估计速度场,压住计算量。在 TikTok 内部流式 benchmark 上,吞吐是 SID-AR 的 3.46 倍,检索质量追平。线上连续两次上线,垂直内容互动 +4.1484%,大盘互动 +0.0111%。大盘增益很小,说明这套方法目前的价值高度集中在内容垂直度高的场景。它延续的思路和 GPR 的生成式单模型框架一脉相承——GPR 用多级语义 ID 映射和异构分层解码器做端到端,X-Rec 则干脆把离散映射这一步拿掉,改在连续空间做粗到细的生成分解。
OneTrans-V2 走的是另一条路:不换生成范式,换级联结构。传统推荐系统里召回、粗排、精排是三套独立训练、独立服务的模型,用户行为序列被重复编码三次,优化目标彼此隔离。OneTrans-V2 用一个 Transformer 吃下全部三级,行为序列只编码一次作为共享上下文,同时保留各阶段特有的候选特征与计算。三个机制值得单独说:
- 稀疏 MoE 扩展共享骨干: 容量随专家数增长,但激活计算有界。配套的 μP 风格参数化负责稳住放大过程中的训练动态。
- DCGR(Decision-Conditioned Generative Retrieval): 把原本按业务目标拆分的多条检索通道合并成一条——先预测一个描述即将发生的交互的 decision prefix,再以它为条件生成 item。业务目标由此变成生成过程的条件,而不是多个独立模型。
- SNT(Sequence-Native Training): 训练以每个用户的终身行为序列为组织单位,把序列编码成本在多次曝光之间摊薄。
线上全三级部署,GMV +9.74%,配合协同设计的 serving 栈后同硬件吞吐是原级联的 3.2 倍。这个 3.2 倍比 X-Rec 的 3.46 倍更有含义——它来自架构合并本身,不是在单一阶段内做优化。
UNIQUE(百度)同样在做召回-排序统一,但切入点更具体:层次量化不稳定,以及检索与排序分离带来的信息损失。它用单层扁平量化替代层次量化,把生成式 code-based 召回和 target-aware 排序融进一个早融合架构端到端训练,并加了一个 balanced quantization 机制缓解码本不平衡、改善长尾表示。部署在 Mobile Baidu 的首页 Feed、发现页、短视频三个场景,总观看时长 +0.96%、总分发量 +1.08%,P99 延迟 89ms、在线推理 MFU 44.23%。新用户和高活跃用户改善更明显——这和扁平量化改善长尾表示的动机一致。
CMRec(阿里巴巴)处理的是跨国家推荐。电商平台在不同市场通常维护互不相交的用户和 item ID 空间,传统跨域方法依赖的共享锚点根本不存在。生成式推荐通过共享 token 空间缓解了一部分问题,但现有方法的行为序列仍然严格按国家切分,知识迁移只发生在参数层面。CMRec 借了多语言 NLP 里 code-switching 的思路,把迁移下沉到数据层面:先从多模态内容和跨国家行为共现里学一个共享语义码本,再用它合成混合国家序列——token 级替换要同时满足静态约束(内容)和动态约束(价格、受众、热度),最后用上下文感知损失按样本在当前序列中的合理性重新加权。真实多国电商数据 + 线上 A/B:广告收入 +1.77%,订单 +2.64%,且数据稀疏国家的提升不影响数据丰富国家。这条路线的前置工作是 OpenOneRec,后者用 on-policy distillation 加 Rec-RL 的两阶段对齐把 1.7B/8B 模型推到 10 个 Amazon 数据集 Recall@10 平均 +26.8%;CMRec 则关心的不是单市场效果,而是跨市场的数据级监督注入。
Retrieval-Grounded Credit Assignment(Microsoft)瞄准的是 reasoning-enhanced 生成式推荐里的信用分配断层。这类模型先生成一段文本推理轨迹,再 beam search 解码 SID,训练用 group-relative policy optimization,reward 是 SID 精确匹配。在大 catalog 下这个 reward 极其稀疏,会出现两种失效:一个 group 内所有 rollout 全 miss 时 advantage 恒为零,完全没有学习信号;不同轨迹只要最终 SID 相同就拿同样的 advantage,哪怕推理质量天差地别。论文的做法是把轨迹结构化拆成 history summary、interest hypotheses 和 final SID 三段,用一个冻结检索器把每个 hypothesis 当 catalog query 执行——这样每个 hypothesis 独立可验证,而不只是通过最终 SID 被间接评判。任意 query 在 top-K 内命中目标就奖励该 rollout,per-query hit 指示器把奖励定位到具体 hypothesis 上。信用因此落在 span 级别,只有单独命中的 hypothesis 拿到正 advantage,检索通道永不更新 final SID span。三个 Amazon Reviews 数据集上一致提升。Video Games 上的 oracle 分析还显示,在生成的 interests 里挑出与目标相关的 query 能同时改善召回和排序——这说明 interest 质量本身还有未释放的空间。相关工作如 DualGR 走的是长短兴趣双分支路由加 search-based SID 解码,Gryphon 则联合训练 item 级打分组件来解决 SID 似然与相关性目标不一致的问题——三者都在同一根轴上:SID 生成过程怎么跟真实相关性对齐。
广告出价与智能体优化
OneBid(快手)想做的是自动出价的基础模型。现有方法从规则控制器演进到强化学习,再到 Decision Transformer,但都和现在的 oCPX 范式不匹配——注册、购买等异构场景各配一个模型,管线碎片化,跨场景建模完全没被探索。统一成单模型有三个难点:多目标控制、严格延迟下的容量扩展、安全的离线策略改进。OneBid 的应对:
- 双原子信号条件化: 把 DT 的单 Return-to-Go 扩成两个——Return-to-Go 管转化价值,Cost-to-Go 管成本比。再加一个 value-aware 正则约束 next-action 预测。
- 序列级 MoE: 共享专家编码跨场景知识,稀疏路由专家捕捉场景特有模式,保证低延迟下容量随模型规模和数据量一致增长。
- CROP(Critic-guided Relative Offline Policy): 学一个 critic 对候选动作做组内相对打分,避免 GRPO 式微调的在线探索风险,同时约束策略偏移以降低 OOD 风险。
线上全量部署,oCPX Ads 整体 ADVV +2.2%,ROAS 场景峰值 +13.1%。这个落差本身就说明问题——统一模型在目标明确、反馈密集的场景收益最大,在目标弥散的场景增益被摊薄。
ADAPT(阿里巴巴淘天)同样针对 auto-bidding 的个性化,但聚焦广告主画像。画像方法在推荐领域早就被验证有效,搬到出价上却困难,原因是三个:纯净画像难提取、公共信息和私有信息难以同时建模、画像更新和冷启动适配麻烦。ADAPT 用两阶段训练:第一阶段通过对比学习在广告主 memory bank 上提取纯净的静态和动态画像;第二阶段把动态画像解耦成公共画像和私有画像,再和静态画像一起条件化出价策略。训练完成后,新广告主的画像构建和现有广告主的画像更新都不需要重训。目前只在大规模离线 benchmark 上验证,没有线上数字。它和 PRO-Bid 关注点不同——后者用 Constraint-Decoupled Pareto 表示和反事实 regret 优化处理约束满足,ADAPT 处理的是"出价策略该以谁为条件"。
A Pinch of SFT, A Dash of RL(Amazon)讨论的是长时程广告智能体里 SFT 和 RL 该怎么配比。企业分析智能体要在分布式业务数据上做多步工具调用——检索、推理、API 调用、执行代码,还要根据中间观察调整。SFT 负责校准工具语法和教师支持的行为,RL 负责探索演示之外的奖励可达行为;但如果均匀施加 RL,会把已经校准好的技能打乱。论文的观察是,checkpoint 轨迹可以事后分成三个区间:Imitation(SFT 已捕获可靠的教师行为)、Lift(两阶段都有帮助)、Discovery(有用的奖励可观测行为落在可靠教师支持之外)。更有价值的是这个划分可以前瞻性使用——依据教师支持度和奖励可观测余量,把特征路由到 SFT-only、SFT 后接 RL、增配 RL,或者先去补环境。后续 18 个特征实验里,这个诊断预测对了 15 个轨迹方向。GPT-OSS 120B 上,targeted SFT 后接 RL 在 8 个广告技能中的 7 个上取得正向点估计,其中 5 个的配对 95% 置信区间不含零,最大增益在 non-disclosure 上 +11.27 分(95% CI [+9.72, +12.82])。SME 审计还发现 targeted RL 把标准信息泄漏从 11.8% 压到 2.9%,对抗泄漏从 22.9% 压到 6.8%,同时可操作性基本保持(86.2% → 85.7%)。在共享 reward 和优化配置下,targeted RL 把七技能均值从 +1.62 提到 +3.57,增量 RL 算力反而少用 43%。
FROST(Meta)处理的是合成数据选择。现有方法强调保真度或多样性,而不是 learner 当前阶段的需求。FROST 用真实训练数据的梯度反馈来估计合成样本效用,核心是两个决策:何时过滤——用批次效用与近期历史校准,只在 out-of-band 批次上触发过滤;保留什么——同样只在 out-of-band 批次内做样本筛选。整个过程不需要外部验证器,也不需要留出验证集。图像分类和 text-to-SQL 微调两个公开基准上,过滤掉 20–30% 合成数据后真实任务性能反而提升。在 Meta 大规模广告重排系统上应用,相对高度优化的生产基线有显著增益。具体 A/B 数值未在摘要中给出,但"过滤掉数据反而变好"这个结论对依赖合成数据扩增的团队是一个直接的方法论提醒。
大模型增强的重排与用户建模
先看一篇结论可能不太受欢迎的工作。Recall Ceiling 审计了 LLM 推荐重排的评估协议。不少 LLM 重排工作采用 oracle 协议——把 ground-truth item 注入候选列表,或者让它与采样负例对比打分。论文在三个主要 Amazon 数据集上显示,这个协议把真实 NDCG@10 高估了 92–95%。原因是一个确定性的上界:在八个数据集、三个领域上,真实检索在 K=100 时只覆盖 2–19% 的相关 item。留一法评估下有 $\mathbb{E}[\mathrm{NDCG}@k] \leq \mathrm{Recall}@|W_\pi|$,其中 $W_\pi$ 是重排的候选窗口。在真实检索条件下,论文测试的所有优化策略——prompt engineering、168 倍参数范围的模型 scaling、序列模型、监督神经重排器、LoRA 微调、混合检索、score-aware prompting、LLM+CF 融合——没有一个显著超过协同过滤基线。文本感知检索在一个数据集上提高了召回,但端到端 NDCG 没变;把上游 CF 分数喂给 LLM,主要效果是让 LLM 复述 CF 的排序。论文因此提出 RAEP(Recall-Aware Evaluation Protocol):先判断检索召回处于什么区间,再决定重排值不值得评测。在论文测到的低召回区间,改进检索比提升重排器复杂度更有效——但论文自己也点明,这个排序在有更高召回、更丰富特征或在线反馈的生产系统里未必成立。相关工作如 Adaptive Re-Ranking 用 utility 函数做查询路由,在多个 IR 数据集上把中位延迟降了 1.15–53 倍、nDCG@10 变化 -17.5% 至 +4.0%,本质上也是在回答"什么时候重排不值得做"。
LLM User Profiling(Comcast)问的是一个很实际的问题:LLM 生成用户画像比聚合方法贵得多,什么时候这笔钱值得花。论文把四种语义用户画像策略做因子化交叉——表示类型(聚合 vs LLM 生成)×时间处理(是否解耦近期与历史行为),在真实生产流媒体数据集上评估。比较维度覆盖用户行为类型、准确性维度与非准确性维度,以及控制解耦的时间窗口设置。结论层面,这不是提出一个新方法,而是给工程决策提供证据——从业者对这类系统性对比的需求其实比又一个新的画像模型更大。相关工作 HyMiRec 走的是混合路线,用轻量推荐器提取粗粒度兴趣嵌入、LLM 推荐器捕获细粒度兴趣嵌入,再用余弦相似度残差码本压缩用户历史;Sci-Surf 则把 LLM 画像与多模态摘要结合,在线评估显示预测对齐度 +10.4%。
COPE(阿里巴巴 Qwen)处理稀疏反馈下的持续个性化。LLM 与规范价值对齐的结果是回答同质化,无法覆盖多样的用户偏好;training-free 方法靠 prompt engineering 占用宝贵上下文窗口,training-based 方法训练完就静态了。COPE 给每个用户分配可学习的个性化 embedding,把偏好捕获、自评估校准、个性化响应优化整合到单个更新步里。关键设计是用自评估生成 proxy reward——显式用户反馈缺失时模型仍能持续更新。在稀疏反馈设置下一致优于 training-free 和 training-based 基线,并且与 Retrieval-Augmented Prompting 互补。这个思路和 Aligning LLMs for Controllable Recommendations 的两阶段 SL+RL 对齐属于同一谱系——都在用学习信号替代显式标注,区别是 COPE 把信号来源换成模型自评,从而摆脱了对标注反馈的依赖。
Robust Fusion(Spotify)讨论的是把行为统计塞进 LLM prompt 的副作用。QSS(Query Slice Stats)是一种交互派生的行为特征,总结 query-candidate 对的历史成功情况。直接注入 QSS 在特征可用时提升排序,但特征被移除时鲁棒性下降——典型的 shortcut learning,模型学会了依赖历史信号而忽略语义和用户上下文模式。论文的解法是 deterministic dual-sample feature-dropout training:每个样本出现两次,一次带 QSS 一次不带。离线看,QSS 注入在可用时提升排序质量 13.3%,双样本训练保住这部分收益的同时,在 QSS 移除评估下相对朴素 QSS 训练提升 4.0%。线上测试中两种 QSS-aware 变体都把搜索成功率提升约 2%——注意,聚合测试无法区分双样本训练和仅特征训练,冷启动对比只是与离线结果方向一致。这个诚实的负面结果值得记一笔。
BoundaryMORPH(AWS AI Labs + Purdue)针对的是 RAG 里的一个结构性错配。开放式 query 越来越"弥散",需要把大批文档塞进有限的 LLM 上下文窗口。系统用快速双塔召回、再用更贵的 cross-encoder 打分,但 CE 预算 B 受延迟严格约束,通常小于上下文容量 k。标准重排因此结构性地浪费算力——去验证显而易见的头部候选,却忽略初始排序更靠后的相关文档。BoundaryMORPH 用高斯过程把双塔初始排序当作结构先验,把 CE 调用集中用于解决 top-k 集合的边界成员判定,而不是寻找单一最相关文档;每次 CE 打分的信息会传播到未打分文档,最大化预算效用。在多个模型和数据集上取得 SOTA,nCG@100 比最强基线高 5.4。前置工作如 GRank 用目标感知生成器加轻量排序器,在公开基准和生产语料上 Recall@500 提升超过 30%、P99 QPS 是树/图检索器的 1.7 倍;BAGEL 则把 LLM 相关性打分和高斯过程贝叶斯主动学习结合,在同等 LLM 预算下超过 LLM 重排方法。三者共享的判断是:在预算受限的重排里,决定"在哪里花查询"比决定"用什么模型"更重要。
两篇偏评估与基础设施的工作也归在这里。Counterfactual Observability(Netflix)把推荐系统可观测性建模成反事实测量问题——估计在没有某个内容或某个模型决策的情况下,推荐器会做什么、会带来什么互动。论文提炼了三项面向内容创作者和模型开发者的可观测性原则,以及覆盖偏差削减、相对性、增量性的测量方法论,同时适用于单阶段和级联推荐系统,已在 Netflix 多个生产推荐系统上部署。原始互动信号(播放、点击)混在一起了内容质量、模型行为、展示偏差和受众触达,这个框架要解决的是归因问题。
RAILS(Zendesk)把 LLM 聚类做成可生产化的东西。用 LLM 当 clusterer 在生产规模下很困难——prompt 装不下整个标签空间,逐文档串行处理吞吐不够。RAILS 把聚类转成对增长标签池的循环,通过文档批处理和有界并发扩展。六个公开基准上平均超过最强 LLM 聚类方法:accuracy 51.2% → 59.3%,NMI 67.2% → 74.8%,ARI 45.4% → 54.7%。在 SaaS 工单主题发现管线中替换了传统 HDBSCAN 阶段,换来更高的聚类质量、prompt 驱动的透明控制和有状态的增量运行。相关工作 SHERLOCK 在京东的在线 A/B 里做到 82% 专家接受率和 386.7% 的日调查吞吐量提升,路线同样是领域知识库加检索增强的两阶段策略。
大规模检索排序系统的工程 Scaling
IntBMoE(Alibaba AMap)对 MoE 的分析框架是本周最清晰的一个。对单个 token 而言,有三个量此前无法独立设定:participation(有多少专家为输出贡献知识)、execution(实际计算几个,决定算力成本)、materialization(需要构建和存储多少组专家参数,决定内存成本)。稀疏路由压低 execution 和 materialization,但 participation 也小;dense output-mixing 恢复全参与,但 execution 随专家数增长;parameter-merging 把 execution 保持在一个专家,materialization 却随路由决策数增长。IntBMoE 用 block-conditioned 专家组合把三者解耦:block 来自一个小型学习码本,每个条目一个;每层用一个轻量 hypernetwork 把该层专家池里的所有专家基合并成一个组合专家。participation 因为是全池参与所以是满的,execution 因为 router 只把 token 送给少数 block 所以稀疏,materialization 因为 block 数量由码本而非输入决定所以有界。Dual-Path Residual Gating 再用乘法门控把两条独立组合的路径耦合起来。图像分类上一致优于稀疏和稠密 MoE 基线,语言建模和序列推荐验证了泛化性。在 AMap 生成式推荐系统上线,服务数亿用户、60ms 延迟预算,线上 A/B 相对 UVCTR 提升 2.4%。
Inherit4Rec(快手)处理的是模型扩容的代价。反复从零训练更大的稠密模型需要大量数据和时间,而增长的计算又和工业系统的严格服务预算冲突。参数继承是一条可行路径,但现有方法主要针对静态语料,在动态演化的推荐数据上会掉点。Inherit4Rec 同时支持两条路径:D2D(Dense-to-Dense) 用混合增长加非对称训练,在扩展时保持前向函数不变、维持更新连续性;D2S(Dense-to-Sparse) 用共激活感知分区和负载均衡损失构建 SMoE,保住稠密模型能力的同时促进专家激活均衡。KuaiRand-1K 和工业短视频数据集上,两种变换在所有预测目标上都优于对比的继承基线。相关工作中 LoopCTR 走的是另一条省算力路径——递归复用共享模型层增加训练时计算,把计算增长和参数增长解耦,训练多循环推理零循环策略;Disaggregated Multi-Tower 则从数据中心拓扑角度入手,用语义保持的塔变换加层次化特征交互,在数据中心上实现最高 1.9 倍加速且不损失精度。
Lightweight Ranking Heads(Google/YouTube)解决的不是模型效果,而是实验速度。在生产级多任务排序模型里加一个新预测任务往往成为瓶颈——可能与现有任务冲突,还要重训 backbone 和下游模型、调 reward 组合公式。Light Heads 允许向现有多任务排序模型动态注入新任务,靠 stop-gradient 和 stateless daily training 严格隔离新任务,用集中式配置让同一组 head 同时挂到多个模型上,从而解锁更快的训练数据生成和下游模型协同训练。YouTube 规模部署后,多任务实验的迭代周期从数周缩短到数天。工程价值明确:把"加一个任务"从模型工程问题降级成配置问题。
ScalarLens(蚂蚁集团)对数值特征嵌入的批评很直接:一个标量只有一个表示,这个前提把"值落在哪里"和"它对当前样本意味着什么"混为一谈。论文在 Criteo 验证集上观察到,即使去掉可加主效应,同一个数值区间在分类上下文和数值上下文中携带的残差点击证据符号相反。生产管线还会放大这个错配——外部归一化的特征要求变换和统计量在训练与服务之间保持同步。ScalarLens 的立场是把数值嵌入重新定义为测量问题:坐标属于值本身,用单调局部网格从 focal scalar 本身构造稳定坐标;预测响应属于上下文中的值,用有界低秩动态生成上下文响应,且不移动那个坐标、不替换分类 token 和 CTR backbone。1,539 次运行的主评估覆盖 19 种表示、3 个数据集、9 个 backbone、3 个 seed,ScalarLens 在 27 个设置中 25 个排第一,另外两个第二。匹配消融显示尺度校正、额外局部容量、泛化条件化都复现不出这个增益;共享标准化下的完整重跑仍然显著优于 DEER、DAES、NaryDis。这条路线往前追可以看 DEI²N 对触发式推荐里即时兴趣动态演化的建模,以及 INFNet 用 hub token 和 aggregate-and-broadcast 做线性复杂度特征交互——后者在商业在线广告系统中部署后收入 +1.587%、点击率 +1.155%。
CC Retriever(LinkedIn)处理粗排的图特征。LinkedIn Feed 中来自用户人脉(好友和关注)的内容占印象和互动的 70% 以上,职业知识图谱里的互动信号横跨一度和二度人脉——包括"陌生人爆款",即一度人脉反应、评论或转发但并非作者的内容。这个扇出导致候选索引超过十亿,筛选到约数万条后要在 120ms P99 延迟预算内打分。CC Retriever 的做法是在 GPU 上用全深度排序模型给这些候选打分,核心是一个 sorted-search GPU 原语,能在运行时 5–10ms 内把稠密的图亲和特征(viewer 到 author)与文档级特征 join。换成 GPU 服务评分后,排序模型参数量扩了 50 倍,线上内容消费时长 +2.5%。这个幅度在 LinkedIn Feed 实验里算显著偏高。参考 FSCD 用可学习特征选择做粗排的效果-效率权衡,以及 ASH/ASMOL 提出的全场景指标——粗排的评估口径本身就是个未解决的问题。
Hybrid GPU-CPU Retrieval(Meta)刻画了一个它称为"个性化-规模悖论"的矛盾:把完整服务库存放进 GPU 内存太贵,CPU 算力又跑不动同样的重交互模型。解法是编排而非新模型类。GPU 通路在约十亿文档的精选在线池上做深度融合——检索加交互预排序;CPU 通路在约二十倍规模的独立在线库存上做轻量个性化打分。每个请求可以只走一条或同时走两条,候选去重后共享下游排序。全系统 A/B 对比 legacy CPU-only 配置,模型打分相关性指标和实质性互动都有提升;分通路实验显示各自部署范围内都有正收益。检索日志显示两条通路贡献的候选在结构上互补。相关工作如 Semantic Search at LinkedIn 用 LLM 相关性判断器加多教师蒸馏的小模型,在固定延迟下把排序吞吐提升 75 倍以上;BEBR(腾讯)则从二值嵌入入手,用循环二值化和 SDC 距离计算省下 30%–50% 索引成本且几乎无损。
MuSeR(百度)在已部署的 MGS 系统上做长序列召回。工业系统通常在延迟和内存约束下把历史截断到几百条动作,长期兴趣利用不足;用户又跨新闻、问答、短视频等多种模态追求异质意图,稀疏 ID embedding 难以表示。MuSeR 三个组件:层次时间压缩——近期动作保持全分辨率,更早的片段渐进池化,使 $10^4$–$10^5$ 量级的单用户历史装进固定服务预算;解耦多查询兴趣抽取加正交正则;多模态语义对齐——用 LLM 蒸馏的文本摘要增强稀疏 item ID。部署侧配套异步用户表示刷新、自适应缓存和跨异构硬件的层次 beam search 检索。百度 APP 首页 Feed、发现页、短视频三个场景线上 A/B:DAU +0.26%,总时长 +0.89%(均 p<0.05),服务延迟和成本同时下降。论文自己说这不是新的建模原语,而是让长期、多兴趣、多模态建模能联合部署的系统级集成——这个定位是准确的。相关工作中 OrDA 用正交正则约束兴趣和习惯隐空间几何垂直并在推理时做因果干预,线上 UCTR +5.64%。
EvoPilot(Meta)讨论的是让 LLM agent 跑长期在线 autoresearch 的这一类新工作。自包含程序上的 autoresearch loop 能在分钟级迭代,但在线 autoresearch 要跨越异步系统、数小时量级的变体和数周量级的 campaign,直接影响产品。一个已经跑完的实验仍可能支持错误结论——代码改动是 no-op、数据窗口泄漏、评估器语义漂移、两条臂走了不同的服务漏斗。EvoPilot 是 human-gated 方法:角色化 agent 通过版本化的 domain skill 和 typed adapter 执行每轮,持久记录保存实验和失败,确定性检查强制执行已记录的教训。论文研究了一个 37 天 campaign,针对 Meta Video Deep Dive 的检索系统,覆盖七个方向,用小时级刷新的数亿视频索引。此前的人工实验没能确立 interaction head 的收益;一次 primitive autoresearch 尝试重访该方向,却把 22 个百分点的离线 hit-rate 下降错误归因于该 head。引入 EvoPilot 后,人工把关的验证追踪到下降来自一个既有的评估缺陷——它产生 3,000 和 600 的输出深度。修复后,匹配对比测得离线提升 3.20 个百分点。研究后回放和变异测试拒绝了无效对比、接纳了有效对比。持久状态恢复了一个被中断的轮次,artifact 复用省下约 5 个 GPU 小时。另有一个七天随机在线评估,估计 VDD 切片上 GSRR 相对提升 0.66%。相关方向可以看 Applying EBR to Airbnb Search 的多阶段用户旅程建模,以及 DualAgent-Rec 用 LLM 当协调器的双 agent 约束优化——后者在 Amazon Reviews 2023 上做到 100% 约束满足、Pareto 超体积提升 4–6%。
GradCIR(Walmart)处理电商视觉搜索里的一类特殊 query——composed image retrieval,用户上传一张图再加一段文字描述想要的修改(换颜色、换风格)。现有 CIR 方法把相关性当成二值的,用单一正样本的三元组训练,但真实 catalog 里大量候选只是部分满足 query,在这个部分匹配谱上的排序才决定体验。GradCIR 的方法论三件套:用 VLM 自动生成 query(目标检测加 modifier 合成)和 4 级相关性标签,无需人工标注;迭代相关性反馈闭环,从训练中的检索器里挖难负样本扩充训练集;hierarchy-aware angular objective,直接在分级标签上训练检索器而不是把它们塌缩成二值。在 PaliGemma2 双塔上用 3.5M 分级 pair 训练(来自 Walmart 原始 catalog)。受控的分级 vs 二值消融隔离了监督粒度的影响,NDCG@10 提升 4.9%–5.9%;同样配方应用到其他多模态编码器,早期融合 backbone 最高提升 8.5% NDCG@10。FashionIQ 上平均召回 0.6703,略超前最强同行评审监督基线,追平或超过所有已发表的 CLIP-L 级零样本 CIR 方法。系统已在 Walmart 生产环境服务在线视觉搜索流量,摘要未给出线上 A/B 数字。
值得关注的方向
评估协议本身正在成为研究对象。 本周有三篇工作从不同角度质疑现有评测口径。Recall Ceiling 证明 oracle 协议把 NDCG@10 高估 92–95%,且真实检索的 2–19% 召回率构成确定性上界;EvoPilot 记录了一次把 22 个百分点下降错误归因的完整过程,以及如何通过确定性检查拦截;Robust Fusion 诚实报告线上聚合测试无法区分双样本训练和仅特征训练。这三个案例指向同一件事:当模型复杂度上升后,评测缺陷带来的偏差可能超过方法改进本身的幅度。对做 LLM 重排的团队,RAEP 那套"先判断召回区间再评测"的流程值得直接借用。
连续空间生成与离散 SID 的路线之争还没定论。 X-Rec 用 flow matching 绕开量化误差和自回归低吞吐,换来 3.46 倍吞吐;OneTrans-V2 的 DCGR 仍在 SID 框架内做决策条件生成;Retrieval-Grounded Credit Assignment 则专注修复 SID 路线下 RL 训练的信用分配断层。X-Rec 的大盘增益只有 +0.0111%,说明连续空间目前还只在垂直度高、语义集中的场景里占优。值得跟踪的是 Gryphon 那类联合训练 item 级打分、解决 SID 似然与相关性目标不一致的工作会不会改变这个格局。
MoE 的容量扩展正在从"堆专家数"转向"解耦成本项"。 IntBMoE 把 participation / execution / materialization 三个量拆开控制,AMap 上 60ms 预算服务数亿用户;Inherit4Rec 用参数继承做稠密到稀疏的平滑转换;OneBid 的序列级 MoE 则服务于跨场景出价。三者都在回答同一个约束——容量要涨,延迟和内存不能同比例涨。接下来值得看的是这套解耦框架能否推广到序列长度维度,而不只是专家维度。
本周论文速览
生成式推荐与统一排序架构
X-Rec — ByteDance 在连续 item embedding 空间用 flow matching 直接学推荐分布并生成 embedding trigger 做 ANN 检索;推理吞吐是 SID-AR 的 3.46 倍,TikTok 垂直互动 +4.1484%、大盘 +0.0111%。
OneTrans-V2 — 用单个 Transformer 统一召回/粗排/精排三级级联,引入 DCGR 统一多目标检索通道与 SNT 摊销终身序列编码,稀疏 MoE + μP 扩展;GMV +9.74%,同硬件吞吐 3.2 倍。
UNIQUE — 百度用单层扁平量化 + 早期融合把生成式 code-based 召回与 target-aware 排序统一;Mobile Baidu 三场景总观看时长 +0.96%、总分发量 +1.08%,P99 89ms。
CMRec — 阿里巴巴把多语言 NLP 的 code-switching 迁移到跨国家生成式推荐,用共享语义码本合成受双约束的混合国家序列;广告收入 +1.77%、订单 +2.64%。
Retrieval-Grounded Credit Assignment — Microsoft 把 reasoning trace 拆成 history summary、interest hypotheses 和 final SID,用冻结检索器执行每个 hypothesis 做 span 级信用分配;三个 Amazon Reviews 数据集一致提升。
广告出价与智能体优化
OneBid — 快手首个统一 oCPX 自动出价基础模型,DT 的单 Return-to-Go 扩成 Return-to-Go + Cost-to-Go 双信号,配序列级 MoE 和 CROP 离线策略优化;oCPX Ads 整体 ADVV +2.2%,ROAS 场景峰值 +13.1%。
ADAPT — 阿里巴巴淘天用对比学习提取纯净静态/动态广告主画像,把动态画像解耦成公共与私有两部分,支持新广告主免训练画像构建;大规模 auto-bidding benchmark 上持续占优。
A Pinch of SFT, A Dash of RL — Amazon 提出 Imitation/Lift/Discovery 三区间诊断框架前瞻性路由 SFT/RL 配比;GPT-OSS 120B 上 7/8 广告技能正向,non-disclosure +11.27 分,targeted RL 省 43% 增量算力。
FROST — Meta 用真实数据梯度锚定合成样本效用,只在 out-of-band 批次决定何时过滤与保留什么;过滤 20–30% 合成数据后真实任务性能提升,已用于大规模广告重排。
大模型增强的重排与用户建模
Recall Ceiling — 揭示 LLM 重排的 oracle 协议高估 NDCG@10 达 92–95%,真实检索 Recall@100 仅 2–19%,提出 RAEP 评估协议;在低召回区间改进检索比升级重排器更有效。
BoundaryMORPH — AWS AI Labs + Purdue 用高斯过程把双塔排序当结构先验,把 cross-encoder 预算集中用于 top-k 边界成员判定;nCG@100 比最强基线高 5.4。
Robust Fusion — Spotify 用 deterministic dual-sample feature-dropout 训练缓解 QSS 行为特征的 shortcut learning;离线 QSS 可用时排序 +13.3%,QSS 移除场景 +4.0%,线上搜索成功率约 +2%。
COPE — 阿里巴巴 Qwen 为每个用户分配可学习个性化 embedding,用自评估生成 proxy reward 支撑稀疏反馈下的持续更新;一致优于 training-free 与 training-based 基线。
LLM User Profiling — Comcast 对四种语义用户画像策略(聚合 vs LLM 生成 × 时间解耦与否)做因子化交叉评估,回答 LLM 画像何时值得其额外成本。
Counterfactual Observability — Netflix 把推荐系统可观测性建模为反事实测量问题,提出三项面向创作者与模型开发者的原则及覆盖偏差削减、相对性、增量性的测量方法论。
RAILS — Zendesk 把 LLM 聚类转成对增长标签池的检索增强循环,配批处理与有界并发;六个基准上 ACC 51.2% → 59.3%,已替换生产管线的 HDBSCAN 阶段。
大规模检索排序系统的工程 Scaling
IntBMoE — Alibaba AMap 用 block-conditioned 专家组合解耦 MoE 的参与度、执行量与物化量;60ms 延迟服务数亿用户,线上相对 UVCTR +2.4%。
Inherit4Rec — 快手提出参数继承框架,D2D 用混合增长 + 非对称训练保持前向函数不变,D2S 用共激活感知分区 + 负载均衡损失构建 SMoE;KuaiRand-1K 和工业短视频数据集上全面占优。
Lightweight Ranking Heads — Google/YouTube 用 stop-gradient 与 stateless daily training 支持向现有多任务排序模型动态注入新任务;多任务实验迭代周期从数周缩短到数天。
ScalarLens — 蚂蚁集团把数值嵌入重定义为测量问题:单调局部网格构造稳定坐标,有界低秩动态生成上下文响应;1,539 次运行中 25/27 设置排第一。
CC Retriever — LinkedIn 用 sorted-search GPU 原语在 5–10ms 内 join 稠密图边特征与文档特征,实现在 GPU 上跑全深度排序模型做粗排;参数扩 50 倍,内容消费时长 +2.5%。
Hybrid GPU-CPU Retrieval — Meta 用 GPU 高深度融合通路(十亿级池)加 CPU 高广度轻量通路(约二十倍库存)解决个性化-规模悖论;全系统 A/B 相比 legacy CPU-only 配置提升相关性与实质性互动。
MuSeR — 百度在已部署 MGS 系统上用层次时间压缩、多查询兴趣解耦、LLM 文本摘要多模态对齐做长序列召回;百度 APP 三场景 DAU +0.26%、总时长 +0.89%。
EvoPilot — Meta 提出 human-gated 长期在线 autoresearch 方法,37 天 campaign 中追踪到 22pp 离线下降实为评估缺陷,修复后离线 +3.20pp;七天在线随机实验 GSRR 相对 +0.66%。
GradCIR — Walmart 把 composed image retrieval 从二值相关性转为 4 级分级监督,用 VLM 自动标注 + 迭代难负样本挖掘 + hierarchy-aware angular objective;NDCG@10 提升 4.9%–5.9%,已服务线上视觉搜索流量。
其他
RLVR² — 百度 ERNIE 团队把多维度 rubric 分数转成组内序数结果,从比较矩阵恢复潜在效用并融合为单一训练信号,避免异质 rubric 尺度校准;3 个模型规模、16 个基准上一致优于 rubric-based 基线。