推荐算法日报 - 2026-09-22
2026-9-22
| 2026-9-22
字数 2924阅读时长≈ 8 分钟
type
Post
status
Published
date
Sep 22, 2026 05:15
slug
daily-report-2026-09-22
summary
MoE 架构进入"解耦控制"时代:今日两篇 5 分论文(IntBMoE、OneBid)均以 MoE 为核心,但思路已从"稀疏路由省算力"转向独立控制参与度/执行量/物化量(IntBMoE 用码本+hypernetwork 组合专家基)与跨场景容量扩展(OneBid 序列级 MoE 共享+稀疏专家)。共同点是:MoE 不再是单纯的效率工具,而是承载"全参与知识融合 + 低延迟执行"的结构性方案,且都已在数亿用户规模线上验证。; 异构编排与 Agent 化研发成为工业落地新范式:Meta 两篇论文(
tags
推荐系统
日报
category
推荐技术报告
icon
📚
password
priority
1

Section 1: 📊 Trend Analysis

  • 🔥 MoE 架构进入"解耦控制"时代:今日两篇 5 分论文(IntBMoE、OneBid)均以 MoE 为核心,但思路已从"稀疏路由省算力"转向独立控制参与度/执行量/物化量(IntBMoE 用码本+hypernetwork 组合专家基)与跨场景容量扩展(OneBid 序列级 MoE 共享+稀疏专家)。共同点是:MoE 不再是单纯的效率工具,而是承载"全参与知识融合 + 低延迟执行"的结构性方案,且都已在数亿用户规模线上验证。
  • 💡 异构编排与 Agent 化研发成为工业落地新范式:Meta 两篇论文(Hybrid GPU-CPU Retrieval、EvoPilot)分别从服务架构(GPU 深度/CPU 广度双通路协同)和研发流程(LLM agent 自动提实验 + 确定性验证防误判)两个层面,展示了"不换模型换编排"的工程红利。这提示推荐工程师:在模型红利边际递减时,系统级编排与实验基础设施的 ROI 可能更高。
  • 🎯 自动出价/广告优化集中爆发:OneBid、ADAPT 两篇聚焦 auto-bidding,分别用统一基础模型 + 离线策略优化和解耦广告主画像 + 免训练适配解决 oCPX 多场景与冷启动问题,说明广告侧正从"每场景一模型"走向"统一骨干 + 场景化后训练"。

Section 2: 📋 今日速览

  • Alibaba / AMap 在高德生成式推荐中提出 IntBMoE,用小型学习码本 + 轻量 hypernetwork 组合专家基,解耦 MoE 的参与度、执行量与物化量,并以 DPRG 耦合双路径。服务数亿用户、60ms 延迟预算下线上 A/B UVCTR 相对 +2.4%。↗
  • Kuaishou 提出统一 oCPX 自动出价基础模型 OneBid,将 DT 单 Return-to-Go 扩展为 Return-to-Go + Cost-to-Go 双信号,配序列级 MoE 与 CROP 离线策略优化。线上 oCPX Ads 整体 ADVV +2.2%,ROAS 场景峰值 +13.1%,已全量部署。↗
  • Meta 针对万亿文档个性化搜索的"个性化-规模悖论",提出 GPU-CPU 异构协同检索:GPU 通路做十亿级池的检索+交互预排序,CPU 通路覆盖约 20 倍库存做轻量打分。全系统 A/B 对比纯 CPU 旧配置,相关性指标与实质互动均提升。↗
  • Meta 为 Video Deep Dive 召回系统提出 EvoPilot 人机协同在线 autoresearch 框架,用版本化 skill、typed adapter 与确定性检查防止 LLM agent 实验误判。37 天 campaign 修复评估缺陷后离线命中率 +3.20pp,7 天线上 A/B GSRR 相对 +0.66%。↗
  • UESTC / Alibaba / Hainan University 提出 ADAPT 自动出价框架,两阶段训练:对比学习提取纯净静态/动态画像,再将动态画像解耦为公共+私有部分联合条件化策略。支持新广告主免训练构建画像,大规模 benchmark 上稳定超越基线。↗
  • Rivian/VW、Stony Brook、Westlake 将安全门控的"可认证可用性"形式化为可规划资源,用精确二项反演 + 动态规划选择报告分区,揭示安全/粒度/流量三者权衡。在 LLM 工具调用、内容审核、病灶分类、推荐四类系统复现同一前沿。↗
  • HKUST 针对时尚互补推荐提出 APCL 框架,用相关性引导的自适应聚合显式建模间接用户-物品/物品-物品关系,并以功能视图对比学习对齐直接与间接表示。融合多模态视觉文本信息,在稀疏交互与冷启动场景下稳定超越基线。↗
  • Independent 研究多跳检索失败的可预测性,证明失败聚集于结构可预测子群,提出无需额外 LLM 调用的 RCS 置信度打分与校准弃答策略。MuSiQue 上 50% 覆盖率下 CWAR 从 39.5% 降至 20.6%,跨数据集迁移仅 -0.5pp AUC 损失。↗
  • Teads 提出 LLM 特征工程迭代框架,generator LLM 提语义定义、extractor LLM 物化特征、下游表格模型评估,并用 AUC 排序反转等模型错误转自然语言反馈引导搜索。特征发现提速最高 3×,生成特征在 SHAP 重要性中占主导且提供语义审计轨迹。↗

Section 3: 📰 Daily Digest

1. IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts

🔗 原文: https://arxiv.org/abs/2609.21346
🏷️ 来源: 🏭 工业界 | Alibaba, AMap
⭐ 评分: ⭐⭐⭐⭐⭐ (5/5)
🎯 推荐理由: 解耦MoE参与度/执行/物化三量,已上线高德生成式推荐,A/B UVCTR+2.4%。
📝 摘要: 论文指出 MoE 存在一个根本矛盾:稀疏路由省算力但牺牲参与度,稠密输出混合恢复全参与但执行量随专家数增长,参数合并则物化量随路由决策增长——三者无法独立控制。IntBMoE 提出 block-conditioned MoE,用小型学习码本固定 block 数量(物化有界),每层用轻量 hypernetwork 将专家池全部基合并为一个组合专家(参与度满),路由器仅将 token 送往少数 block(执行稀疏),并以 Dual-Path Residual Gating 通过乘法门控耦合两条独立组合路径。图像分类上稳定超越稀疏/稠密 MoE 基线,语言建模与序列推荐验证泛化性。该模型已全量部署于高德生成式推荐系统,在数亿用户、60ms 延迟预算下线上 A/B UVCTR 相对 +2.4%。局限在于核心实验以视觉任务为主,推荐侧收益通过线上指标间接体现。

2. OneBid: A Unified Auto-Bidding Foundation Model for Diverse oCPX Advertising Scenarios

🔗 原文: https://arxiv.org/abs/2609.21550
🏷️ 来源: 🏭 工业界 | Kuaishou
⭐ 评分: ⭐⭐⭐⭐⭐ (5/5)
🎯 推荐理由: 快手统一 oCPX 自动出价基础模型,双信号 DT + 序列 MoE + CROP,线上 ADVV +2.2%。
📝 摘要: 现有自动出价方法(规则控制、RL、Decision Transformer)与主流 oCPX 范式日益脱节:注册、购买等异构场景各配一个模型,管线碎片化且跨场景建模不足。OneBid 借鉴 LLM 基础模型思路,从异构 oCPX 日志学习可复用骨干,再经离线后训练适配各场景。方法上把 DT 的单一 Return-to-Go 条件扩展为 Return-to-Go(转化价值)+ Cost-to-Go(成本比)双原子信号,并加 value-aware 正则;用序列级 MoE(共享专家编码跨场景知识、稀疏路由专家捕获场景模式)在低延迟下实现容量随规模/数据一致扩展;后训练阶段提出 CROP,用 critic 对候选动作做组相对打分,规避 GRPO 式在线探索风险并约束策略漂移。已在快手全量部署,线上 A/B oCPX Ads 整体 ADVV +2.2%,ROAS 场景峰值 +13.1%。

3. Hybrid GPU-CPU Retrieval for Personalized Search at Ultra-Large Scale

🔗 原文: https://arxiv.org/abs/2609.21281
🏷️ 来源: 🏭 工业界 | Meta
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: Meta 工业级 GPU-CPU 异构协同检索系统,线上 A/B 验证,解决万亿文档规模个性化-覆盖矛盾。
📝 摘要: 万亿文档规模的 UGC 检索面临"个性化-规模悖论":全量库存放 GPU 显存过于昂贵,而 CPU 又无法在延迟关键路径上跑交互密集型模型。论文不提出新模型类,而是用编排解决——GPU 高深度通路在约十亿文档的精选在线池上融合检索与交互预排序,CPU 高广度通路在约 20 倍规模的独立库存上做轻量个性化打分,每请求可单跑或双跑,候选去重后共享下游排序。系统已上线,全系统 A/B 对比纯 CPU 旧配置在模型相关性打分与实质互动上均有提升,检索日志显示两通路贡献结构上不同的候选,容量规划量化了"深度给 GPU、广度给 CPU"的经济性。局限在于核心是系统编排创新而非新算法,A/B 具体数值未量化披露。

4. Verify, Don't Trust: Agentic Model Development for Video Discovery Retrieval at Scale

🔗 原文: https://arxiv.org/abs/2609.21257
🏷️ 来源: 🏭 工业界 | Meta
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: Meta 提出人机协同在线 autoresearch 框架,用确定性验证防止 LLM agent 实验误判,线上 GSRR +0.66%。
📝 摘要: LLM agent 已能自动提出、实现并评估模型改动,但在线 autoresearch 跨越异步系统、小时级变体与数周 campaign,即便跑完也可能因空改动、数据窗口泄漏、评估语义漂移或两臂走不同 serving funnel 而得出无效结论。EvoPilot 提出人机门控的长周期在线 autoresearch 方法:角色化 agent 通过版本化 domain skill 与 typed adapter 执行每轮,持久化记录保留实验与失败,确定性检查强制执行历史教训。在 Video Deep Dive 召回系统的 37 天 campaign 中,早期 primitive autoresearch 曾把 22pp 离线命中率下降错误归因于 interaction head,EvoPilot 追查到是既有评估缺陷(输出深度 3000 vs 600),修复后匹配对比离线提升 3.20pp;7 天随机线上评估 VDD 切片 GSRR 相对 +0.66%。局限是贡献偏工程方法论,human-gated 降低了自动化程度。

5. Auto-Bidding with Disentangled Advertiser Profiles and Train-Free Adaptation

🔗 原文: https://arxiv.org/abs/2609.21308
🏷️ 来源: 🏭 工业界 | UESTC, Alibaba, Hainan University
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 解耦广告主画像+免训练自适应,为自动出价提供个性化策略,工业落地潜力强。
📝 摘要: 画像方法在推荐领域已证明有效,但迁移到自动出价受限,因为提取纯净画像难、公共与私有信息难以同时建模、画像更新与冷启动适配困难。ADAPT 提出两阶段训练范式并支持免训练适配:Stage 1 在广告主 memory bank 上用对比学习提取纯净的静态与动态画像;Stage 2 将动态画像解耦为公共画像与私有画像,与静态画像联合条件化出价策略;训练完成后,新广告主可直接构建画像、存量广告主可更新画像而无需重训。方法基于 Decision Transformer 与双向注意力 Transformer 骨干,在大规模自动出价 benchmark 上稳定超越基线,消融验证各模块有效性。局限在于仅在离线 benchmark 验证,未报告线上 A/B,且 auto-bidding 相对推荐核心排序问题属偏边缘子问题。
  • 推荐系统
  • 日报
  • AI 技术日报 - 2026-09-23AI 技术日报 - 2026-09-22
    Loading...