推荐周报 2026-W37

本周 14 篇工作集中在三条技术主线上:跨阶段联合优化、电商搜索的业务目标对齐、以及多模态与检索表示中的信号保真。 主线一:级联系统的联合优化取代分阶段调参。 快手的 UniRec 把粗排与精排的融合模块放进同一计算图联合训练,线上 app usage duration +0.616%;华为的 PTDG 用低秩近似按 item 动态重连任务依赖强度,线上 CVR +1.2%、eCPM +1.9%;滴滴的 ALIGN-HOLD 则把 hold 策略的奖励从手工组合换成偏好模型学出来的密集信号,28 天 A/B 覆盖日均约 10 万次请求。三篇的共同指向是——级联阶段的独立调优已经触到天花板,收益要来自阶段间的梯度流动。 主线二:电商搜索从"语义相关"转向"业务对齐"。 阿里巴巴的 SAM-D2Q 用强化学习偏好对齐替代纯文本的 Doc2Query 扩展,AliExpress 线上 GMV +3.38%、Pay Count +2.27%;华为的 IGPO 走 training-free 路线,把策略与库存事实解耦,线上 CTR 相对提升 3.17%、审核 bad case 减少 38.9%。两篇都不改模型主体,改的是优化目标与决策边界。 主线三:多模态与检索表示中的信号衰减开始被显式建模。 小红书相关团队的 LARK 提出"跨模态稀释"并给出一套潜在对齐方案;MURAL 用不确定度感知融合压制噪声模态;Embedding Surgery 则在稠密检索侧做局部嵌入修正,DL-Hard 上 nDCG@10 相对提升最高 60.64%。

推荐算法日报 - 2026-09-12

级联系统跨阶段联合优化成为工业界新焦点:快手 UniRec 首次系统性地将粗排与精排的融合模块放入同一计算图联合训练,用双轴偏好对齐(垂直跨阶段一致性 + 水平紧凑聚合)解决上下游目标不一致问题,并引入属性组相对正则化防止高奖励区域过拟合。这标志着工业推荐从"各阶段独立调优"向"全链路端到端对齐"演进,对已有级联架构的团队有直接复用价值。; 合成数据微调的"隐性代价"被系统性揭示:Manulife 在 34,396 个技能的生产级路由系统上发现,合成数据微调虽提升分布内检索,却导致 OOD 召回

推荐算法日报 - 2026-09-11

偏好学习替代手工奖励,成为工业级决策优化的主流范式:DiDi 的 ALIGN-HOLD 用隐式市场偏好构建偏好对训练 Reward Model,替代 EXHOLD 手工组合奖励,配合 bandit 策略学习与 label-free 低可识别性交互过滤,在 28 天 A/B 中同时提升完单率与司机收入。这标志着工业界从"人工设计奖励"向"从行为轨迹中学习偏好"的迁移,对推荐/匹配系统中的时机决策(hold、延迟曝光、流量调控)具有直接借鉴意义。; LLM-as-a-Judge 的可靠性问题被系统性

推荐算法日报 - 2026-09-08

多模态与LLM深度渗透召回/精排全链路:今日多篇论文(SAM-D2Q、LARK、MURAL)将视觉-语言模型、多模态特征引入召回与排序,且不再停留在"拼特征"层面,而是通过RL对齐业务目标(GMV)、潜在token缓解跨模态稀释、不确定性感知融合抑制噪声,标志着多模态推荐从"能用"走向"好用"。; 从"静态模型"到"动态自适应"的范式迁移:Embedding Surgery(查询时局部更新embedding)、IGPO(训练-free库存感知策略优化)、PTDG(动态任务依赖图)三篇不约而同地挑

推荐周报 2026-W36

本周推荐系统研究围绕三条主线展开:生成式推荐从单点召回组件走向覆盖排序与推理的工业级框架;CTR 建模范式重新组织上下文单元以对齐真实决策过程;召回侧则在多兴趣与多模态的叠加下重新收敛效率与成本。 主线 1:生成式推荐从“解码物品”走向“统一生成与推理”。 腾讯的 TGR 将生成式范式推进到排序、端到端生成和推理注入三个方向,其中 CCFormer 在五个 A/B 场景取得显著提升;百度 ICGR 把查询意图一致性贯穿 SID 构建、SFT 与偏好优化全链路,线下 Recall@20 提升 21.7%。共同指向是——生成式推荐不再止步于“用模型替代索引”,而是开始重构排序与召回之间的边界。 主线 2:统一 CTR 模型开始以“上下文”为基本单元。 美团 UniCon 把请求上下文当作同质单元,统一历史与目标的结构,线上 RPM 提升 3.09%;字节 ReST 则在行为序列上验证了 LLM 式 Transformer 在基准上饱和后仍可沿推荐原生设计继续扩展。两篇的共同指向是——推荐特有的信号噪声与计算不对称需要架构级的重新设计,而非简单搬用 NLP 缩放法则。 主线 3:召回侧的成本意识回归。 Snap 的 SetMIR 把多兴趣召回建模为集合预测,用 presence score 动态削减 33% 的 ANN 查询;同一团队的 CAMIE 用单个多模态编码器替换碎片化的 I2I 检索栈;Mubadala 的 PULSAR 用两阶段池化索引把中位向量检索延迟降低 15.1 倍。三者的共同逻辑是——召回的性能度量不再只有准确率,查询预算和索引体积正在成为一等的优化目标。

推荐算法日报 - 2026-09-05

生成式推荐进入"语义ID + 结构优化"深水区:今日多篇论文(HypRQ-VAE、EPIC)聚焦生成式推荐的 item indexing 与解码过程优化。HypRQ-VAE 首次将双曲空间引入语义 ID 学习以适配长尾幂律分布,EPIC 则在扩散去噪中引入显式物品级后验竞争解决部分 SID 歧义。共同信号是:生成式推荐正从"能不能生成"转向"如何生成得更准、更覆盖长尾",双曲几何与后验条件化成为新抓手。; 蒸馏技术从"跨模型"走向"自蒸馏"与"任务语义迁移":SelfDR 提出 LLM 自蒸馏框

推荐算法日报 - 2026-09-03

生成式推荐从概念走向工业落地:今日多篇论文显示生成式范式正加速渗透工业推荐。腾讯 TGR 框架将生成式排序(GenRank)、端到端生成(GenRec)与推理注入(Reason)三路耦合推进,覆盖数亿用户;字节 ReST 则用推荐原生 Transformer 缩放行为序列建模,线上收入 +11.93%。生成式不再只是学术概念,已在精排、召回等核心环节产生可量化的业务价值。; 序列建模与 Transformer 的"推荐原生"改造成为竞争焦点:无论是字节 ReST 的 dual-gated att

推荐算法日报 - 2026-09-02

生成式检索(Generative Retrieval)进入工业深水区:今日 5 篇高星论文中 4 篇聚焦生成式检索(ICEGR、CHAP、HF-SID、TAAL、MERIT),且百度、美团、阿里等大厂均有线上 A/B 验证。核心战场已从"能不能用"转向工程落地:CHAP 用残差级联将多步解码压缩为单步推理,TAAL 定位到 91.9%-96.6% 的检索失败发生在 beam search 前两步,HF-SID 在表示层修复地理/数值/结构保真度——推理延迟与 SID 信息保真度是当前落地的两大瓶

推荐算法日报 - 2026-09-01

[Agent 驱动的检索范式兴起]:从 ITER 到 PULSAR,检索系统正从"单次查询-返回结果"转向"多轮交互-轨迹学习"。ITER 利用 agent 历史子查询序列作为训练信号,PULSAR 面向企业级视觉文档 RAG 场景,两者都强调利用交互上下文优化检索质量,这预示着推荐系统将从被动响应转向主动推理。; [多模态与异构特征的"选择性"融合]:AMUR 和 HubMixer 不约而同地放弃了"全量融合"思路——AMUR 用信息论筛选与用户兴趣强相关的模态信号,HubMixer 则通过潜

推荐周报 2026-W35

本周推荐系统研究围绕三条技术主线展开:语义 ID(Semantic ID)的工程化打磨进入深水区、检索系统从"静态管道"转向"查询自适应"、以及 LLM/Agent 在推荐链路中的角色从"增强组件"演化为"闭环决策者"。 主线 1:语义 ID 从"能生成"走向"能用、好维护、不漂移": 快手的两篇工作分别从码本结构和动态更新入手——单级大码本替代多级残差量化,把三级 SID 压成两级,自回归解码 FLOPs 降了 47.93%-48.70%,在线消费指标 +0.792%;TAGR 则针对直播广告场景设计了动态语义 ID(LSID),进房率 +8.5%、收入 +16.1%。腾讯的 Tlow 用 flow-based 变换替代 RQ-VAE 解决码本依赖问题,在微信多模态检索中 CTR 提升 10.32%。三篇工作共同指向一个判断——SID 的工程稳定性(而非生成准确率)已经成为落地瓶颈。 主线 2:检索效率从"一刀切"转向"查询与场景自适应": Alibaba 的 TransRetrieval 用加权平均聚合解决特征异质性导致的 token-norm 发散,在 40 亿交互数据集上验证了 log-linear scaling,线上收入 +2.53%。AdaWidth 则更进一步——为不同查询动态分配不同维度的嵌入宽度,在 6 个任务上以 55%-84% 更少的维度持平 SOTA 的 NDCG@10。VK 的多哈希用户嵌入将 ID 嵌入表缩减 98%,单节点时序邻居采样成本从 O(deg(v)+k) 降到 O(log(deg(v))+k)。效率优化的粒度正在从"系统级"下探到"查询级"。 主线 3:LLM/Agent 从"推荐引擎"走向"系统自我进化的驱动者": Alibaba 的 Astar 把"提出演化方向"这个此前依赖资深专家的环节交给模型——Astar-8B 在真实执行评估中单次提案成功率 0.6786,是人类专家(0.3229)的两倍。PayPal 的 SCOUT 则把 MCP 工具暴露重构为上下文选择问题,工具 token 消耗从 140.2k 降到 1.3k(降 99%)。这两篇都指向同一个趋势:LLM 不再只是推荐模型的一部分,而是开始接管推荐系统自身的迭代过程。

推荐算法日报 - 2026-08-29

[LLM 从"推荐引擎"走向"系统自进化引擎"]:今日多篇论文(Astar、ProRetrieval、CoVeMem)不再将 LLM 仅用于生成推荐结果,而是让其承担更高阶的职责——Astar 学习从工业迭代历史中提出系统演化方向,ProRetrieval 让 LLM 充当检索编排器合成可执行程序,CoVeMem 则让 LLM 通过可梯度更新的向量记忆理解用户。LLM 正在从"被调用的模型"变成"驱动系统迭代与决策的智能体"。; [工业级 GNN 与检索系统走向"规模化工程创新"]:VK 的好友

推荐算法日报 - 2026-08-28

Scaling Law 正式进入工业推荐检索:TransRetrieval 与 AMBER 两篇工业界论文(阿里、Meta)不约而同地将"缩放定律"引入推荐系统。前者验证了检索阶段计算量与 Recall 之间存在 log-linear 关系,后者提出"快照分辨率"(snapshot resolution)作为新的缩放维度。这意味着工业推荐正从"堆模型容量"转向"系统化扩展计算预算",为算力分配提供了理论依据。; LLM 与经典推荐架构加速融合,但走向"轻量落地":今日多篇论文展示了 LLM 落地