推荐算法日报 - 2026-08-08

生成式推荐从"单点尝试"走向"端到端替代":今日多篇论文(Gryphon-v2、QDET、Align-RAG)共同指向一个趋势——用单一生成式模型替代传统多级级联架构。Gryphon-v2 用"生成+排序"一体模型替换了 Yandex Music 生产环境 15+ 候选生成器的级联系统;QDET 用 7B 模型在专业任务上超越 671B 通用模型。核心方法论在于蒸馏(Rollout Distillation)和多任务微调,让紧凑模型在保持生成能力的同时获得排序级精度,且服务延迟与级联持平。这对工

推荐算法日报 - 2026-08-07

生成式推荐全面渗透排序链路:今日多篇论文将生成式范式引入激励分配(快手 GOAL)和重排阶段(京东 DEGR),用条件序列生成替代传统打分/优化,配合强化学习或 ORPO 做偏好对齐。生成式模型正从召回/粗排向精排、重排、激励分配等更细粒度决策场景渗透,成为工业界探索的新方向。; 多目标优化与约束控制成为工业落地核心痛点:直播场景的稀疏延迟多行为建模(Twitch)、激励广告的 ROI 全局约束(快手)、重排的即时-探索价值平衡(京东),都指向同一个问题——如何在多目标、多约束下做序列级决策。M

推荐算法日报 - 2026-08-06

长序列建模进入"压缩-感知"双轨时代:今日多篇论文聚焦用户行为序列的规模化处理。SITA 通过语义兴趣令牌实现目标感知压缩,KGD 提出知识几何解耦应对流式分布漂移,两者均强调在压缩表示的同时保留目标自适应能力,且都在工业数据集(快手、Shopee)上验证了可扩展性,标志着长序列建模从"检索 vs 压缩"的对立走向融合。; LLM 全面渗透推荐全链路,从"能用"走向"可控":LLM 的应用已覆盖重排(InvariRank 评估位置偏差)、冷启动(NAVER WEBTOON 用 LLM 先验暖启动

推荐算法日报 - 2026-08-05

[生成式推荐进入工程化落地期] 今日多篇论文(DME、GRACE、Exp-RSFT、SmartGR、OMEGA、UnpairGR)聚焦生成式推荐,但重心已从"能否生成"转向"如何高效服务":GRACE 解决广告场景的资格匹配与延迟瓶颈,SmartGR 用层级感知蒸馏压缩推理成本,Exp-RSFT 则从训练侧应对稀疏噪声反馈。生成式推荐正从实验室走向工业级部署,工程优化(KV cache、beam search、蒸馏)成为核心议题。; [多模态与语义信号深度融入召回检索] DME 统一图文视频嵌入

推荐算法日报 - 2026-08-04

LLM 生成式检索进入生产落地期:从 Snapchat 的 SnapLGR 到 POI 场景的 Think2Go,LLM 不再停留在离线实验,而是通过 Semantic ID 构建、继续预训练(CPT)与推理优化(TensorRT-LLM beam search)三件套,真正扛起线上召回流量。核心难点已从"能不能生成"转向"如何在延迟和成本约束下生成得又快又准"。; 多模态语义标识符(SID)成为连接内容与行为的枢纽:淘宝闪购 GALA、SnapLGR、PaletteID 不约而同地围绕 SID

推荐周报 2026-W31

本周推荐系统研究呈现三条交织的技术主线:生成式推荐的工业部署密度达到新高,多家公司密集披露线上收益;LLM 推荐从显式推理转向潜在推理,推理成本成为规模化部署的首要约束;工业基础设施论文集中解决训练-服务不一致、推理计算复用和冷启动问题。三条线共同的指向是——推荐系统正从"模型能力竞赛"转向"系统工程竞赛"。 主线 1:生成式推荐进入多目标、可控的工业化阶段。 快手的 Multi-Decoder OneRec 用多解码器结构解耦共享表示与目标特化,线上 app 使用时长 +0.37%、冷启动 +2.09%;京东的 OxygenREC-v2 以 3B 参数 MoE 将判别信号内化进生成式骨干,GMV 提升 2.8%-6.8%。生成式推荐的竞争焦点从"能不能召回"转向"能不能控方向、调目标"。 主线 2:LLM 推荐的推理方式从显式 CoT 转向潜在推理。 快手的 WhisperRec 将教师 CoT 压缩为潜在 token,SID@64 提升 17.44%,在线推理吞吐量提升超 10 倍;LaRec 用个性化高斯混合分布采样推理起点,探索多路径潜在推理。显式推理的质量天花板仍在,但推理成本决定了谁能在线上活下来。 主线 3:工业推荐系统的工程深化。 Meta 的 ROCS 将请求侧计算共享从特征交互扩展到序列模型,检索模型 QPS 提升 3 倍;Memory Layer 用与模型共训的键值缓存统一训练-服务表示,NE gap 缩小 86%。训练和服务的结构性对齐,正在成为比模型结构更重要的优化杠杆。

推荐算法日报 - 2026-08-01

[生成式推荐进入"反馈闭环"时代]:今日多篇论文(Kuaishou 的 Feedback-Grounded Policy、Alibaba 的 LoopMemGR、MBZUAI/JD 的 Personalized NL)共同指向一个趋势:生成式推荐不再满足于"用 LLM 理解用户",而是开始将推荐决策本身作为可学习的对象,通过引入反馈信号、经验记忆、协同信号来弥合"理解"与"行动"之间的鸿沟,并借助知识蒸馏实现 LLM-free 的工业级在线推理。; [推理效率成为工业级落地的核心战场]:Meta

推荐算法日报 - 2026-07-31

生成式推荐进入"多目标可控"时代:今日多篇工业界论文(快手 Multi-Decoder OneRec、阿里 Gwhere、快手 PSG)不约而同地聚焦于生成式检索/重排的工程化落地。核心不再是"能不能生成",而是"如何在同一框架下解耦多目标(时长、互动、冷启动)、显式控制配额、并保证候选互补性"。LoRA 专家隔离 + 协调解码 + 约束束搜索成为标配方案。; 位置编码与推理效率成为生成式推荐的新瓶颈:Google 的 ClockRoPE 从理论层面证明任意注意力调制函数可由其傅里叶变换诱导的随

推荐算法日报 - 2026-07-30

生成式推荐进入价值对齐与工程优化深水区:今日多篇论文聚焦生成式推荐,但已从“如何生成”转向“如何生成得更好”。RGD 提出奖励引导解码,在不重训模型的前提下对齐业务价值;SPARC 和 TopoGR 则分别从属性压缩和拓扑结构保留角度优化语义 ID 的表示质量。这表明生成式推荐正从概念验证走向工业级精细化调优。; LLM 赋能推荐系统走向“轻量化”与“解耦化”:Meta 的 LLM 双塔论文证明,将 LLM 作为语义表示骨干而非生成引擎,可兼顾效率与效果;Spotify 的假设驱动货架生成系统将

推荐算法日报 - 2026-07-29

生成式推荐走向全链路统一与工业级落地:今日多篇论文(OxygenREC-v2、UniR²、LaRec)聚焦于用生成式范式统一召回与排序,甚至将多目标优化内化到单一Decoder-only模型中。京东和快手分别展示了3B MoE和统一序列架构的线上收益,标志着生成式推荐从概念验证进入大规模工业部署阶段。; LLM/Agent推荐从“大脑”转向“纠错系统”:Melo和SMART等工业论文揭示了一个关键洞察:LLM推荐在工业规模下的瓶颈不再是模型推理能力,而是如何检测和修复实体幻觉、长尾退化等运行时错

推荐算法日报 - 2026-07-28

全链路冷启动与去偏成为工业界标配:Pinterest 的 PinEqualizer 展示了从召回、粗排、精排到重排的全漏斗冷启动与去偏方案,已部署两年并显著提升探索与用户参与。这表明工业界正从单点优化转向端到端系统级设计,以系统性解决新内容曝光不足和模型偏置问题。; 跨域与图粗化技术应对数据稀疏与规模挑战:面对数据稀疏和探索不足,Cross-Domain OPE/L 通过引入源域数据增强目标域策略评估与学习。同时,针对大规模图推荐的可扩展性瓶颈,图粗化+标签传播方案在电信场景下实现了 NDCG@

推荐周报 2026-W30

本周推荐系统研究围绕三条技术主线展开。生成式推荐从侧重“能生成”转向“生成得好且经济”——BARGE 解决了语义 ID 的单序列扁平化问题,TSGR 将商业价值嵌入检索过程,DLMRec 用扩散替代自回归。排序模型侧向于统一架构与不确定性建模:WHALE 融合 Wukong 和 HSTU 两种高性能主干,UAME 将预测不确定性用作标签偏差的校正项。LLM 应用从纯推理转向状态化与闭环优化:RecGPT-V3 引入持续用户记忆,RECAP 用 GRPO 优化用户画像。 生成式推荐从“能跑”走向“跑得稳”: 腾讯的 BARGE 识别出生成式推荐的两个结构性缺陷——多 token ID 序列化破坏物品级结构、分层码本训练推溯不一致导致语义漂移。BARGE 通过 Item Context-Aware Attention(ICA)恢复物品级上下文,配合 Hierarchical Path Reranking 和 Dual-Path Decoding 将线上 CTR 提升 0.60%。与此同时,阿里巴巴的 TSGR 从另一个角度切入:让语义 ID 编码过程本身就对商业价值敏感,线上 GMV 增长 1.64%。两篇的共同指向是——生成式推荐的核心瓶颈不在生成能力,而在 ID 设计与解码结构。 排序模型走向架构统一与可解释的不确定性: Meta 的 WHALE 将 Wukong(高阶非序列特征交互)和 HSTU(长用户行为序列)在每一层通过注意力融合模块连接,让高阶特征交叉能反复从长历史中检索细粒度证据。不替换现有主干,而是让它们协同工作。快手的 UAME 改变了一个基础假设:用户满意度标签本身就是有偏的行为代理,模型不应该忽略这种不确定性。UAME 将预测建模为高斯分布,用不确定性程度加权样本损失,在短视频推荐上用户满意度提升 0.32%。 LLM 应用从辅助工具到推荐核心引擎: 淘宝的 RecGPT-V3 是一个里程碑式的系统级更新——Memory Hub 将用户建模计算削减 55.8%,Latent Intent Reasoning 将输出 token 成本降低 200 倍,同时 GMV 增长 3.97%。它证明多模态推理可以在线上以可接受的资源代价运行。快手的 RECAP 用 GRPO 优化 LLM 生成的用户画像,线上用户使用时长提升 0.139%。结合之前的研究,LLM 在推荐中的应用正在从“能不能用”转向“怎么用得既好又省”。

1
...
34567
...
16