- 标签:
- 日报 (277)
- 推荐系统 (191)
- 技术趋势 (153)
- AI (149)
- 周报 (54)
- 论文 (33)
- 推荐 (9)
- 思考 (8)
- LLM (6)
- Agentic Engineering (5)
- 深度学习 (4)
- 工具 (3)
- Transformer (3)
- Harness Engineering (3)
- 强化学习 (1)
- 思维模型 (1)
- 管理 (1)
- 生成式 (1)
本周推荐系统研究集中在四条技术主线:生成式推荐进入工业深水区、排序模型向长序列和细粒度语义演进、召回系统在异构索引和因果优化上取得突破、LLM增强推荐从实验走向工程落地。34 篇论文中有 23 篇来自工业界(含 18 篇已部署),13 篇报告了线上 A/B 结果。 主线 1 "生成式推荐从 DocID 设计到微调对齐": 阿里巴巴的 CRID 将业务价值排序直接编入 DocID,在 300M 商品库上全流量 GMV +1.06%。GFlowGR 用 GFlowNet 微调生成式推荐,在淘宝搜索广告实现年收入 +0.4%。美团 NONTP 通过时序对比学习和跨域学习扩展 NTP 训练信号,线上 CTR +1.8%、GMV +2.1%。三篇的共同指向是——生成式推荐正从 "能生成" 转向 "会优化"。 主线 2 "排序模型追求深度解耦与长时建模": Meta 的 SlimPer 将个性化排序建模为 <user, item> 知识库迭代精炼,支持 10k+ 历史事件且 O(N) 复杂度,部署于 Instagram。Yandex 的 Long-History User Transformers 通过离线编码 + 缓存 + 轻量在线模型解耦长历史推理,搜索广告 +2.77%。阿里 SAM 用饱腹感门控显式建模兴趣生命周期,将购买后重复率降低 60%。 主线 3 "召回系统的工程与因果范式": Pinterest 的因果检索框架减少 85% 购物触发器而不损关键会话。MESH 通过模块化架构和门控偏置校正,使新鲜物品缩放指数提升 14 倍,用户留存 +0.46%。Microsoft 的 FlashTrie 将生成式检索的约束解码全量迁移至 GPU,800M 关键词库 <3ms,线上收入 +0.71%。 主线 4 "LLM 推荐的轻量化和 Agent 化": Vrbo 用训练免费的 LLM 合成查询解决长尾覆盖问题,缩小 3B 模型与 API 模型的召回差距至 <1%。QuintoAndar 的 LLM 重排序融合对话上下文在房产搜索中 CTR +5.3%。Kuaishou 的 RashomonLLM 将解释生成与预测耦合,在直播 CTR 上 AUC +2.3% 且解释质量提升 8.7%。
本周推荐系统研究围绕三条技术主线展开:生成式检索的工业落地与理论深化、LLM/Agent从概念验证走向真实部署、以及精排/联邦学习在工业环境中的鲁棒性优化。 生成式检索加速落地与多兴趣精细化: 快手在推送通知系统中部署了异构生成式架构 HGenPush,采用非自回归多token预测替代传统自回归解码,实现DAU提升0.181%。Walmart将库存感知RAG引入赞助搜索,InvAwr-RAG将广告填充率提升68%。理论层面,BACH通过贝叶斯混合头解决多兴趣双塔的路由坍塌问题,在三个基准上刷新召回率;DaV-Gen提出draft-and-verify机制统一生成式检索的效率与精度。此外,Signed MaxSim首次从理论上证明MaxSim的表达力不低于向量内积,并扩展至任意实值内积。 LLM/Agent推荐从原型走向生产: Meta的 SCOReD 是本周最突出的部署工作——通过学生感知的CoT优化将教师推理轨迹适配到小模型,线上获得NDCG+1.56%和Recall@5+1.9%,同时推理长度减少27.3%。Walmart使用LLAMA2 7B+LoRA做广告相关性三分类,准确率89.43%超越GPT-4。学术方面,MMEACR提出双轨记忆架构加强Agent的视觉推理能力;LBR系统性地揭示了LLM推荐中的长度偏差,并提出轻量校正方案(NDCG@5提升16.82%);综述论文Autonomous Information Seeking为Agent推荐建立了三范式分类法。 工业级精排与联邦学习优化: 快手的 PIT-SUN 是一种可直接部署的经验边际变换框架,通过对重尾目标进行概率积分变换与期望一致性恢复,在线上全面改善点精度和校准。FeLiX则针对联邦学习中客户端流失问题,提出流式感知可用性层级和延迟鲁棒聚合,将收敛时间缩短2.37倍。
本周24篇论文中,4篇来自工业在线部署(Meta、Netflix、阿里巴巴、快手),覆盖召回、排序、重排、全链路生成阶段。核心技术密度的分布逻辑在变——生成式推荐从"能生成"走向"能推理",召回从嵌入匹配转向导航式探索,排序阶段则在约束和解释之间寻找平衡。 生成式推荐进入"推理+强化学习"时代: GR2、ShopX和GenPage在同一周展示了三种不同的生成式架构走向。GR2在重排阶段首次引入推理链(CoT)和RL后训练,在工业流量上R@1提升18.7%。ShopX将生成式推荐从候选生成推向"意图到物品"的端到端执行,在淘宝Agent场景下复杂请求满足率提升55-75%。GenPage走得最远——用单Transformer替代Netflix整套多阶段主页流水线,核心指标+0.24%的同时延迟降低20%。三篇的共同指向是:生成式推荐的核心壁垒已从"能否生成"转向"能否在推理质量与部署效率之间找到工业可行解"。 召回从静态匹配走向动态图探索: Meta的硬负采样通过LLM聚类生成实时同簇负样本,在线召回率+8.5%、流行度偏差-12.3%。快手的IID-Nav将召回建模为自主图探索,支持间接无限深度遍历。Kuaishou的POEM利用多任务排序分数构建偏序序列,实现请求级别的实时兴趣更新。三条技术路径共享一个趋势:召回正从静态嵌入查询转向动态、上下文感知的行为建模。 约束优化与可解释性重回视野: Avito的PermR在5600万搜索查询上证明了相邻交换法能在生产延迟内逼近整数规划收益。KakaoBank的ChunkGroupSHAP用分组Shapley值弥合了词级解释与密集排序器之间的粒度鸿沟。这两个工作提醒行业:在大模型热潮中,渐进式工程优化和可解释性工具仍能产出具象收益。
本周 12 篇论文中,工业部署论文占据主导——8 篇来自 YouTube、TikTok、快手、腾讯、沃尔玛等一线平台,均有线上 A/B 实验指标。研究聚焦于三个相互交织的方向:生成式推荐与LLM增强、大规模检索的 GPU 加速、以及工业系统的架构与归因优化。 生成式推荐从“生成物品 ID”走向“生成物理物品”: 快手提出的 RaG(Kuaishou)将生成式推荐与视频生成统一,在 4 亿 DAU 平台上实现广告收入 +1.87%。YouTube 的 TokenMinds(YouTube)将 Semantic ID 从物品侧扩展到用户侧,生成离散用户 token 与稠密 embedding 双输出,覆盖全量用户流量。两条路线指向同一个判断——生成式推荐正在从离线一致性验证进入线上收益兑现阶段。 用户建模从“稠密向量”向“离散语义 ID”切换加速: 快手与 YouTube 几乎同时发布了基于 SID 的框架。这不仅是表征形态的变化,更意味着推荐系统与 LLM 世界的底层 token 空间开始对齐,跨场景统一(短视频/长视频、推荐/广告)的成本大幅降低。 工业归因与缩放方法论走向精细化: TikTok 的 归因校正框架(TikTok)将因果实验与每日生产归因对齐,将蚕食率降低约 15 个百分点。腾讯的 NOVA(Tencent)用智能体自动化架构演化,L3 任务线上 GMV 提升 +2.02%。快手的 UniFormer(Kuaishou)提出模型中心缩放框架,将建模空间显式分解为特征和任务两个维度。三者共同揭示——当模型架构趋于收敛,工程自动化和测量准确性成为工业竞争的新壁垒。
本周推荐系统研究集中在三个方向:大规模图检索的全生命周期协同设计、基于Transformer的序列建模在多平台落地、以及多任务排序架构从DNN向Transformer native的迁移。Meta、Airbnb、Alibaba、Shopee、NetEase Cloud Music等公司各自发布了线上部署工作,提供具体的AB指标。 主线1(大规模图系统的端到端设计): Meta的RankGraph-2(Meta)将图构建、表示学习、在线服务三个阶段耦合优化,在百亿节点图上计算成本降低83%、召回率是GAT+Deep Graph Infomax的3.8倍、线上CTR+0.96%、CVR+2.75%。同方向,HighLevel的ScoreGate(HighLevel)用双分数统计融合控制RAG检索数量,生产环境减少34.8% token、召回率97.77-99.34%。 主线2(生成式推荐从理论走向生产): Airbnb的JourneyFormer(Airbnb)在搜索排序中部署基于Transformer的序列模型,处理长且稀疏的用户行为;阿里巴巴的OneBar(Alibaba)用端到端生成式框架做视频电商查询推荐,GMV提升21.67%。两篇共同指向——生成式推荐需要在实际约束(冷启动、延迟、标签稀疏)下做工程折中,而非单纯追求离线指标。 主线3(多任务排序的Transformer-native范式): Shopee的OneRank(Shopee)消除编码器-预测器分离,在Transformer内部做任务私有通道和梯度分离,线上CTR+1.2%、CVR+0.8%。网易云音乐的PIANO(NetEase Cloud Music)用可学习[CLS] token实现列表级多目标重排,CTR+0.62%、CVR+4.45%。两者都说明:将多目标推理内化到Transformer堆中比外挂MLP更有效。
本周推荐系统研究围绕三条技术主线展开:生成式推荐从架构完备走向工业级工程落地,其中编辑性、长序列建模、物品级评分等关键能力被逐一攻克;LLM增强的推荐从离线推理迈向在线实时,谷歌与快手等团队实现了十亿用户规模的实时用户画像与意图推理;召回排序系统的成本与效率优化出现系统性方案,小红书以90%硬件成本节省为代价将聚类ANNS部署至SSD存储,同时CTR模型的残差路径设计开始突破缩放定律瓶颈。 主线1(生成式检索工程化): 快手推出的OneRetrieval首次实现了可编辑的生成式检索,在替换倒排索引分支后显著提升订单量与CTR;Yandex的Gryphon引入联合训练的物品级评分组件,替换超过15个候选生成器与粗排阶段,召回量Recall@1000提升3.7%;京东的AdaGRPO通过自适应门控GRPO损失,将HR@10从11.01%提升至12.18%;Meta的Beyond Item IDs提出Global-Aware Compression Transformer,将峰值内存降低一个数量级;阿里的SSRLive通过动态语义ID融入用户-主播交互信号,线上观看时长+3.38%。 主线2(LLM推荐实时化): 谷歌的LLM-Based User Personas框架实现了十亿用户规模的实时自然语言用户画像生成,结合知识蒸馏与异步推理在线上A/B测试中显著提升用户价值;快手的AIR通过离线生成原子意图、在线检索组合的方式实现了400倍推理加速,GMV+3.446%;DoorDash的Mind the Gap利用分层RAG从餐厅订单中生成多级分类特征,在零售品类上CTR+2.1%;OPPO的ToolRec为小布助手(1.5亿月活)构建了双层级点击校准机制,CTR显著提升。 主线3(召回排序系统效率优化): 小红书的Helmsman在40台SSD服务器上替代了原需35000核与0.35PB DRAM的HNSW集群,硬件成本节省90%;DeRes通过双路径残差架构在工业CTR数据集上AUC+0.32%,且计算-AUC缩放定律显示8层DeRes匹配16层OneTrans(2倍计算节省);Meta的DUET将用户行为分离为点击与转化两个流,分别用专用Transformer预训练,离线NE降低0.38%;eBay的Representation Curriculum通过分阶段训练缓解曝光依赖信号,冷启动Recall+5.2%。
本周推荐系统研究围绕三条技术主线展开。 主线1:生成式推荐从“能跑”走向““跑得稳”——语义ID与推理能力成为工业焦点。 Pinterest的UniPinRec实现了检索与排序的全栈统一(线上engagement +1%,延迟-11.1%),跳出了生成式推荐仅做检索的边界。快手的OneReason(线上部署)则揭示了思考模式在生成式推荐中无效的根本原因——感知与认知双因素缺失,并给出三级CoT格式和专化-统一训练的解决方案。两者的共同指向是:生成式推荐的核心瓶颈已从模型架构转移至数据形态(语义ID)与系统协同。 主线2:跨域冷启动从“搬特征”到“学迁移”——LLM作为跨域桥接器开始大规模落地。 快手的RGCD-Rep(服务4亿+用户)用MLLM推理蒸馏将短视频用户兴趣迁移至直播,冷启动参与度显著提升。Meta的Quantizing Intent论文(线上AUC +1.522%冷启)则将有机feed行为量化为语义ID注入广告排序,证明行为富集度决定跨域迁移质量。两篇的共同发现是:跨域迁移的关键不在对齐特征,而在构建可迁移的语义表征。 主线3:LLM/Agent增强推荐走向行业差异化——从通用检索到垂直场景的深度适配。 理想汽车的HPRO(132天A/B,销量+9.5%)将偏好优化引入销售线索评分,解决稀疏监督和漏斗层级问题。快手的Taiji(CTR +12.4%,收入+15.2%)提出帕累托最优策略优化,在语义与ID之间找到最优权衡点。Syft的DynaTree(生存率提升1.5倍)则用离线智能体建树+在线轻量子树选择解决时间敏感新闻检索的效率问题。这些工作表明,LLM在推荐中的应用正从“通用方案”走向“场景定制”。
本周推荐系统研究围绕三条技术主线展开。 工业级知识蒸馏进入迁移率量化时代: 字节跳动、Meta、微软、阿里分别展示了大规模蒸馏框架。字节的Rec-Distill(24B教师、20K序列)实现蒸馏迁移率>60%,阿里GPlan将LLM推理压缩为隐式token,Meta的LoopFM通过结构化中间表示让蒸馏迁移率翻倍,微软HARNESS-LM以190M参数恢复教师98%精度。四篇的共同指向是——蒸馏已经不只是模型压缩手段,而是把大模型能力“货币化”为可量化的业务指标。 生成式推荐从项目生成走向意图序列与条件生成: 阿里QGS在Quark搜索部署conditional next-item预测,Netflix揭示1B参数生成式推荐中不同任务的缩放天花板,清华SID碰撞分析发现Hit@10被高估103%。三篇共同说明——生成式推荐正在进入精细化评估和条件控制阶段。 推荐系统缩放从“堆参数”转向多维协同与测试时计算: Coupang系统研究CVR模型在骨干、嵌入、数据三个维度的可加缩放效应;阿里UTTSI首次将test-time compute引入CTR,无模型修改下CTR提升5.3%;Meta的rank-aware decomposition使DLRM吞吐量提升87.5%。缩放的核心矛盾已从“能不能大”变为“怎么用得巧”。
本周推荐系统研究围绕三条技术主线展开:生成式推荐从“验证可行性”走向“工业级部署与优化”,去偏与校准技术从单一方法走向融合框架,搜索召回系统在冷启动和异构加速上取得具体突破。 生成式推荐进入工业化深水区: 快手、腾讯、美团的四篇部署论文覆盖了推理增强(RPORec)、长兴趣建模(GenLI)、世界知识融合(LWGR)等核心痛点。共同的指向是——生成式推荐的核心问题已从“能不能用”转变为“如何稳定、可控地替换或增强传统pipeline”。 去偏与校准从“纠正均值”走向“治理分布”: 字节跳动的PEARL、快手的DADF、Pinterest的PRL-PUTS分别从对比百分位、残差校正、效用权重调优三个角度,给出了生产级解决方案。其中PEARL的Watch Duration +2.10%和DADF的时间花费+0.347%表明,分布级别偏差校正仍有显著收益空间。 搜索召回系统聚焦冷启动与系统效率: 淘宝的GrowthGR(新商品GMV+5.3%)和Airbnb的合成数据框架(查询长度KL散度降至0.66)展示了LLM+反事实推断在冷启动中的工程潜力。华为与京东合作的Ascend-RaBitQ将billion-scale向量搜索的NPU加速提升至4.6倍,为大规模召回提供了硬件-算法协同的新基准。
本周推荐系统研究围绕三条技术主线展开:生成式推荐架构从tokenizer优化走向推理效率提升,LLM增强推荐从孤立的辅助模块演化为具备记忆与推理能力的智能体,系统工程层的量化与线程编排成为工业部署的实际瓶颈突破点。 主线 1“生成式推荐的解耦与加速”: 阿里在TmallAPP上线 CQ-SID / EG-GRPO,以类别感知语义ID和专家引导强化学习实现GMV +1.15%,生成召回贡献72.63%购买。Tencent与清华的 AsymRec 提出非对称连续-离散框架,用多专家投影替代对称量化,平均提升15.8%。美团的 DIG 将tokenizer嵌入判别式排序模型端到端训练,同时提升检索与排序。Snap的 SID-MLP 用MLP蒸馏替代Transformer解码器,加速8.74倍且精度持平。这些工作的共同指向是——生成式推荐正在从“能跑”向“跑得稳、跑得快”过渡,核心手段是解耦输入输出表示与替换密度过高的结构。 主线 2“LLM推荐向推理与记忆演进”: Microsoft Research的 PGR 引入前瞻引导检索,用Tree-of-Thought扩展查询步骤,在MemoryQuest上召回提升近3倍。美团的 RecRM-Bench 提供了100万条结构化条目覆盖指令遵循、事实一致性等四维奖励,为智能体推荐系统提供基础。SDAR(美团)用门控辅助目标稳定OPSD蒸馏,在ALFWorld、Search-QA等基准上相对GRPO提升7-10%。差异在于——PGR侧重检索前的前瞻推理,SDAR侧重训练中的稳定性,但共同挑战是LLM在推荐场景中的记忆与推理能力仍远未成熟。 主线 3“系统协同设计成为工业落地关键”: Meta的 LoKA 通过Probe-Mods-Dispatch三件套在FP8下实现训练吞吐+20%、推理加速+40%且无质量损失。Xiaohongshu的 CCD-Level Thread Orchestration 利用CCD架构的缓存特性,在ANNS服务上取得3.7x吞吐提升和30-90% P999延迟降低。Baidu的 Efficient Generative Targeting 结合量化、稀疏化和并行验证,实现1.8倍推理加速并部署于广告系统。这些工作表明——模型架构改进的边际效应递减时,硬件感知的系统优化正成为实际收益的主要来源。
本周 22 篇论文里能看出两条主线:生成式推荐继续在 Semantic ID 这一层做深耕,检索 / agentic search 这条线则在重写检索接口本身。另有三篇围绕 RAG 工程化(合成表格扩散、自动化 RAG 管线、生产级数据层),列入论文速览的"其他"部分。 生成式推荐侧四篇论文把更多结构化信号——商业价值、地理坐标、协同信号、长尾边界——直接压进 Semantic ID 这一层。腾讯(微信视频号广告)的 UniVA 做到 SID/decoding/serving 三段同时注入 eCPM 信号,离线 Hit Rate@100 +37.04%、线上 A/B GMV +1.5%;UCSD × Snap 的 Latte 从理论上证明自回归 SID 解码树会把语义近的 item 强行拉到一起,再给出在 token 前缀挂 latent 的低成本修补,NDCG@10 +3.45%。 检索侧的故事更激进。一周之内出现三种"重写检索接口"的反命题:Meta Superintelligence Labs 的 SIRA 把多轮 agent 探索压成一次 LLM-corpus 双向扩展的 BM25;Texas A&M / Stanford / UWashington 等 19 作者的 DCI 直接删掉 retriever,让 Claude Sonnet 4.6 用 grep + bash 在原始语料上调查(BrowseComp-Plus accuracy 从 69.0% 升到 80.0%、API 成本降 29.4%);UC Berkeley 的 T3 把 RAG 的"corpus"从文档换成 LLM 思维轨迹,AIME 上给 Gemini-2.5-Flash 注水 +56.3%。MIT 同期放出 OBLIQ-Bench,把"为什么必须改接口"这件事量化——传统 BM25 / dense / late interaction 在隐含意图查询上几乎全部接近 0 NDCG@10。 工业精排和召回侧维持"先拆瓶颈、再谈结构"的节奏。Meta Ads 的 IEFF 把特征下线从 3-6 个月重训压到不需重训,效率类 rollout 提速 5×;阿里淘天的 RecGPT-Mobile 把 next-query LLM 搬到手机端;中科大 × 美团的 DynamicPO 揭示多负样本 DPO 的"偏好优化坍塌"现象并给出梯度抑制的理论解释。整体趋势是:算法侧追求"动态自适应目标",工程侧追求"可回滚的弹性接口"。
本周 32 篇论文里有几条主线在同时推进。一是生成式推荐范式继续在工业链路里深挖——快手一家就贡献三篇,从 list-wise 重排到召回-排序统一再到 codebook 自适应,配合美团/英伟达的 KV cache serving 和华为的 RL 信号修复,把"生成式推荐能用,但 serving、RL、inference 顶不住"这条线一次性补齐。二是 LLM 推荐器的训练目标被拆开重做——Google 在 H-consistency 框架下证明 DPO 标准代理损失不一致并提出 SA-DPO,Meta 证明 GRPO+二元奖励等价于 AUC 优化并提出 Windowed Partial AUC,配合美团的潜在推理多因子分解和稀疏场景下"对齐够不够"的争论,质疑了"一个对齐目标走到底"的主流做法。三是 LLM 智能体在推荐系统的角色边界正在收敛——LinkedIn 的 schema-aligned 长期语义记忆、AgenticRecTune 的多智能体配置调优、Snap 的端到端趋势检测,三个工业落地都把 LLM 放在配置/记忆/趋势这类延迟不敏感、语义价值高的位置上,绕开了精排召回的实时性瓶颈。 基础设施侧 Meta 同时放出两篇系统论文——一篇 versioned late materialization 砍训练数据冗余,一篇 FreeScale 砍 256 卡分布式的计算气泡,明确支撑 HSTU/ULTRA-HSTU 的序列长度激进 scaling。LLM-检索-重排链路上则形成明显的"压缩派"共识:ResRank 把 passage 压成单 token、UAE 把 utility 信号蒸馏进 embedding、RRK 用多 token 压缩,统一指向"把推理预算从过 LLM 生成压到过一次相似度"。