推荐周报 2026-W34
2026-8-22
| 2026-8-22
字数 8477阅读时长 22 分钟
type
Post
status
Published
date
Aug 22, 2026 05:32
slug
rec-weekly-2026-W34
summary
本周(2026-08-16 ~ 2026-08-22)推荐系统研究围绕三条主线展开:工业级系统从"分场景模型"走向"统一架构"、生成式推荐从"能离线跑"转向"可上线服务"、Agent 化推荐进入工程化和评估规范化阶段。 主线1:统一架构加速整合多业务流。 小红书的 OneModel 用单个模型统一自然推荐、广告和商家三条流量线,线上广告侧 CTR 提升 8.18%;Meta 的 UniDot 从 FM 点积视角统一序列建模与特征交互。两篇工作的共同指向是——存储和算力红利消退后,多场景碎片化部署的工程成本成为主要矛盾。 主线2:生成式推荐加速落地。 快手的 OGR 实现了端到端生成有序 slate,线上 Effective Views 提升 1.120%,NDCG@5 在工业数据上提升 48.2%。EchoRec 将多 token 预测从效率工具拓展为密集监督信号。生成式推荐本周的关键词是"产出物"——不只是生成单个 item,而是生成有序列表。 主线3:Agent 化推荐系统的工程化。 阿里巴巴的 PILOT 将 LLM agent 用于实验管理和策略搜索,搜索效率从 53.3% 提升到 93.3%;微软的 AdsWorldEngine 在对话广告场景让 agent 与工具协同进化,线上 RPM 提升 22%。Agent 推荐正在从单点推理走向流程治理。
tags
推荐系统
周报
论文
category
推荐技术报告
icon
📚
password
priority
1

本周概览

本周(2026-08-16 ~ 2026-08-22)推荐系统研究围绕三条主线展开:工业级系统从"分场景模型"走向"统一架构"、生成式推荐从"能离线跑"转向"可上线服务"、Agent 化推荐进入工程化和评估规范化阶段。
主线1:统一架构加速整合多业务流。 小红书的 OneModel 用单个模型统一自然推荐、广告和商家三条流量线,线上广告侧 CTR 提升 8.18%;Meta 的 UniDot 从 FM 点积视角统一序列建模与特征交互。两篇工作的共同指向是——存储和算力红利消退后,多场景碎片化部署的工程成本成为主要矛盾。
主线2:生成式推荐加速落地。 快手的 OGR 实现了端到端生成有序 slate,线上 Effective Views 提升 1.120%,NDCG@5 在工业数据上提升 48.2%。EchoRec 将多 token 预测从效率工具拓展为密集监督信号。生成式推荐本周的关键词是"产出物"——不只是生成单个 item,而是生成有序列表。
主线3:Agent 化推荐系统的工程化。 阿里巴巴的 PILOT 将 LLM agent 用于实验管理和策略搜索,搜索效率从 53.3% 提升到 93.3%;微软的 AdsWorldEngine 在对话广告场景让 agent 与工具协同进化,线上 RPM 提升 22%。Agent 推荐正在从单点推理走向流程治理。

生成式推荐与语义ID

本周生成式推荐有两条清晰的进展线:一是语义 ID 的构建质量开始被系统性审视,二是生成目标从单物品向 slate 级对齐演进。
快手的 OGROGR)提出"一次生成,完成排序"(Once Generated, Ranked)的端到端框架。它的核心是 TUSID——一种融合 item 级语义信息和局部协同信号的层次化语义 ID。相比 TIGER 的纯语义 ID,TUSID 将协同过滤信号注入 ID 构建过程,解决"语义相近但用户行为差异大"的 ID 碰撞问题。生成侧采用列表级偏好规划(list-wise preference planning)加流水线位置级解码,直接生成有序 slate 而非单个 item。训练时用 SPA(reward-guided conservative policy optimization)做偏好对齐,避免纯似然模仿导致的推荐结果平庸化。离线实验显示,工业数据集上 NDCG@5 相对提升 48.2%,线上 A/B 测试 Effective Views 提升 1.120%。这套框架把 DualGR 的长短期兴趣路由和曝光感知损失的思想延展到了 slate 生成上。
语义 ID 的诊断视角。 华为的 SIDScope(SIDScope)是一个值得注意的诊断资源。它系统评估了九种 tokenizer 导出(覆盖 TIGER、E4SRec、M2TRec 等七种家族)的语义 ID 接口健康度,核心发现是"机制条件性"——当检索消耗 SID 前缀时,前缀对齐度与候选曝光强相关;当评分变为前缀无关时,这种相关性就消失。它还揭示了一个隐藏缺口:有效目标路径存在但不唯一检索到目标 item 的概率差有 1.2-3.0 个百分点。这意味着很多生成式推荐模型在离线评估中的"正确生成"并未转换为"正确检索"。
EchoRec 把多 token 预测变成监督信号。EchoRec)观察到未来行为携带当前行为的"语义回声"——远高于随机 pair 的相似度,但会随意图转移而衰减。基于此,EchoRec 设计了两阶段模块:Horizon-aware Preference Generation (HPG) 在基础推荐器上串联轻量辅助分支,逐个条件建模偏好演化;Verifiable Holistic-Preference Alignment (VHA) 用循环一致投影器压制虚假对齐,且理论上排除了可逆传输下的秩坍缩。辅助组件推理时可丢弃,线上零开销。在 Amazon Beauty/Sports/Toys 三个数据集上超越 TIGER、EAGER 等基线,并自然获得多物品生成能力。
时序编码的解耦。Decoupled Temporal Encoding)来自一个真实的外卖和即时零售推荐系统,观察到用户行为存在多层级时间规律:近因效应、饭点高峰、工作日/周末切换、促销流量爆发。现有方法(时间戳特征、间隔嵌入、衰减函数、注意力偏置)通常把异质时间信号塞进统一表示,难以区分宏观时间动态与局部顺序线索。DTE 用两个互补模块解耦它们——个性化宏观时间模块注入紧凑时间原语到 item 嵌入,时间门控微序列模块只在交互时间密集时引入相对顺序偏置。轻量、参数高效,容易集成到现有系统。
服装搭配生成。USCM)把服装搭配生成形式化为 Constrained Ensemble Generation (CEG) 问题,建模为有限时域确定性 MDP。USCM 联合建模集合级兼容性与潜在组合意图,并用 Latent Expansion Monte Carlo Tree Search (LE-MCTS) 在组合过程中做物品检索,平衡局部美学协同与全局结构平衡。在 Polyvore Outfits 上达到 SOTA,并在 iFashion 和 PolyvoreU 上做了零样本验证。
共性趋势:生成式推荐不再只看单物品生成质量,而是把 slate 级效用、检索端到端的可解析性、时间结构纳入建模目标。SID 的构建质量正成为一个新的评估维度。

LLM推理与Agent增强推荐

本周 Agent 推荐的看点不在推理链设计,而在"治理"——如何让 agent 在安全边界内做决策、如何让 agent 与其工具协同进化、如何让推理成本可承受。
阿里 PILOT:agent 做实验治理。PILOT)淘宝部署的 LLM-agent 框架,核心不是在推荐模型上做推理,而是把"优化推荐系统"这件事本身交给 agent。三个角色协同:Experiment Manager 驱动完整实验生命周期(任务接收、观测治理、异常恢复、事后复盘),只从规则生成的法律命令包中选择动作;Search Planner 在 Manager 请求时提出面向用户分群的决策树候选;Memory Curator 异步把实验结果蒸馏为策略级领域知识,与主循环故障隔离。部署在淘宝 5 个实验桶,相比自由探索的 ROAM 基线,IPV 提升 1.40%(ROAM 为 1.00%),交易额提升 1.50%(ROAM 为 1.13%),搜索效率从 53.3% 提升到 93.3%,全程无人干预。PILOT 的价值在于把推荐系统优化的经验沉淀为可复用方法论,而不是每次从零开始调参。
微软 AdsWorldEngine:agent 与工具共同进化。AdsWorldEngine)对话广告场景下的 agentic 框架。Opportunity Gate 判断是否展示广告,Orchestrator 生成商业意图、调用广告工具、构建 Top-3 广告列表,Evaluator 给投放广告评分供离线优化。核心创新是迭代 actor-tool 训练流程——先 SFT + agentic RL 训练 Orchestrator,然后用高/低奖励的 rollout 构造偏好数据来训练工具本身。这形成了自改进循环:系统不仅学会使用广告工具,还学会从奖励行为中改进工具。配套的 label grounded judgment modeling 用思考迹丰富标签、通过反思过滤不一致理由,并用 cost-sensitive GRPO 变体保留不对称奖励差距。离线多样性提升 60%,相关性提升 80%;线上 A/B 测试 RPM 提升 22%,广告覆盖提升 74%。相比 RecThinker 的固定工具调用,AdsWorldEngine 的工具本身成为可学习对象。
剪枝,不蒸馏。rEDMRec)提出 LLM 推理不需要每次重新生成。如果能把推理压缩为结构化记忆,轻量模型只需检索。rEDMRec 把教师 LLM 的推理蒸馏为四种可编辑经验通道:长期偏好、短期上下文、物品感知、反事实硬负样本比较。LLM 记忆控制器负责 Add/Delete/Modify/Keep 操作,并通过 K-agent 辩论优化记忆条目。轻量学生模型(3B-20B)完全通过检索记忆排序,不调用教师。在 ML-1M、Amazon Beauty、Steam 上用十个学生骨干验证,HR@1 最高提升 13.3%(对比第二好的基线)。消融显示:短期上下文是唯一在所有容量档位都一致的通道,长期、物品感知和反事实贡献是容量依赖的——在最强的学生模型上甚至可能反转。
认知启发的双阶段推荐。CARA)把用户决策建模为直觉情感偏好与深思熟虑的理性评价两种机制。CARA 先在候选过滤阶段用粗粒度偏好约束收窄搜索空间,再通过双视角决策建模(情感 + 理性)做最终推荐决策。引入的 boundary-aware KTO 策略——优先训练那些模型偶尔能答对但不稳定的样本,提高信息偏好信号密度。在三个 Amazon Reviews 域上相对提升最高 10.15%。
持续推荐的三难。TRACER)识别出 Stability-Plasticity-Cognitivity (SPC) Trilemma:LLM 的通用语义先验(Cognitivity)与保留个性化历史偏好(Stability)、适应个体兴趣迁移(Plasticity)之间存在冲突。TRACER 用三个专门模块协同,防止单一要素主导。在五个真实数据集上最高提升 14.38%,延续了 AdaTTDTRN 的多任务融合思路。
紧凑 LLM 的层间退出融合。FLEXRec)在 Qwen 3 1.7B 和 Llama 3.2 3B 的每个 Transformer 层插入预测头,用 AC-Router 动态选择每个用户序列的退出层数量和身份,用 target-k hinge loss 约束路由稀疏性。三个真实数据集上达到紧凑骨干方法 SOTA 精度,同时保持全语料排序效率。
固定目录下的可靠对话推荐。MACS)在固定商品目录场景,LLM 负责语言任务(解析用户请求、偏好引导、生成回复),确定性模块负责正确性关键操作(商品检索、硬约束过滤、品牌排除、渐进式放宽)。会话持久偏好层跨轮次跟踪约束。140 查询单轮基准上 Pass 率 87.1%,品牌合规率 1.000;10 场景多轮基准上 Pass@5 达 72%(对比 GPT+Catalog 的 56%),零约束漂移。
训练无关的 LLM 推荐精炼。CoRRe)采用 post-LLM 范式——在 LLM 生成物品表示之后注入协同信号。用 item-item 共购图精炼嵌入方向,用物品流行度调整幅度,无需训练即匹配或超越部分训练方法。
BoN 蒸馏的截断改进。TUP)把 Best-of-N 蒸馏中的重加权分解为两个独立维度:截断低排名样本 + 锐化高排名权重。理论证明:对任意未知 oracle 奖励,最优单调重加权可以被低位截断规则匹配——支持"删掉"而非"降权"低排名样本。闭式归一化、纯离线训练,在 AlpacaEval 和 MT-Bench 上与 DPO、KTO、ORPO、SimPO 等强基线竞争。
组件级知识蒸馏。GOD)指出传统蒸馏把教师和学生独立训练后匹配输出,混淆了学生组件的影响。GOD 用"嫁接"构建混合模型——替换教师的冻结组件为学生可训练对应物,分别评估学生嵌入 + 教师编码器、教师嵌入 + 学生编码器,提供组件级反馈。推理时只用学生,零额外成本。三个真实数据集上最高提升 13.92%。
SCoRD 的持续蒸馏。SCoRD)聚焦 LLM 重排器持续蒸馏的高成本问题。语义推理助手把 LLM 推断用户意图的能力蒸馏为可复用的意图级指导;选择性蒸馏(只在低置信度序列上)避免了重复 LLM 推理。意图漂移信号反馈给重排器,实现高效的检索器-重排器协同适应。

检索召回与索引压缩优化

本周检索方向的主题是"压缩与精炼"——在有限的存储、计算和上下文预算内,挤出现有资源的更多价值。
美团的推理驱动个性化检索。TTP)针对本地生活电商的意图缺口问题:稀疏模糊的查询 + 丰富用户历史才能补全意图。TTP 用两阶段训练统一推理与检索:SFT 阶段建立冷启动能力,GRPO 阶段让推理过程与检索效用对齐。显式推理用户历史购买序列,生成意图增强查询,再编码为统一稠密嵌入。线上 A/B 测试订单量提升 0.46%。延续了 HyMiRec 的多兴趣提取思路,但把推理从隐式嵌入交互变为显式推理过程。
结构感知的量化。Variable Bit Allocation for Quantization)观察到现代模型产生的嵌入有显著几何结构(Matryoshka 性质),而现有量化方案按维度均匀分配比特。提出简单的可变比特分配框架:把嵌入划分为连续桶,用贪心策略非均匀分配存储。在相同存储预算下,非均匀分配一致优于均匀基线;低比特位区收益最大——PQ 召回率最高提升 8%,SQ 最高提升 18%。在 DRQUniNote 之外,指向结构感知压缩的新方向。
任务对齐的延迟交互量化。CrossQ)针对 ColBERT 类延迟交互检索的大索引问题。标准压缩最小化 token 重建误差,但排序质量取决于保持稀疏"胜者 token"的分数。CrossQ 的洞察:索引时计算轻量文档上下文(不存储),用它条件化 token 码本选择。训练目标对齐排序——保持候选分数分布、保护硬负样本间隔。2 B/token 时 MRR@10 提升 0.010(对比最强同体积基线),4 B/token 时实现 64 倍原始 token 存储压缩,8 B/token 时保留全精度 ColBERT 的 98% MRR@10。
同一预算下的关系型召回。DBRR)回答一个直接的问题:在固定检索预算下,如何在 top-k 之外恢复更多证据?DBRR 把预算分配为相关性选择的种子 + 受限图邻域。在 HotpotQA FullWiki 上,完整支持证据恢复率提升 23.8 个百分点(配对风险差 0.2377,bootstrap 95% CI 0.2269-0.2489)。桥接型问题驱动了主要增益(28.7 点),比较型问题增益较小(4.2 点)。真实关系优于随机邻居和保度重排图控制的对照。结论:证据完整性不仅取决于哪些 item 排名最高,还取决于上下文如何围绕它们分配。
统一查询扩展与检索。DEPT)解决单模型同时做查询扩展和密集检索的移动目标问题:检索监督应该改进查询侧扩展,但同一更新也移动作了检索目标的文档嵌入。DEPT 让微调后的文档嵌入保持接近缓存的初始嵌入,同时允许检索梯度通过直通解码进入生成器。用 Qwen3-4B 和 LLaMA-3.2-3B 在 BEIR 五个数据集上验证,平均 nDCG@10 超越训练无关、独立训练和分阶段统一基线。
跨引擎静态剪枝可移植性。Static Pruning Across Sparse Retrieval Regimes)首次系统比较静态剪枝在三个引擎(精确倒排索引、BMP、SEISMIC)上的表现,覆盖 1,140 种配置。发现:索引侧剪枝(文档和 posting list)是可移植的——一致降低延迟 1.2-6.6 倍和索引大小 18-82%,因为稀疏检索是内存受限的;查询侧剪枝已被现代引擎内化(BMP 的 β、SEISMIC 的 query_cut);静态剪枝与动态剪枝互补——BMP 上合并文档和查询剪枝可获 2.5 倍加速,NDCG@10 与精确基线差距小于 0.003。NDCG@10 饱和而 Recall@10 仍在 85-95% 区间,这个拐点可以作为可移植的停止准则。
无监督稀疏语义检索。Sparse Coverage)针对专利检索中单向量嵌入可能压缩多个技术组件的问题。把局部 span 嵌入映射到嵌入空间中心的稀疏词汇表,中心用覆盖导向的 k-center 目标选择,span 激活附近中心产生兼容倒排索引的稀疏表示。在 CLEF-IP 2013 上达到或超过强密集专利编码器的文档级召回。
多维方面检索基准。MAPLE)指出现有论文检索基准只评估单查询-论文相关性,忽略同一篇论文的多个可搜索方面。MAPLE 包含 2,095 个查询,覆盖论文的动机、方法、实验结果三方面。最强模型 AnyAspect@20 达 98.1%,但 AllAspect@20 仅 15.7%——差距巨大。实验/结果查询和表格引用查询对大多数检索器都难。
RAG 多样性优于冗余。Redundancy and Diversity in RAG)用 FictionalQA 控制实验,排除参数先验和答案相关性的混淆后,发现:重复文档和 LLM 改写不显著提升答案正确性,而多样化的文档(新闻、博客等不同体裁)提升 17%-47%。提升由体裁多样性驱动,而非更多相关答案可用。
Agent 工具检索的源风格坍缩。ToolScout)发现微调检索器在源特定切片上崩溃的现象——FT-1100 尽管与金标工具的词汇重叠更高,但在另一源切片上坍缩。查询侧 TF-IDF 指纹能比语义或长度代理更好地标记故障源风格。ToolScout 用此信号做路由,在混合 4,996 查询流上覆盖率从 22.3% 提升到 86.1%。

多场景统一排序与工业评估

工业界本周主旋律清晰:从分场景模型走向统一架构。同时,评估方法论出现两个方向——离线任务设计(impression share prediction)和基准的回归检验。
小红书 OneModel:统一多流排序。OneModel)用单一模型覆盖自然推荐、广告和商家服务三条流量线。方法:把异质行为映射为共享事件序列,用 action-oriented backbone 学习长上下文用户表示,引入 Scenario-aware Information Modulation 平衡跨流迁移与场景特化。部署时采用分层用户表示、多目标训练、特征分解、用户特征预取、共享用户塔计算和图级推理优化。线上 A/B 具体数字:Explore Feed 的 Time Spent 提升 0.33%、Engagement 提升 1.25%;Feed Advertising 的广告价值提升 3.43%、CTR 提升 8.18%;Merchant Recommendation 的 DGMV 提升 1.1867%、GPM 提升 2.1585%。对比 HSTU 类架构,OneModel 更强调多场景条件化——共享长上下文 + 场景调制。
Meta UniDot:FM 点积的统一视角。UniDot)一个优雅的观察:FM 的嵌入内积和注意力机制中的 query-key 点积是同一个原语。基于此,UniDot 把非序列字段和多域行为序列 token 化到共享 token 空间,并行运行 token-mixing bus(特征交互)和 sequence-retrieval bus(序列建模),每层通过 MLP-Mixer 融合交换状态,FM Highway 携带显式逐层点积交互直达分类器。TAAC KDD Cup 2026 工业赛道亚军。
Google SDF:内容过时的双机制分解。SDF)部署在 Google Discover(数亿日活),把内容过时分解为两种机制:supersession(新更新使旧覆盖过时)和 relevance decay(信息价值随生命周期自然衰减)。两个互补过滤器:关系过时模型检测 item 对之间的 supersession,预测流量比(PTR)模型从内容预测相关性衰减。在排序前用析取方式剪除过时候选。两年生产部署后,用户提交的过时反馈(in-product feedback)相对部署前下降 54.9%。这比传统的年龄截断和行为启发式更精准——年龄截断无法反映真实相关性损失,行为启发式依赖滞后信号。
离线评估的新任务。Impression Share Prediction)Meta 提出把 impression share prediction 作为离线评估任务:给定候选排序模型,预测它在目标桶(按点击、视频观看等优化目标分组)上的印象分布。这是反事实任务——候选从未在线上服务过。结构因果模型识别反事实效应,统计学习框架从候选的早期交互置信度信号和当前系统状态预测。Random Forest 在训练期间见过的模型上比常数基线 L1 误差降低 49%;对未见模型,首小时最难——容量状态仍反映先前模型,encoder-conditioned 架构模拟 2 小时 rollout 后恢复 +22% L1。
电商媒体排序的序列决策。SMEO)Amazon 的媒体排序问题:商品详情页的图片、视频、3D 渲染是有序集合,客户按顺序消费。SMEO 两阶段:先学习轨迹效用模型从消费媒体前缀估计有序证据如何帮客户达成购买决策(缓解位置偏差和变深不平衡),再训练自回归排序策略用生存加权奖励(survival-weighted reward-to-go)优先排列最决策相关的信息。离线评估(doubly robust off-policy estimation)转化率提升 5.5%,客户达到购买决策所需的滑动次数少 15%。
基准回归检验。Do Sequential Recommendation Benchmarks Really Require Higher-Order Sequence Modelling?)用两个简单的 recency-weighted 成对探针(SeqRules 和 PCTM)检验现有基准是否真的需要高阶序列建模。结果:在三个 Amazon 数据集上至少一个探针超过 eSASRec 复现 15-38%,MovieLens-1M 上超过 4.4%,MovieLens-20M 上落后 27.3%。在另外四个数据集上,至少一个探针超过 sampled-softmax SASRec 复现 9-28%。结论是现有基准可能不适合衡量高阶序列建模的增益。这对 DualGRHiGR 等序列推荐评估有直接影响。
金融异构图基准。FinFraudBench)提供两个大规模异构图数据集(CreditCard-Fraud 和 BankTrans-Fraud),分别有 899 万节点和 8,923 万条有向边,保留六种实体类型和十四种边类型,自然欺诈率镜像部署约束。涵盖排序和不平衡敏感分类指标的标准化评估协议,评估了 GCN、GAT、GraphSAGE、HGT、RGCN 等基线。
隐私感知的云设备协同推荐。PriCoRec)应对隐私法规限制云端处理敏感用户数据(年龄、性别等)的挑战。设计云侧预排序(可用特征)+ 设备端精排(本地个性化特征)。云侧预排序引入多样性正则化器提升候选质量;云引导训练机制通过知识蒸馏让设备端模型轻量化的同时保持性能。传统知识蒸馏在设备侧通常只做 label 模仿,PriCoRec 的做法是用云侧丰富特征引导设备侧模型训练。
时间序列基础模型的排序坍缩。Forecast Collapse)发现一个值得警惕的现象:用 TSFM 预测 1000 支美股的小时收益率时,预测变得近乎平坦、排序能力差。原因是双重的:低可预测性限制了校准点预测的幅度,而逐序列目标未能识别跨序列结构。这暴露校准-排序权衡——优化平方误差导致平坦预测,直接优化交叉相关性改善排序但会过度膨胀预测幅度。CalibRank 目标函数在 Finance1K 上几乎将交叉相关性提高了两倍,同时保持幅度接近目标。

值得关注的方向

多模态基础模型成为工业资产个性化的标准件。 Netflix 的实践(Multimedia Asset Personalization)展示了 CLIP 和自研三模态模型 MediaFM 如何统一五种画布模型、解决冷启动、并让视频预览个性化超越单模态基线。关键经验是一个简单的离线代理任务(预测流行度胜者)可以加速模型筛选,作为端到端 A/B 测试的门槛。这与 BiListing 的 Airbnb 部署和 Spotify 2T-HGNN 的有声书推荐形成互证——多模态基础模型嵌入将成为工业推荐系统的标准基础设施。
离线评估方法的创新。 本周几篇工作指向同一个方向:离线评估不只是预测精度的代理,而应该预测线上行为的某个可验证结果。Meta 的 impression share prediction 预测候选模型的印象分布,Netflix 的代理任务预测流行度胜者,印象分享预测用结构因果模型识别反事实效应。这暗示离线评估的下一步发展——从"这个模型 AUC 高不高"到"这个模型上线后印象怎么分布"。
统一架构向业务流扩展。 OneModel 的跨流统一(自然推荐 + 广告 + 商家)和 OneMall 的电商多场景统一证明了一个判断:用户行为在平台内是连续的跨流轨迹,分开建模会碎片化用户表示。接下来值得关注的是统一模型如何做场景条件化的精细控制——OneModel 的 Scenario-aware Information Modulation 是一个方向,UniDot 的 FM 视角是另一个。

本周论文速览

生成式推荐与语义ID
OGR — 快手提出端到端生成有序 slate 框架,TUSID 融合语义与协同 ID,线上 Effective Views 提升 1.120%,NDCG@5 提升 48.2%。
SIDScope — 提出语义 ID 接口诊断资源,覆盖九种 tokenizer、七种家族,揭示路径-物品不一致隐藏差距 1.2-3.0 个百分点。
EchoRec — 用循环一致偏好对齐将多 token 预测从效率工具拓展为密集监督,三个 Amazon 数据集上超越 TIGER、EAGER。
Decoupled Temporal Encoding — 解耦宏观时间动态与微观顺序信息,轻量、部署友好,适用于生成式推荐。
USCM — 服装搭配生成形式化为 CEG 问题,USCM + LE-MCTS 在 Polyvore Outfits 上 SOTA,iFashion 和 PolyvoreU 零样本验证。
LLM推理与Agent增强推荐
PILOT — 淘宝部署 LLM-agent 实验优化框架,三角色受控循环,搜索效率 53.3% 提升至 93.3%,交易额提升 1.50%。
AdsWorldEngine — 微软提出自进化对话广告 agent,Orchestrator 与工具协同进化,线上 RPM 提升 22%,广告覆盖提升 74%。
rEDMRec — 将 LLM 推理蒸馏为四种可编辑经验通道,学生模型(3B-20B)纯检索排序,HR@1 最高提升 13.3%。
RecPFN — 基于先验拟合网络的序列推荐 ICL 方法,合成数据预训练,八个基准上零样本 SOTA。
SCoRD — 语义推理助手实现检索器-重排器持续协同适应,选择性蒸馏降低 LLM 推理成本。
CoRRe — post-LLM 范式注入协同信号精炼物品嵌入,无需训练即匹配部分训练方法。
CARA — 认知启发的双阶段推荐框架,边界感知 KTO 策略,相对提升最高 10.15%。
FLEXRec — 紧凑 LLM 层间退出融合加自适应路由,Qwen 3 1.7B / Llama 3.2 3B 上 SOTA 精度,保持全语料排序效率。
MACS — 混合多智能体电商对话推荐,确定性约束执行,多轮 Pass@5 72%(对比 GPT+Catalog 56%)。
TRACER — 平衡稳定性-可塑性-认知性三难,五个真实数据集最高提升 14.38%。
TUP — BoN 蒸馏的截断-锐化分解,理论证明低位截断可匹配最优单调重加权。
GOD — 组件级嫁接蒸馏,三个真实数据集最高提升 13.92%。
检索召回与索引压缩优化
TTP — 美团提出推理驱动个性化稠密检索,SFT + GRPO 显式推理用户意图,线上订单量提升 0.46%。
SSR-GRPO — 阿里巴巴结合语义 ID 与 RL 优化电商检索,双视角相关性评估 + 硬负样本挖掘,已部署。
Quantization Beyond Uniform Bit Allocation — 可变比特分配量化,利用 Matryoshka 结构,PQ 召回最高提升 8%,SQ 提升 18%。
CrossQ — 跨 token 条件量化,2 B/token 时 MRR@10 提升 0.010,4 B/token 时 64 倍压缩。
DBRR — 固定预算下种子 + 图邻域分配,HotpotQA 支持证据恢复率提升 23.8 个百分点。
DEPT — 单一 decoder-only LLM 端到端联合优化查询扩展与检索,BEIR 五数据集平均 nDCG@10 提升。
Static Pruning Across Sparse Retrieval Regimes — 跨引擎剪枝可移植性研究,1,140 种配置,索引侧剪枝可移植,静态与动态剪枝互补。
Sparse Coverage — 无监督稀疏语义检索,k-center 覆盖选择中心,CLEF-IP 2013 达到或超过强密集编码器文档级召回。
MAPLE — 多方面论文检索基准,最强模型 AllAspect@20 仅 15.7%。
How retriever redundancy and diversity impact RAG — 控制实验证明文档多样性提升正确性 17%-47%,冗余和改写无显著提升。
ToolScout — 源风格坍缩检测与路由,TF-IDF 指纹将覆盖率从 22.3% 提升至 86.1%。
多场景统一排序与工业评估
OneModel — 小红书统一多流排序(自然推荐 + 广告 + 商家),广告 CTR 提升 8.18%,DGMV 提升 1.1867%。
SDF — Google Discover 部署的过时过滤系统,分解 supersession 与 decay 双机制,用户过时投诉下降 54.9%。
UniDot — FM 点积视角统一特征交互与序列建模,KDD Cup 2026 工业赛道亚军。
Impression Share Prediction — Meta 提出离线评估新任务,随机森林 L1 误差降 49%,encoder-conditioned 模拟恢复 +22%。
SMEO — Amazon 电商媒体排序的两阶段序列决策,离线转化提升 5.5%,滑动次数减少 15%。
SAGA — 金融多表面行为序列的生成式动作嵌入,per-field tokenization,下游点击和转化提升。
Do Sequential Benchmarks Need Higher-Order Modeling? — 简单探针在多个基准上超过 Transformer 复现,质疑现有基准对高阶序列建模的衡量能力。
FinFraudBench — 大规模异构图金融欺诈基准,899 万节点、8,923 万条边,六种实体类型。
PriCoRec — 云设备协同隐私保护广告推荐,多样性正则化器 + 云引导训练,敏感特征留在设备端。
GEO-Flag — GEO 优化网页检测基准,IPT 在 ModernBERT 上将 F1 从 0.862 提升至 0.944。
Forecast Collapse — 时间序列基础模型的预测坍缩现象,CalibRank 近三倍交叉相关性提升。
RelArena-α — 关系学习统一基准框架 + TabPFN-Rel + 模型无关接口,开源三个软件系统。
其他
Lipschitz Bandits with Arbitrary Feedback Delays — 任意反馈延迟下的 Lipschitz bandit,消除算法(随机)+ EXP3(对抗),遗憾界匹配无延迟情形加 √D 延迟代价。
  • 推荐系统
  • 周报
  • 论文
  • AI周报 2026-W34推荐算法日报 - 2026-08-22
    Loading...