type
Post
status
Published
date
Sep 15, 2026 05:15
slug
daily-report-2026-09-15
summary
长序列建模进入"压缩+缓存"工程化阶段:腾讯 ChronicleRec 与偏好漂移子序列学习两篇同日出现,共同指向一个共识——全序列注意力已到成本天花板,行业正转向"一次性压缩为可缓存表示"(target-independent tokens)与"软子序列边界+线性注意力"两条路线,核心诉求是把超长序列建模从在线打分链路中解耦出去,用缓存换延迟。; 多兴趣召回从"辅助正则"转向"训练目标内生分化":阿里 MIMA 用多正样本匈牙利排他分配,让兴趣分化由目标函数本身驱动而非额外正则项,并补上跨兴趣
tags
推荐系统
日报
category
推荐技术报告
icon
📚
password
priority
1
Section 1: 📊 Trend Analysis
- 🔥 长序列建模进入"压缩+缓存"工程化阶段:腾讯 ChronicleRec 与偏好漂移子序列学习两篇同日出现,共同指向一个共识——全序列注意力已到成本天花板,行业正转向"一次性压缩为可缓存表示"(target-independent tokens)与"软子序列边界+线性注意力"两条路线,核心诉求是把超长序列建模从在线打分链路中解耦出去,用缓存换延迟。
- 💡 多兴趣召回从"辅助正则"转向"训练目标内生分化":阿里 MIMA 用多正样本匈牙利排他分配,让兴趣分化由目标函数本身驱动而非额外正则项,并补上跨兴趣通道的分数校准(路由模块)。这标志着多兴趣召回正从"堆兴趣向量数量"转向"解决兴趣坍缩+通道可比性"的精细化阶段。
- 🤖 Agent 范式开始反噬推荐系统本身:MemRetriever 把记忆检索变成可学习的多步搜索-反思-终止决策层,Spotify 与 UNC Charlotte 两篇立场论文则直接质疑"人类是推荐接收方"这一二十年假设,提出 delegation spectrum 与个人 Agent 中介推荐。检索/推荐链路正在被 Agent 化重构,评估指标(CTR/停留)面临失效风险。
Section 2: 📋 今日速览
- Alibaba 在电商多兴趣召回场景提出 MIMA,把同请求共现物品组成正样本集,用匈牙利匹配排他分配监督不同兴趣,让兴趣分化由训练目标内生驱动。三个公开集+工业集全面超 SOTA,线上 A/B 取得显著业务收益。↗
- Tencent 针对长序列生成式推荐,用多维偏好漂移学习可微软子序列边界,线性注意力聚合+交叉注意力+门控融合兼顾近期与长期偏好。在准确率与计算效率上一致超越全序列建模与目标感知检索基线。↗
- Tencent 提出 ChronicleRec,将超长行为序列一次性压缩为按时间排序的 Chronicle Tokens,recency-aware 多粒度合并+因果编码器+多 horizon 掩码,token 可缓存解耦在线打分。KuaiRand 与 AdLive 上逼近全注意力性能,七天线上 A/B 确认显著收益。↗
- Pinterest 上线生产级 DCO 系统 PinDCO,用组件融合网络 CCFN 对图像/标题/布局分塔建模,并针对瀑布流布局引入像素感知调分模块 PAM 优化整页效率。线上 A/B 广告 CTR 提升 3.09%,整页指标正向,已在 Pinterest Ads 全量部署。↗
- MemTensor 提出 MemRetriever,把长期记忆检索建模为多步决策:每步在并行搜索、串行搜索、反思去噪间选择,证据充分即终止,用 GRPO 优化。LOCOMO、LongMemEval 等五个基准一致提升,4B-RL 在 LongMemEval 检索指标上超越 DeepSeek-v4-Flash。↗
- OPPO 在小布助手交互发起场景部署 InitGen,联合生成一组候选 query 并用活跃度+排序分加权偏好优化对齐部分反馈,滚动窗口更新模型。线上 A/B CTR 从 0.95% 升至 1.61%(相对 +69.1%),曝光 +17.9%,180ms 内产出候选集,服务 1.5 亿月活。↗
- Meta 提出冻结检索器+生成式验证器的后验重排方案,验证器以候选物品标识符 token 似然打分,训练无需负采样与候选池,推理仅打分 top-K。在 Amazon 商品与 YaMBDa 音乐场景统一提升 SASRec、GRU4Rec、NextItNet、MiniOneRec 的 Recall@10。↗
- UNC Charlotte 立场论文提出个人 Agent 中介推荐(PAMR)新范式,主张从平台侧物品排序转向用户侧证据中介,并给出边界准则与中介中心评估框架。Yelp 餐厅推荐概念验证显示,来源选择与受控披露在效用-可追溯-曝光-成本上取得最佳折中。↗
- Spotify 立场论文指出 Agentic Web 下推荐范式正在分叉:可委托场景(常规购买、旅行)主消费方从人转向 Agent,体验型场景人仍是最终裁判。提出 delegation spectrum 框架,并勾勒 Agent 偏好建模、双受众优化与 Agent 注意力经济研究议程。↗
Section 3: 📰 Daily Digest
1. MIMA: Multi-Interest Recommendation via Multi-Positive Exclusive Assignment
🔗 原文: https://arxiv.org/abs/2609.12842
🏷️ 来源: 🏭 工业界 | Alibaba
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 以多正样本匈牙利排他分配驱动兴趣分化,工业级多兴趣召回并线上验证有效。
📝 摘要: 多兴趣召回用多个兴趣向量做细粒度候选匹配,但普遍存在兴趣坍缩——学到的兴趣收敛到相似表示。MIMA 指出单正样本范式是主因:每个实例只给一个正样本,意图被独立优化,同一个最佳匹配兴趣被反复更新向不同正样本,其余兴趣监督不足。方法将同一请求内共现物品组成正样本集,用因果 Transformer 解码器生成互补兴趣,再通过匈牙利匹配把每个正样本排他地分配给一个独立兴趣,使兴趣分化由训练目标本身涌现而非依赖辅助正则;另引入轻量路由模块估计用户-兴趣激活概率,校准跨兴趣通道分数使其可比。三个公开数据集与阿里国际电商工业数据集上一致超越 SOTA,线上 A/B 取得显著业务收益。局限在于未披露具体 A/B 提升数字,匈牙利匹配在大规模候选集上的计算开销与工程落地细节也披露有限。
2. Preference-Drift-Aware Subsequence Learning and Hierarchical Context Fusion for Long-Sequence Generative Recommendation
🔗 原文: https://arxiv.org/abs/2609.12556
🏷️ 来源: 🤝 产学合作 | Tencent, Northeastern University
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 腾讯工业界长序列生成式推荐工作,用偏好漂移软子序列+层次融合兼顾精度与效率。
📝 摘要: 长序列生成式推荐自回归建模用户交互序列以生成下一物品表示,现有方法分两类:高效全序列建模与目标感知上下文检索。论文实验揭示,序列变长时前者计算成本持续增长而精度增益快速饱和甚至因噪声退化;后者虽缩短输入,却易受"语义一致但偏好不一致"噪声与上下文不完整困扰。两类范式都忽略用户偏好动态变化与跨子序列依赖。方法用多维偏好漂移信息学习可微软子序列边界,以带软分配权重的线性注意力将子序列内物品聚合为偏好一致的表示,规避全序列注意力开销;再用交叉注意力捕获近期交互与相关子序列上下文的依赖以抑制噪声,最后门控融合近期表示与全局子序列上下文。大量实验在推荐准确率与计算效率上一致超越基线。局限是未报告线上 A/B 或大规模部署细节。
3. ChronicleRec: Pre-training Temporally Anchored Tokens for Lifelong User Modeling
🔗 原文: https://arxiv.org/abs/2609.12375
🏷️ 来源: 🤝 产学合作 | Tencent, UNSW
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 腾讯工业级超长序列压缩框架,可缓存时间锚定 token,线上 A/B 验证有效。
📝 摘要: 超长用户行为序列建模对工业推荐与在线广告至关重要,但把数千历史行为直接喂入排序模型计算上不可行,截断又丢失长程信号。现有 lifelong-interest 方法为每个候选检索目标相关行为,把长序列建模与候选打分耦合、在线成本重复;近期 target-independent 压缩方法虽可缓存用户摘要,却常在序列末尾追加 query token 并用双向编码,产出无序冗余、忽略时间结构的摘要。ChronicleRec 用 pre-train-and-transfer 框架把超长序列一次性压缩为按时间排序的 Chronicle Tokens:recency-aware 多粒度合并保留近期行为、粗化远期历史;将 query token 与合并序列交错并用因果编码器,使每个 query 只总结其时间锚点之前的历史;多 horizon 设计在并行分支掩蔽不同近期窗口以学习互补长程兴趣;压缩器用 mask-and-predict 目标预训练,从压缩的旧历史重建被留出的近期行为。因 token 与目标无关可逐用户缓存,解耦超长序列建模与在线候选打分。KuaiRand 与 Tencent AdLive 上超越近期窗口与单遍压缩基线并逼近全注意力性能,七天线上 A/B 确认显著收益。局限是属对现有压缩范式的系统性改进而非开创性方向,未给出具体线上提升数字,且未完全达到全注意力性能。
4. PinDCO: Whole-Page Aware Dynamic Creative Optimization at Scale
🔗 原文: https://arxiv.org/abs/2609.11943
🏷️ 来源: 🏭 工业界 | Pinterest
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: Pinterest 生产级 DCO 系统,组件融合+像素感知调分,线上 CTR +3.09%。
📝 摘要: 生成式 AI 大幅加速高质量广告创意生产,单 campaign 候选变体数量激增,对在严格延迟与成本约束下匹配创意与受众的 DCO 系统提出更高要求。PinDCO 是 Pinterest 十亿级视觉发现平台上的生产级广告创意检索与选择系统:核心 Creative Component Fusion Network(CCFN)为每个创意组件(图像、标题、布局)设独立塔并用组件特定超参应对不同建模复杂度,融合组件表示后在 ad-level 预测条件下预测 creative-level 分数,并通过探索-利用策略提升训练数据质量。针对 Pinterest 瀑布流网格布局中创意渲染尺寸影响邻近内容与 session 级参与的特点,引入 Pixel-aware Adjustment Module(PAM)按创意尺寸调分,鼓励高效利用屏幕空间、优化整页结果。为支撑海量候选,另用轻量预筛选模型早期剪枝,并通过缓存与动态批处理优化 serving。离线分析与线上 A/B 显示广告 CTR 提升 3.09% 且整页指标正向,已在 Pinterest Ads 平台上线。属面向 DCO 的工程化创新,整体为增量式改进而非范式级突破。
5. MemRetriever: Learning to Search, Reflect, and Retrieve from Long-Term Memory
🔗 原文: https://arxiv.org/abs/2609.11951
🏷️ 来源: 🏭 工业界 | MemTensor
⭐ 评分: ⭐⭐⭐⭐ (4/5)
🎯 推荐理由: 把长期记忆检索变成可学习的多步搜索-反思-终止决策层,4B 模型超越 DeepSeek-v4-Flash。
📝 摘要: 长期记忆支撑个性化 Agent,但其价值取决于在正确时机检索到正确证据。多数记忆系统用静态 top-k 检索:发一次 query、返回固定数量记忆、直接交给下游模型,这会漏掉跨 session 分布的证据、引入无关内容、浪费上下文,在多跳、时序与知识更新类问题上尤甚。MemRetriever 把记忆访问建模为多步搜索过程:每步基于当前证据推理,选择并行搜索做广探索、串行搜索做定向补全、或反思去噪做过滤与证据评估,当保留证据足以支撑下游回答时终止。方法构建 ReAct 风格搜索-记忆轨迹做监督冷启动,再用 GRPO 优化,奖励设计鼓励证据覆盖、噪声削减、答案充分与高效终止。LOCOMO、LongMemEval、HotpotQA、MuSiQue、2WikiMultiHopQA 上一致超越静态检索与纯监督基线,MemRetriever-4B-RL 在相同 pipeline 下于 LongMemEval 主要检索指标超越 DeepSeek-v4-Flash,MuSiQue 上为对比方法中最强。决策逻辑与存储后端无关,可运行于外部知识库与向量数据库。局限是缺少线上部署验证,且 4B 模型对比结论仅在特定检索指标上成立。