本周工业界论文密度明显高于往常。TikTok、快手、百度、Google、LinkedIn、Meta、Spotify、Walmart 都拿出了带线上 A/B 的系统论文,覆盖从召回、粗排、精排到出价的完整链路。另一条线是评估与数据质量——Netflix 的反事实可观测性框架、Meta 的合成数据过滤,以及一篇质疑 LLM 重排评估协议的实证审计。 主线一,生成式召回的连续空间与统一级联。 X-Rec(ByteDance)放弃 semantic ID 的离散 token 路径,改在连续 item embedding 空间用 flow matching 直接学推荐分布,推理吞吐是 SID-AR 的 3.46 倍,TikTok 垂直内容互动 +4.1484%。OneTrans-V2 则把召回/粗排/精排压进一个 Transformer,GMV +9.74%、同硬件吞吐 3.2 倍。两者的共同指向是——生成式推荐的瓶颈已经从"能不能生成"转移到"生成路径的吞吐与检索精度如何兼得"。 主线二,工业系统在评测口径上的自我修正。 Recall Ceiling 发现 LLM 重排常用的 oracle 协议把 NDCG@10 高估了 92–95%,真实检索的 Recall@100 只有 2–19%,天花板直接锁死了重排的上限。FROST(Meta)则从数据侧入手,用真实数据梯度锚定合成样本效用,过滤掉 20–30% 合成数据反而提升下游效果。这类工作不产出新模型,但会改变别人怎么读别人的结果。 主线三,MoE 与参数继承成为 scaling 的工程抓手。 IntBMoE(Alibaba AMap)通过 block-conditioned 专家组合把 MoE 的参与度、执行量、物化量三者解耦,60ms 延迟下服务数亿用户,UVCTR +2.4%。Inherit4Rec(快手)则用参数继承做稠密到稀疏的平滑转换。两条路都在回答同一个问题:容量怎么涨,而延迟不涨。
本周推荐系统研究围绕三条主线展开:工业界把生成式范式迁移到已有排序/召回链路、用户语义信号(自然语言理由、推理轨迹)进入推荐特征空间、长序列压缩与记忆的自演化。 主线一:生成式升级走"平滑迁移"路线。 Meta 的 LIGE-GR 把成熟的 pointwise 排序泛化为 listwise 生成与评估,在 Instagram Reels 提升 time spent 1.14%、Facebook Video 0.72%,且只需适度额外推理资源。阿里巴巴国际数字商业的 LazFormer 用生成式预训练为排序同时提供稀疏与稠密参数初始化,再用可迁移残差适配器解决稠密参数负迁移。两条路线的共同指向是——不替换服务基础设施,只改写表征与优化目标。 主线二:用户语义信号成为一等文本信号。 快手的 SARA 把用户自然语言偏好解释(AURs)从 86,564 位作者扩展到 10M 作者空间,并把正负 rationale 送进生产排序。阿里巴巴的 CoFree 针对 LLM embedding 中的 reasoning collapse,用 embedding-oriented 与 reasoning-oriented 双奖励做端到端耦合优化,CoFree-4B 在 MTEB 与 BRIGHT 共 22 个数据集上相对 Qwen3-Embedding-4B 平均绝对提升 2.8 nDCG@10。 主线三:长序列压缩与记忆隔离。 腾讯的 ChronicleRec 把超长行为序列一次性压成时间锚定的 Chronicle Tokens,按用户缓存,解耦超长序列建模与在线候选打分。LION 则指出持续演化会引发 evolution conflict——异构偏好漂移在共享自回归参数空间内互相冲突,主导行为模式会压制长尾模式,解法是以稀疏 Key-Value 记忆层做参数隔离。