- 标签:
- 日报 (277)
- 推荐系统 (191)
- 技术趋势 (153)
- AI (149)
- 周报 (54)
- 论文 (33)
- 推荐 (9)
- 思考 (8)
- LLM (6)
- Agentic Engineering (5)
- 深度学习 (4)
- 工具 (3)
- Transformer (3)
- Harness Engineering (3)
- 强化学习 (1)
- 思维模型 (1)
- 管理 (1)
- 生成式 (1)
2017 年,Ilya Sutskever 读到《Attention Is All You Need》时,立即意识到”这就是我们需要的一切”。OpenAI 随即放弃了 RNN/LSTM 路线,全面转向 Transformer,催生出整个 GPT 系列。Transformer 的并行能力让他们得以实现一直相信的 Scaling 路径。八年后的今天,推荐系统终于走到了同样的路口。 2024 年之前,推荐领域有了 HSTU、TIGER 这样的工作,但大多数团队还在观望。2025 年,我观察到一个明显的转变:大家开始认真地把排序模型 Dense Scaling Up,搞生成式召回和端到端推荐。这很像 2017 年——当时大家忙着把 LR/GBDT/FM 切换到 Deep Model 和双塔,切换过程持续了一两年,之后再没人回头。我的判断是,2026 年将是推荐系统 All-In Transformer 的一年,不改变就落后。
从精排切换成深度学习以来,工业界一直会把排序的模型结构研究切分成基本的两部分,序列处理和特征交叉,甚至有一些公司的排序组,下面都拆成两个Team分别处理行为序列和特征交叉。从最早的时候,比如序列用DIN来处理,序列就被压成了一个或多个向量表征,再参与与其他特征的交叉。我们可以理解成MLP(concat(DIN, Features)),发展到今天大多数的模型研究,还是分立地把MLP换成DCN,增加个LHUC,复杂化为Rank Mixer或Transformer,把DIN叠加MHA,直接换成Transformer,可以写成RankMixer(concat(Transformer, Features))。 从MLP(concat(DIN, Features))到RankMixer(concat(Transformer, Features)),本质没有变,就是序列处理和特征交叉是一个隐式的两阶段处理,序列被压缩到Vector Space才和特征发生交叉。而LLM的有趣之处,就是在Next Token Prediction利用到的交叉发生在词序列的Token Space之中,它能启发推荐排序模型的,就是每一个特征的交叉应该发生在用户序列的Token Space之中。
本周工业界论文密度明显高于往常。TikTok、快手、百度、Google、LinkedIn、Meta、Spotify、Walmart 都拿出了带线上 A/B 的系统论文,覆盖从召回、粗排、精排到出价的完整链路。另一条线是评估与数据质量——Netflix 的反事实可观测性框架、Meta 的合成数据过滤,以及一篇质疑 LLM 重排评估协议的实证审计。 主线一,生成式召回的连续空间与统一级联。 X-Rec(ByteDance)放弃 semantic ID 的离散 token 路径,改在连续 item embedding 空间用 flow matching 直接学推荐分布,推理吞吐是 SID-AR 的 3.46 倍,TikTok 垂直内容互动 +4.1484%。OneTrans-V2 则把召回/粗排/精排压进一个 Transformer,GMV +9.74%、同硬件吞吐 3.2 倍。两者的共同指向是——生成式推荐的瓶颈已经从"能不能生成"转移到"生成路径的吞吐与检索精度如何兼得"。 主线二,工业系统在评测口径上的自我修正。 Recall Ceiling 发现 LLM 重排常用的 oracle 协议把 NDCG@10 高估了 92–95%,真实检索的 Recall@100 只有 2–19%,天花板直接锁死了重排的上限。FROST(Meta)则从数据侧入手,用真实数据梯度锚定合成样本效用,过滤掉 20–30% 合成数据反而提升下游效果。这类工作不产出新模型,但会改变别人怎么读别人的结果。 主线三,MoE 与参数继承成为 scaling 的工程抓手。 IntBMoE(Alibaba AMap)通过 block-conditioned 专家组合把 MoE 的参与度、执行量、物化量三者解耦,60ms 延迟下服务数亿用户,UVCTR +2.4%。Inherit4Rec(快手)则用参数继承做稠密到稀疏的平滑转换。两条路都在回答同一个问题:容量怎么涨,而延迟不涨。