From Next-One to Next-N:这才是推荐系统的范式改变

推荐系统 20 年来方法换了六七轮,但问题定义从未改变——始终是预测下一个 item。缺多样性、缺发现性、规则泛滥,根源都在这里。真正的范式改变不是换方法,而是重新定义问题:从 Next One 到 Next N。

生成式推荐 (Generative Recommendation) 工业界深度 Survey

覆盖 101 篇核心论文(58 篇工业界 + 43 篇学术精选),系统梳理 2022-2026 年生成式推荐从学术概念到工业主流范式的完整技术演进。以 TIGER、HSTU、OneRec 等里程碑论文为核心,深入分析 Semantic ID、模型架构、训练范式、推理增强、长序列建模等关键技术方向。

算法工程师的核心能力是什么

谜底就在谜面上。 "算法工程师",做个语法分析,这是个偏正结构。"算法"是定语,"工程师"才是中心语。定语修饰中心语,中心语决定你的身份。 算法工程师核心能力就是"工程能力"。 就像策略产品、用户产品、B端产品——核心都是产品能力。前面的定语告诉你在哪个领域工作,后面的中心语才是你安身立命的东西。 定语决定你的赛道,中心语决定你的天花板。

算法组织熵减与Scaling Law的悖论

我们先思考下,一个公司组织里,为什么需要 Leader,需要层级?任何一个超过几十人的组织都需要架构设计。这件事如此普遍,以至于我们很少追问:为什么需要组织架构?组织架构本质上在解决什么问题? 表面上看,组织架构是在划分职责、分配资源、明确汇报关系。但如果往下挖一层,会发现一个有趣的视角:一个组织本质上是一个分布式信息处理系统。 外部信息进来,内部处理,输出决策和行动。组织架构定义的,其实是信息如何在这个系统里流动——谁产生信息,谁消费信息,信息经过哪些节点,在哪里被过滤,在哪里被聚合。

2026:推荐系统 All-In Transformer 的元年

2017 年,Ilya Sutskever 读到《Attention Is All You Need》时,立即意识到”这就是我们需要的一切”。OpenAI 随即放弃了 RNN/LSTM 路线,全面转向 Transformer,催生出整个 GPT 系列。Transformer 的并行能力让他们得以实现一直相信的 Scaling 路径。八年后的今天,推荐系统终于走到了同样的路口。 2024 年之前,推荐领域有了 HSTU、TIGER 这样的工作,但大多数团队还在观望。2025 年,我观察到一个明显的转变:大家开始认真地把排序模型 Dense Scaling Up,搞生成式召回和端到端推荐。这很像 2017 年——当时大家忙着把 LR/GBDT/FM 切换到 Deep Model 和双塔,切换过程持续了一两年,之后再没人回头。我的判断是,2026 年将是推荐系统 All-In Transformer 的一年,不改变就落后。

从RL比SFT更不容易遗忘到反观推荐系统缺陷

最近陆续有了一些研究LLM中RL相比SFT更不容易造成灾难性遗忘的工作,清晰地支出是RL的On-Policy特性带来了参数的稳定,而SFT将模型参数推向与预训练分布差异很大的方向,导致了遗忘问题(如图,遗忘问题的衡量就是随着新任务的学习,旧任务的平均表现下降)。 这一清晰地结论,点亮了我对很多事情的理解,推荐系统原来孤立的问题也有可能连成一片,有了更深层次的支撑。 本文包括: • LLM领域,RL比SFT更不容易造成灾难性遗忘的工作解读 • 推荐系统是标准的off-policy 监督学习,(猜想)许多缺陷也应当由此而生

推荐系统线上能跑多大的模型

本文不是从系统优化角度谈复杂的模型的部署和优化问题,而是从行业成本角度,看线上推理多复杂的模型是可以满足成本及ROI要求的。 做一个假设: • 电商推荐行业,主要是更熟悉成本核算 • 部署标准的Transformer作为排序模型,参考OneTrans结构 • 参数规模对齐qwen2的系列模型,更直观看看能跑哪个尺寸

OneTrans 推荐系统对齐序列处理与特征交叉

从精排切换成深度学习以来,工业界一直会把排序的模型结构研究切分成基本的两部分,序列处理和特征交叉,甚至有一些公司的排序组,下面都拆成两个Team分别处理行为序列和特征交叉。从最早的时候,比如序列用DIN来处理,序列就被压成了一个或多个向量表征,再参与与其他特征的交叉。我们可以理解成MLP(concat(DIN, Features)),发展到今天大多数的模型研究,还是分立地把MLP换成DCN,增加个LHUC,复杂化为Rank Mixer或Transformer,把DIN叠加MHA,直接换成Transformer,可以写成RankMixer(concat(Transformer, Features))。 从MLP(concat(DIN, Features))到RankMixer(concat(Transformer, Features)),本质没有变,就是序列处理和特征交叉是一个隐式的两阶段处理,序列被压缩到Vector Space才和特征发生交叉。而LLM的有趣之处,就是在Next Token Prediction利用到的交叉发生在词序列的Token Space之中,它能启发推荐排序模型的,就是每一个特征的交叉应该发生在用户序列的Token Space之中。

推荐算法日报 - 2026-08-12

生成式推荐进入"策略生成"新范式:今日多篇工业界论文(IntHQ、MetaStrategy、PushDualGen)不再直接生成物品序列,而是转向生成可执行策略(JSON策略包、语义ID+解释copy)或优化多任务交互。这一转变使生成式推荐能无缝集成现有预测模型、业务规则和护栏,大幅降低落地门槛,成为工业界探索的核心方向。; Agent/LLM 从"旁路"走向"元控制":DREAM 提出在现有级联流水线之上叠加智能体元控制层(M1-M2-M3 分层推理),MetaStrategy 用 LLM 策

推荐算法日报 - 2026-08-11

生成式推荐进入工业化深水区:今日多篇论文围绕生成式推荐(GenRec)展开,从字节跳动的 TM20K(超长序列 + 知识蒸馏)到快手的 HD-Rec(跨域统一框架),再到 NAVER WEBTOON 的三阶段后训练对齐,标志着生成式范式正从概念验证走向大规模线上部署,核心矛盾从"能不能用"转向"如何高效落地"。; 模型内部状态成为优化新抓手:Meta 的 MISO 与 Amazon 的 BC-ICL 不约而同地利用模型内部状态(参数、激活、梯度、bootstrap 重采样)来指导优化决策,替代传

推荐周报 2026-W32

本周推荐系统研究围绕三条技术主线展开:生成式推荐从概念验证走向端到端工程落地、LLM 从排序辅助进入核心决策环节、预训练-持续刷新范式重新定义知识归属。工业界论文过半,Yandex、快手、字节、腾讯、Snap、Shopee、LinkedIn、京东、微软、华为均有部署论文,且大多附带线上 A/B 数据。 主线 1:生成式推荐走出「生成即召回」原型,向端到端单模型演进。 Yandex 的 Gryphon-v2 用单个模型替代 15 个候选生成器、粗排与精排的完整级联,活跃用户 +1.41%;Snap 把 LLM 生成式召回推进到短视频场景,View Time +0.37%。两者共同指向——生成式架构的工程瓶颈(排序目标传递、推理成本、资格约束)正在被逐个拆解。 主线 2:LLM 从排序辅助进入高风险决策环节。 腾讯 SeqLLM 为支付风控注入行为序列建模,商户筛查精度从 92.0% 提到 97.5%;快手 HOBA 用 LLM 推理超参数、SARSA 选专家、专家池执行,三层结构让竞价决策在线自适应,目标成本 +3.6%。百度 QDET 用 7B 模型在时间线摘要任务上追平 DeepSeek-R1-671B,CTR +5.5%。 主线 3:预训练-持续刷新的范式开始重划「知识」与「几何」的归属。 Shopee 的 KGD 用行为多 token 预测清洗预训练知识、锚定校准残差解耦任务几何,GMV/用户 +1.75%,90 天生产流验证无衰减。这条线指向一个判断:预训练推荐模型的下一个战场不是更大的模型,而是如何在持续分布漂移中守住已学知识、同时让下游适配不被梯度干扰。

推荐算法日报 - 2026-08-08

生成式推荐从"单点尝试"走向"端到端替代":今日多篇论文(Gryphon-v2、QDET、Align-RAG)共同指向一个趋势——用单一生成式模型替代传统多级级联架构。Gryphon-v2 用"生成+排序"一体模型替换了 Yandex Music 生产环境 15+ 候选生成器的级联系统;QDET 用 7B 模型在专业任务上超越 671B 通用模型。核心方法论在于蒸馏(Rollout Distillation)和多任务微调,让紧凑模型在保持生成能力的同时获得排序级精度,且服务延迟与级联持平。这对工