From Next-One to Next-N:这才是推荐系统的范式改变

推荐系统 20 年来方法换了六七轮,但问题定义从未改变——始终是预测下一个 item。缺多样性、缺发现性、规则泛滥,根源都在这里。真正的范式改变不是换方法,而是重新定义问题:从 Next One 到 Next N。

生成式推荐 (Generative Recommendation) 工业界深度 Survey

覆盖 101 篇核心论文(58 篇工业界 + 43 篇学术精选),系统梳理 2022-2026 年生成式推荐从学术概念到工业主流范式的完整技术演进。以 TIGER、HSTU、OneRec 等里程碑论文为核心,深入分析 Semantic ID、模型架构、训练范式、推理增强、长序列建模等关键技术方向。

算法工程师的核心能力是什么

谜底就在谜面上。 "算法工程师",做个语法分析,这是个偏正结构。"算法"是定语,"工程师"才是中心语。定语修饰中心语,中心语决定你的身份。 算法工程师核心能力就是"工程能力"。 就像策略产品、用户产品、B端产品——核心都是产品能力。前面的定语告诉你在哪个领域工作,后面的中心语才是你安身立命的东西。 定语决定你的赛道,中心语决定你的天花板。

算法组织熵减与Scaling Law的悖论

我们先思考下,一个公司组织里,为什么需要 Leader,需要层级?任何一个超过几十人的组织都需要架构设计。这件事如此普遍,以至于我们很少追问:为什么需要组织架构?组织架构本质上在解决什么问题? 表面上看,组织架构是在划分职责、分配资源、明确汇报关系。但如果往下挖一层,会发现一个有趣的视角:一个组织本质上是一个分布式信息处理系统。 外部信息进来,内部处理,输出决策和行动。组织架构定义的,其实是信息如何在这个系统里流动——谁产生信息,谁消费信息,信息经过哪些节点,在哪里被过滤,在哪里被聚合。

2026:推荐系统 All-In Transformer 的元年

2017 年,Ilya Sutskever 读到《Attention Is All You Need》时,立即意识到”这就是我们需要的一切”。OpenAI 随即放弃了 RNN/LSTM 路线,全面转向 Transformer,催生出整个 GPT 系列。Transformer 的并行能力让他们得以实现一直相信的 Scaling 路径。八年后的今天,推荐系统终于走到了同样的路口。 2024 年之前,推荐领域有了 HSTU、TIGER 这样的工作,但大多数团队还在观望。2025 年,我观察到一个明显的转变:大家开始认真地把排序模型 Dense Scaling Up,搞生成式召回和端到端推荐。这很像 2017 年——当时大家忙着把 LR/GBDT/FM 切换到 Deep Model 和双塔,切换过程持续了一两年,之后再没人回头。我的判断是,2026 年将是推荐系统 All-In Transformer 的一年,不改变就落后。

从RL比SFT更不容易遗忘到反观推荐系统缺陷

最近陆续有了一些研究LLM中RL相比SFT更不容易造成灾难性遗忘的工作,清晰地支出是RL的On-Policy特性带来了参数的稳定,而SFT将模型参数推向与预训练分布差异很大的方向,导致了遗忘问题(如图,遗忘问题的衡量就是随着新任务的学习,旧任务的平均表现下降)。 这一清晰地结论,点亮了我对很多事情的理解,推荐系统原来孤立的问题也有可能连成一片,有了更深层次的支撑。 本文包括: • LLM领域,RL比SFT更不容易造成灾难性遗忘的工作解读 • 推荐系统是标准的off-policy 监督学习,(猜想)许多缺陷也应当由此而生

推荐系统线上能跑多大的模型

本文不是从系统优化角度谈复杂的模型的部署和优化问题,而是从行业成本角度,看线上推理多复杂的模型是可以满足成本及ROI要求的。 做一个假设: • 电商推荐行业,主要是更熟悉成本核算 • 部署标准的Transformer作为排序模型,参考OneTrans结构 • 参数规模对齐qwen2的系列模型,更直观看看能跑哪个尺寸

OneTrans 推荐系统对齐序列处理与特征交叉

从精排切换成深度学习以来,工业界一直会把排序的模型结构研究切分成基本的两部分,序列处理和特征交叉,甚至有一些公司的排序组,下面都拆成两个Team分别处理行为序列和特征交叉。从最早的时候,比如序列用DIN来处理,序列就被压成了一个或多个向量表征,再参与与其他特征的交叉。我们可以理解成MLP(concat(DIN, Features)),发展到今天大多数的模型研究,还是分立地把MLP换成DCN,增加个LHUC,复杂化为Rank Mixer或Transformer,把DIN叠加MHA,直接换成Transformer,可以写成RankMixer(concat(Transformer, Features))。 从MLP(concat(DIN, Features))到RankMixer(concat(Transformer, Features)),本质没有变,就是序列处理和特征交叉是一个隐式的两阶段处理,序列被压缩到Vector Space才和特征发生交叉。而LLM的有趣之处,就是在Next Token Prediction利用到的交叉发生在词序列的Token Space之中,它能启发推荐排序模型的,就是每一个特征的交叉应该发生在用户序列的Token Space之中。

推荐算法日报 - 2026-10-07

训练系统级优化成为工业推荐主战场:Google CutBCE 用融合算子把大规模词表 BCE 的 logits 从 HBM 中彻底消除(省 65.7% HBM、提速 225.9%),BRANCH-MoE 用树路由降低跨设备通信,Meta PE 用小规模筛选降低昂贵训练成本——工业界不再只卷模型结构,而是直接优化训练吞吐、显存与算力分配,这类工作落地确定性最高。; 生成式推荐从"能生成"走向"可信、可控、可扩展":CreGR 首次在 tokenization 与 generation 两阶段联合建

推荐算法日报 - 2026-10-06

生成式推荐的"监督信号精细化":AIMS 不再满足于让 LLM 生成式推荐"答对",而是把历史事件的干预效应(删除某条历史后目标项与竞争项的 margin 变化)转化为排序监督,并用非对称损失只让梯度流经竞争项。这标志着 LLM 推荐从"对齐历史偏好"转向"主动纠偏历史误导",是工业界处理"历史压过当前请求"这一真实痛点的可落地思路。; 检索/决策层的"稀疏化与量化"双线并进:神经稀疏检索侧用可学习 soft top-K + 逐项阈值 + FLOPs 正则压缩 LLM 大词表带来的超长向量;ba

推荐周报 2026-W40

本周推荐系统研究可以归到三条主线上,共同点是从"方法有效"转向"方法在生产里成立"。 主线一:生成式推荐从单点创新走向端到端工程化。 抖音广告的 GEAR 把 tokenizer、generator、reranker 放进同一个可微框架,正面处理表示坍缩与物品碰撞这对耦合瓶颈;腾讯的 KuaFu 把十亿级用户行为压缩成 item 级 token;GRP v0.1 用单个 encoder-decoder 同时承担召回、排序与奖励建模。三篇都指向同一个问题——生成式检索的瓶颈已经不在模型容量,而在 tokenizer 稳定性与 serving 成本。 主线二:LLM 用户理解的收益边界开始被划清。 生产流媒体平台的对照实验发现,LLM 生成画像只在探索型用户上优于聚合画像,而在占约五分之四的惯常消费人群上反而更弱。这是一个反直觉但可操作的结论,直接决定了画像策略应该按消费模式动态选择,而不是全局替换。 主线三:训练基础设施与检索架构被当作独立议题拆解。 Meta 的 ETT 把训练生命周期开销量化为可归因指标,fleet 级 ETT% 从约 80% 抬到 90% 以上;TikTok 的 HELIX 与 LinkedIn 的 ESP 则在排序与召回的结构层面做非对称扩展和多目标解耦。这些工作单看增量有限,但合起来说明工业系统的主要收益来源正在从"换模型"转向"改结构"。

推荐算法日报 - 2026-10-03

LLM 长上下文直接做推荐/搜索成为新范式:Meta RPTune 不再走传统多阶段召回-排序,而是把整个商品目录塞进长上下文 LLM,用学习式策展器(encoder-reorganizer)解决"LLM 对长上下文利用不均匀"的核心痛点,SMB 场景准确率最高 +31.4pp。这提示中小目录场景可以绕开复杂检索链路,但策展质量决定上限。; 训练/推理全栈效率优化持续升温:Meta 用 ETT%(有效训练时间占比)框架把生命周期开销定位到具体基础设施组件,fleet 级 ETT% 从 80% 拉