本周推荐系统研究以工业部署论文领跑。Netflix、Yandex、Meta、LinkedIn、快手、阿里、字节各自拿出了线上 A/B 结果,密集程度在本年度少见的。如果只看一个趋势——生成式推荐正在从实验室验证阶段转向"用单一模型替换整个生产级联"的系统工程阶段。 主线 1(生成式推荐的两个方向): Yandex Music 的 Sona 用单一生成式模型替换了超过 15 个候选生成器加预排序/排序的完整级联,Active Users +4.53%。Netflix 的 GenRec 走了另一条路——不替换级联,而是用 LLM 排序器作为精排层,A/B 中相对生产排序器取得统计显著提升。同一周内两条路线并行验证,是本周论文密度最高的信号。而快手的 PushDualGen 则在解决生成式推荐的可解释性:生成 SID 后附带一段可跳过的 copy 作为解释,有效播放率 +8.50%,不满率 -37.70%。 主线 2(因果推断从理念走向部署): LinkedIn 的决策中心因果优化框架在 Feed 营销流量上实现 +7.20% 长期价值提升,把因果效应估计、贝叶斯 bandit 和线性规划分配统一到一个目标下。Meta 的 MARCO 更微观——用点击类型作为自由行为标签分解点击意图,每点击转化 +2.80%。两篇的共同指向:因果推荐不再只是论文里的去偏技巧,而是生产系统里可落地的收益来源。 主线 3(多任务与全链路优化的系统工程化): 阿里的 IntHQ 在高德部署,处理生成式推荐里多任务学习的三个 collapse 问题,UVCTR +1.60%。阿里的 DREAM 则在淘宝首页用智能体元控制架构在现有流水线之上叠加策略层,IPV +2.06%。字节的 TM20K 把电商行为序列扩展到 2 万长度,ADSS +1.036% 而服务延迟只增 5.6%。
本周推荐系统研究围绕三条技术主线展开:生成式推荐从概念验证走向端到端工程落地、LLM 从排序辅助进入核心决策环节、预训练-持续刷新范式重新定义知识归属。工业界论文过半,Yandex、快手、字节、腾讯、Snap、Shopee、LinkedIn、京东、微软、华为均有部署论文,且大多附带线上 A/B 数据。 主线 1:生成式推荐走出「生成即召回」原型,向端到端单模型演进。 Yandex 的 Gryphon-v2 用单个模型替代 15 个候选生成器、粗排与精排的完整级联,活跃用户 +1.41%;Snap 把 LLM 生成式召回推进到短视频场景,View Time +0.37%。两者共同指向——生成式架构的工程瓶颈(排序目标传递、推理成本、资格约束)正在被逐个拆解。 主线 2:LLM 从排序辅助进入高风险决策环节。 腾讯 SeqLLM 为支付风控注入行为序列建模,商户筛查精度从 92.0% 提到 97.5%;快手 HOBA 用 LLM 推理超参数、SARSA 选专家、专家池执行,三层结构让竞价决策在线自适应,目标成本 +3.6%。百度 QDET 用 7B 模型在时间线摘要任务上追平 DeepSeek-R1-671B,CTR +5.5%。 主线 3:预训练-持续刷新的范式开始重划「知识」与「几何」的归属。 Shopee 的 KGD 用行为多 token 预测清洗预训练知识、锚定校准残差解耦任务几何,GMV/用户 +1.75%,90 天生产流验证无衰减。这条线指向一个判断:预训练推荐模型的下一个战场不是更大的模型,而是如何在持续分布漂移中守住已学知识、同时让下游适配不被梯度干扰。