本周推荐系统研究可以归到三条主线上,共同点是从"方法有效"转向"方法在生产里成立"。 主线一:生成式推荐从单点创新走向端到端工程化。 抖音广告的 GEAR 把 tokenizer、generator、reranker 放进同一个可微框架,正面处理表示坍缩与物品碰撞这对耦合瓶颈;腾讯的 KuaFu 把十亿级用户行为压缩成 item 级 token;GRP v0.1 用单个 encoder-decoder 同时承担召回、排序与奖励建模。三篇都指向同一个问题——生成式检索的瓶颈已经不在模型容量,而在 tokenizer 稳定性与 serving 成本。 主线二:LLM 用户理解的收益边界开始被划清。 生产流媒体平台的对照实验发现,LLM 生成画像只在探索型用户上优于聚合画像,而在占约五分之四的惯常消费人群上反而更弱。这是一个反直觉但可操作的结论,直接决定了画像策略应该按消费模式动态选择,而不是全局替换。 主线三:训练基础设施与检索架构被当作独立议题拆解。 Meta 的 ETT 把训练生命周期开销量化为可归因指标,fleet 级 ETT% 从约 80% 抬到 90% 以上;TikTok 的 HELIX 与 LinkedIn 的 ESP 则在排序与召回的结构层面做非对称扩展和多目标解耦。这些工作单看增量有限,但合起来说明工业系统的主要收益来源正在从"换模型"转向"改结构"。
本周工业界论文密度明显高于往常。TikTok、快手、百度、Google、LinkedIn、Meta、Spotify、Walmart 都拿出了带线上 A/B 的系统论文,覆盖从召回、粗排、精排到出价的完整链路。另一条线是评估与数据质量——Netflix 的反事实可观测性框架、Meta 的合成数据过滤,以及一篇质疑 LLM 重排评估协议的实证审计。 主线一,生成式召回的连续空间与统一级联。 X-Rec(ByteDance)放弃 semantic ID 的离散 token 路径,改在连续 item embedding 空间用 flow matching 直接学推荐分布,推理吞吐是 SID-AR 的 3.46 倍,TikTok 垂直内容互动 +4.1484%。OneTrans-V2 则把召回/粗排/精排压进一个 Transformer,GMV +9.74%、同硬件吞吐 3.2 倍。两者的共同指向是——生成式推荐的瓶颈已经从"能不能生成"转移到"生成路径的吞吐与检索精度如何兼得"。 主线二,工业系统在评测口径上的自我修正。 Recall Ceiling 发现 LLM 重排常用的 oracle 协议把 NDCG@10 高估了 92–95%,真实检索的 Recall@100 只有 2–19%,天花板直接锁死了重排的上限。FROST(Meta)则从数据侧入手,用真实数据梯度锚定合成样本效用,过滤掉 20–30% 合成数据反而提升下游效果。这类工作不产出新模型,但会改变别人怎么读别人的结果。 主线三,MoE 与参数继承成为 scaling 的工程抓手。 IntBMoE(Alibaba AMap)通过 block-conditioned 专家组合把 MoE 的参与度、执行量、物化量三者解耦,60ms 延迟下服务数亿用户,UVCTR +2.4%。Inherit4Rec(快手)则用参数继承做稠密到稀疏的平滑转换。两条路都在回答同一个问题:容量怎么涨,而延迟不涨。