推荐算法日报 - 2026-10-09

检索监督信号从"正样本增强"转向"负样本判定":今日多篇论文(Elastic 的 VLM 教师蒸馏、文档结构消融)共同指向一个核心痛点——标注不完整导致假负例污染对比学习。Elastic 用 VLM 教师判定挖掘池中的 hard negatives,比传统正样本增强(attention grounding / description alignment)带来更大增益(v2 nDCG@5 +4.1),提示工业检索团队应重新分配教师算力到负样本侧。; 训练-推理一致性成为生成式推荐的新战场:浙大团队

推荐算法日报 - 2026-10-08

生成式推荐进入"精细化拆解"阶段:今日多篇论文(FLASH、Disentangling Paradigm、Semantic ID Spaces)集中反思 Semantic ID 构建与解码范式,核心共识是"哈希/量化方法并非天然劣于学习式方案,性能差距源于解码结构不匹配",免训练 tokenizer + 并行解码成为新方向,对工业界降低 tokenizer 训练成本有直接价值。; 强化学习与因果推断渗透召回/评估全链路:RELER 用 RL 直接在嵌入空间优化检索奖励,RLCP 用共形推断动态调

推荐算法日报 - 2026-10-07

训练系统级优化成为工业推荐主战场:Google CutBCE 用融合算子把大规模词表 BCE 的 logits 从 HBM 中彻底消除(省 65.7% HBM、提速 225.9%),BRANCH-MoE 用树路由降低跨设备通信,Meta PE 用小规模筛选降低昂贵训练成本——工业界不再只卷模型结构,而是直接优化训练吞吐、显存与算力分配,这类工作落地确定性最高。; 生成式推荐从"能生成"走向"可信、可控、可扩展":CreGR 首次在 tokenization 与 generation 两阶段联合建

推荐算法日报 - 2026-10-06

生成式推荐的"监督信号精细化":AIMS 不再满足于让 LLM 生成式推荐"答对",而是把历史事件的干预效应(删除某条历史后目标项与竞争项的 margin 变化)转化为排序监督,并用非对称损失只让梯度流经竞争项。这标志着 LLM 推荐从"对齐历史偏好"转向"主动纠偏历史误导",是工业界处理"历史压过当前请求"这一真实痛点的可落地思路。; 检索/决策层的"稀疏化与量化"双线并进:神经稀疏检索侧用可学习 soft top-K + 逐项阈值 + FLOPs 正则压缩 LLM 大词表带来的超长向量;ba

推荐周报 2026-W40

本周推荐系统研究可以归到三条主线上,共同点是从"方法有效"转向"方法在生产里成立"。 主线一:生成式推荐从单点创新走向端到端工程化。 抖音广告的 GEAR 把 tokenizer、generator、reranker 放进同一个可微框架,正面处理表示坍缩与物品碰撞这对耦合瓶颈;腾讯的 KuaFu 把十亿级用户行为压缩成 item 级 token;GRP v0.1 用单个 encoder-decoder 同时承担召回、排序与奖励建模。三篇都指向同一个问题——生成式检索的瓶颈已经不在模型容量,而在 tokenizer 稳定性与 serving 成本。 主线二:LLM 用户理解的收益边界开始被划清。 生产流媒体平台的对照实验发现,LLM 生成画像只在探索型用户上优于聚合画像,而在占约五分之四的惯常消费人群上反而更弱。这是一个反直觉但可操作的结论,直接决定了画像策略应该按消费模式动态选择,而不是全局替换。 主线三:训练基础设施与检索架构被当作独立议题拆解。 Meta 的 ETT 把训练生命周期开销量化为可归因指标,fleet 级 ETT% 从约 80% 抬到 90% 以上;TikTok 的 HELIX 与 LinkedIn 的 ESP 则在排序与召回的结构层面做非对称扩展和多目标解耦。这些工作单看增量有限,但合起来说明工业系统的主要收益来源正在从"换模型"转向"改结构"。

推荐算法日报 - 2026-10-03

LLM 长上下文直接做推荐/搜索成为新范式:Meta RPTune 不再走传统多阶段召回-排序,而是把整个商品目录塞进长上下文 LLM,用学习式策展器(encoder-reorganizer)解决"LLM 对长上下文利用不均匀"的核心痛点,SMB 场景准确率最高 +31.4pp。这提示中小目录场景可以绕开复杂检索链路,但策展质量决定上限。; 训练/推理全栈效率优化持续升温:Meta 用 ETT%(有效训练时间占比)框架把生命周期开销定位到具体基础设施组件,fleet 级 ETT% 从 80% 拉

推荐算法日报 - 2026-10-02

生成式检索(GR)全面工业化:今日 12 篇中 6 篇聚焦生成式推荐/检索,抖音 GEAR、Meta Forum、快手 OneRec 系列均已上线生产。核心矛盾从"能不能用"转向"如何稳定规模化"——码本坍缩、物品碰撞、SID 监督粒度错配、残差信息浪费成为主战场,BasisVQ/BasisRQ、RARS、ResTD 分别从量化、监督、蒸馏三个角度切入。; LLM 画像与推理的"条件性"落地:多篇论文(流媒体画像、服务时门控、快手 OneReason)共同指向一个结论——LLM 生成画像/CoT

推荐算法日报 - 2026-10-01

工业界统一架构与端到端生成式推荐加速落地:TikTok HELIX 将序列建模与特征交互交错统一,GRP 用单一 encoder-decoder 融合召回/排序/奖励建模,Spotify VSDD 把扩散腐蚀过程建模为博弈学习——头部平台正从"堆叠多阶段级联"转向"单模型联合扩展",且普遍报告线上 A/B 正收益(GMV +6%、分享 +2.56%),说明统一架构已跨过可行性验证阶段。; 训练过程本身成为新的优化战场:Meta 的 UWSR 从 prequential 原则解释 one-epoc

推荐算法日报 - 2026-09-29

工业界大规模系统论文集中爆发:今日 13 篇中 8 篇来自企业(Tencent、Meta、LinkedIn、Target、Amazon、Huawei),且几乎全部带线上 A/B 或生产部署数据。KuaFu 的 GMV +1.37%、Target 的 CTR +0.97%、LinkedIn 的 70M 周活部署,说明推荐系统的创新重心正从"刷离线指标"转向"可上线的工程系统"。; 用户行为序列的压缩与理解成为 LLM 推荐核心战场:KuaFu 把单 item 压到 2-4 token、缓存 10K

推荐周报 2026-W39

本周工业界论文密度明显高于往常。TikTok、快手、百度、Google、LinkedIn、Meta、Spotify、Walmart 都拿出了带线上 A/B 的系统论文,覆盖从召回、粗排、精排到出价的完整链路。另一条线是评估与数据质量——Netflix 的反事实可观测性框架、Meta 的合成数据过滤,以及一篇质疑 LLM 重排评估协议的实证审计。 主线一,生成式召回的连续空间与统一级联。 X-Rec(ByteDance)放弃 semantic ID 的离散 token 路径,改在连续 item embedding 空间用 flow matching 直接学推荐分布,推理吞吐是 SID-AR 的 3.46 倍,TikTok 垂直内容互动 +4.1484%。OneTrans-V2 则把召回/粗排/精排压进一个 Transformer,GMV +9.74%、同硬件吞吐 3.2 倍。两者的共同指向是——生成式推荐的瓶颈已经从"能不能生成"转移到"生成路径的吞吐与检索精度如何兼得"。 主线二,工业系统在评测口径上的自我修正。 Recall Ceiling 发现 LLM 重排常用的 oracle 协议把 NDCG@10 高估了 92–95%,真实检索的 Recall@100 只有 2–19%,天花板直接锁死了重排的上限。FROST(Meta)则从数据侧入手,用真实数据梯度锚定合成样本效用,过滤掉 20–30% 合成数据反而提升下游效果。这类工作不产出新模型,但会改变别人怎么读别人的结果。 主线三,MoE 与参数继承成为 scaling 的工程抓手。 IntBMoE(Alibaba AMap)通过 block-conditioned 专家组合把 MoE 的参与度、执行量、物化量三者解耦,60ms 延迟下服务数亿用户,UVCTR +2.4%。Inherit4Rec(快手)则用参数继承做稠密到稀疏的平滑转换。两条路都在回答同一个问题:容量怎么涨,而延迟不涨。

推荐算法日报 - 2026-09-26

生成式召回从"离散SID"走向"连续空间":X-Rec 用 flow matching 直接在连续 item embedding 空间学习推荐分布,规避 SID 量化误差与自回归低吞吐,3.46× 吞吐 + TikTok 线上验证;OneTrans-V2 的 DCGR 则把多目标召回通道统一为决策条件生成。生成式召回正从"token 序列生成"向"连续几何生成"演进,工业界已进入真刀真枪的线上比拼阶段。; 全链路统一建模成为工业级新范式:OneTrans-V2 用一个 Transformer 打

推荐算法日报 - 2026-09-25

预算受限重排成为 RAG/推荐系统的结构性痛点:BoundaryMORPH 直指 cross-encoder 预算 B 小于上下文窗口 k 的结构性错配,用高斯过程将有限算力聚焦于 top-k 边界集合判定;Q-REACT 则把有限 reranker 反馈蒸馏为可复用的 query 侧残差。两篇共同指向一个工程共识——重排算力必须"花在刀刃上",而非均匀验证头部候选。; LLM 推荐评估方法论遭遇系统性反思:Recall Ceiling 论文揭示 oracle 协议高估 NDCG@10 达 92