type
Post
status
Published
date
Oct 3, 2026 05:31
slug
rec-weekly-2026-W40
summary
本周推荐系统研究可以归到三条主线上,共同点是从"方法有效"转向"方法在生产里成立"。 主线一:生成式推荐从单点创新走向端到端工程化。 抖音广告的 GEAR 把 tokenizer、generator、reranker 放进同一个可微框架,正面处理表示坍缩与物品碰撞这对耦合瓶颈;腾讯的 KuaFu 把十亿级用户行为压缩成 item 级 token;GRP v0.1 用单个 encoder-decoder 同时承担召回、排序与奖励建模。三篇都指向同一个问题——生成式检索的瓶颈已经不在模型容量,而在 tokenizer 稳定性与 serving 成本。 主线二:LLM 用户理解的收益边界开始被划清。 生产流媒体平台的对照实验发现,LLM 生成画像只在探索型用户上优于聚合画像,而在占约五分之四的惯常消费人群上反而更弱。这是一个反直觉但可操作的结论,直接决定了画像策略应该按消费模式动态选择,而不是全局替换。 主线三:训练基础设施与检索架构被当作独立议题拆解。 Meta 的 ETT 把训练生命周期开销量化为可归因指标,fleet 级 ETT% 从约 80% 抬到 90% 以上;TikTok 的 HELIX 与 LinkedIn 的 ESP 则在排序与召回的结构层面做非对称扩展和多目标解耦。这些工作单看增量有限,但合起来说明工业系统的主要收益来源正在从"换模型"转向"改结构"。
tags
推荐系统
周报
论文
category
推荐技术报告
icon
📚
password
priority
1
本周概览
本周推荐系统研究可以归到三条主线上,共同点是从"方法有效"转向"方法在生产里成立"。
主线一:生成式推荐从单点创新走向端到端工程化。 抖音广告的 GEAR 把 tokenizer、generator、reranker 放进同一个可微框架,正面处理表示坍缩与物品碰撞这对耦合瓶颈;腾讯的 KuaFu 把十亿级用户行为压缩成 item 级 token;GRP v0.1 用单个 encoder-decoder 同时承担召回、排序与奖励建模。三篇都指向同一个问题——生成式检索的瓶颈已经不在模型容量,而在 tokenizer 稳定性与 serving 成本。
主线二:LLM 用户理解的收益边界开始被划清。 生产流媒体平台的对照实验发现,LLM 生成画像只在探索型用户上优于聚合画像,而在占约五分之四的惯常消费人群上反而更弱。这是一个反直觉但可操作的结论,直接决定了画像策略应该按消费模式动态选择,而不是全局替换。
主线三:训练基础设施与检索架构被当作独立议题拆解。 Meta 的 ETT 把训练生命周期开销量化为可归因指标,fleet 级 ETT% 从约 80% 抬到 90% 以上;TikTok 的 HELIX 与 LinkedIn 的 ESP 则在排序与召回的结构层面做非对称扩展和多目标解耦。这些工作单看增量有限,但合起来说明工业系统的主要收益来源正在从"换模型"转向"改结构"。
生成式推荐的统一架构与工程落地
生成式检索进生产的核心矛盾,是要在一个可微框架里同时保持 tokenizer 稳定、候选可区分、serving 可承受。本周三篇部署论文分别对应这三项中的不同环节。
GEAR(字节跳动)— 抖音广告的端到端生成式检索框架。它把两个在文献里常被分开讨论的瓶颈放在一起处理:表示坍缩,即物品 tokenizer 在连续分布漂移下收敛到退化结果;物品碰撞,即大候选池中不同物品共享同一 token 序列。两者的耦合在于——扩大码本容量以缓解碰撞,会同步加剧坍缩。
技术上的解法分两层。针对坍缩,GEAR 提出 BasisVQ:用正交基对码本做重参数化,让梯度在全局共享,并对隐空间施加刚性旋转。论文强调这不需要 ad-hoc 启发式,梯度动力学本身就稳定下来。进一步扩展的 prefix-aware BasisRQ 在同等渐进时间复杂度下提升了码本表达力,代价是可接受的。针对碰撞,GEAR 在生成过程里挂了一个上下文条件重排头,用极小的额外算力对碰撞物品做消歧。
这套设计和业界的其他路线形成对照。此前 GPR 走的是统一输入模式加异构分层解码器的端到端单模型路线,MDGR 则用并行码本、自适应掩码监督与两阶段并行解码在多个数据集上提升至多 10.78%,并报告线上收入 +1.20%。GEAR 的差异点是把 tokenizer 的梯度稳定性当作一等公民,而不是靠解码策略事后补救。目前该系统在抖音广告服务数亿日活用户,报告了"substantial"级别的在线 A/B 提升,但摘要未披露具体数值。
KuaFu(腾讯)— 一个统一的行为压缩层,最小单位是单条行为 item。它要解决的问题很具体:内容兴趣摘要类任务单用户需读取数百条 item,序列化成 prompt 文本后是数万 token;而画像在十亿用户上每周刷新一次,合计约 10 万 QPM,在固定 GPU 预算下这是硬吞吐下限。
KuaFu 用两轴投影器把每条 item 压到 2-4 个 token、宽度 128-256。折算下来 token 轴约 10 倍、宽度轴约 20 倍,per-item 缓存从 10 KB 降到 0.5 KB。压缩必然带来失真,论文因此显式定义了四类幻觉——虚构、遗漏、日期错配、逻辑断裂——并配套四阶段保真度训练与分层中间评估,目的是让压缩表示本身可被评估,而不是等下游指标弥散式退化后才发现问题。
结果上,KuaFu 在四个生产画像任务的全部五项 headline 指标上持平或超过未压缩的单任务生产模型;per-GPU 吞吐提升 37%-350%,节省 190 块 GPU。公开基准上,同压缩比下几乎全面超过既有的压缩器(域外 MRQA 最高 +17.7 EM);在 RecBench 上,4B 模型超过 8B 对照 1.90 个点。该系统已在腾讯广告与推荐平台运行十个月,整体 GMV +1.37%。同赛道里,xGR 从 serving 侧切入,通过分离 KV 缓存统一 prefill 与 decode 实现至少 3.49 倍吞吐提升;DOS 则用用户-物品双流框架加正交残差量化在美团做语义 ID。KuaFu 的位置是这三者中最靠近"用户表示预处理层"的一环。
GRP v0.1[^grp] — 用单个 encoder-decoder 把召回、排序、奖励建模合到一起,生成多模态 Semantic ID,并用联合训练的排序模块打分;冻结后的排序模块再为强化学习后训练提供奖励。论文提出的 mGRPO 在奖励优化里加入 reference-anchored margin,用来保住 logged target 的似然——这是一个针对生成式推荐里"RL 后训练把线上真实分布打偏"的常见失效模式的修补。serving 优化把端到端召回延迟降低 69%。
线上结果分两组:仅作召回源时,观看时长 +0.46%、分享 +0.77%;叠加 early-ranking bypass 与弱源替换后,观看时长 +0.82%、分享 +2.56%,平台级护栏指标中性。论文自己承认排序质量与部分推荐指标仍有 gap。这条渐进式部署路径与 Gryphon 的思路接近——后者在编码器-解码器里联合训练物品级评分组件,在工业音乐服务上 Recall@1000 提升 3.7%,替换了 15 个以上候选生成器与粗排阶段;DualGR 则用双分支长短期路由加基于搜索的 SID 解码,在线 A/B 取得 +0.527% 视频播放与 +0.432% 观看时长。三篇报告的线上幅度都在 0.5%-3% 区间,说明生成式召回在成熟平台上已经是"小步替换"而非"整体重写"的阶段。
另外两篇非部署工作值得在速览里留意:Meta 的 Forum 检索工作把跨平台 Semantic ID 迁移到新社交场景,用 3B 指令微调 LLM 从用户上下文直接生成 SID;Spotify 的 VSDD 把离散扩散的前向腐蚀过程建模为 leader-follower Stackelberg 博弈,用去噪器的学习改进量而非重构难度来奖励腐蚀选择。
[^grp]: GRP v0.1 的作者所属机构未在摘要中披露,此处省略机构标注。
LLM 驱动的用户理解与上下文建模
这一组的共同问题是:LLM 生成的用户表示,到底在什么条件下比传统聚合画像更好。本周的答案比预期更保守。
When LLM-Inferred User Context Adds Value in Production Streaming Recommendation(生产流媒体平台)— 在生产流媒体平台上做全目录排序评估,设计空间是 2×2:表示类型(聚合 or LLM 生成)× 上下文范围(整体历史 or 注意力融合长短期)。
结论是条件性的。聚合画像在惯常消费(habitual)用户上持续更强,这类人约占整体的五分之四;LLM 生成画像只在探索型(exploratory)用户上更强,即后续交互在语义上偏离历史的用户。论文还观测到 LLM 画像存在流行度吸引子效应——列表内多样性小幅上升,但目录覆盖显著下降、新颖性下降。
这组结果的实际含义是:画像策略应该由推断出的消费模式来选,而不是全局替换。表层的"LLM 画像更好"或"聚合画像更好"都是错的。相关工作里,HyMiRec 走的是另一条路——用轻量推荐器抽粗粒度兴趣嵌入、LLM 抽细粒度嵌入,再用余弦相似度残差码本压缩历史;DMT 则从拓扑角度把全局 embedding 查找分解到不相交的塔上,取得最高 1.9 倍加速。两者都在回避"让 LLM 独自承担用户表示"这一假设。
RPTune — 面向 SMB 长上下文目录检索的端到端框架。前提是:当商家目录能塞进长上下文窗口时,全目录 prompting 可以替代为大市场设计的多阶段检索。但塞得进去不等于用得好,LLM 对长上下文的利用并不均匀。
RPTune 因此把学习式目录策展与 LLM 后训练耦合成一个闭环。encoder-reorganizer 策展器依据下游 LLM 的反馈对商品排序与剪枝,策展后的目录反过来提升后训练效果,监督信号由 context-relative reward 自动生成,不需要人工标注。在 7 个真实商户(覆盖不同零售垂直)上,每商户 100 条复杂对话查询,策展带来最高 31.4 个百分点的准确率提升,后训练再平均加 10.3 个点,专有与开源权重 LLM 上均一致。需要指出的是,这套方法面向的是小目录场景,未验证于百万级商品市场。与之对照,DARA 用 RL 微调 LLM 做少样本预算分配,From Logs to Language 则用强化学习训练 verbalization agent 把原始交互日志转成自然语言上下文,在 Netflix 生产流数据上相对模板基线取得最高 93% 的相对提升。RPTune 的差异在于把"上下文怎么组织"本身变成了可学习对象。
AutoResearch at Production Scale(Amazon)— 把 Karpathy 的 AutoResearch 范式(LLM 迭代编辑训练脚本,保留提升 held-out 标量的修改)扩展到生产规模。运行了 12 周、220 多个实验,单次迭代消耗多小时多 GPU 算力,评估涉及相互竞争的多项准则。
论文的贡献不在于自动化本身,而在于归纳出五个在生产环境下才出现的失效模式:基础设施脆弱性、agent 记忆衰减、搜索方向停滞、迭代成本不对称、指标固着。对应提出 prevent-persist-redirect 三原则脚手架。跨两个独立开发的表示学习系统(单次迭代成本相差近三个数量级),五个失效模式同时出现,论文据此判断这是生产级自主研究的结构性质,而非特定应用的偶然现象。
数据上,框架相对手工调参基线取得 Recall@6 提升 1.82 倍、coherence 提升 2.1 倍,agent 自主设计了一个纯文本 fallback,把目录覆盖扩大 5.8 倍。横向看,DAS 用双对齐语义 ID 在快手广告场景服务超 4 亿日活用户,ScalDPP 则把行列式点过程集成进 RAG 检索做块间依赖建模。AutoResearch 的位置更偏"优化流程的元层",而非具体表示方法。
大规模推荐的训练效率与优化
当模型侧创新边际收益下降时,系统侧的浪费就变得可见。本周有四篇论文在拆解训练与 profiling 的效率问题,其中三篇来自 Meta。
Optimizing Effective Training Time for Large-Scale Recommendation Systems(Meta)— 论文的起点是一个不太好意思公开的数字:在本工作之前,最大的推荐训练工作负载(每天数百亿训练样本、数千 GPU)只有 50%-60% 的端到端墙钟时间真正用于在新数据上推进训练。其余被生命周期开销吞掉。
论文提出 ETT%(Effective Training Time) 作为运营框架,把丢失时间做层级归因到独立的基础设施组件(TTS/TTR/失败次数等),并暴露出跨作业重启重复执行的工作。基于这套归因,实施了一组全栈优化:训练器初始化阶段的通信消除与 pipeline overlap、动态 shape 处理、autotuning 剪枝、可复用的 PyTorch 2 编译缓存、异步 checkpointing、独立模型发布、降低恢复成本。
结果:每个 benchmark 的 ETT% 都有提升,平均 +15.5%,最大工作负载达到 85%;部署后 fleet-wide ETT% 从约 80% 升到 90% 以上。这套指标的意义在于它把"训练效率"从单一 MFU 数值扩展成了可分解的运营语言。参照系上,Kunlun 通过统一架构设计把 B200 上的 MFU 从 17% 提到 37%、扩展效率翻倍,xGR 则从 serving 侧拿吞吐。三者针对的是同一类浪费的不同切面。
Component Benchmark(Meta)— 分层 profiling 系统,针对的是推荐模型的结构异构性:内存带宽受限算子、小型计算受限稠密层、jagged 类别特征带来的动态 shape、低算术强度算子混在同一张图里。标准工具只能给端到端吞吐或算子级 trace,无法归因到建模工程师真正在讨论的子模块。
CB 的做法是对每个子模块独立刻画性能,输出树状交互可视化,底层是插件化的子模块 benchmark 框架。对象模型是 TB 级、跑在数千 GPU 上、每天摄入 100B 样本。论文未给出量化加速收益,属于工具类工作,但和 DMT 的塔式分解思路互补——后者用结构拆分换数据局部性,CB 用 profiling 粒度下沉换归因能力。
UWSR — 用 prequential 原则的违反来解释推荐模型普遍存在的 one-epoch 现象。第一轮时,某样本的标签尚未影响用于给它打分的 embedding 行;后续轮次里这些行已经包含了此前更新引入的位移,共享 consumer 因此有动机去利用这个位移,而这不能泛化。论文把它称为 self-influence asymmetry,用精确标量模型和局部影响分析建立联系。
基于该假设提出的 uncertainty-weighted sensitivity regularization (UWSR),通过惩罚 consumer 对不确定 embedding 的依赖来抵消失配。与其他补救手段的关键区别是 UWSR 保留学习到的 embedding 不做重置。三个基准上,四轮 UWSR 相对单轮训练降低测试交叉熵 1.38%-6.78%,AUC 提升 0.0058-0.0231。这个视角与 Sparse Feature Attention 关注的稀疏化方向不同,但都属于"从训练动力学而不是结构设计里找收益"。
Soft Curriculum Learning(短视频平台)— 目标是打破流行度反馈循环。短视频平台的训练数据天然偏向头部物品,模型记住 head 模式,牺牲对长尾的泛化。课程学习是对症的,但工业落地的障碍在于:动态数据拒绝算法大量 CPU-bound,会把 TPU/GPU 饿死。
论文的解法是不做刚性数据过滤,改用 loss annealing 加重图内权重调整,在连续训练设定下实现动态课程节奏而不损失系统吞吐。验证覆盖三类模型:基于序列的召回(如 SASRec)、双塔召回、大规模连续排序模型。线上 A/B 在整体用户满意度与新鲜内容消费上均有提升,具体幅度未披露,模型吞吐不退化。历史脉络上,MEMOIR 用 LLM 把交互历史分段生成语义记忆来处理偏好漂移,Factorized Transport 用最优传输近似统一多模态多视图表示;两者的关注点都是表示,而软课程学习关注的是训练数据的分布控制。
工业级检索与排序架构优化
四篇论文全部来自生产系统,共同主题是在既有架构上做结构改造,而不是引入新范式。
HELIX(字节跳动)— 出发点是一个观察:工业排序模型沿两条轴扩展,异构特征交互与长行为序列建模,单独扩展任一条都存在 scaling ceiling 和次优的 scaling-law 斜率,论文猜测要获得更好的斜率必须联合扩展两轴。
HELIX 的做法是把序列检索与特征交互交错(interleave),并强制从可复用序列状态到候选条件 mix-tokens 的单向信息流。这样既保留了跨深度的通信,又让 user-side 序列计算可摊销,从而支持序列建模与特征交互的非对称灵活扩展。部署于 TikTok 电商推荐后,离线 CTR AUC、CVR AUC 及其他排序指标一致提升;线上 A/B 中电商视频人均 GMV 提升约 6%。
这个结果和同赛道的历史工作形成一条线。HyFormer 已经把长序列建模与特征交互整合进单一混合 Transformer 骨干,在工业数据上超过 LONGER 与 RankMixer;IAT 用两阶段方法把每个历史交互实例压缩成统一实例 token;LMN 则用外部记忆模块在抖音电商搜索上做长期兴趣建模。HELIX 的差异在于把"两轴该怎么耦合"提升为显式的架构约束,并给出单向信息流这一具体形式。
ESP(LinkedIn)— 针对双塔检索的一个结构性限制:它把语义相关性、互动、收入等异质信号压进同一个静态 embedding 空间,训练完成后无法在 serving 时调整目标优先级;而多目标损失联合优化又常引起目标间干扰。
Embedding Subspace Partitioning 把 embedding 分解为任务感知子空间,用子空间相似度的加权和替代单一内积,权重可在服务时调节。对 Transformer 双塔,ESP 用模型原生的 EOS token 作为分段符,配合分段感知的注意力掩码与位置编码重置,在单次前向中保证子空间隔离。服务端用 GPU 加速的穷举 kNN 跑单一拼接索引,不需要多头部方法所需的分目标 ANN 基础设施。
在基于 MS MARCO 构建的开放基准上,单个 ESP 模型可以描出一条较宽的 Pareto 前沿,在多种工作点上稳定优于多任务基线。在 LinkedIn 求职匹配平台(周活 7000 万以上),ESP 支持了动态检索重配置并带来关键业务指标提升。相关历史上,DSIN 用 30 分钟间隔把行为序列切成 session 建模兴趣演化,RAT 通过检索外部相似样本增强候选表示,HiGR 则在列表级生成里做多目标偏好对齐。ESP 与 HiGR 都在处理多目标,但 ESP 把调节权放到了服务时。
Retail Product Search at Target(Target)— 混合检索系统的完整工程记录,融合词法检索与向量检索。论文覆盖数据处理、embedding 训练、结果集精度控制、多通道融合以及低延迟优化。融合策略上,团队比较了多种方案后采用加权交错(weighted interleaving)。
线上 A/B 相对纯词法检索:CTR +0.97%、订单转化 +0.98%、人均需求 +1.10%,零结果搜索量大约减半。系统已大规模部署,每日服务数百万用户。这篇工作的价值主要在工程完整性——零售搜索的意图分布从精确匹配到开放式发现跨度很大,同时还要平衡相关性、收入和利润,单一方法很难覆盖。
TSG Suggester(AWS)— 云事件管理场景下的排障指南(TSG)推荐。值班工程师在时间压力下手动关键词搜索指南,此前实证研究发现指南检索占用了相当比例的缓解时间。
论文在 314 个真实事件(涉及 112 个 TSG、18 个服务团队)上比较了五种检索策略。Tree+KG 把每份指南转成保留原生章节层级的树,在内部节点挂载 LLM 生成的问题抽象——目的是桥接指南的"解决方案导向"语言与事件的"问题导向"语言——再抽取 per-guide 实体知识图谱,查询时融合 embedding 相似度与实体级匹配。
结果:Top-1 准确率 54.78%、Top-5 82.48%,在所有 cutoff 上领先全部基线,相对纯文本 RAG 的 Top-1 提升 8.58 个点。两个副发现更值得注意。结构对齐占主导:保留或重建文档结构的方法,在需要精确区分时明显优于扁平 chunking。多模态增强反而有害:给指南截图生成 caption 再注入,相对纯文本基线损失 22.64 个 Top-5 点,原因是通用 caption 稀释了 embedding 而非锐化它。这个负面结果在 RAG 类工作里比较少见。相关方向上,RAGSearch 的基准工作发现智能体搜索能显著提升 dense RAG 并缩小与 GraphRAG 的差距,而 GraphRAG 在复杂多跳推理中仍有优势;Mandol 则用层次化记忆模型加凝聚式语义结构实现 5.4 倍检索加速。TSG Suggester 的结果部分支持了结构优先的判断。
值得关注的方向
tokenizer 稳定性正在成为生成式推荐的工程焦点。 GEAR 用正交基重参数化码本处理表示坍缩,KuaFu 用两轴投影器加保真度训练处理压缩失真,MDGR 用并行码本和自适应掩码。这些工作的共同点是:tokenizer 不再是预处理步骤,而是与生成器联合优化的训练对象。判断依据是 GEAR 明确指出扩大码本缓解碰撞会加剧坍缩,说明两者不能分别调参解决。推进方主要是字节、腾讯这类有亿级候选池的团队,因为碰撞问题在中小规模上不显著。
行为压缩层可能成为 LLM 推荐栈的独立组件。 KuaFu 的形态值得注意:它不产出推荐结果,只产出可复用的压缩表示,per-item 缓存 10 KB 降到 0.5 KB,节省 190 块 GPU,GMV +1.37%。这种"不做模型只做表示层"的定位,意味着它可以被多个下游任务共享,而不是被某个模型绑定。腾讯已经跑了十个月,说明工程上可行。实际应用前景取决于压缩比与保真度能否在更多任务类型上同时成立——KuaFu 目前验证的是四类画像任务。
训练效率的度量方式正在从单一指标走向可归因框架。 Meta 的 ETT% 把 50%-60% 的有效训练时间拆到具体基础设施组件上,Kunlun 用 MFU 和扩展效率,Component Benchmark 用子模块分层 profiling。这组工作对整个行业的价值可能不在于某个优化本身,而在于建立了一套可比较、可定位的语言。当训练规模到数千 GPU、每天数百亿样本时,"哪里慢"比"怎么快"更难回答。
本周论文速览
生成式推荐
GEAR — 字节跳动提出端到端生成式广告检索框架,用正交基重参数化码本(BasisVQ/BasisRQ)缓解表示坍缩、上下文条件重排头消解物品碰撞;在抖音广告服务数亿日活用户。
KuaFu — 腾讯提出统一行为压缩层,每条行为压至 2-4 token、宽度 128-256,缓存 10 KB 降至 0.5 KB;per-GPU 吞吐提升 37%-350%,节省 190 GPU,线上 GMV +1.37%。
GRP v0.1 — 用单个 encoder-decoder 统一召回、排序与奖励建模,提出 mGRPO 保住 logged target 似然;serving 延迟降低 69%,线上观看时长 +0.46%~+0.82%、分享 +0.77%~+2.56%。
Exploring Forum Post Retrieval with Generative Modeling — Meta 在 Facebook Forum 新场景上复用跨平台 Facebook Feed 的层次化 SID,用 3B 指令微调 LLM 生成 SID,系统消融 SID 构造、用户历史与画像特征等设计选择。
VSDD — Spotify 将离散扩散的前向腐蚀过程建模为 leader-follower Stackelberg 博弈,以去噪器学习改进量而非重构难度作奖励;在分子有效性、文本困惑度与离线歌单推荐指标上均有提升。
LLM 用户理解与上下文建模
When LLM-Inferred User Context Adds Value — 生产流媒体平台的 2×2 对照实验发现,聚合画像在约五分之四的惯常消费用户上更强,LLM 生成画像仅在探索型用户上更优,且存在流行度吸引子效应。
RPTune — 将学习式目录策展与 LLM 后训练耦合,用 context-relative reward 自动生成监督;7 个真实商户上策展带来最高 31.4 点提升,后训练平均再加 10.3 点。
AutoResearch at Production Scale — Amazon 运行 12 周、220+ 实验,归纳出生产规模自主研究的五个失效模式,提出 prevent-persist-redirect 脚手架;Recall@6 提升 1.82 倍、coherence 2.1 倍、目录覆盖扩大 5.8 倍。
训练效率与优化
Optimizing Effective Training Time — Meta 提出 ETT% 运营框架,把训练生命周期开销归因到具体基础设施组件;benchmark 平均 ETT% +15.5%,fleet-wide 从约 80% 升至 90% 以上。
Component Benchmark — Meta 提出子模块级分层 profiling 系统,插件化架构加树状交互可视化,面向 TB 级、数千 GPU、日均 100B 样本的推荐模型。
UWSR — 用 prequential 原则违反与 self-influence asymmetry 解释 one-epoch 现象,提出不确定性加权敏感度正则化;四轮训练相对单轮降低测试交叉熵 1.38%-6.78%,AUC 提升 0.0058-0.0231。
Soft Curriculum Learning — 短视频平台用 loss annealing 与重图内权重调整替代刚性数据过滤,在序列召回、双塔召回与大规模排序的连续训练中打破流行度反馈循环,线上用户满意度与新鲜内容消费提升且吞吐不退化。
工业检索与排序架构
HELIX — 字节跳动提出交错序列检索与特征交互的统一排序架构,强制从可复用序列状态到候选条件 mix-tokens 的单向信息流;部署于 TikTok 电商,线上人均 GMV 提升约 6%。
ESP — LinkedIn 将双塔 embedding 分解为任务感知子空间,以服务时可调的加权相似度替代单一内积,用 EOS token 分段保证子空间隔离;在周活 7000 万以上的求职匹配平台实现动态检索重配置。
Retail Product Search at Target — Target 的混合检索系统融合词法与向量检索,采用加权交错融合策略;线上 CTR +0.97%、订单转化 +0.98%、人均需求 +1.10%,零结果搜索量减半。
TSG Suggester — AWS 提出 Tree+KG 检索系统,保留指南章节层级并在内部节点挂载 LLM 生成的问题抽象;314 个真实事件上 Top-1 54.78%、Top-5 82.48%,比纯文本 RAG 高 8.58 个 Top-1 点,并报告多模态 caption 注入反而损失 22.64 个 Top-5 点。