OneTrans 推荐系统对齐序列处理与特征交叉

从精排切换成深度学习以来,工业界一直会把排序的模型结构研究切分成基本的两部分,序列处理和特征交叉,甚至有一些公司的排序组,下面都拆成两个Team分别处理行为序列和特征交叉。从最早的时候,比如序列用DIN来处理,序列就被压成了一个或多个向量表征,再参与与其他特征的交叉。我们可以理解成MLP(concat(DIN, Features)),发展到今天大多数的模型研究,还是分立地把MLP换成DCN,增加个LHUC,复杂化为Rank Mixer或Transformer,把DIN叠加MHA,直接换成Transformer,可以写成RankMixer(concat(Transformer, Features))。 从MLP(concat(DIN, Features))到RankMixer(concat(Transformer, Features)),本质没有变,就是序列处理和特征交叉是一个隐式的两阶段处理,序列被压缩到Vector Space才和特征发生交叉。而LLM的有趣之处,就是在Next Token Prediction利用到的交叉发生在词序列的Token Space之中,它能启发推荐排序模型的,就是每一个特征的交叉应该发生在用户序列的Token Space之中。

推荐算法日报 - 2026-08-20

[生成式推荐从"生成候选"走向"端到端生成结果":今日多篇论文(OGR、DEPT)不再将生成式模型局限于召回阶段,而是直接端到端生成最终推荐结果(有序 Slate)或统一"查询扩展+检索"。核心挑战从"如何生成"转向"如何让生成目标与最终排序/检索目标对齐"——OGR 用列表级偏好规划 + 奖励引导策略优化,DEPT 用文档嵌入保持微调解决"移动目标"问题。工业落地价值极高,尤其 OGR 已在快手线上验证。; [紧凑 LLM 成为落地主角,效率与效果之争进入新阶段:FLEXRec、CARA 等论

AI 技术日报 - 2026-08-20

今日 AI 领域围绕"隐私安全"与"Agent 工程化"双主线展开。OpenAI 预览 Private Safety Processing,试图调和 Zero Data Retention 承诺与跨交互安全监控的矛盾,正面回应 Anthropic 的企业客户隐私优势;同时 CFO 确认 2027 年上市时间表,商业化路径进一步清晰。开源侧,Ornith-1.5 以自改进策略训练发布三档模型,比肩 Claude Opus 4.8;Qwen3.8-27B 发布 4 天登顶 Cline 本地模型榜首。地缘政治层面,美国出口管制漏洞曝光——中国 AI 公司借道东南亚远程租用 Nvidia 算力,RAS

推荐算法日报 - 2026-08-19

[工业级系统落地成为主旋律]:今日多篇重磅论文来自 Google、Meta、Amazon、PayPal 等一线大厂,且均已在生产环境部署验证。Google Discover 的 SDF 系统将内容过时问题分解为 supersession 和 decay 两种机制并分别建模,两年部署用户投诉下降 54.9%;Meta 的 UniDot 统一特征交互与序列建模,斩获 KDD Cup 2026 工业赛道亚军。工业界正从"单点模型优化"转向"全链路系统级问题拆解",且更强调可部署性和推理成本控制。; [

AI 技术日报 - 2026-08-19

今日 AI 领域动作密集:OpenAI 罕见暂停部分前沿 RL 训练,CEO Sam Altman 与首席科学家 Jakub Pachocki 公开表态"安全信心将越来越决定 AI 进步速度",并签署 Pacing the Frontier 协调倡议。模型竞争白热化,智谱发布 GLM-5.3,Intelligence Index 60 分持平 Kimi K3,agentic Elo 跃至 1770 仅次于 Claude Opus 5;DeepSeek 开源 harness 却遭独立复测分数争议,较官方低 9-33 分。产业资本端,Anthropic 营收 run rate 突破 $65B 并密

推荐算法日报 - 2026-08-18

对话式推荐进入 Agent 化与可靠性双轨时代:今日多篇论文聚焦对话式推荐,但技术路线明显分化。Microsoft 的 AdsWorldEngine 走全 LLM Agent 路线,通过 Orchestrator 与 Tool 协同进化实现自改进;而 Stanford/MIT/Amazon 的 MACS 则走混合路线,将语言理解交给 LLM、把约束执行交给确定性模块。两条路线都强调"可靠性"——前者用 Opportunity Gate 控制广告侵入性,后者用确定性过滤保证硬约束不漂移。对工业界而

AI 技术日报 - 2026-08-18

今日 AI 领域迎来基础设施层的标志性并购:Stripe 以 70 亿美元收购 OpenRouter,模型路由层价值重估,AI 聚合时代开启。与此同时,LiteLLM 供应链攻击波及 2,500+ 公司、434,000 条 CI/CD 管道,成为 2026 年最大 AI 供应链安全事件。NVIDIA 为 OpenAI 提供 4.25 吉瓦 AI 工厂算力,20 年 6000 亿美元算力承诺揭示约束已从芯片迁移到电力。模型侧,Grok 4.6 在 Agentic 指数并列第一且成本仅为 Claude 的 1/4,Qwen3.8-27B 被列为首个达前沿水平的本地模型,消费级硬件跑出超 100 t

AI 技术日报 - 2026-08-17

今日 AI 领域迎来商业化拐点信号:Anthropic 首次实现盈利并秘密提交 IPO,OpenAI 企业收入首超个人客户,两大头部实验室同时进入"用收入说话"的新阶段。技术侧,Stripe 拟超 70 亿美元收购 OpenRouter,DeepSeek 开源 deepseek-harness 编码 Agent 框架并发布超连接约束新论文,清华与 ByteDance 联合开源 CUDA Agent 实现 GPU 内核自动编写。开源小模型生态持续升温,Qwen3.8-27B 本地运行实测引发广泛讨论,8GB 显卡即可跑满 64k 上下文。

AI 技术日报 - 2026-08-16

今日 AI 领域呈现"开源生态爆发 + 自主 Agent 能力质变"的双主线格局。Qwen 开源模型全球下载量突破 30 亿登顶世界第一,Qwen3.8-27B 上线即获社区热捧;X 开源 For You 推荐算法并公布排名权重,马斯克亲自转发。Agent 自主性迎来里程碑:Grok 4.6 连续 48 小时无间断构建射击游戏,Prime Intellect 完成最大规模开源自主 AI 研究实验。成本效率竞争白热化,DeepSeek Pro V4 Max 以 $23 完成 Rust 重写挑战,仅为 Fable 成本的 4%。监管与对齐辩论升温,Dario Amodei 长文回应"监管即权力集中

AI周报 2026-W33

这一周几乎是模型发布周。8/11-8/12 的 Frontier Model Day 前后,xAI、Alibaba、DeepSeek、智谱、Google 在三天内扎堆上新,加上 8/14 的 Cursor 收购,构成了 2026 年至今密度最高的一周。单看模型侧,Grok 4.6(Artificial Analysis 评测)拿下 61 的 Intelligence Index,Qwen3.8-2.4T-A95B 开源,DeepSeek V4 Pro 以 MIT 许可发布,GLM-5.3 上线,Gemini 3.7 Flash 紧随其后。每条单独拎出来都是季度级事件,集中在五天内发生,说明迭代节奏已经从"季度发布"压到了"周级"。 值得注意的第二条线:效率成了这一轮竞争的主轴。Grok 4.6 定价 $2/$6,cache hit 降到 $0.5;Gemini 3.7 Flash 的 intro 价格是 3.6 的一半;OpenAI 预告了 Ultrafast 档位,把 GPT-5.6 Sol 推到 750 tokens/秒。头部模型在智力差距缩小的前提下开始拼单位成本——方向跟 2025 年完全一致,但这周的密度罕见。 第三条线是 Agent 基础设施的整合。Cursor 被 SpaceX 收购加入 SpaceXAI,vLLM 一周内为五个新模型提供 day-0 支持,Agent 的"交付层"和"编排层"都在快速收敛。下面分主题展开。

推荐周报 2026-W33

本周推荐系统研究以工业部署论文领跑。Netflix、Yandex、Meta、LinkedIn、快手、阿里、字节各自拿出了线上 A/B 结果,密集程度在本年度少见的。如果只看一个趋势——生成式推荐正在从实验室验证阶段转向"用单一模型替换整个生产级联"的系统工程阶段。 主线 1(生成式推荐的两个方向): Yandex Music 的 Sona 用单一生成式模型替换了超过 15 个候选生成器加预排序/排序的完整级联,Active Users +4.53%。Netflix 的 GenRec 走了另一条路——不替换级联,而是用 LLM 排序器作为精排层,A/B 中相对生产排序器取得统计显著提升。同一周内两条路线并行验证,是本周论文密度最高的信号。而快手的 PushDualGen 则在解决生成式推荐的可解释性:生成 SID 后附带一段可跳过的 copy 作为解释,有效播放率 +8.50%,不满率 -37.70%。 主线 2(因果推断从理念走向部署): LinkedIn 的决策中心因果优化框架在 Feed 营销流量上实现 +7.20% 长期价值提升,把因果效应估计、贝叶斯 bandit 和线性规划分配统一到一个目标下。Meta 的 MARCO 更微观——用点击类型作为自由行为标签分解点击意图,每点击转化 +2.80%。两篇的共同指向:因果推荐不再只是论文里的去偏技巧,而是生产系统里可落地的收益来源。 主线 3(多任务与全链路优化的系统工程化): 阿里的 IntHQ 在高德部署,处理生成式推荐里多任务学习的三个 collapse 问题,UVCTR +1.60%。阿里的 DREAM 则在淘宝首页用智能体元控制架构在现有流水线之上叠加策略层,IPV +2.06%。字节的 TM20K 把电商行为序列扩展到 2 万长度,ADSS +1.036% 而服务延迟只增 5.6%。

推荐算法日报 - 2026-08-15

测试时优化与推理效率成为新战场:从 TTT-Embed 在冻结模型嵌入空间中学习轻量向量、无需权重访问即可复用排序奖励,到 Prof-K 用单遍过滤实现 1.5-10 倍 top-k 加速,再到 Search-R1 用结构化停止判断减少检索调用——业界正从"训练更大的模型"转向"在推理/测试阶段用更少的算力榨取更多性能"。对工业推荐系统而言,这意味着可以在不重新训练大模型的前提下,通过轻量适配层或算法优化实现召回/排序的即时增益。; 鲁棒性与去偏从"单点"走向"全链路":DrEM 处理上游多任务