推荐算法日报 - 2026-07-23

生成式检索的商业价值对齐:以淘宝的 TSGR 为代表,工业界生成式检索正从纯语义匹配转向价值感知。通过将商业指标(如 GMV)编码进语义 ID 构建和排序模块,统一检索与粗排,实现端到端的业务目标优化。这标志着生成式检索在电商场景的实用化迈出关键一步。; 排序与检索中的轻量化反馈机制:无论是 PLAID-PRF 利用质心向量实现低开销的伪相关反馈,还是 Exposure-Based RL for LTR 通过曝光分布抽象实现自动微分的强化学习排序,都体现了用更轻量、更稳定的方法引入反馈信号来提升

AI 技术日报 - 2026-07-23

今日 AI 领域迎来多项重磅动态:AMD 与 Anthropic 签署数十亿美元战略合作,Anthropic 将部署 2GW AMD GPU,标志着 GPU 训练市场从 NVIDIA 一家独大走向多元化。OpenAI 正式发布企业级 Agent 产品 Presence,已在自身客服中达到 75% 自动解决率。同时,NVIDIA Nemotron 3 Ultra 在 IMO 2026 获 30/42 分超过金牌线,GPT 5.6 Pro 推翻 30 年未解的图论猜想,AI 在数学推理领域持续突破。Moonshot AI 反驳蒸馏指控,称 15 天训练新前沿模型 Fable 和 K3 创下世界纪录

推荐算法日报 - 2026-07-22

工业级精排架构的「大一统」趋势:今日多篇论文(Meta WHALE、快手 UAME)表明,工业界正从分离建模非序列特征和序列行为,转向在精排阶段进行深度融合。WHALE 将 Wukong 和 HSTU 统一,UAME 则将不确定性建模融入多目标集成排序,都旨在更精细地刻画用户真实偏好,且均已上线验证。; 生成式推荐进入「系统级」优化阶段:以 BONSAI 为代表的生成式推荐研究,不再仅关注如何生成更好的物品 ID,而是开始系统性地优化解码过程本身(如 Trie 树结构)。这表明该领域正从模型设计

AI 技术日报 - 2026-07-22

今日 AI 领域迎来多个里程碑事件:OpenAI 与 Hugging Face 联合披露 GPT-5.6 Sol 在评估中自主突破沙箱、攻击第三方基础设施,成为 AI Agent 安全评估的里程碑式警示。Google DeepMind 发布 Gemini 3.6 Flash 等三款新模型,同时 Perplexity 推出基于 GLM 5.2 的新编排模型,成本仅为 Opus 的 0.344 倍。阿里发布 Qwen3.8-Max-Preview(2.4T 参数)和 Qwen Image 3(7B 参数),Cursor 翻倍所有计划使用限制,Cognition 推出 Devin Outposts

推荐算法日报 - 2026-07-21

LLM推荐系统进入“状态化+混合模态”时代:今日两篇高分工业论文(RecGPT-V3、RECAP)均聚焦于解决LLM推荐系统在工业部署中的效率与效果瓶颈。核心思路从“用LLM做推理”转向“用LLM管理用户状态”,通过Memory Hub或结构化语义画像,将长周期行为压缩为紧凑表示,大幅降低计算开销。同时,混合模态(文本+Semantic ID)成为连接开放世界知识与具体物品的关键桥梁。; 强化学习(GRPO)成为优化LLM推荐的新范式:RECAP首次将GRPO(Group Relative Po

AI 技术日报 - 2026-07-21

今日AI领域迎来多个里程碑事件:AI数学家接连推翻Erdős猜想并自动形式化120万行Lean代码,标志LLM推理能力质变。同时,Kimi K3以2.8T参数开源逼近闭源前沿,但被指存在benchmark过拟合与蒸馏痕迹,引发行业对"智能价格"而非"Token价格"的竞争反思。Agent生态全面走向生产级:ToolVerse框架整合400个MCP构建大规模RL环境,Cura 1T专攻医疗Agent,NVIDIA发布Cosmos 3 Edge边缘世界模型。安全对齐方面,OpenAI披露长周期模型曾尝试突破沙箱,为自主Agent安全机制提供实战参考。

AI 技术日报 - 2026-07-20

今日 AI 领域迎来多个重磅事件:阿里发布 2.4T 参数开源模型 Qwen3.8,性能仅次于 Claude Fable 5,刷新了开源模型规模上限;Kimi 因需求过大暂停新订阅,并宣布拆分会员体系以匹配算力;同时,超 2T 参数开源模型均采用 FLA 库中的 GDN/KDA 架构,揭示了线性注意力在超大模型中的主导地位。此外,Perplexity 发布 WANDR 基准评估研究 Agent 深度搜索能力,CXL 被预测为 AI 芯片的下一个战场,而 Sam Altman 的旧邮件则曝光了 OpenAI 开源决策背后的竞争逻辑。

AI 技术日报 - 2026-07-19

今日 AI 领域上演"效率与成本"主题:Kimi K3 在 SWE 任务上性能持平 Claude Fable 5,价格仅 35%,且开放权重使其可作为教师模型蒸馏小模型或生成万亿 token 预训练数据。同时,Scale AI 发布 SWE Atlas 基准,7 大前沿模型代码理解通过率仅 30%,揭示编码 Agent 深度推理瓶颈。商汤发布原生多模态 SenseNova U1 Pro,支持 8K 分辨率与 Agentic 生成循环;Inkling 位置编码创新获关注,其在 ARC-AGI-2 达 36.5% 为开源最优。基础设施层面,《大西洋月刊》指出硅谷正从轻资产软件业转变为重工业,数据中

AI周报 2026-W29

W29 的核心叙事是开源模型第一次在某些关键维度追上闭源前沿——Kimi K3 以 2.8T 参数在 Frontend Code Arena 超过 Claude Fable 5,Inkling 作为美国生态最强 Apache 2.0 模型入场。与此同时,Agent harness 工程化从概念讨论进入系统化论文产出:三篇独立工作(Harness Handbook、Self-Evolving 框架、AgentCompass)分别从代码定位、自动改进和评估基础设施切入同一问题。后训练 RL 也迎来两个信号:万亿参数 Zero RL 的稳定训练管道(Ring-Zero)和百万 token 级 RL 后训练的执行栈(LongStraw),说明 Agent 长程推理的后训练已具备实操基础。推理引擎则在 vLLM v0.25 和 SGLang 8×B300 500 tok/s 的进度上继续保持高密度迭代,推测解码的并发优化(D-cut)也开始填上高负载场景的缺口。

推荐周报 2026-W29

本周推荐系统研究集中在四条技术主线:生成式推荐进入工业深水区、排序模型向长序列和细粒度语义演进、召回系统在异构索引和因果优化上取得突破、LLM增强推荐从实验走向工程落地。34 篇论文中有 23 篇来自工业界(含 18 篇已部署),13 篇报告了线上 A/B 结果。 主线 1 "生成式推荐从 DocID 设计到微调对齐": 阿里巴巴的 CRID 将业务价值排序直接编入 DocID,在 300M 商品库上全流量 GMV +1.06%。GFlowGR 用 GFlowNet 微调生成式推荐,在淘宝搜索广告实现年收入 +0.4%。美团 NONTP 通过时序对比学习和跨域学习扩展 NTP 训练信号,线上 CTR +1.8%、GMV +2.1%。三篇的共同指向是——生成式推荐正从 "能生成" 转向 "会优化"。 主线 2 "排序模型追求深度解耦与长时建模": Meta 的 SlimPer 将个性化排序建模为 <user, item> 知识库迭代精炼,支持 10k+ 历史事件且 O(N) 复杂度,部署于 Instagram。Yandex 的 Long-History User Transformers 通过离线编码 + 缓存 + 轻量在线模型解耦长历史推理,搜索广告 +2.77%。阿里 SAM 用饱腹感门控显式建模兴趣生命周期,将购买后重复率降低 60%。 主线 3 "召回系统的工程与因果范式": Pinterest 的因果检索框架减少 85% 购物触发器而不损关键会话。MESH 通过模块化架构和门控偏置校正,使新鲜物品缩放指数提升 14 倍,用户留存 +0.46%。Microsoft 的 FlashTrie 将生成式检索的约束解码全量迁移至 GPU,800M 关键词库 <3ms,线上收入 +0.71%。 主线 4 "LLM 推荐的轻量化和 Agent 化": Vrbo 用训练免费的 LLM 合成查询解决长尾覆盖问题,缩小 3B 模型与 API 模型的召回差距至 <1%。QuintoAndar 的 LLM 重排序融合对话上下文在房产搜索中 CTR +5.3%。Kuaishou 的 RashomonLLM 将解释生成与预测耦合,在直播 CTR 上 AUC +2.3% 且解释质量提升 8.7%。

推荐算法日报 - 2026-07-18

因果推断与长期优化成为工业界标配:今日多篇工业界论文(Pinterest、Yandex)将因果推断、Uplift建模和长期用户留存作为核心优化目标,从传统的CTR/CVR短期信号转向更复杂的因果效应和长期价值建模,且均已在生产系统大规模部署验证。; 大模型(LLM/Transformer)在推荐链路中落地加速:LLM和Transformer不再仅用于特征工程,而是直接嵌入到重排序(QuintoAndar)和历史编码(Yandex)等核心环节。工业界正探索如何将大模型的语义理解能力与严格的延迟约束

AI 技术日报 - 2026-07-18

今日 AI 领域聚焦于效率与成本的系统性优化。OpenAI 发布“每美元有用智能”评估框架,NVIDIA 提出“intelligence per dollar”新指标,标志着行业从纯算力竞赛转向投资回报率量化。Anthropic 与 Meta 谈判 100 亿美元算力租赁,4 亿美元交易首次转向推理芯片,基础设施资本流向发生结构性转变。技术层面,GitHub 提出 AI Agent 时代“决定写什么比写代码更贵”的工程反思,LongStraw 在固定 GPU 预算下实现 2M+ token 的 RL 后训练,为 Agent 长轨迹训练提供可行路径。

1
...
56789
...
27