本周24篇论文中,4篇来自工业在线部署(Meta、Netflix、阿里巴巴、快手),覆盖召回、排序、重排、全链路生成阶段。核心技术密度的分布逻辑在变——生成式推荐从"能生成"走向"能推理",召回从嵌入匹配转向导航式探索,排序阶段则在约束和解释之间寻找平衡。 生成式推荐进入"推理+强化学习"时代: GR2、ShopX和GenPage在同一周展示了三种不同的生成式架构走向。GR2在重排阶段首次引入推理链(CoT)和RL后训练,在工业流量上R@1提升18.7%。ShopX将生成式推荐从候选生成推向"意图到物品"的端到端执行,在淘宝Agent场景下复杂请求满足率提升55-75%。GenPage走得最远——用单Transformer替代Netflix整套多阶段主页流水线,核心指标+0.24%的同时延迟降低20%。三篇的共同指向是:生成式推荐的核心壁垒已从"能否生成"转向"能否在推理质量与部署效率之间找到工业可行解"。 召回从静态匹配走向动态图探索: Meta的硬负采样通过LLM聚类生成实时同簇负样本,在线召回率+8.5%、流行度偏差-12.3%。快手的IID-Nav将召回建模为自主图探索,支持间接无限深度遍历。Kuaishou的POEM利用多任务排序分数构建偏序序列,实现请求级别的实时兴趣更新。三条技术路径共享一个趋势:召回正从静态嵌入查询转向动态、上下文感知的行为建模。 约束优化与可解释性重回视野: Avito的PermR在5600万搜索查询上证明了相邻交换法能在生产延迟内逼近整数规划收益。KakaoBank的ChunkGroupSHAP用分组Shapley值弥合了词级解释与密集排序器之间的粒度鸿沟。这两个工作提醒行业:在大模型热潮中,渐进式工程优化和可解释性工具仍能产出具象收益。
今日 AI 领域聚焦效率革命与 Agent 工程深化:vLLM 团队将 Qwen3-Omni 实时语音推理延迟降至 0.6s、吞吐提升 5.4 倍,标志多模态推理走向实用;Anthropic 与三星洽谈定制 AI 芯片,AI 巨头加速硬件自研;NVIDIA 推出 GPU 收入分成计划,降低初创公司算力门槛。同时,ZCode 以免费策略挑战 Cursor 和 Claude Code,Adobe 展示 'Agentic Site' 概念,预示 Agent 驱动 Web 体验的新范式。学术界方面,蚂蚁集团发布 Vera 框架系统性测试 LLM Agent 安全,Microsoft 推出首个 Offi
今日 AI 领域迎来多个里程碑事件:Anthropic 前沿模型 Fable 5 和 Mythos 5 在出口管制解除后全球重新上线,标志美国 AI 监管从激进限制转向有条件开放。MCP 协议宣布 7 月 28 日转向无状态,所有生产部署团队需紧急适配。Meta 公开 AI 存储架构演进,揭示传统 BLOB 延迟瓶颈导致 GPU stall 的核心挑战。同时,Together AI 完成 8 亿美元 C 轮融资,估值 83 亿;Kling AI 生成的广告片在戛纳电影节获奖;Boston Dynamics 的 Spot 机器人部署于 2026 世界杯安保。AI 正从聊天机器人时代走向自主工作时
今日 AI 领域迎来多个重磅发布:Anthropic 发布 Claude Sonnet 5,性能逼近 Opus 4.8 但价格更低,同时推出面向科学家的 Claude Science 工作台。Amazon 成立 10 亿美元 FDE 组织押注 Agent 现场部署,X 推出官方 MCP Server 扩展生态。微软连发 Memora 记忆系统和 SkillOpt 技能优化两项 Agent 架构突破,NVIDIA 通过软件优化使 DeepSeek V4 在 Blackwell 上月内性能提升 5 倍。Figure 人形机器人 F.03 已抵达宝马工厂,Jim Fan 发布 ASPIRE 机器人技
今日 AI 领域迎来多个重磅动态:美团 LongCat 的 Owl Alpha 1.6T MoE 模型登顶 OpenRouter,完全基于 50k 中国 ASIC 训练,标志着国产算力生态的里程碑式突破。同时,阶跃星辰 Step 3.7 Flash 在自主 Agent 评测中排名第二,MiniMax M3 428B 在三台 Mac 上本地运行并自主创建股票组合,中国 AI 力量全面崛起。工具生态方面,Cursor 发布 iOS 应用、vLLM 深度优化 TTS 模型、LlamaParse 推出 Retrieval Harness,Agent 开发正从桌面走向移动端和生产级。学界方面,上海 AI
本周 AI 行业围绕一条核心叙事展开:大规模基础设施层的能力突破,正在加速从实验室到生产部署的转化。 OpenAI 在同一天发布两则重磅消息——自研推理芯片 Jalapeño 与 GPT-5.6 Sol——覆盖了从硬件到模型栈的完整闭环。这不是孤立的发布,而是上下游协同推进的节奏:芯片优化推理成本,模型提升能力上限,两者共用同一个基础设施栈。 第二条主线是 Agent 工程从实验走向生产治理。Stripe 发布金融合规 Agent 实战案例,AWS 连续三篇博客聚焦 MCP 代理层与数据治理,GitHub 给出 Copilot agentic harness 的横评数据。与此同时,Anthropic 的 Claude Slack Tag 将 LLM 定位为组织级持久成员,Karpathy 评价这是 "LLM UI/UX 的第三次重大设计"。Agent 不再是单次对话,而是公司内部持续运行的角色。 第三条主线是 后训练范式从人工摸索向自动化、系统化演进。Amazon 发布 A-Evolve,在 30B 模型上实现无人干预的自主后训练;OpenAI 验证了有益行为 RL 在分布外泛化上的持久性;Qwen 的路标语言世界模型为 Agent RL 提供了可扩展的训练环境。这些工作共同指向一个信号:RL 不再只是 SFT 后的微调步骤,而是正在成为模型能力扩展的主引擎。