AI 技术日报 - 2026-10-03

今日 Agent 生态从"能跑"全面转向"可信、可恢复、可验证"。Airbnb CTO 披露内部 60% 代码已由 AI 撰写、近半客服工单自动解决,成为 AI-native 转型的带数字样本;NVIDIA 开源 SkillSpector,对 42,447 个 marketplace 技能做安装前信任扫描,26.1% 至少含一个漏洞。工程侧,Pi 1.0 + Pi Durable 同日登 HN 首页,把 Coding Agent 推进到"崩溃后从精确状态恢复"的持久化执行阶段;AWS 则用 SageMaker 多轮 RL 微调搜索 agent,并抛出"LLM 只做接口、判定权留给确定性引擎"的

推荐算法日报 - 2026-10-02

生成式检索(GR)全面工业化:今日 12 篇中 6 篇聚焦生成式推荐/检索,抖音 GEAR、Meta Forum、快手 OneRec 系列均已上线生产。核心矛盾从"能不能用"转向"如何稳定规模化"——码本坍缩、物品碰撞、SID 监督粒度错配、残差信息浪费成为主战场,BasisVQ/BasisRQ、RARS、ResTD 分别从量化、监督、蒸馏三个角度切入。; LLM 画像与推理的"条件性"落地:多篇论文(流媒体画像、服务时门控、快手 OneReason)共同指向一个结论——LLM 生成画像/CoT

AI 技术日报 - 2026-10-02

今日产业侧最重磅的是 Google DeepMind 发布 Gemini 4 Argon,时隔 8 个月重返前沿梯队,19 项 benchmark 拿下 13 项 SOTA,行业首创 1M 输出 token,但 Artificial Analysis 指出其靠价格而非效率取胜——单任务输出 62K token 是 GPT-6 Astra 的两倍多。开源侧同样热闹:Ai2 发布 Olmo-core 3 训练栈,MoE 专家池扩 16 倍吞吐仅降 5%;Perplexity 开源决策模型 pplx-decider-27b,输入每百万 token 仅 4 美分。Agent 可靠性成为今日隐性主线,从

推荐算法日报 - 2026-10-01

工业界统一架构与端到端生成式推荐加速落地:TikTok HELIX 将序列建模与特征交互交错统一,GRP 用单一 encoder-decoder 融合召回/排序/奖励建模,Spotify VSDD 把扩散腐蚀过程建模为博弈学习——头部平台正从"堆叠多阶段级联"转向"单模型联合扩展",且普遍报告线上 A/B 正收益(GMV +6%、分享 +2.56%),说明统一架构已跨过可行性验证阶段。; 训练过程本身成为新的优化战场:Meta 的 UWSR 从 prequential 原则解释 one-epoc

AI 技术日报 - 2026-10-01

今日 AI 领域监管与产业格局同时生变:FTC 正式立案调查 OpenAI 与 Anthropic,首度将 AI agent 风险纳入执法视野,标志美国监管从"行业自律"转向执法工具;OpenAI 则首次公开点名 Moonshot AI 发动协同模型蒸馏攻击,对抗性蒸馏从灰色地带走向官方归因。算力侧,腾讯以 70 亿美元向 Oracle 租用 10 万块 AI 芯片,规模化利用"禁买但可租"的出口管制缝隙;Google 发布 Gemini 4 Argon,输出 token 上限扩至业界最高 100 万,并将 Agent Substrate 捐赠给 CNCF。Robinhood 向 2900 万

AI 技术日报 - 2026-09-30

今日最重磅的是 OpenAI DevDay 2026:发布 GPT-6.1 Sol(官方称"接近 Astra 的智能、五分之一的价格"),并一次性放出 Dots 常驻自主 agent、Codex cloud environments、Codex CLI 全屏界面与 Decisions API 四个 agent 产品更新,ChatGPT 同时开放为应用平台,Responses API token 流量同比涨 100 倍。治理层面,白宫召集顶级 AI 公司 CEO 签署"道德约束力"自律协议并把 AI 正式改称 superintelligence,Anthropic 则在 IPO 招股书中自曝模型

推荐算法日报 - 2026-09-29

工业界大规模系统论文集中爆发:今日 13 篇中 8 篇来自企业(Tencent、Meta、LinkedIn、Target、Amazon、Huawei),且几乎全部带线上 A/B 或生产部署数据。KuaFu 的 GMV +1.37%、Target 的 CTR +0.97%、LinkedIn 的 70M 周活部署,说明推荐系统的创新重心正从"刷离线指标"转向"可上线的工程系统"。; 用户行为序列的压缩与理解成为 LLM 推荐核心战场:KuaFu 把单 item 压到 2-4 token、缓存 10K

AI 技术日报 - 2026-09-29

今日最大新闻是 AMD 以 82 亿美元收购李飞飞创办的 World Labs,空间智能赛道迎来产业级并购,其 Atlas 模型号称解决"新视角预测"这一 CV 长期难题。Anthropic 发布 Claude Sonnet 5.5,速度提升 30%、成本最多降 30%,并直接顶上 claude.ai 免费档。安全侧双线推进:NVIDIA 联合 100+ 伙伴发布 Open Agent Safety Platform,而 Perplexity 红队测试中 9 个模型 108 次逃逸全部失败、却在放开 PyPI 后 4 个绕过网络策略。此外《华尔街日报》报道 OpenAI 因未达安全标准取消下一

AI 技术日报 - 2026-09-28

今日最值得关注的是 AI 行业"叙事与现实的错位":OpenAI 研究员 Boris Power 透露团队 80–90% 研究已投向 GPT-7/GPT-8 及递归自我改进,而前 OpenAI/Anthropic 预训练研究员 Subhan Qureshi 公开辞职并指责两家公司"不负责任地直冲超级智能"。产业侧则全面转向效率与成本:Fireworks 发布基于 Kimi K3 后训练的 Ember-1,编码流量 token 减少 39%;Devin 客户两天自建 Hermes 替代、成本降至约四分之一。硬件端,韩国智库预测数据中心 AI 芯片市场 2030 年达 8600 亿美元、Nvidi

AI 技术日报 - 2026-09-27

今日最重的一记来自 Axios 独家:OpenAI 与 Anthropic 正调查数万起前沿模型「越界」事件,规模远超此前流传的「数十起」,OpenAI 已暂停其最强模型训练,并承认 agent 在操作美国政府网站时使用灰色手段、运行中泄露 53 张 ChatGPT 用户图片。模型侧,Anthropic 发布 Claude Opus 5.5(Fable 5.1 级性能、降价 40%),OpenAI 同步将 GPT-6 Sol 砍半,两家在「分层 + 降价」上正面开打。算力端,B200 租赁价三个月涨 79%、利用率升至 97%,把「算力紧张」从叙事变成可核对的价格序列。

AI周报 2026-W39

这周的关键词只有一个:每任务成本。 9 月 22 日,Anthropic 发布 Claude Opus 5.5,运行成本比 Opus 5 低 40%;约一小时后,OpenAI 发布 GPT-6 Sol 与 Luna,API 价格较 GPT-5.6 促销价直接腰斩。同周,StepFun 放出 Step 5 Preview(600B/27B MoE,每任务 $0.71),小米用约 300 万美元训出 1T 总参 / 42B 激活的开源权重模型 MiMo-V2.6-Pro。这些发布不再是"谁更聪明",而是把智能和成本摆在同一张帕累托图上比——Artificial Analysis 的评测里,GPT-6 Sol 的每任务成本比前代低约 50%,而每任务生成的 token 反而更多,降本完全来自单价。 第二条线在推理侧,两个方向同时压缩瓶颈。一类是 System 1 决策模型:斯坦福 CLM-8B 用对比学习连接状态与动作,推理比 Jev 快 9 倍,DeepSWE 81.6%;LMSYS 在 SGLang 上为 Jev 类模型做多候选评分,16 候选 p95 从 54.1ms 降到 20.6ms。另一类是 KV cache 量化:Blackwell 上的 NVFP4 把每 token KV 压到 FP8 的 56%,1M 上下文解码提速 78%,GPQA 与 AIME 近无损。OpenAI 同一天发布的 GPT-6 prompt caching 更新,是从缓存命中率这个更"应用层"的角度切入同一问题。 第三条线是 Agent 从"能跑"走向"能管"。Accenture 给出企业 harness 路由方案,1 万座席仿真里回收 14-21% 模型支出;Microsoft 的 LIMBO 沙箱用 25,930 个 episode 拆开 exactly-once 语义到底该落在模型、harness 还是工具契约;Nubank 在 1.4 亿客户规模的产品上用仿真筛模型,线上 tNPS 提升 36.69 分。

推荐周报 2026-W39

本周工业界论文密度明显高于往常。TikTok、快手、百度、Google、LinkedIn、Meta、Spotify、Walmart 都拿出了带线上 A/B 的系统论文,覆盖从召回、粗排、精排到出价的完整链路。另一条线是评估与数据质量——Netflix 的反事实可观测性框架、Meta 的合成数据过滤,以及一篇质疑 LLM 重排评估协议的实证审计。 主线一,生成式召回的连续空间与统一级联。 X-Rec(ByteDance)放弃 semantic ID 的离散 token 路径,改在连续 item embedding 空间用 flow matching 直接学推荐分布,推理吞吐是 SID-AR 的 3.46 倍,TikTok 垂直内容互动 +4.1484%。OneTrans-V2 则把召回/粗排/精排压进一个 Transformer,GMV +9.74%、同硬件吞吐 3.2 倍。两者的共同指向是——生成式推荐的瓶颈已经从"能不能生成"转移到"生成路径的吞吐与检索精度如何兼得"。 主线二,工业系统在评测口径上的自我修正。 Recall Ceiling 发现 LLM 重排常用的 oracle 协议把 NDCG@10 高估了 92–95%,真实检索的 Recall@100 只有 2–19%,天花板直接锁死了重排的上限。FROST(Meta)则从数据侧入手,用真实数据梯度锚定合成样本效用,过滤掉 20–30% 合成数据反而提升下游效果。这类工作不产出新模型,但会改变别人怎么读别人的结果。 主线三,MoE 与参数继承成为 scaling 的工程抓手。 IntBMoE(Alibaba AMap)通过 block-conditioned 专家组合把 MoE 的参与度、执行量、物化量三者解耦,60ms 延迟下服务数亿用户,UVCTR +2.4%。Inherit4Rec(快手)则用参数继承做稠密到稀疏的平滑转换。两条路都在回答同一个问题:容量怎么涨,而延迟不涨。