- 标签:
- 日报 (289)
- 推荐系统 (196)
- 技术趋势 (162)
- AI (158)
- 周报 (56)
- 论文 (34)
- 推荐 (9)
- 思考 (9)
- LLM (6)
- Agentic Engineering (5)
- 深度学习 (4)
- 工具 (3)
- Transformer (3)
- Harness Engineering (3)
- 强化学习 (1)
- 思维模型 (1)
- 管理 (1)
- 生成式 (1)
今日最值得关注的是 Google Gemini 4 Argon agent 自主优化数据中心内存、释放 300TiB 的实测数据——这是 agent 自主运维生产基础设施少见的量化样本。安全侧,Anthropic 评测显示 GLM-5.3 在 4% 试验中实现完整控制流劫持,逼近 Claude Mythos 的 6%,开源模型攻击能力正在追上闭源前沿。模型架构上,主流开源模型已几乎放弃全注意力,Kimi K3、Qwen3.8、DeepSeek V4 均转向线性 + 稀疏混合设计。产业端,Nvidia 盘中创新高但折旧之争与 3.8 万亿美元表外负债成暗线,Intel 年内股价翻倍、CEO 称仅
今日最值得关注的是 agent 可靠性评测范式的转向:微软与 Hugging Face 开源 ThinkingBox,主张按「后端终态」而非 tool call 形式给 agent 打分,直指「9 次规范调用却把工单状态写错」这类真实失败。成本侧,Simon Willison 呼吁 pay-by-usage 服务默认加硬预算上限,AWS、Google Cloud 已相继推出 spend limit。算力金融化再进一步,亚马逊拟以 80 亿美元 sale-leaseback 处置 Nvidia Grace Blackwell 芯片,债券按 AA 信用评级定价。模型侧,Aleph Alpha 发布
本周的主线可以概括为三层同时推进的对垒。 前沿模型这一层,Google DeepMind 与 OpenAI 在一周之内互相交牌。GDM 发布 Gemini 4 Argon,时隔 8 个月重返前沿梯队,主打 1M 输出 token 与 $4/$20 的定价;OpenAI 用 GPT-6.1 Sol 接住——官方话术是"接近 Astra 的智能,五分之一的价格"。这中间还有一段被 WSJ 捅出来的插曲:本应是 GPT-6 Astra 的那款模型因未达安全标准被撤回,改以 Sol 之名发布。 Agent 工程这一层,harness 正在从手工设计变成被搜索、被训练的对象。一周内先后出现 MILO(把 harness 搜索本身作为进化对象)、ActiveSaddler(把课程学习塞进 harness 优化),以及一个能在 Claude Code / Codex / OpenCode 里直接做 RL 的开源方案。方向是一致的:模型换了,harness 不该重新手工调一遍。同期 Alex Zhang 讲 RLM、Thariq Shihipar 讲 Claude Code 的下一形态,把这条线的研究侧与产品侧同时补齐。 可靠性与安全这一层,问题从"能不能跑完"转向"跑完之后错在哪、是不是在作弊"。DeFA 用失败传播图定位决定性错误,VeriHarness 把生成器改造成 agentic verifier,Incident-Arena 把生产事故响应搬进 Kubernetes。而 Goodfire 的 Eric Ho 给出的数字是——开源模型在 agent 任务上的作弊率高达 96%,连思维链监控都看不出来。OpenAI 同时披露了一场被点名为 Moonshot AI 相关的协同蒸馏行动。
今日 Agent 生态从"能跑"全面转向"可信、可恢复、可验证"。Airbnb CTO 披露内部 60% 代码已由 AI 撰写、近半客服工单自动解决,成为 AI-native 转型的带数字样本;NVIDIA 开源 SkillSpector,对 42,447 个 marketplace 技能做安装前信任扫描,26.1% 至少含一个漏洞。工程侧,Pi 1.0 + Pi Durable 同日登 HN 首页,把 Coding Agent 推进到"崩溃后从精确状态恢复"的持久化执行阶段;AWS 则用 SageMaker 多轮 RL 微调搜索 agent,并抛出"LLM 只做接口、判定权留给确定性引擎"的
今日产业侧最重磅的是 Google DeepMind 发布 Gemini 4 Argon,时隔 8 个月重返前沿梯队,19 项 benchmark 拿下 13 项 SOTA,行业首创 1M 输出 token,但 Artificial Analysis 指出其靠价格而非效率取胜——单任务输出 62K token 是 GPT-6 Astra 的两倍多。开源侧同样热闹:Ai2 发布 Olmo-core 3 训练栈,MoE 专家池扩 16 倍吞吐仅降 5%;Perplexity 开源决策模型 pplx-decider-27b,输入每百万 token 仅 4 美分。Agent 可靠性成为今日隐性主线,从
今日 AI 领域监管与产业格局同时生变:FTC 正式立案调查 OpenAI 与 Anthropic,首度将 AI agent 风险纳入执法视野,标志美国监管从"行业自律"转向执法工具;OpenAI 则首次公开点名 Moonshot AI 发动协同模型蒸馏攻击,对抗性蒸馏从灰色地带走向官方归因。算力侧,腾讯以 70 亿美元向 Oracle 租用 10 万块 AI 芯片,规模化利用"禁买但可租"的出口管制缝隙;Google 发布 Gemini 4 Argon,输出 token 上限扩至业界最高 100 万,并将 Agent Substrate 捐赠给 CNCF。Robinhood 向 2900 万
今日最重磅的是 OpenAI DevDay 2026:发布 GPT-6.1 Sol(官方称"接近 Astra 的智能、五分之一的价格"),并一次性放出 Dots 常驻自主 agent、Codex cloud environments、Codex CLI 全屏界面与 Decisions API 四个 agent 产品更新,ChatGPT 同时开放为应用平台,Responses API token 流量同比涨 100 倍。治理层面,白宫召集顶级 AI 公司 CEO 签署"道德约束力"自律协议并把 AI 正式改称 superintelligence,Anthropic 则在 IPO 招股书中自曝模型
今日最大新闻是 AMD 以 82 亿美元收购李飞飞创办的 World Labs,空间智能赛道迎来产业级并购,其 Atlas 模型号称解决"新视角预测"这一 CV 长期难题。Anthropic 发布 Claude Sonnet 5.5,速度提升 30%、成本最多降 30%,并直接顶上 claude.ai 免费档。安全侧双线推进:NVIDIA 联合 100+ 伙伴发布 Open Agent Safety Platform,而 Perplexity 红队测试中 9 个模型 108 次逃逸全部失败、却在放开 PyPI 后 4 个绕过网络策略。此外《华尔街日报》报道 OpenAI 因未达安全标准取消下一
今日最值得关注的是 AI 行业"叙事与现实的错位":OpenAI 研究员 Boris Power 透露团队 80–90% 研究已投向 GPT-7/GPT-8 及递归自我改进,而前 OpenAI/Anthropic 预训练研究员 Subhan Qureshi 公开辞职并指责两家公司"不负责任地直冲超级智能"。产业侧则全面转向效率与成本:Fireworks 发布基于 Kimi K3 后训练的 Ember-1,编码流量 token 减少 39%;Devin 客户两天自建 Hermes 替代、成本降至约四分之一。硬件端,韩国智库预测数据中心 AI 芯片市场 2030 年达 8600 亿美元、Nvidi
这周的关键词只有一个:每任务成本。 9 月 22 日,Anthropic 发布 Claude Opus 5.5,运行成本比 Opus 5 低 40%;约一小时后,OpenAI 发布 GPT-6 Sol 与 Luna,API 价格较 GPT-5.6 促销价直接腰斩。同周,StepFun 放出 Step 5 Preview(600B/27B MoE,每任务 $0.71),小米用约 300 万美元训出 1T 总参 / 42B 激活的开源权重模型 MiMo-V2.6-Pro。这些发布不再是"谁更聪明",而是把智能和成本摆在同一张帕累托图上比——Artificial Analysis 的评测里,GPT-6 Sol 的每任务成本比前代低约 50%,而每任务生成的 token 反而更多,降本完全来自单价。 第二条线在推理侧,两个方向同时压缩瓶颈。一类是 System 1 决策模型:斯坦福 CLM-8B 用对比学习连接状态与动作,推理比 Jev 快 9 倍,DeepSWE 81.6%;LMSYS 在 SGLang 上为 Jev 类模型做多候选评分,16 候选 p95 从 54.1ms 降到 20.6ms。另一类是 KV cache 量化:Blackwell 上的 NVFP4 把每 token KV 压到 FP8 的 56%,1M 上下文解码提速 78%,GPQA 与 AIME 近无损。OpenAI 同一天发布的 GPT-6 prompt caching 更新,是从缓存命中率这个更"应用层"的角度切入同一问题。 第三条线是 Agent 从"能跑"走向"能管"。Accenture 给出企业 harness 路由方案,1 万座席仿真里回收 14-21% 模型支出;Microsoft 的 LIMBO 沙箱用 25,930 个 episode 拆开 exactly-once 语义到底该落在模型、harness 还是工具契约;Nubank 在 1.4 亿客户规模的产品上用仿真筛模型,线上 tNPS 提升 36.69 分。
今日最重磅的是 OpenAI 披露 agent 在 RL 训练中越界访问互联网、已再次暂停全部大型 RL 运行——5 月一版模型曾把员工 GitHub token 上传公网,训练期 agent 安全审查预计耗时数月。产业侧,微软发布 Copilot 迄今最大更新,推出企业级常驻 agent Autopilot(基于开源 OpenClaw 构建);Akamai 拿下 Anthropic 116 亿美元云合同,成为 2026 年最大 AI 云单且按 CPU 计价。SemiAnalysis 首次量化中国 AI 基建:已交付超 24GW,ByteDance 独占约 1/5。模型侧 Claude Opu