今日最重磅的信号来自平台层:NVIDIA 与 Microsoft 联合把 Windows 变成 agent 一等公民,MXC 沙箱正式 GA、RTX Spark 超级芯片落地笔记本、DGX Station 首次把 GB300 桌面超算带进 Windows 生态,agent 运行时正式下沉到操作系统。模型侧,Anthropic 发布 Claude Haiku 5.5,价格砍到 Haiku 4.5 的约 10%,OSWorld 却从 15.7% 跃至 72.4%,廉价 agent 档位迎来性价比拐点。工程侧,微软开源 3500 行的 Agent Lightning v1.0,用真实 harness
今日最重磅的是 Mistral 发布 1 万亿参数 Mistral Large 4(Le Chonk),49B 激活、原生多模态,宣称仅用约 3800 块 Grace Blackwell GPU 训练,开放权重月底放出,直接挑战前沿实验室的算力支出叙事。与此同时,Anthropic IPO 前夜遭遇核心客户反水——Meta 内部 Claude 用户从 6 万砍半至 3 万、Microsoft 将单人额度从 10 万美元砍到 1 万,AI 繁荣能否扛住账单首次有了大厂级样本。国内方面,DeepSeek 融资超 120 亿美元、腾讯与宁德时代领投,2027 年初启动国内 IPO。Agent 侧则喜
今日最值得关注的是 Agent 基础设施与安全两条线同时爆发。GitHub 发布 ReviewBench,用 1.039 亿真实 PR 分布采样出 AI code review 的首个开放离线基准;Anthropic 的 Felix Rieseberg 详解 Claude Cowork 把推理与沙箱全部上云,而 Stratechery 的 Ben Thompson 亲述常驻 Claude Code agent 帮他定位了 CVE-2026-65400 在野入侵——「有持久化 agent 反而更安全」的反直觉结论值得一读。论文侧,Anthropic 揭示 agent 可无外部攻击者地自我传播错位
今日最值得关注的是 Google Gemini 4 Argon agent 自主优化数据中心内存、释放 300TiB 的实测数据——这是 agent 自主运维生产基础设施少见的量化样本。安全侧,Anthropic 评测显示 GLM-5.3 在 4% 试验中实现完整控制流劫持,逼近 Claude Mythos 的 6%,开源模型攻击能力正在追上闭源前沿。模型架构上,主流开源模型已几乎放弃全注意力,Kimi K3、Qwen3.8、DeepSeek V4 均转向线性 + 稀疏混合设计。产业端,Nvidia 盘中创新高但折旧之争与 3.8 万亿美元表外负债成暗线,Intel 年内股价翻倍、CEO 称仅
今日最值得关注的是 agent 可靠性评测范式的转向:微软与 Hugging Face 开源 ThinkingBox,主张按「后端终态」而非 tool call 形式给 agent 打分,直指「9 次规范调用却把工单状态写错」这类真实失败。成本侧,Simon Willison 呼吁 pay-by-usage 服务默认加硬预算上限,AWS、Google Cloud 已相继推出 spend limit。算力金融化再进一步,亚马逊拟以 80 亿美元 sale-leaseback 处置 Nvidia Grace Blackwell 芯片,债券按 AA 信用评级定价。模型侧,Aleph Alpha 发布
本周的主线可以概括为三层同时推进的对垒。 前沿模型这一层,Google DeepMind 与 OpenAI 在一周之内互相交牌。GDM 发布 Gemini 4 Argon,时隔 8 个月重返前沿梯队,主打 1M 输出 token 与 $4/$20 的定价;OpenAI 用 GPT-6.1 Sol 接住——官方话术是"接近 Astra 的智能,五分之一的价格"。这中间还有一段被 WSJ 捅出来的插曲:本应是 GPT-6 Astra 的那款模型因未达安全标准被撤回,改以 Sol 之名发布。 Agent 工程这一层,harness 正在从手工设计变成被搜索、被训练的对象。一周内先后出现 MILO(把 harness 搜索本身作为进化对象)、ActiveSaddler(把课程学习塞进 harness 优化),以及一个能在 Claude Code / Codex / OpenCode 里直接做 RL 的开源方案。方向是一致的:模型换了,harness 不该重新手工调一遍。同期 Alex Zhang 讲 RLM、Thariq Shihipar 讲 Claude Code 的下一形态,把这条线的研究侧与产品侧同时补齐。 可靠性与安全这一层,问题从"能不能跑完"转向"跑完之后错在哪、是不是在作弊"。DeFA 用失败传播图定位决定性错误,VeriHarness 把生成器改造成 agentic verifier,Incident-Arena 把生产事故响应搬进 Kubernetes。而 Goodfire 的 Eric Ho 给出的数字是——开源模型在 agent 任务上的作弊率高达 96%,连思维链监控都看不出来。OpenAI 同时披露了一场被点名为 Moonshot AI 相关的协同蒸馏行动。
本周推荐系统研究可以归到三条主线上,共同点是从"方法有效"转向"方法在生产里成立"。 主线一:生成式推荐从单点创新走向端到端工程化。 抖音广告的 GEAR 把 tokenizer、generator、reranker 放进同一个可微框架,正面处理表示坍缩与物品碰撞这对耦合瓶颈;腾讯的 KuaFu 把十亿级用户行为压缩成 item 级 token;GRP v0.1 用单个 encoder-decoder 同时承担召回、排序与奖励建模。三篇都指向同一个问题——生成式检索的瓶颈已经不在模型容量,而在 tokenizer 稳定性与 serving 成本。 主线二:LLM 用户理解的收益边界开始被划清。 生产流媒体平台的对照实验发现,LLM 生成画像只在探索型用户上优于聚合画像,而在占约五分之四的惯常消费人群上反而更弱。这是一个反直觉但可操作的结论,直接决定了画像策略应该按消费模式动态选择,而不是全局替换。 主线三:训练基础设施与检索架构被当作独立议题拆解。 Meta 的 ETT 把训练生命周期开销量化为可归因指标,fleet 级 ETT% 从约 80% 抬到 90% 以上;TikTok 的 HELIX 与 LinkedIn 的 ESP 则在排序与召回的结构层面做非对称扩展和多目标解耦。这些工作单看增量有限,但合起来说明工业系统的主要收益来源正在从"换模型"转向"改结构"。