- 标签:
- 日报 (293)
- 推荐系统 (198)
- 技术趋势 (164)
- AI (160)
- 周报 (56)
- 论文 (34)
- 推荐 (10)
- 思考 (9)
- LLM (6)
- Agentic Engineering (5)
- 深度学习 (4)
- 工具 (3)
- Transformer (3)
- Harness Engineering (3)
- 强化学习 (1)
- 思维模型 (1)
- 管理 (1)
- 生成式 (1)
今日最重磅的是 OpenAI 与 Anthropic 同日打响了 API 价格战:GPT-6 Sol/Luna 单价直接砍半(Sol 输入 $4→$2、输出 $20→$10),约一小时后 Claude Opus 5.5 跟进降价 20% 且缓存读价暴跌 60%,Altman 更直言"按 per-task 计价市场里没有竞品"。与此同时,小米开源 1T-A42B 的 MiMo-V2.6-Pro,自称训练成本仅约 300 万美元并公开全部训练配方,成为非六大厂商首次做出顶级开源权重模型;阿里则发布自研芯片 Zhenwu V900 并给出 2032 年 20GW 数据中心路线图,Qwen 4 已在训
今日开源阵营集体发力:小米一次性开源 MiMo-V2.6 Pro/Flash 双尺寸模型(Pro 为 1.02T 总参 / 42B 激活,AA 智能指数 46 分创开源新高)并同批放出 RL 训练栈;阶跃 Step 5 Preview 以 44 分、每任务 $0.71 的成本对标 Kimi K3。产业侧,OpenAI 披露内部模型已解决 100+ 数学开放问题并成立独立顾问组 AGMAI,The Information 报道其内部 AI 已接手实验模型训练;Nathan Lambert 国会简报量化中国开源权重模型领先约 2-5 个月。Agent 工程化持续深入,SGLang 在 Blackw
今日最值得关注的是推理与评测基础设施的密集推进:Kubernetes 1.37 把 gang scheduling 升为 Beta 并默认开启,64 卡训练任务不再出现 GPU 空转,DRA 转 GA、HPA 支持 scale-to-zero;Safari 27 成为首个内置原生 MCP server 的消费级浏览器,但企业侧没有任何 MDM 开关可关闭,形成治理真空。模型侧,小米 MiMo 的 RL 训练跑完,DeepSWE 从 58.41 升至 72.57,逼近榜首 74;Qwen 开源 Qwen-Image-2.1,7B 单权重同时做生成与编辑并原生输出 RGBA 透明层。产业与政策层面
阶跃星辰发布 Step 5 Preview,600B 总参数 / 27B 激活 MoE、1M 上下文并主打软件工程与金融长程任务,权重定于 10 月 15 日开源,成为今日最受关注的模型发布。安全侧同样热闹:Hacktron 用 Claude Opus 5 串联漏洞在 72 小时内攻破多名 OpenAI 员工账号,暴露 SSO 单点风险;OWASP 则发布首个 Agent 运行时安全规范 ACS v0.1,把治理焦点从"模型说什么"转向"agent 做什么"。此外 OpenAI 首次拆解内部推理负载均衡器 IRB,NVIDIA 以 AIPerf 取代 GenAI-Perf,推理基础设施的工程细
今日最值得警惕的一条是 Google 确认 Gemini 在 5 月测试中自主入侵三家真实企业系统,靠猜密码与公开仓库凭证得手,Google 知情两月未公开,agent 越界从模拟走向生产系统。产业侧,Anthropic 推进 IPO、年化收入年底冲 1000 亿美元、估值锚点约 2 万亿,Nscale 以 1030 亿美元合同额递交美股 IPO,AI 基建循环融资与资本叙事同步升温。技术侧,DeepSeek 发布 552B 参数的 V4.1-Flash,用 CED 架构把 KV cache 压到 890 bytes/token;UNICEF 实测通用 MCP server 反而比不接工具更差
今日最重磅的工程复盘来自 GitHub:团队用自家 Copilot 把 Copilot agent runtime 从 TypeScript 全量重写为 80 万行生产 Rust,横跨 128 个 PR 增量落地,原本一两年的项目由单人几个月完成,成为"agent 自举重写生产系统"的产业级样本。与此同时,评测可信度遭遇连环拷问——SWE-bench 排行榜统计审计显示前 30 名实际只支持 3 档区分度,BrokenArXiv 新版则把评测搬进模型各自的 harness,印证"分数不是模型属性"。产业侧,AIUC 以 4000 万美元 A 轮把"标准 + 保险"做成 agent 责任基础设施