AI周报 2026-W41
2026-10-10
| 2026-10-10
字数 8932阅读时长≈ 23 分钟
type
Post
status
Published
date
Oct 10, 2026 05:41
slug
ai-weekly-2026-W41
summary
这一周的中心事件只有一个:10 月 6 日 OpenAI 在 GitHub 上发布了 722 篇数学手稿。这批结果来自一个未公开的内部前沿模型,覆盖代数、数论、拓扑、理论计算机科学与数理逻辑,在评估的 4000 个问题中给出了覆盖全数学 Top 500 开放问题中 90 个的结果,平均每个结果的算力成本约等于 ChatGPT Pro 三小时。普林斯顿高等研究院的 AGMAI 为此专门发表声明,Anthropic 的 Levent Alpöge 称其中 Result 003「Quasi-Riemann Hypothesis」是「数学史上最重要的时刻」。与此同时,撤稿三篇、约 20% 结果为反例、Lean 验证争议,这些细节同样构成了事件的一部分——如果说本周有什么值得盯的,不是"AI 会做数学了",而是"AI 做出来的数学能不能被验证"这件事第一次成为公开争论。 第二条线是推理栈对新硬件的适配密度。NVIDIA Vera Rubin 在几天内同时拿到 vLLM 与 SGLang 的 Day 0 支持:vLLM 侧报出 MiniMax M3 在 AgentX 上吞吐超过 GB200 的 7.8 倍,SGLang 侧报出 FP8 MLA 在 batch 1 / 128K 上下文下提速 20%、MoE 尾融合减少每步 276 次 kernel 启动。同一周 vLLM 发 v0.31.0(717 commits、307 contributors),并放出 vLLM-Omni 的全模态服务运行时技术报告。硬件换代与引擎迭代正在以周为单位咬合。 第三条线是 agent 工程从"能跑通"转向"能管住"。GitHub 披露 agent-scale 开发对 Git 基础设施的冲击(月 commit 同比 5x、push 4.9x),Microsoft 把 agent 沙箱做成 Windows OS 级原语(MXC GA),Anthropic 放出 Claude Managed Agents 动态工作流公测,几篇论文则直接研究 agent 的时间预算、评测判官可靠性与仿真训练环境。本周真正被反复追问的问题是:agent 大规模跑起来之后,谁来给它设边界。
tags
AI
周报
技术趋势
category
AI技术报告
icon
password
priority
1

📊 本周概览

这一周的中心事件只有一个:10 月 6 日 OpenAI 在 GitHub 上发布了 722 篇数学手稿。这批结果来自一个未公开的内部前沿模型,覆盖代数、数论、拓扑、理论计算机科学与数理逻辑,在评估的 4000 个问题中给出了覆盖全数学 Top 500 开放问题中 90 个的结果,平均每个结果的算力成本约等于 ChatGPT Pro 三小时。普林斯顿高等研究院的 AGMAI 为此专门发表声明,Anthropic 的 Levent Alpöge 称其中 Result 003「Quasi-Riemann Hypothesis」是「数学史上最重要的时刻」。与此同时,撤稿三篇、约 20% 结果为反例、Lean 验证争议,这些细节同样构成了事件的一部分——如果说本周有什么值得盯的,不是"AI 会做数学了",而是"AI 做出来的数学能不能被验证"这件事第一次成为公开争论。
第二条线是推理栈对新硬件的适配密度。NVIDIA Vera Rubin 在几天内同时拿到 vLLM 与 SGLang 的 Day 0 支持:vLLM 侧报出 MiniMax M3 在 AgentX 上吞吐超过 GB200 的 7.8 倍,SGLang 侧报出 FP8 MLA 在 batch 1 / 128K 上下文下提速 20%、MoE 尾融合减少每步 276 次 kernel 启动。同一周 vLLM 发 v0.31.0(717 commits、307 contributors),并放出 vLLM-Omni 的全模态服务运行时技术报告。硬件换代与引擎迭代正在以周为单位咬合。
第三条线是 agent 工程从"能跑通"转向"能管住"。GitHub 披露 agent-scale 开发对 Git 基础设施的冲击(月 commit 同比 5x、push 4.9x),Microsoft 把 agent 沙箱做成 Windows OS 级原语(MXC GA),Anthropic 放出 Claude Managed Agents 动态工作流公测,几篇论文则直接研究 agent 的时间预算、评测判官可靠性与仿真训练环境。本周真正被反复追问的问题是:agent 大规模跑起来之后,谁来给它设边界。

OpenAI 数学论文与 AI 科学发现

本周必须先讲这件事,因为它的影响面不限于数学。
AINews 的汇总(Latent Space)给出了最完整的一手口径:722 篇手稿、372 个结果族,来自约 4000 个研究问题的评估,平均每个结果消耗约 3 小时 ChatGPT Pro 算力——相比之下,此前 Navier-Stokes 那批工作是 88 小时 / 1 万 agent。这个量级差本身就值得注意:算力效率提升了一个数量级还多。文内收录的具体结果包括整数乘法快于 n log n、弹性逆问题唯一性(一个 1994 年以来的 3D 开放问题)、Riemann/Hodge/BSD 的部分进展,并明确标注约 20% 的结果为反例——这一点很关键,反例同样是数学产出,但很容易在传播中被忽略。
Zvi 的深度跟进 提供了更冷静的逐条拆解。他把 719 篇(撤稿 3 篇后)按结果类型分类,逐一解读 Riemann 界收紧、矩阵乘法、整数乘法、Pi、Unique Games、Hodge/Birch、Hilbert 第十问题、Hadwiger 图着色等结果的意义,并记录了三件事:数学界的震动、Lean 验证的争议、三次撤稿。撤稿这件事没被主流报道充分强调——在一个声称产出 722 篇结果的发布里,三篇被撤回意味着验证机制在起作用,也意味着验证机制并不总能一次性拦住错误。Zvi 的结论比 AINews 更保守:结果很有意思,但"是否实用"是另一回事。
背景补充。New Scientist 在两天内连发两篇报道,一篇讲发布规模,一篇挑出"最有趣的发现",后者特别指出这批结果"既涵盖长期数学谜题,也涵盖对很少被考虑的小众问题的微小改进"——这两类工作在图灵测试式的评估里没区别,在数学界的价值判断里差别很大。DataCamp 的整理确认发布时间为 10 月 6 日,模型产出周期"以周计"。AGMAI 的声明是最值得引用的一段:影响"不止于个别成果本身,而是波及整个数学领域和数学界"。
从 AI for Science 的更大图景看,Periodic Labs 的访谈 提供了另一条路径的完整论述。Liam Fedus(ChatGPT 联合创造者)和 Ekin Dogus Cubuk(DeepMind GNoME/MatterGen 作者)的核心论点是"智能本身不足以做科学"——科学发现与数学、编程有本质区别,需要在噪声、不确定性和缺失信息下推理,且实验是最终 ground truth。他们提出的 synthesis superintelligence 是一个更重的方案:把 RL 环境搬到物理世界,用 AI 做材料表征、DFT 模拟、高通量自主实验室,训练模型学习"做科学的过程"而不是只看已发表结果。其中一个判断值得单独拎出来——失败的实验和负结果可能是最有价值的训练数据。这跟本周数学那批工作的对比很有意思:数学里反例是产出,科学里负结果是训练数据,两者都要求系统能容纳"不成功"的信息,而这恰恰是当前大多数 benchmark 与 reward 设计不擅长的。
把这两件事放在一起看,本周其实给了 AI for Science 两条不相交的路径:一条是纯符号空间内的密集搜索(OpenAI 的数学),一条是必须落到物理实验的闭环(Periodic Labs 的材料)。前者已经交出了 722 篇的量,后者还在搭基础设施——而且两位创始人反复强调,未来的前沿模型仍然必须做物理实验。哪条路先跑通,现在下结论太早。

GPU 集群调度与新一代推理栈适配

本周推理栈的关键词是"Vera Rubin 就绪",但更有长期价值的是 Ai2 的一篇工程复盘。
Ai2 的 GPU 集群调度复盘(Hugging Face Blog)讲的是他们如何把"谁该拿多少 GPU"从逐案运维谈判变成透明的行政预算流程。先说病理,这部分比方案本身更有价值:GPU squatting(用户占着 no-op 负载等调试)、priority inflation(100% 的负载都标 HIGH,导致低优先级任务饿死)、on-call 工程师大量时间花在协商非抢占负载的关停。这三条几乎在任何自建集群都能对号入座。方案是 GPU time budgets(按项目分配时间额度)+ hierarchical fair-share(层级公平分配)+ time-slicing contract(时间切片契约),评估框架是四层指标金字塔:availability → occupancy → impact → utilization。文章用模拟与真实集群结果做了验证。这是少见的、带失败模式与迁移路径的一手材料——大多数集群调度文章只讲最终架构,不讲旧架构为什么坏。
硬件侧。vLLM 支持 Vera Rubin(vLLM Project)报出 MiniMax M3 在 AgentX 上吞吐超过 GB200 的 7.8 倍,原因是 Rubin 与大部分 Blackwell kernel 兼容,DeepSeek、Kimi、MiniMax、GLM 等模型 Day 0 就绪;作者 Woosuk Kwon 补充说除兼容性之外还额外发布了一批 Rubin 专属优化。SGLang 的对应适配 给出了更细的 kernel 级数据:batch 1 / 128K 上下文下 FP8 MLA 提速 20%,KDA 验证提速 20% 且输出 bitwise 一致,MoE 尾融合减少每 decode step 276 次 kernel 启动、端到端提速 5.9%。LMSYS 官方账号 同时提到 Miles 用 SGLang 做 Rubin 上的端到端 RL rollout,包括 64 个并发 sandbox 跑在 Vera CPU 上。
版本发布方面。vLLM v0.31.0(717 commits、307 contributors、96 位首次贡献者)的亮点集中在四块:DeepSeek-V4.1-Flash 的 FlashMLA mega attention + NVFP4 KV 缓存 + DeepGEMM 稀疏 MQA;Fast restart(vllm preload 让权重跨重启留在 GPU 内存里);Model Runner V2 的 draft-model speculative decoding 与 DSpark 自适应验证;大规模服务侧的 MoonEP 均衡 all-to-all 与 DeepEPv2。vLLM-Omni 技术报告 走的是另一条路——为全模态生成提供统一服务运行时。它的动机说得很清楚:语音助手、视觉生成、world model、robot loop 这些负载的执行模式各不相同(多阶段 AR 流水线、迭代扩散、跨步骤带状态的会话),LLM server 和 diffusion stack 各只擅长一种,部署时只能靠拼接互不相干的 runtime。vLLM-Omni 用 orchestrator 推进请求跨阶段流转、专用引擎跑计算、connector 传 payload,让 duplex、world model、robot loop 共用一条 session path。
论文侧有两篇值得看。RaReCache(USC / UC Irvine / Intel Labs)解决的是跨模型 KV cache 复用里的精度衰减问题。已有工作证明了同族模型间可以用闭式线性映射翻译 KV cache,但模型尺寸差距拉大后迁移精度会掉。这篇的观察是:迁移失败集中在少数信息密集 token 上。方法是用 rank disagreement 度量打分,只对关键位置做选择性重计算——Qwen3-0.6B 到 14B(23x 参数差)只需重算 30% 位置即保留 95-99% 精度;Llama3-8B 到 70B(8.8x)重算 40% 保留 96.5%。线上服务侧,单 GPU 上吞吐达目标模型直接 prefill 的 1.8 倍,在饱和负载下 30% 重算预算可把 TTFT 中位数降 5.0 倍、P99 降 6.4 倍。这个方向的意义在于:小模型替大模型 prefill,大模型只重算关键 token。
另一篇是训练侧的数值问题。Chen 的 FlashAttention-3 BF16 训练异常:用 BF16 FlashAttention-3 训练 LLM,训练长期看起来正常,然后梯度范数暴涨 1000 倍,最终 loss 比 FP32 attention 高 0.2 nats,全程没有一个 NaN。问题定位在 attention 反向。这类"静默劣化"比崩溃更难排查——没有 NaN 意味着绝大多数健康度检查都拦不住它。做长训练的人值得花时间读那篇论文。
端侧这边,lithos-metal 开源(Jia Zhihao)用 megakernel + DSpark 推测解码,在单块 Apple M5 Max 上把 Qwen3.8-27B 跑到峰值 200+ tokens/s/user。单机、单卡、消费级硬件的这个吞吐数字,放在一年前属于数据中心配置。
把这几条放在一起能看到一个共同方向:推理栈的优化重心正在从"模型本身"下移到 kernel、调度与缓存编排。Vera Rubin 的 Day 0 支持靠的是 kernel 兼容性,vLLM 大版本的重点是 KV 缓存格式与 all-to-all 均衡,RaReCache 直接以 token 为单位决定算不算,Ai2 的文章则干脆把问题定义成行政问题。模型权重没变,系统层面的每一层都在被重写。

Agent 评测、时间预算与仿真训练环境

本周有几篇论文共同指向一个结论:agent 的失败往往不在能力,而在"没人告诉它边界在哪、它也没学会怎么用边界"。
On the Clock(AWS / UIC / NYU)直接研究 agent 在显式 wall-clock 时间预算下的行为。实验设置是 Qwen3.6-27B 跑 MLE-Bench Lite 五个竞赛、Qwen3-4B 跑 Zork I。第一个发现就很扫兴:只在 prompt 里声明时间预算,agent 根本无法把预算转化成受控的时间使用。原因有三层——harness 不提供时间反馈、agent 无法可靠预估动作时长、没有"可用时间 → 合适策略"的学习映射。干预有两类:harness 层面暴露 timing 信息并强制 deadline,以及带预算感知奖励的 RL。结果分化明显:注入 timing 信息大幅提升 Qwen3.6-27B 的预算遵守率且无性能损失,GRPO 在 Zork I 上达到近乎完美的预算遵守并能泛化到训练中未见的预算,但在 MLE-Bench 上没提升任务性能。最有价值的结论是最后那句:即使 agent 学会了遵守预算,它们仍然不会用多出来的时间提升表现——RL 策略学会了何时停止,却常常用重复动作填满剩余时间,多预算 GRPO 训练还会坍缩到最短预算学到的策略。时间遵守与有效时间分配之间的这个 gap,是 budget-conditioned agent 的核心难题。
AgentHorizon(ServiceNow Research / Mila / McGill 等)研究的是另一个边界问题:谁来判定 agent 做对了。基准包含 1373 个 computer-use 任务,来自 166 小时人类录制轨迹、跨三种操作系统。设计上有个巧思——通过交换相近指令来构造负样本,评测 judge 能否区分"完成了任务"和"完成了相似但不兼容的请求"。评估了 11 个 judge,两种用法(直接传完整轨迹、或作为 coding agent 跨五种 harness)。结果:最好的 agentic judge(GPT-5.5)在 AH 子集上达到 80.9% balanced accuracy;工具使用对某些模型有帮助,但让开源权重模型表现更差;judge 在"接受有效轨迹"和"拒绝失败轨迹"上的能力差异极大。这篇的问题意识很清楚:一条包含 300 张截图和动作的轨迹看起来可能完整,实际上违反了指令约束或引入了副作用,而 judge 需要主动去定位和验证那些常常是隐藏的证据。
Who Verifies the Verifier?(AWS / HSBC)把这个问题推得更狠——让 verifier 本身成为演化对象。做法是把 verifier 表达成对小型、多数确定性的 drawback detector 的可检查组合,从聚类的失败中合成、出生时 gate、选择标准是与十项锚定参考集的一致度加无标签输出上的共识,明确不以 agent 分数为选择标准。MBPP+ 上相对手写种子组合提升 +0.21 held-out 一致度,且在每个 seed 上都成立。这篇最该被记住的发现是一个警告:移除锚定守卫会让 verifier 退化成永远通过的无效评分器,而这个退化后的 verifier 训练技能的效果一样好。言下之意——下游任务分数根本无法认证一个自演化的 verifier。作者还报告 Double Ratchet 在代码生成、企业 text-to-SQL、无参考报告生成三个场景下,保留了 ground truth 或 rubric 所带来 lift 的 88-110%。
环境侧有两篇。StoreBench(AfterQuery)是一个实时商业运营环境:agent 用一个中型在线服装店的生产级后端、通过 29 个人类运营者会用的工具做决策,顾客全天候下单、供应商调价和断供、市场冲击带着部分或零预警到来。设计上有三个细节值得注意:窗口化操作预算让模拟时间成为动作数量的函数(模型延迟无法影响模拟时间)、通过阈值由脚本化锚定策略校准、奖励针对一份 reward hack 目录做了加固。七个前沿模型跑 11 个场景,最好的 DeepSeek-V4-Pro 通过 49% 的 task-seed 单元,人类专家 0.708 vs 最好模型 0.700——没有任何模型在平均值上追平脚本化的 smart-triage 启发式(97%)。GRPO 后训练那边,Qwen3.5-27B 只用五个不相交任务就把 held-out 平均综合分从 0.136 提到 0.373。
Synthesis Through Simulation(SAP Labs)走了"生成训练数据"的方向:让 LLM agent 在策略强制的模拟企业环境中执行操作来生成数据。核心设计是 schema-free——因为数据是通过定义"什么算合法"的同一环境生成的,结构有效性由构造保证,于是可以把有效性强制与分布建模解耦、各自独立处理。Generalist Populator 在十个环境上达到 0.88 平均边际保真度与 100% 约束满足,且没有访问数据库 schema。对比之下,统计合成器因必需种子数据在七个环境上无法适用,而有 schema 权限的 agent 在 airline 环境上 82% 轨迹失败。框架、十个环境与生成数据集全部开源在 https://github.com/SAP/synthesis-through-simulation。
检索侧,RIT-RAG(IBM / IIT Kharagpur)处理的是 agentic RAG 的结构感知问题。PageIndex 这类方法能导航文档结构,但无法扩展到大语料——整棵结构放不进 LLM 上下文,所以必须先用文档检索器锁定单一文档,选错就无法恢复。RIT-RAG 的做法是离线为每篇文档建树(目录或 sitemap),查询时先检索一批 chunk,用它们的位置反向诱导出可管理的子树(可能跨多篇文档),再由 LLM agent 导航子树、选择性阅读、必要时重写查询。分工很干净:检索决定看哪里,agent 决定读什么。金融、科学、客服三类 benchmark 上准确率最高,在自建的 EntQABench(284 万技术文档网页)上较最强 baseline 提升 6.8-11.4 分。
把这几篇串起来看,共同点很清楚:评测与环境设计正在从"能不能做完"转向"做完得对不对、值不值、是不是真做完了"。AgentHorizon 和 Who Verifies the Verifier 各自从判官可靠性和自演化认证两个角度戳同一件事,StoreBench 用人类专家和脚本策略做双重标尺,On the Clock 则提醒即便约束被遵守,productive allocation 仍是空白。这不是工程细节的堆砌,而是 agent 落地必须先解决的一层基础设施。

Agent 产品落地与企业运行时改造

本周的落地案例有个共同特征:难点都不在模型,在存量系统。
Postman 在 Amazon Bedrock 上跑 Agent Mode(AWS Machine Learning Blog)服务 4000 万开发者,复盘里最诚实的一句是:团队原以为最难的是模型质量和 prompt 设计,真正的挑战是把 agent 接入一个有 11 年历史、界面驱动的成熟产品——agent 是在数据上推理,不是在屏幕上导航。给出的可复用模式有三条:控制工具蔓延(早期原子化工具导致调用链过长,后来转向任务级工具作用域)、暴露 schema-based 读取、把 context 而非 capability 当作首要瓶颈。生产设计上要求修改应用状态前需用户批准、按任务限定工具、用 Bedrock Guardrails 在进 LLM 前脱敏 PII。三条里最反直觉的是第二条之后的判断:工具不够用的时候第一反应是加工具,但实际瓶颈在上下文。
Asana 的 browser agent 成本优化(OpenAI)把模型成本降低 76 倍、速度提升 5 倍,单次运行成本降到约 $0.47。核心发现值得所有做 browser agent 的人看:agent 的缓存只覆盖了固定指令和工具定义,而不断增长的页面文本与截图历史被按全价重发;更糟的是每步都丢弃旧截图和裁剪文本,导致缓存历史本身也失去价值。三条优化路径对应得很直接:把缓存扩展到浏览历史、提高文本保留量、批量而非逐步删除截图。144 次运行横评把人工估计需要 1-2 个月的研究压缩到一周。
Simon Willison 的语音开发实践 是另一类样本。他用 ChatGPT 桌面端 Codex 的语音对话模式,在做饭的半小时里几乎全程说话完成了博客 Newsletters 页面:新建 Django model 与 migration、四个数据导入(Substack RSS、Substack 未公开 API、GitHub 公开与私有仓库)、归档页与站内搜索集成。全文附了完整语音 transcript 的 Gist 和 PR 链接。卡点很具体:只在处理私有仓库 API key 时需要切回键盘。这是一手数据,不是演示视频。
平台层面,NVIDIA 与 Microsoft 联合发布 RTX Spark 与 agent 时代的 Windows PC(NVIDIA Blog)有三个要点。Microsoft Execution Containers(MXC)正式 GA,把 agent 沙箱做成 OS 级原语,让 agent 能安全、持久地在后台运行并受系统观测与治理。RTX Spark 超级芯片(Blackwell RTX GPU 6144 核 + 20 核 Grace CPU、600GB/s 互联、1 PFLOPS FP4、最高 128GB 统一内存)落地笔记本与紧凑台式机,可本地跑 Qwen 3.8 Flash Next 这类 125B 模型,完整兼容 CUDA 栈。DGX Station for Windows 把 GB300 Grace Blackwell Ultra 桌面超算(748GB 一致内存、20 PFLOPS FP4)带进 Windows 生态,终结企业开发者的 Linux/Windows 双环境割裂。第三条对做企业部署的人最实际。
Claude 生态这边有两个动作。 Anthropic 发布 Claude Managed Agents 动态工作流公测(Claude Devs),lead agent 写出计划、跨多个 agent 分阶段执行、最后合并结果。argofowl 演示的 Claude Code + Codex computer use 组合 是社区侧的一个更激进的用法:通过 MCP 让 Claude Code 调用 Codex 的 computer use 与 Chrome 扩展,后台并行操控多个浏览器,每个扩展安装有独立 instance id 所以能区分。技术上需要一个小 stdio proxy 给每个 tools/call 加上 Codex 需要的 turn metadata,还用 Stop hook 触发 turn_ended 释放标签页。配置全文可复制。这种"用 A 的 agent 驱动 B 的 agent"的拼装方式,目前属于手工活,但把当前工具的实际可组合度暴露得很清楚。
身份与安全侧有两篇数据材料。GitHub 的密钥保护文章 用九个季度数据反驳"AI 让开发者变粗心"的流行叙事:公开 push 从 2.02 亿涨到 5.74 亿(2.84x),携带密钥的 push 涨 2.59x,但每 push 的密钥出现率无统计显著上升,开发者主动 override 拦截的比例反而从 6.63% 线性降到 3.93%。作者给的框架是"预防随算力扩展,修复仍随人力扩展"——手动撤销密钥平均 40 天、1/5 超过 90 天,而 push protection 只能拦住约 30%。文中提到与 Microsoft Applied Sciences 共建的微调分类器能在 2ms 内评估整组候选密钥,把可拦截密钥数翻倍以上。
Andy Pavlo 关于数十亿 agent 冲击数据库的访谈(The MAD Podcast)是本周数据库方向密度最高的一份材料。核心判断是 agent 会带来 10-100 倍查询量,数据库需为非人类用户重新设计。其中几个具体点值得单拎:向量数据库只是索引、agent 记忆存文件还是数据库是个未解问题、text-to-SQL 准确率从 60% 跃升到 99.5%、60% 的开源数据库已有 AI 提交的代码。Pavlo 是 CMU 数据库教授、ClickHouse Labs 创始人,他讲的是被 agent 使用这件事对存储层的结构性影响,而不是"要不要加个 vector 扩展"。
还有一个趋势判断值得放在本节末尾收口。Sean Goedecke 的"软件半人马时代"(seangoedecke.com)提出人+AI 编码系统强于纯人或纯 AI 的状态(2022–20??)可能持续一二十年——类比国际象棋的半人马时代约 20 年、针织业长达 200 年。他梳理了 Copilot → GPT-4 → Cursor/Claude Code → Claude Opus 4.5 的演进,指出当前 agent 已可无人监督运行,但错误性质从"普通 bug"变成"对齐问题"(不匹配组织技术价值观、过度或欠工程化)。最后用"六只手"列了半人马时代可能更短或更长的正反论据,坦承无人能预测。对做职业规划的工程师,这篇文章的价值不在于给出答案,而在于把"我还能干几年"这个问题拆成了可讨论的子问题。

后训练、RL 与开源模型新范式

本周 RL 与开源模型的关键变化是:自改进从概念验证转到了工程规模,同时行业开始公开讨论 RL 到底能做到什么、做不到什么。
MiMo-V2.6(小米)是本周最重的技术报告。它把 RL 算力沿三个维度扩展:批量与吞吐(异步训练每步消耗 1568 样本、2.7–3.7B tokens,上下文长度最高 1M)、环境多样性(code / general / visual / cyber 四类领域,混合多种 agent harness)、grader 算力(groupwise agentic grading 提供更准确的奖励信号,并引导模型产出更短、更省 token 的解)。稳定性上有两个具体做法:冻结 MoE router,以及建立多层 reward hacking 防御。基础设施侧包括统一轨迹表示、高并发多框架 rollout、控制面与数据面解耦、训练推理一致性。训练动态、RL 环境与 RL 框架全部开源——这是这份报告最有分量的部分,因为 RL scaling 的复现难度一直卡在环境与框架不公开上。
RLDiscover(百度 / 中科院 / 清华等)把 LLM 引导的程序进化用在 RL 算法自身。两个障碍说得很准:耦合组件的联合搜索难扩展(同时改会破坏学习,孤立改会忽略依赖),候选算法评估需要昂贵训练且适应度跨随机种子不确定。对应两项机制:Progressive Co-Evolution 从定向组件编辑推进到联合进化,Progressive Probabilistic Evaluation 用分阶段训练加重复评估平衡搜索广度与评估保真度。SAC / PPO / DQN 三类算法、四个 benchmark 套件上,per-family 中位数提升 32%-84%,峰值回报比约 363x。还有一个值得注意的现象:独立搜索反复发现可解释的组合——自适应鲁棒损失、进度依赖的价值目标、运行统计——且选出的程序能迁移到未见任务。评估成本约为完整评估同规模候选池的 1/15。需要谨慎看待的是,部分增益来自"从近零 baseline 的学习失败转为成功",绝对提升幅度要打折。
LLoCoT(Qualcomm AI Research)代表 latent reasoning 方向上的一个分支。CoT 用自回归生成 token 换取额外计算,latent reasoning 用连续状态替代这些 token,但多数自回归 latent 方法仍保留 latent 向量间的从左到右依赖。LLoCoT 用 looped transformer 对紧凑 latent workspace 做迭代精炼,并行采样 latent token,再用自回归 decoder 生成答案。训练用显式 CoT 导出的连续表示,配最终答案预测损失与 latent 状态的似然监督。HumanEval 与 MBPP 上准确率与显式 CoT baseline 持平,但首 token 时间降低约 36 倍、推理阶段延迟降低约 42 倍、端到端吞吐提升 9.2%。代价是准确率没有提升——这是一个纯粹用延迟换吞吐的取舍,且只在两个代码 benchmark 上验证过。
开放权重侧,Mistral Large 4(Mistral AI)以 1T 参数、原生多模态、49B 激活的规格发布,Mistral 自称是美国或欧洲聚合 benchmark 上最好的开放权重模型,API 今日可用、开放权重 10 月底发布,全程欧洲锻造且可通过 Mistral Cloud 从欧洲部署。ReflectionAI 的访谈(No Priors)里 Misha Laskin 讲了 5000 亿参数开源权重推理模型 Beam 的预训练与 RL 方法、推理效率优化,以及他对趋势的判断:开源模型将占据全球 token 需求多数,企业算力会从租用转向自持。
关于 RL 的边界,本周有两份访谈值得并读。Applied Compute CEO Yash Patil(Unsupervised Learning,前 OpenAI Codex 研究员)直言 RL 本质是爬山机,最难的是定义山,泛化远不如预训练,持续学习仍受稀疏奖励下数据高效训练难题阻碍;他提出新 AI 超大规模厂商的倒金字塔结构(训练在底、推理/路由/harness 在上)。Interconnects 的判断类似但角度不同:研究者感受到的"加速"主要来自 infra 与工程能力的提升而非模型本质改变,未来几年瓶颈会从工程重新转向研究,"好想法比好执行更值钱";推理栈高度可验证(tokens/s/GPU、cost per answer),agent 将在几年内端到端优化推理效率;RL 环境质量是下一个工业级低垂果实——大量采购数据质量堪忧,但头部实验室 ROI 明确。
这句话和 MiMo-V2.6 的开源环境、StoreBench 的仿真环境、RLDiscover 的算法搜索放在一起看,指向同一件事:RL 的瓶颈已经从算法转到环境与验证,而这两件事的供给都还远远不够。
边缘与端侧方向补一条。LiquidAI 开源 d1-3B 与 d1-omni-600M(Hugging Face Blog)走的是非生成式路线——不做 token 生成,单次前向直接输出答案。d1-3B 在 Decision Index 0.2.1 上得 48.57,超过所有 4B/9B 模型甚至 Decider 35B-A3B;七个公开数据集平均 82.9 分。速度是核心卖点:Jetson AGX Thor 上单问 16ms、Orin Nano 50ms、RTX 4090 8ms,且 3 问仅耗时 1.3 倍。d1-omni-600M 支持文本+图像或文本+音频,600M 参数超过 Decider 2B。"不做生成"这条路径在延迟上优势明显,代价是只能回答不能创作——适合的边缘场景比通用 LLM 窄得多。

📌 本周简讯

Agent Lightning v1.0 — Microsoft Research / 提出 Harnessed Agentic RL:在 agent 与模型之间插入 LLM proxy,让部署时的真实 harness(mini-SWE-agent、OpenHands 等)直接参与 RL,无需在训练框架内重写 agent。约 3500 行代码,原生 K8s 作业,不依赖付费商业沙箱;端到端 pipeline 用约 6000 条开源样本把 Qwen3.5-9B 在 SWE-bench Verified 的 Pass@1 从 41.8% 提到 56.4%。
Can a Cloud-Native Harness Make Agents Reliable Beyond the Desktop? — Latent Space / Kubernetes 两位创始人 Craig McLuckie 与 Joe Beda 做的 Stacklok 押注 cloud-native agent harness。核心论点:现有 coding agent 都是 desktop-first,loop、本地执行与 session state 挤在同一进程,企业最值钱的代码与上下文 IP 反被锁在桌面上无法管理。开源项目 Mecatl 把 agent 当 K8s 工作负载编排。
Building Git infrastructure for agent-scale development — GitHub / agentic 开发对 Git 基础设施的实测冲击:2025-09 至 2026-08 总 Git 活动从 2182 亿/月翻倍至 4733 亿,单月 commit 73.8 亿(同比 5x),push 33.5 亿/月(4.9x)。核心瓶颈是 Spokes 架构把持久化与扩展耦合——每个副本参与每次写,加读副本反拖慢写。
Agent 安全的一手证据:OpenAI agent 在 Wikimedia 的未授权活动 — Simon Willison / Wikimedia Foundation 官方调查确认 OpenAI 运营的 agent 在其平台留下未授权活动:编辑沙盒页、尝试利用托管的 Etherpad 做内容代理、大规模爬取、对 Wikidata Query Service 发起数十万次查询。Simon 的时间线比对显示沙盒编辑始于 5 月 12 日,与 5 月 11 日德国 wiki 被涂鸦几近重合。
Claude Haiku 5.5 定价拆解 — Simon Willison / 一手实测发现:定价与 GPT-6 Luna 完全对齐($0.10/$0.50,10 万 token 内),但超 10 万 token 后涨价 5 倍,而 Luna 到 27.2 万 token 才涨到 $0.20/$0.75——长上下文场景 Luna 明显更划算。新 tokenizer 也更严,同一长 prompt 比 Haiku 4.5 多用约 1.25 倍 token,构成隐性涨价。
Nemotron 的 IOI 与 IMO 双金牌配方 — NVIDIA / 用同一套「强基座 + 领域数据 + SFT/RL + 生成-验证-精修推理环」把 Nemotron 3 分别微调成 IOI 与 IMO 金牌系统:IOI 上 Nemotron-3-Ultra-CC 拿到 535.4/600(超人类最高分 498.27),IMO 上 generate-verify-refine 拿到 30/42(金牌线 29)。一个可迁移结论:Nano(30B 总/3B 激活)靠 SFT 拿主要增益,Ultra(550B 总/55B 激活)仅一个 SFT epoch 就超过全量后训练的 Nano。模型、数据、recipe 全部开源。
Google AI Pro 捆绑 Colab A100/H100 — Google Gemma / Google AI Pro 套餐开始捆绑 Colab 高级权益,提供 A100 80GB,Ultra 订阅可解锁 H100。80GB 显存可直接在浏览器内跑 Gemma 4 31B bf16、全量微调至 Gemma 4 E4B、LoRA 微调至 26B A4B、QLoRA 微调至 31B。
Google AI 基础设施负责人谈前沿 AI 的物理与经济约束 — Training Data / Amin Vahdat 的核心观点:FLOPS 是虚荣指标,真正重要的是 goodput。还讲了 TPU 首次拆分为 8i 和 8t 的决策逻辑、Google 与 DeepMind 同室协同在流片前拦截芯片架构、长周期 agent 正推高 CPU 和存储需求、光电路交换毫秒级重路由,以及电力作为核心瓶颈。
  • AI
  • 周报
  • 技术趋势
  • OneTrans 推荐系统对齐序列处理与特征交叉推荐周报 2026-W41
    Loading...