AI周报 2026-W34
2026-8-22
| 2026-8-22
字数 6908阅读时长 18 分钟
type
Post
status
Published
date
Aug 22, 2026 05:44
slug
ai-weekly-2026-W34
summary
本周 AI 领域有一条清晰的主线:能力的增长节奏正在逼迫评估、治理和安全体系同步提速。Sam Altman 宣布暂停部分前沿 RL 训练(本周最重磅的产业事件),理由是能力进步超出了安全和对齐的节奏。与此同时,NVIDIA 的 AVO agent 在 ARC-AGI-3 上完成全部 183 关拿下 100%,Ornith-1.5 通过自我改进训练追平 Claude Opus 4.8——能力端与安全端在同一步频上加速,形成张力。 第二条线是评测与训练环境的范式转移:从静态、零样本的基准走向实时、长时程、自生成的环境。本周的 FM-Bench(AnalogyAI)用 20 年足球管理模拟检验长期决策,EnvHarness(Google)让静态环境学会自适应演化,Wuying-Browser-Agent(阿里云)则直接引入平均 37.9 步的 BrowserBench——评测不再测"能不能",而是测"能否长期稳定地做"。 第三条线是推理优化进入工程精细阶段:LFM2.5-DSpark(Liquid AI)的推测解码带来 3.2 倍加速,LMSYS 的权重缓存守护进程把引擎加载从 495 秒压到 0.63 秒。成本曲线在多个层面被压低。
tags
AI
周报
技术趋势
category
AI技术报告
icon
password
priority
1

📊 本周概览

本周 AI 领域有一条清晰的主线:能力的增长节奏正在逼迫评估、治理和安全体系同步提速。Sam Altman 宣布暂停部分前沿 RL 训练(本周最重磅的产业事件),理由是能力进步超出了安全和对齐的节奏。与此同时,NVIDIA 的 AVO agent 在 ARC-AGI-3 上完成全部 183 关拿下 100%,Ornith-1.5 通过自我改进训练追平 Claude Opus 4.8——能力端与安全端在同一步频上加速,形成张力。
第二条线是评测与训练环境的范式转移:从静态、零样本的基准走向实时、长时程、自生成的环境。本周的 FM-Bench(AnalogyAI)用 20 年足球管理模拟检验长期决策,EnvHarness(Google)让静态环境学会自适应演化,Wuying-Browser-Agent(阿里云)则直接引入平均 37.9 步的 BrowserBench——评测不再测"能不能",而是测"能否长期稳定地做"。
第三条线是推理优化进入工程精细阶段:LFM2.5-DSpark(Liquid AI)的推测解码带来 3.2 倍加速,LMSYS 的权重缓存守护进程把引擎加载从 495 秒压到 0.63 秒。成本曲线在多个层面被压低。

Agent 评测基准与自生成环境

这一周的评测基准发布密集,方向高度一致:从"标定静态技能"转向"生成动态、长时程的真实场景"。
NVIDIA AVO在 ARC-AGI-3 上完成全部 183 关、25 个公开环境,得分 100%——在无指令、无明确规则的前提下。"通用编程 agent"这个标签容易让人忽略它的意义:ARC 系列测的是抽象推理的泛化,而 AVO 没有针对该基准做任何专项优化。它的价值在于证明了当前 agent 足以在没有显式目标的交互中自主探索并完成任务,为评估"真正的自主性"提供了上限样本。
**亚马逊的 SOP-Bench 从另一个维度切入:不再测泛化,而是测真实业务流。它将企业标准操作程序(SOP)与可用工具、ground-truth 答案配对,覆盖医疗、物流、金融、内容审核等 12 个领域、2000+ 任务。每个任务包含完整的 SOP 文本、工具接口、规格说明和已知答案,框架支持团队替换自己的 agent、添加自有 SOP,并记录完整工具调用与推理轨迹,失败可回溯到具体步骤。它的一个发现值得注意:强基础模型在处理真实流程中的歧义和多步协调时仍明显不足。这指向一个长期被忽略的事实——benchmark 里的任务做得好,不等于 SOP 走得了。
FM-Bench 把长度拉到极致:一个 LLM agent 运营一支足球队 20 个游戏年,通过 26 个工具、约 340-400 个决策点,用与对手相同的预算组建阵容、交易球员、谈合同、投资设施和青训、布置阵型,并对董事会负责——可以被解雇。关键设计在于:没有 LLM judge、没有人工评分,一个确定性引擎将每一年的累积结果换算成最终分数。15 个模型全部跑完 20 年,而盲脚本基线在大部分场景中提前死掉。三个发现值得展开:
  • 模型排序与规模、价格、厂商均无关联;排序只在时间轴后期才稳定下来,最佳的人类玩家(首玩)仅排在模型榜末位。
  • 拉开差距的是管理行为而非计算量:高分模型在末期减少慢回报投资、让现金保持运转而非闲置、提前开启续约,而 token 花费预测不了任何东西。
  • 没有一个模型能从数百次被拒报价中学会市场的隐藏价格;自管理记忆呈现出两种相反的失效模式——只增不删的档案库,或每个赛季重写的计划。
这说明长时程场景中,"该做什么"比"怎么算"更重要,而现有的记忆机制和推理框架都还没有准备好。
EnvHarness(Google)处理的是评测/训练环境的"静止性"问题:手搭的环境对 agent 的弱点视而不见,agent 进步后又被迅速甩开。它提出一个可编程的组件插件层,包装静态环境、重塑其行为而不改动底层逻辑;配套的 EnvRigger 把目标策略当黑盒,观察执行轨迹、诊断缺陷、合成新组件,再用新鲜 rollout 验证。在四个领域五个基准上,EnvHarness 比原始环境和领域特定的生成管线都强,held-out 实例上最高提升 9.0 分,执行步数少 9.8%,且为 RL 提供了更优的优化信号——策略与环境可以持续地协同进化。
与 EnvHarness 同方向但走另一条路的,是 Metrics That Write Themselves(AWS):让评估器从自身盲区自动演化。它借用了程序验证里的 counterexample-guided abstraction refinement(CEGAR):把评估器池视为一个抽象,寻找两个得分相同但一正一误的碰撞答案,把这对答案作为"写作请求"而不是 prompt。在 MBPP+ 和 HumanEval+ 上,这个循环写出了 55 行的算子,在 428 个未见任务上闭合了"什么都不标"到"完美过滤"之间 15.4% 的差距(+0.0065, p=0.0010),而标志数只有最好手写算子的四分之一。一个额外的细节:LLM judge 在同样信息下也能达到相近效果,但每个候选都要永久性付一次模型调用费,而演化出的算子一次都不用。
Wuying-Browser-Agent(阿里云)则用结果说话——27B 模型在 WebVoyager 上 80.6%、Online-Mind2Web 上 66.7%、BrowserBench 上 65.1%,均为开源 SOTA。它自身的贡献点在于引入 BrowserBench:350 个中英双语真实网页任务,平均 37.9 步——因为现有基准大多太短,暴露不了长时程失败模式。这印证了本周的主题:真实部署不是 3 步能解决的问题。
LEGO-RL(字节跳动)解决的是另一个痛点:native coding-agent harness 的执行环境与策略梯度训练天然错配——环境崩溃和 reward hacking 污染结果信号,训练-推理不一致让 rollout 行为与策略更新脱钩。它用 in-process LLM proxying 捕获原始生成流做 token 级对齐、沙箱编排做 stage-wise 防御,在三个 harness(OpenHands SDK、Claude Code、OpenCode)上把 Qwen3.5-35B-A3B 的 SWE-bench Verified 分别从 64.0/62.4/57.2 提到 70.4/68.2/66.6,同时 rollout-训练概率相关性保持在 0.99 以上。
把这几件事放一起,能看出评测范式的转向:NVIDIA AVO 测无指令探索,SOP-Bench 测真实业务流,FM-Bench 测 20 年长期决策,EnvHarness 和 Metrics That Write Themselves 让评测环境和评估器自己演化,Wuying 用更长任务暴露失败模式。它们的共同逻辑是——静态基准测不出 agent 在真实世界的价值,"可复现地贴近真实"才是新的标尺。

Agent 工具权限治理与上下文安全

Agent 的工具调用走向规模化之后,"权限治理"从理论探讨变成了有明确架构图的工程。AWS 本周发布的两篇文章构成了一个完整的治理叙事。
Amazon Bedrock AgentCore Gateway 直击企业痛点:MCP 凭据散落本地、策略漂移、审计缺失。它给出一个四阶段成熟度路径——Connect(连接)→ Control(控制)→ Catalog(编目)→ Harden(加固),每个阶段独立交付价值,并匹配具体的 AWS 服务(Identity、Policy、Guardrails、Registry)以及自托管替代方案(Kong、OPA、NeMo Guardrails)。Dogwood 策略的自然语言编写 则进一步降低了策略治理的门槛——用自然语言描述合规文档,系统自动转换为形式化 Dogwood 策略,新增了时间约束(限流、前置条件、工具调用顺序、累积效应)等高级控制。文中以零售银行客服 Agent 为例,展示了监管语义到可执行策略的转化路径。
这两篇都是厂商视角的方案,但背后的需求是真实的:工具调用组合正在产生新的攻击面。Brave 检索到一个精炼的概括——"读文件 + 调网络 + 调 Bash 的组合,等于给了 Agent 一台无监控的电脑"。长会话状态污染、RAG 内容污染、工具权限过大,这些在治理文章里作为痛点出现的问题,本周在论文层面得到了更直接的证据。
Inadvertent Context Leakage in Language Models(Meta、UC Berkeley、UCSD)可能是本周安全方向最重要的一篇。它研究的不是 prompt injection 或越狱,而是更隐蔽的东西:敏感上下文(日历、凭据、健康记录、财务数据)仅仅存在于模型的 context window 里,就会在 benign 输出中引入隐藏关联——即使模型正确拒绝了直接提取。研究者在 8 个专有模型上的实验结果:
  • 2 位数的 in-context secret 在普通过程中以接近完美的准确率被重建,4 位数达到 82% 精确匹配。
  • 更强模型泄漏更多——更强大的指令遵循放大了对 in-context secrets 的敏感度。作者据此认为泄漏是能力的副产品,而非可修补的 bug。
  • 两个实际攻击被验证:一个训练过的分类器从日常自然语言输出中推断用户记忆的语义谓词(健康状况、财务事件);一个 RL 训练的对手能从生产型 agent 中提取完整的社保号。
这个发现与治理文章形成闭环:即便你在架构层面管好了工具权限、做好了策略隔离,秘密本身的存在就是风险。它的含义有点反直觉——你越是让模型能力变强,它越是能"无意中"泄露。这也解释了为什么水印和秘密检测这类防御性技术开始进入工业界的产品路线图。
VSysBench(首尔大学、NAVER Cloud AI、KAIST)把视线转向系统消息与多模态能力的冲突。它基于 MMVet-v2 构建,把约束分为 5 主类 22 子类,并为每条约束配上违反指令层级的"错配样本"。在 16 个 MLLM 上的发现:施加系统消息会显著侵蚀基础任务准确率;开放权重模型在用户冲突下合规性崩溃,而顶级专有模型保持稳定;视觉锚定的约束对每个模型都是最难的一类。这个"合规-能力"的权衡在系统消息逐步成为生产部署默认配置的当下,是比"能看"更实际的问题。

LLM 推理加速与成本优化

推理优化本周的看点不在新原理,而在工程精细度的量化提升。推演路径不再追求"能不能跑",而是"能在多大程度上逼近理论边际"。
LFM2.5-DSpark(Liquid AI)是本周推理侧的头部增量。它发布 DSpark 系列草稿模型检查点,通过推测解码把解码延迟压到最高 3.2 倍加速。关键技术组合:DFlash 并行骨干 + 马尔可夫链顺序头 + 置信度调度验证器,在贪心解码下输出与基线一致、质量无损。草稿模型约 300M 参数,覆盖 1.2B、2.6B、8B-A1B 三个尺寸,llama.cpp 和 SGLang 均已 day-one 集成。推测解码本身不是新概念,但 DSpark 的价值在于它的完整性——训练好的草稿模型直接可用、主流框架当日支持、端侧和 CPU/GPU 数据齐全,属于拿到就能复现的收益。
LMSYS 的 权重缓存守护进程 解决的是引擎重启时间问题——这在多租户、滚动更新的生产环境里是真实的成本。它构建了一个常驻 GPU 进程,通过 CUDA IPC zero-copy 把已量化权重映射给新引擎,把 Ling-2.6-1T FP8 的权重加载从约 495 秒降到 0.63 秒——约 785 倍,Qwen3-235B FP8 上约 500 倍,端到端启动时间缩短 93.9%。关键设计:每块 GPU 只加载和量化一次,所有引擎映射同一组 IPC handle,active-standby 故障切换小于 1 秒,不需要为副本保留空闲 GPU。这个方案对推理服务商的意义不亚于一个加速算法——它把"冷启动"从分钟级压到秒级,服务密度随之上升。
SkyRL 的 IsoExec(NovaSkyAI)处理的是 RL 训练的一个深层隐患:vLLM 的 rollout 引擎和 Megatron 的训练器跑同一个策略,但 token 的 logprob 因浮点非结合性而出现分歧。IsoExec 用执行契约 + 统一模型对齐 rollout 与训练两侧的舍入敏感执行选择,在不同 TP、EP、SP 布局下实现 bitwise 一致。对 Gated DeltaNet,chunkwise-parallel 循环算法让并行训练和 prefill 与循环解码在 bit 级别相同。Qwen3.5-35B-A3B、DAPO、8×H100、50 步的实验:logprob 差异从 1.6e-2 降到 6.7e-7,整步开销 25.3%。vLLM 的 scheduler 和 CUDA graphs 依然适用。
AWS 的 查询感知压缩 追求的是 token 层面的成本削减:在检索后、主模型生成前,用一个小模型(Claude Haiku)按用户查询过滤 chunks,只保留相关片段,减少主模型(Claude Sonnet)的输入 token。这实际上是把"压缩"从模型压缩扩展到了上下文压缩。文章提供了完整的成本模型、延迟权衡和质量评估方法,并展示了与 prompt caching、Intelligent Prompt Routing、Rerank API 的叠加效果。
端侧也有值得注意的工程增量。Qwen3.8-27B 在 M4 Max 上的优化:ANE prefill + MTP k=3,代码任务 72.1 tok/s、散文 53.3 tok/s,prefill 从 83 提到 274 tok/s(3.3 倍),decode 提升 10%(因为 prefill 不再阻塞)。另一个极简案例——用 PyTorch 内置 GELU 替代自制实现,训练速度从 21k 提到 25k token/s。这两件事放在一起说明:当框架和算法层面的优化做到位后,是否调用优化过的算子、是否用好硬件原生路径,决定了最后这 20% 的差距。
硅谷 101 的 Token 经济特辑把这一整块放在更宏观的背景下:Token Maxing 热潮之后是成本失控,嘉宾分享了日烧数百美元的亲历体验。一个可操作的信息是本地开源模型与前沿模型搭配的性价比策略——推理优化的每一项工程进展,都在推动这条曲线往下走。

后训练与模拟驱动的 Scaling Law

本周有一组信号指向同一个判断:参数规模不再是能力的第一决定因素,后训练、特别是长时程环境的强化学习,正在成为新的 scaling 轴。
最直接的表态来自 Z.ai CEO 唐杰(Latent Space 访谈):"参数已死"。GLM-5.3 的飞跃完全来自长时程环境的 RL 训练——环境覆盖数天工程师工作量,且整个环境、评判器、验证器均为合成生成。文中提出了后 Chinchilla 时代的五个 scaling 旋钮(含 MoE 稀疏性),并指出高级技能(如漏洞挖掘)依赖 20+ 推理步的长因果链,而非参数记忆。GLM-5.3 的独立评测 部分佐证了这个说法:Artificial Analysis 智能指数 60 分与 Kimi K3 持平,较 GLM-5.2 涨 7 分;agentic 能力的 Elo 从 1524 跳到 1770(246 点),仅次于 Claude Opus 5 的 1855,超越此前开源领头羊 Kimi K3(1668)逾 100 点。但代价也明确:每任务输出 token 约 18,700,比前代增 20%、比 Kimi K3 多 27%;每智能指数任务成本 $0.68,是 GLM-5.2 的 1.5 倍——能力涨了,token 效率降了。权重预计一周内开源,754B 总参数、40B 激活的尺寸与 GLM-5.2 持平。
Ornith-1.5 把环境生成的逻辑推进了一步:在训练过程中实时为自己合成环境。RL reward 包含一个任务组件——模型在提出自己学得会的新任务时获得奖励。官方发布(ornith_)把这条线完整描述为自改进闭环:模型提出新任务、生成任务专属的 scaffold、为 RL 产出解决方案 rollout,持续创造新的学习经验。Ornith-1.5 跨越 9B Dense、35B MoE、397B MoE 三个尺寸,MIT 许可开源。基准数字:Terminal-Bench 2.1 86.1、SWE-bench Verified 86、HLE 44.6、ClawEval 81.4、Tool Decathlon 71.2。这是自改进训练从概念验证走向实用化的一个样本——把"模型为自己造任务"从论文里搬进了可下载的权重。
Mobius(上海 AI Lab)从架构层面回应同一问题。它把知识(FFN)与推理(Self-Attn)解耦:全局共享的 Memory(FFN)存知识向量,多个 Reasoner(Self-Attn)以隐藏状态为缓存和载体,反复查询记忆做组合推理。结果是 7B 模型用基线 62.6% 的训练数据达到同等下游分数,35B 模型在同等分数下带来近 4 倍端到端推理加速。知识与推理分离的价值在强化学习时代会更明显——reasoner 可以独立迭代,memory 可以单独更新而不影响推理链路。
Simulation: the new Scaling Law(Latent Space / Simile AI)把这条线的另一面讲了出来:用模拟复现人类行为。CEO Joon Sung Park 从 2023 年 Smallville 生成式 Agent 聊到如今 20 亿美元估值的 Simile——用长访谈、交易数据、随机对照试验构建人类行为数字孪生,在 1000 个真实人上达到 85% 的行为复现准确率。一个关键的洞察:前沿模型过度理性化,反而难以模拟非理性的人类——需要通过后训练注入因果机制,而不是单纯靠 prompt。模拟的规模法则、数据中心级模拟世界的成本、以及用模拟解决气候变化/UBI/民主稳定性问题的愿景,都是在延伸"模拟是训练信号来源"这条思路。
Percy Liang 的 Marin 535B-A23B 本周开始训练,全程公开:预训练 80% + 中期训练 20%,18.75T tokens,11× GB200 NVL72,约 3 个月,2.7e24 FLOPs。开训前先用 1.6B-A61M 到 27.7B-A1.2B 的四梯 scaling ladder 调试问题并预测主实验。这是"开放过程"一个更完整的样本。
Harvey 的 Tenet 展示了后训练在垂直行业的落地形态:基于 Kimi K3 基座 + Fireworks 后训练,语料为公开法律数据、合成数据、以及模拟长时程法律工作的人类专家数据。LAB 全通率提升 82%、LAB Contracts 上提升 22%,以 LAB Contracts SOTA、LAB 第二的成绩,并将收益泛化到 Apex Agents、Redline Bench、Professional Reasoning Bench。成本是头部基础模型的四分之一以下。Harvey 还后训练了三个子代理模型(M&A 尽职调查、审查表格、律所知识),各自针对高规模长时程任务优化——法律行业是 agentic 工作流最自然的大规模场景之一。
把这一组的信号连起来:GLM-5.3 证明后训练 RL 能大幅提升 agentic 能力,Ornith-1.5 证明模型能自我合成训练环境,Mobius 从架构上把知识存储与推理分离,Simile 把模拟推向人类行为复现,Tenet 展示了这些方法在垂直行业的产品化路径。后训练和模拟正在成为比"更大模型"更重要的话题。

AI 权力结构与监管合规

这周在治理层面的动静不小,而且呈现出一种此前少见的反差:一边是能力的加速推进,一边是围绕"安全节奏"的主动刹车和制度性讨论。
Sam Altman 宣布暂停部分前沿 RL 训练原推)是本周最具分量的产业事件:"我们暂停了部分前沿 RL 训练,以确保我们能够达到新能力水平所需的对齐、安全和监控标准。"并称"模型进展现在极其迅速,我们一直说如果模型能力超过安全和对齐的推进速度,我们会采取行动。"他预期"对安全的信心将日益决定 AI 进展的步伐"。这是前沿实验室首次公开以"安全节奏不足"为由暂停训练。它的信号意义不止于 OpenAI 自身——如果 OpenAI 愿意为安全按下暂停键,其他实验室在竞争压力下未必跟得上,这正是 Allen 本周在 Hard Fork 节目里讨论的两周暂停可能波及其他实验室的由来。Hard Fork 本期 还有历史学家 Jill Lepore 讨论其新书《人工国家的兴衰》——企业机器统治人类的威胁。
诚然,Altman 的声明措辞留有余地,且 Open AI 暂停后旋即发布 GPT-5.6 Sol 降价策略(简讯详述),两者构成一周之内的微妙对照。这并不构成对暂停的真实性的否定——也可能正是暂停释放了推理资源的信号。
OpenAI AI Futures 是本机构在治理思想上的新动作:成立 Strategic Futures 团队,由 Dean Ball 主笔,首篇文章把问题拉到一个更长的尺度——当自主系统使国家无需依赖人力即可投射武力、征收税收、运行官僚机构时,"权力集中"的风险如何威胁个体自由。文章刻意用联邦党人文集和牛顿力学的类比,主张理解权力倾向的"机制"而非依赖"羊皮纸屏障"(即纸面制度约束)。这种把 AI 治理放进宪政史语境的尝试,至少提供了一个新的 mental model:AI 时代的安全不只是技术对齐,还包括权力结构的再设计。
AI 文本水印在这一周进入了落地验证期。Zvi 的系统解读 梳理了完整脉络:Scott Aaronson 在 OpenAI 期间提出的方案基于伪随机源与密钥,对输出质量零影响、边际成本近零,可被改写移除。Google 自 2024 年起在 Gemini 3.7 Flash 等模型上部署,通过 2000 万样本实测确认无用户反馈差异。Anthropic 为遵守 EU Code of Practice 已悄然推出水印,OpenAI 计划跟进。文章同时剖析了社区对水印的过度反对情绪——多数反对理由经不起推敲——并区分了合理防御性研究与系统性移除的伦理边界。水印技术本身并不新鲜,但它从论文走向三大前沿实验室的默认配置,这个过程本身就是监管压力的一个注脚。
它触及了本周监管主线的一个核心矛盾:各国监管框架(美国行政命令、EU Code of Practice)正在逐步成型,但技术治理的落地节奏远落后于能力增长。水印是少数已被实际部署的合规技术之一——因为它的边际成本近零且对用户感知无影响,这正是治理技术得以落地的现实条件。

📌 本周简讯

GPT-5.6 Sol 降价 — OpenAI / API 与 credit 价格下调超 20%,持续 3 个月。能力提升的同时成本下降,与 Altman 的暂停声明形成同一周内的对照。
GLM-5.3 评测数据 — Artificial Analysis / 智能指数 60 分与 Kimi K3 持平,agentic Elo 1524→1770 位居第二;但每任务输出 token 增 20%,成本 1.5 倍于前代。
DeepSeek-V4-Flash-Vision-Exp — DeepSeek / 实验性多模态模型,文本能力持平 V4-Flash,多模态 agent 基准大幅提升、接近 Opus-4.8,已上线 API。
Ornith-1.5 正式发布 — Ornith / 9B/35B/397B 三尺寸,终端基准、SWE、reasoning 多项成绩追平 Claude Opus 4.8,MIT 许可开源。
Codex 防误删安全更新 — OpenAI / 针对 GPT-5.6 误删用户文件的案例,加入删除目标检查、多层级执行审查与 RL 防破坏训练。
T-Rex 触觉开源 — NVIDIA / Berkeley / 双时钟异步触觉架构 + 50 小时(约 5500 段)触觉机器人数据,22 自由度手部硬件,为触觉作为多模态第一公民提供数据基础。
GEN-1.5 数据规律分析 — Jim Fan / 指出人类数据中对称模式与"失误-恢复"片段是关键信号,保留失败片段可实现上下文学习;UMI 直接采集数据优于遥操作。
Marin 535B 开训 — Percy Liang / 535B-A23B 全程公开训练,18.75T tokens、2.7e24 FLOPs、约 3 个月,预训练 80% + 中期训练 20%。
  • AI
  • 周报
  • 技术趋势
  • OneTrans 推荐系统对齐序列处理与特征交叉推荐周报 2026-W34
    Loading...