AI周报 2026-W39
2026-9-26
| 2026-9-26
字数 7189阅读时长≈ 18 分钟
type
Post
status
Published
date
Sep 26, 2026 05:41
slug
ai-weekly-2026-W39
summary
这周的关键词只有一个:每任务成本。 9 月 22 日,Anthropic 发布 Claude Opus 5.5,运行成本比 Opus 5 低 40%;约一小时后,OpenAI 发布 GPT-6 Sol 与 Luna,API 价格较 GPT-5.6 促销价直接腰斩。同周,StepFun 放出 Step 5 Preview(600B/27B MoE,每任务 $0.71),小米用约 300 万美元训出 1T 总参 / 42B 激活的开源权重模型 MiMo-V2.6-Pro。这些发布不再是"谁更聪明",而是把智能和成本摆在同一张帕累托图上比——Artificial Analysis 的评测里,GPT-6 Sol 的每任务成本比前代低约 50%,而每任务生成的 token 反而更多,降本完全来自单价。 第二条线在推理侧,两个方向同时压缩瓶颈。一类是 System 1 决策模型:斯坦福 CLM-8B 用对比学习连接状态与动作,推理比 Jev 快 9 倍,DeepSWE 81.6%;LMSYS 在 SGLang 上为 Jev 类模型做多候选评分,16 候选 p95 从 54.1ms 降到 20.6ms。另一类是 KV cache 量化:Blackwell 上的 NVFP4 把每 token KV 压到 FP8 的 56%,1M 上下文解码提速 78%,GPQA 与 AIME 近无损。OpenAI 同一天发布的 GPT-6 prompt caching 更新,是从缓存命中率这个更"应用层"的角度切入同一问题。 第三条线是 Agent 从"能跑"走向"能管"。Accenture 给出企业 harness 路由方案,1 万座席仿真里回收 14-21% 模型支出;Microsoft 的 LIMBO 沙箱用 25,930 个 episode 拆开 exactly-once 语义到底该落在模型、harness 还是工具契约;Nubank 在 1.4 亿客户规模的产品上用仿真筛模型,线上 tNPS 提升 36.69 分。
tags
AI
周报
技术趋势
category
AI技术报告
icon
password
priority
1

📊 本周概览

这周的关键词只有一个:每任务成本。
9 月 22 日,Anthropic 发布 Claude Opus 5.5,运行成本比 Opus 5 低 40%;约一小时后,OpenAI 发布 GPT-6 Sol 与 Luna,API 价格较 GPT-5.6 促销价直接腰斩。同周,StepFun 放出 Step 5 Preview(600B/27B MoE,每任务 $0.71),小米用约 300 万美元训出 1T 总参 / 42B 激活的开源权重模型 MiMo-V2.6-Pro。这些发布不再是"谁更聪明",而是把智能和成本摆在同一张帕累托图上比——Artificial Analysis 的评测里,GPT-6 Sol 的每任务成本比前代低约 50%,而每任务生成的 token 反而更多,降本完全来自单价。
第二条线在推理侧,两个方向同时压缩瓶颈。一类是 System 1 决策模型:斯坦福 CLM-8B 用对比学习连接状态与动作,推理比 Jev 快 9 倍,DeepSWE 81.6%;LMSYS 在 SGLang 上为 Jev 类模型做多候选评分,16 候选 p95 从 54.1ms 降到 20.6ms。另一类是 KV cache 量化:Blackwell 上的 NVFP4 把每 token KV 压到 FP8 的 56%,1M 上下文解码提速 78%,GPQA 与 AIME 近无损。OpenAI 同一天发布的 GPT-6 prompt caching 更新,是从缓存命中率这个更"应用层"的角度切入同一问题。
第三条线是 Agent 从"能跑"走向"能管"。Accenture 给出企业 harness 路由方案,1 万座席仿真里回收 14-21% 模型支出;Microsoft 的 LIMBO 沙箱用 25,930 个 episode 拆开 exactly-once 语义到底该落在模型、harness 还是工具契约;Nubank 在 1.4 亿客户规模的产品上用仿真筛模型,线上 tNPS 提升 36.69 分。

前沿模型:成本腰斩成为主战场

9 月 22 日这天很密集。Anthropic 先发 Claude Opus 5.5,新 Claude 5.5 家族首款,官方称多数任务达到 Fable 5.1 水平,运行成本比 Opus 5 低 40%。约一小时后 OpenAI 发 GPT-6 Sol 与 Luna。
GPT-6 Sol/Luna 是 Astra 之后的成本效率梯队:沿用 Astra 的训练方法,能力上延续专业工作、事实性、编码、computer use 与对齐,但 API 价格直接砍半。Sol 输入 $4→$2、输出 $20→$10;Luna $0.20→$0.10、$1.20→$0.50。Sam Altman 在推文里的表述是"每 token 价格减半,每任务价格更低"。OpenAI 把降价归因于缓存与推理侧改进——他们同一天发了一篇更好的 prompt caching,机制细节见下一节。两家模型已通过 ChatGPT 官方账号确认在 ChatGPT Work 与 Codex 中面向 Plus/Pro/Business/Enterprise/Edu 推出。
Artificial Analysis 的逐项评测给了更清楚的画面。成本侧:GPT-6 Sol (max) 跑一次 Intelligence Index 花 $1.06/任务,比前代 $1.99 便宜约 50%;Luna (max) $0.07/任务,便宜约 60%。但两个模型每任务生成的 token 其实更多了(Sol 31k vs 29k,Luna 51k vs 41k)——降本来自单价,不来自效率。编码侧:Sol 在 Codex harness 下 Coding Agent Index 得 57(+2),Terminal-Bench 4.0 从 37% 到 43%,SWE-Atlas-QnA 从 54% 到 58%,每任务成本 $2.99 约降一半;Luna 反而退 2 分(SWE-Atlas-QnA 44% vs 49%)。幻觉侧两代都收窄,但方式值得注意:Sol 幻觉率从 92% 降到 60%,代价是"只答 83% 的问题"(前代 99%),准确率从 59% 掉到 54%。GDPval-AA v2.1 上 Sol 掉了约 100 Elo,是本轮最明显的退步——评测方人工回看输出后认为,退步主要来自呈现质量下降与交付物漏掉 rubric 元素。
Simon Willison 在他的记录里补了两个细节:GPT-5.6 十一月还将涨回 25%,所以官方对比基准下的实际降幅更大;Opus 5.5 在 max 档首次没能返回"鹈鹕骑自行车"的 SVG。后者是趣闻,前者说明定价页上的对照点选得很有讲究。
国内同周也出牌。StepFun 先在推文里介绍 Step 5 Preview:600B 总参 / 27B 激活 MoE,1M 上下文 + 视觉,面向 agentic 工作与专业工作,特别强调金融场景。官方给出 AA 指数 44、每任务成本 $0.71。10 月 15 日开源权重。配合下一节的架构论文 KITE 一起看,这个模型的能力-成本曲线调整有一部分是在架构层完成的。
更值得注意的是小米。MiMo-V2.6-Pro 是 1T 总参 / 42B 激活的开源权重模型,官方称训练成本约 300 万美元,并同步推出 Flash 与 UltraSpeed(同质量下输出速度最高 20 倍)。技术报告把 RL 沿三轴展开:全异步大 batch(每次更新 1,568 样本、最高 1M 上下文、每步 3.5-3.7B tokens)、多任务多 harness 环境混合、组内相对比较的 grader compute 提供长程奖励。小米同时开源了环境代码与训练配方——code、ARVO 漏洞复现、general、webdev、music 五套 recipe,加可组合 mini-harness 配置,7k+ 任务数据集暂未放出。团队负责人 LuoFuli 在推文里称这是"开源模型团队迄今单次 RL 计算规模最大的训练之一",并额外放出从 MiMo RL 轨迹蒸馏的 Qwen 模型、7K 环境与完整 RL 框架,理由是"让社区专注在真正的 Agentic RL 问题上,而不是从零搭环境"。他还给了一条训练策略上的判断:MixRL 用在可验证的中等难度任务(代码与 agentic)上,难验证、超长程或纯主观信号的任务走 MOPD 单独训练再合并。
把这几个发布放一起看,本周的成本下移发生在多个量级:前沿厂用缓存与推理基础设施压单价,二线厂用架构与 MoE 激活比压每任务成本,开源侧用 RL 算力换训练成本。做选型的团队需要重算一遍。

System 1 决策模型与 KV Cache:同一瓶颈的两个切面

这周推理侧的两条线都指向同一个观察:LLM 在 agent 场景里的瓶颈,很多时候不是"想得不够深",而是"决策太慢、缓存太贵"。
先说决策模型。斯坦福团队(Azalia Mirhoseini 的一手发布与论文一作 jackyk02 的帖子)推出 Contrastive Language Model(CLM),思路是把状态和动作通过对比学习直接连起来,跳过自回归里生成 token 的那一步。CLM-8B 在 computer use、gaming、tool calling 上与 Jev 零样本表现相当,推理快 9 倍;轻量 fine-tune 后在 DeepSWE 拿到 81.6%,Terminal-Bench 2.1 拿到 87.6%。团队同时建立了跨算力、模型规模与数据规模的 scaling law,并开源 checkpoint、数据与训练/服务基础设施。对 agent 从业者来说,这是把"决策"从生成任务里拆出来的一个可行起点。
这条线的设计哲学在 Latent Space 的 Jev 访谈里讲得最清楚。Diogo Almeida 是 InstructGPT 合著者,现在是 TypeSafe AI 的 CEO。他的核心主张是:ChatGPT 成功之后,业界只剩一条路——自回归对话微调,对齐、拒答、可靠性都被带偏;三类 RLHF 都不是正确的北极星。他主张小型的、面向生产的 System 1 模型,强调 KV cache 决定一切,模型应该像 regex 一样隐入背景。访谈里覆盖了 Jev 在编码 agent、语音+浏览器控制、实体解析、自然语言搜索上的落地,并预告了 ReasoningJev 方向。
部署侧,LMSYS 给出了工程化做法。他们用 SGLang 服务 Jev 类决策模型:问题在于 generate + top-k logprobs 可能丢掉需要的 label,而且共享上下文会被每个候选重复算一遍。SGLang 的两条对策是 `/v1/score` 直接返回指定 label 的分数,以及 Multi-item scoring(MIS)——共享上下文只算一次,每个候选独立隔离。效果是 MIS 延迟从 2 到 16 候选几乎平坦,16 候选在 Qwen3-8B 上的 p95 从 54.1ms(Generate)降到 20.6ms(MIS);在 Qwen3-0.6B 上负载升高时 MIS p95 仍在 100ms 以下,而 Generate 与 SIS 已经是秒级。
另一条线是 KV cache 量化。LMSYS 与阿里 Qwen、NVIDIA 合作,在 Blackwell 上实现 NVFP4 KV cache:每 token 占用约 FP8 的 56%,解码吞吐在 32K / 160K / 1M 上下文分别提升 37% / 58% / 78%,Qwen3.5-397B-A17B 上 GPQA-Diamond 与 AIME 2025 与 FP8 持平,1M 上下文下容量是 FP8 的 1.78 倍。实现靠三个组件的组合:NVFP4 两级缩放、decode 阶段的 in-kernel 反量化、paged KV cache;在 SGLang 里打开只需要一个 flag `--kv-cache-dtype nvfp4`。AgentX 在 FP8 下吞吐会掉头的地方,更高缓存命中率让 NVFP4 还能继续线性扩。
架构层面,StepFun 的 KITE 论文提供了一个更激进的思路。它以"训练成本、prompt 处理、解码"三者同时降为目标,方法是从小模型扩展到大模型时(upcycling),把新增参数放在不影响 attention KV 的区域。具体实现叫 SST(Step Scale Transformer),双塔解码器,一塔产 KV,另一塔读。同等累计训练算力下,SST 是 67B MoE、每 decode token 激活 2.15B 体参,训练损失低于 47B/63B MoE 的 1.48B/2.02B 激活对照,估算推理成本分别降 6.7% 与 31.6%。实验只在单一模型家族内部做对照、无下游 benchmark、未开源代码,所以只能作为架构方向的信号读,还不是可复用的方案。
训练侧的效率还有一条独立思路。Amazon 的 CounterRoute 论文处理的是"模型什么时候该思考、什么时候该直答"。它的做法是在一个共享 policy 上联合学习路由与模式条件响应,用当前 policy 的反事实 rollout 只对 routing token 分配跨模式信用,响应 token 由 within-mode GRPO 训练,早期再用 paired-to-self-routed curriculum 稳定训练。九个 benchmark 上宏平均准确率提升的同时,Qwen3-8B 减少 51%、Qwen3-14B 减少 41% 生成 token;直接答题更强的指令遵循与常识 benchmark 上 think rate 可低到 1% 而质量更好。训练只覆盖数学与指令遵循,但路由行为与响应质量泛化到了 coding、science、knowledge、commonsense。
最后回到实用层,OpenAI 的 GPT-6 prompt caching 更新是这周对 agent 长任务成本影响最直接的一篇。30 分钟窗口内复用共享前缀可享最高 90% 输入 token 折扣;新增 Prompt Caching Dashboard 追踪命中率与输入构成;cache miss 会返回结构化 JSON(如 `reason=tools_changed`、受影响 token 数),直接定位是模型、工具、设置还是输入打破了复用。工程侧三条保缓存实践:用显式 cache breakpoint 选择缓存前缀;GPT-6 上可以中途调整 reasoning effort 而不破缓存(追加 `configuration_update`);工具定义/schema/顺序保持稳定,用 `allowed_tools` 或 `tool_choice=none` 替代删除定义,新指令追加到上下文末尾。GitHub Copilot 实测未命中 token 占比降超 50%。
把这四件事放在一起看:System 1 决策模型改变的是"要不要生成",KV cache 量化与 KITE 改变的是"生成多贵",CounterRoute 与 prompt caching 改变的是"什么时候值得付这笔钱"。agent 推理的路由、缓存、量化正在被拆成可以独立优化的层次。

Agent Harness 治理与企业规模化部署

这周最有意思的技术论文都围绕一个非常具体的问题:企业级 agent 落地时,钱花在哪、错出在哪、谁该负责。
Accenture Responsible AI 的 Control the Harness, Control the Cost 从成本结构入手。论文的论证起点是:大多数企业不自己造 harness,而是买 Anthropic Claude Code 或 OpenAI Codex,但 harness 决定哪个模型回答、模型读到什么、prompt cache 怎么用、哪些 subagent 跑——它既选价格表上的费率,也决定在这个费率上买多少量。企业保留默认值的 harness,就等于继承这些选择与账单。作者的做法是造一个可定制路由器,用 Jev(一个带校准概率的分类器)按企业自带 taxonomy 给每条 prompt 打标;因为一个用户轮次在同一个 prompt cache 上其实是多个请求,router 只在"没有对话需要重建缓存"的时机切模型——会话开始、side lane、subagent 启动。从价格表推导出的一个反直觉结论是:长工具密集会话中,最高价模型反而比下一档便宜(大约 10,000 条真实会话复现)。在 10,000 座席的仿真里,按 Anthropic 2026 年 9 月 21 日的公开价回收 14-21% 模型支出($3.3M-$5.0M/年)。论文还横向梳理了 20 个 harness 的风险、单一供应商依赖的定价,并给出企业可自运行的控制平面与"是否该自研 harness"的决策阶梯。
Microsoft 的 LIMBO 论文处理的是可靠性一侧:工具调用超时或返回服务器错误时,操作可能已经生效,盲目重试就是重复扣款、重复发布、重复部署。核心问题是 exactly-once 语义应该强加在模型、harness 还是工具契约哪一层。作者造了一个确定性沙箱 LIMBO(6 个服务、12 种故障模式、以 ledger 评分),跑了 25,930 个 episode,覆盖 9 个近期模型、3 个生产 harness、2 种契约变体、15 种恢复条件。结论按故障类型分:能立即读回时模型决定——前沿模型被指示 exactly-once 后几乎不重复写(0.5%),弱模型经常重复,模型解释 53% 的已解释方差;不能读回(请求还在飞行中或传输重复投递)时,同样的前沿模型重复率是 56% 与 74%,契约解释 81%。论文还证明:在没有 in-flight 时间上界时,任何仅验证的策略在 late commit 下都不能保证 exactly-once。等待只在 in-flight 延迟有短且已知上界时有效;重尾延迟下,即使每个 episode 等一小时也不如给每次写操作配一个 idempotency key——重复率从 28% 降到 4%,因为 agent 看到 key 就会用。harness 几乎不影响结果,一个附 key 的 guard 能跨 harness 无缝迁移。还有一个很容易被忽略的信号:agent 在 90% 重复生效的场景里都自报成功。
Nubank 的 Screen Before You Serve 把视角拉到 1.4 亿客户规模的生产环境。CX agent 的改进难点在于:必须识别意图、遵循复杂运营政策、可靠使用工具,而人工端到端测试覆盖有限,线上实验又把客户暴露给失败。作者用假设驱动的仿真工作流(Snowglobe 模拟器)在部署前筛选候选 agent:合成客户对 agent 响应做出反应,模拟的工具输出让多步 agentic 工作流不必调生产后端。在 Card Delivery agent 及其后继 Card Management(巴西流量最大的 chat-support agent)上,4 个已部署版本的仿真与生产版本级二值评估分数高度相关;仿真引导迭代使 tNPS 提升 36.69 分(线上 A/B);他们还用 16,000+ 仿真对话筛选开放权重模型配置,后续线上 A/B 中自服务率提升 8.82 个百分点至 Nubank 历史最高,tNPS 没有统计显著变化。
训练侧,AWS AI / Amazon 的 PSP 论文诊断了一个普遍但不容易察觉的问题:on-policy self-distillation(OPSD)在多轮 agent 里教学生"以有信心"的方式行动,但没有教会它信息从哪来;训练出的 agent 表现得像拥有从未观察到的特权信息,最差情况性能低于未训练基座。作者提出 Privileged Self-Practice:把特权信息从 loss 移到 sampler。具体做法是当 rollout 在一个任务上大多失败时,注入一段由 analyzer 模型写的 per-task instruction,带 instruction 重新采样,用未改动的 GRPO 目标训练。AppWorld 与 SWE-bench Verified 上,三个不同 student 模型都取得最佳平均分,是唯一稳定超越 plain GRPO 的方法——AppWorld 任务目标完成率最高 +65%,SWE-bench Verified resolved rate 最高 +61%。
阿里通义的 Qwen-Planner-Agent 是把上述思路系统集成的一个典型案例。论文搭了一个闭环 AI-for-AI 框架:AI for Data 用专业 agent 造任务、采轨迹、筛选平衡数据,再用训练反馈指导后续数据生成;AI for Training 用监督规划冷启动加混合环境在线 agentic RL,其中 CARE(Competence-Aware Reward-and-Advantage Engineering)在保持任务表现的同时降低推理与工具调用成本;AI drives model-harness co-evolution 在执行期编排 memory、skills、tools,把结构化 action feedback 与保留的失败轨迹回灌到模型与 harness 的协同适配。成果在自建 MobilePA-Bench 上是所有评测模型与系统中最好的(77.1),工具使用、memory、skills、subagent 协调四个维度全面超越基座。局限也很明显:主要靠自建 benchmark,非移动 benchmark 只给了"有提升"没有具体数字。
这五篇放一起,可以看到企业级 agent 讨论的层次从"哪个模型好"转到了"路由在哪、幂等键谁装、仿真怎么筛、特权信息放在 loss 还是 sampler"。这些问题都不是模型层能解决的,需要 harness、工具契约、仿真与数据的联合设计。

Coding Agent 沙箱隔离与全流程自动化

这周有两条关于 agent 运行环境的内容,一条讲隔离为何必须做,一条讲分离职责后能做什么。
Package Manager Sandboxing 是本周视角最反直觉的一篇。文章从 Homebrew 7.0.0 说起:安装拆成有网络的 fetch 阶段与离线的 install 阶段,用内核级 Landlock 取代 Bubblewrap,把任意 Ruby 的 `post_install` 迁移为签名声明式 `*_steps`。作者随即指出,这套沙箱原语(Seatbelt / Landlock / seccomp)正是 Claude Code、Codex CLI、Cursor、Gemini CLI 采用的同一套栈——理由也很直接:两者都在跑未审查代码。更关键的是二者已经在攻防上交叉:agent 会替你装包;Shai-Hulud 蠕虫通过 postinstall 脚本写入 Claude Code 配置实现持久化;Mandiant 报告攻击者劫持编码助手会话在约 100 个内部仓库扩散。文章给出 gating / confining / replacing 三分法,并指出两条路未来共同的未解难题:如何验证受限阶段的输出。这不是一篇给答案的文章,但把两个看似无关的领域的同源关系讲清楚了。
GitHub Security Lab 的 Fuzzing Taskflow Agent 是相反方向的样本:把 C/C++ 项目的模糊测试全流程交给 LLM agent——自动识别入口点、分析构建系统、写 harness、跑 AFL++、读覆盖率、迭代改进 harness、triage 崩溃并生成漏洞报告。架构上做了明确的责任分离:agent 只做决策,MCP 工具只暴露 `run_afl_for` / `compile_harness` 这类原语,状态全部走 SQLite。每个 harness 构建两份二进制(`.afl` 用于 fuzzing,`.cov` 用于真实行/分支覆盖率回放),形成 coverage-feedback 闭环。文章明确警告:该流程会在宿主机直接执行 LLM 选定的构建命令,必须在一次性环境运行。这种"agent 决策 + MCP 原语 + 独立状态存储"的层次划分,是本周可复用的 agentic pipeline 设计模式之一。
When chat is the wrong UI 从交互范式切进来。核心论点是:chat 是 LLM 的默认交互界面,但大多数任务场景下它是错误的。作者以 GitHub Copilot app 的 canvas 为例——一种运行在 app 内、无浏览器外壳的全栈小应用,可与 agent 双向通信、调通过第三方 API、在本地执行代码。关键洞察是:与其让 agent 反复执行 `stage and commit` 这类操作浪费 token,不如让 agent 构建一个工具,后续交互全部免费。文中给出 Connect 4、Winget 包管理、SQLite 浏览器、Jekyll 编辑器等实例,展示如何用 canvas 把 research→prototype→plan→implement→iterate→finalize 工作流中的自己移出循环。
最后一条产品消息来自 Microsoft 与 OpenClaw。微软发布了基于 OpenClaw 的常驻 agent Autopilot,由 Omar Shahine 团队主导,OpenClaw 官方特别强调微软"把大量改进贡献回 OpenClaw"。这条本身信息量有限,但它和上面的沙箱、canvas 放在一起,可以看到 coding agent 的产品形态在往"常驻、多入口、可被第三方构建"的方向长。

生物安全与产业安全争论

这周的"安全"话题有两条对立的叙事线。
一条来自 Latent Space 对 Radical Numerics CEO Eric Nguyen 的访谈。他把 AI 生物安全讲成一条完整技术线:他在 Stanford 长期推 Genomic Language Models 不被生物学界接受,最终参与 Evo / Evo 2,而这些模型已被 Arc/Stanford 团队用来生成整段噬菌体基因组并合成出有功能的病毒。访谈解释了 DNA 语言的特殊性(4 字母表、单基因 60K、人类基因组 3B),以及 long-context 创新(StripedHyena)为什么是生物智能的前提。其中一个实验很漂亮:只给模型低分 aptamer,让它沿分数轨迹自行外推,复现了未展示的高分序列——相当于"在 DNA 里做 chain-of-thought"。核心立场是:能提升生物能力的模型同样能帮防御跟上,而当前防御正在输,所以主张更用力推前沿。这条和此前的 OpenAI→HuggingFace 攻击事件连起来看,是前沿实验室明确列为两大风险域之一的生物安全在公共讨论里少见的、有技术细节的版本。
另一条是英伟达 CEO 黄仁勋在 Ezra Klein Show 的对话。他从产业视角回应 AI 安全争议、监管必要性与技术乐观主义,涉及算力、模型演进与全球 AI 竞争格局。核心论点是他认为 AI 末日论被过度夸大。访谈的价值在于理解顶级产业领袖的战略思维——尤其考虑到英伟达在算力供给中的位置,它对监管话题的立场本身就是一个产业信号。
第三条是 Zvi 对 Claude Opus 5.5 系统卡的逐节精读。他跳过与旧卡重复的部分,聚焦真正有信息量的章节:分类器回退策略、RSP 评测(仍是 CB-1 而非 CB-2)、生物评测的重大政策变化(不再测试 helpful-only 版本,改用避免拒答的测试设计)、agentic safety、prompt injection 风险、对齐与诚实性评测、白盒分析、sandbagging、CoT 可控性等。对想理解"系统卡里哪些是真信号"的从业者,这是一份高密度导读。其中一个细节值得留意:Anthropic 在生物评测上放弃 helpful-only 版本,反映的是测试设计在往"避免拒答干扰评测结果"的方向调整。
把这三条放一起看其实是同一场争论的三个视角:技术侧的军备竞赛论证、产业侧的乐观主义反应、以及前沿实验室自己公开的安全评测框架。争论没有一个收敛点,但这周的输入比往常更具体——有可合成的噬菌体基因组、可讨论的产业立场、可对照的系统卡条款。

📌 本周简讯

OpenRouter: from Seed to Stripe — Latent Space / OpenRouter CEO Alex Atallah 与 AMP 的 Anjney Midha 复盘从 Llama/Alpaca 时代押注"没有单一模型会赢"到成为 1,000 万开发者、日处理超 10 万亿 token 的中立路由层,以及被 Stripe 收购的全过程。其中"agentic fraud 将成为 AI 经济定义性安全问题"——自主 agent 攻击 token 流——这个提法值得留意。
Who Feeds the GPUs? Inside AI's Hidden $30B Layer — The MAD Podcast / VAST Data 创始人 Renen Hallak 讲 AI 栈里被忽视的数据层:DASE 共享架构、传统数据库在万亿向量下崩溃的原因、训练与推理的基础设施差异,以及 KV cache、RAG、agent memory 与 agent 身份权限安全。客户需求信号从 500PB 到 2EB 这个变化是本期最好用的锚点。
我看到了 Scaling Law 的信号 | 对谈清华叉院助理教授徐梦迪 — 十字路口 / 徐梦迪讲机器人 in-context learning 研究,讨论具身智能的 Scaling Law 信号与陷阱、预训练天花板、数据闭环难题及世界模型风向。结合 Generalist GEN-1.5 发布,他的判断是机器人当前大约处于 GPT-1 阶段。
NarrateAI: production-ready LLM quality assurance on Amazon Bedrock — AWS / 实时对话式 BI 助手的五层 QA 工程:按检索段落总量路由(约 90% 走单次拼接快路径)、跨账号多模型 failover、实时流式评估、复合评估框架、两段级联的数值幻觉校验。整体在流式响应下达到约 99% 数值准确率。
Runway's WorldPrompt and the Engineering of Real-Time Worlds — Latent Space / 独家采访 Runway CTO Kamil Sindi 与首席研究科学家 Robin Kahlow,解读 GWM Worlds 2 新特性 WorldPrompt——一种可固定首帧并生成带时间戳事件的输入格式。文中有 Runway、Genie 3、Odyssey-2 Pro、World Labs RTFM 的横向对比表,并拆解把视频模型变成实时运行时的两大工程难题:整段生成改逐帧、生成压到实时帧率。
Offloaded inference for real-world physical AI robotics — Microsoft Research / 首个系统性测量 onboard vs edge vs cloud 推理对移动操作任务的影响:轻量 GPU 下建图规划慢达 383%、导航障碍及时检测掉 30%、VLA 精度掉 50%。Physical AI Toolchain 同期新增基于 Kubernetes 的容器化部署与分布式推理编排能力。
Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war — Simon Willison / 记录 9/22 的模型发布潮与完整价格对比表,并指出 GPT-5.6 十一月还将涨价 25%,所以官方对比基准下的实际降幅比公告数字更大。Opus 5.5 缓存读价降 60%,对 90%+ 输入走缓存的长 agentic 对话意义明显。
  • AI
  • 周报
  • 技术趋势
  • AI 技术日报 - 2026-09-27推荐周报 2026-W39
    Loading...