AI 技术日报 - 2026-09-22
2026-9-22
| 2026-9-22
字数 4490阅读时长≈ 12 分钟
type
Post
status
Published
date
Sep 22, 2026 05:00
slug
ai-daily-2026-09-22
summary
今日开源阵营集体发力:小米一次性开源 MiMo-V2.6 Pro/Flash 双尺寸模型(Pro 为 1.02T 总参 / 42B 激活,AA 智能指数 46 分创开源新高)并同批放出 RL 训练栈;阶跃 Step 5 Preview 以 44 分、每任务 $0.71 的成本对标 Kimi K3。产业侧,OpenAI 披露内部模型已解决 100+ 数学开放问题并成立独立顾问组 AGMAI,The Information 报道其内部 AI 已接手实验模型训练;Nathan Lambert 国会简报量化中国开源权重模型领先约 2-5 个月。Agent 工程化持续深入,SGLang 在 Blackw
tags
AI
日报
技术趋势
category
AI技术报告
icon
📰
password
priority
1

📊 今日概览

今日开源阵营集体发力:小米一次性开源 MiMo-V2.6 Pro/Flash 双尺寸模型(Pro 为 1.02T 总参 / 42B 激活,AA 智能指数 46 分创开源新高)并同批放出 RL 训练栈;阶跃 Step 5 Preview 以 44 分、每任务 $0.71 的成本对标 Kimi K3。产业侧,OpenAI 披露内部模型已解决 100+ 数学开放问题并成立独立顾问组 AGMAI,The Information 报道其内部 AI 已接手实验模型训练;Nathan Lambert 国会简报量化中国开源权重模型领先约 2-5 个月。Agent 工程化持续深入,SGLang 在 Blackwell 上用 NVFP4 KV cache 将上下文容量提升 1.78 倍,MCP 2026-07-28 修订彻底移除协议级 session。

🔥 趋势洞察

  • 开源权重进入万亿参数竞赛:小米 MiMo-V2.6 Pro 以 1.02T 总参、46 分 AA 指数刷新开源上限,阶跃 Step 5 以 1/2.8 成本对标闭源,中国开源阵营领先美国约 2-5 个月
  • 决策模型成为第三条评测路线:Jev 以 0.44s、$0.00035/次 的方差比 LLM-as-judge 低数百倍,Bespoke-Nimble-9B 开源对标,agent 评测成本结构或被重写
  • 推理栈向低精度与全双工演进:SGLang 用 NVFP4 KV cache 将 1M 上下文吞吐提升 78%,NVIDIA 开源全双工语音模型原生支持工具调用,推理效率与交互形态同步突破

🐦 X 推文动态

📈 热点与趋势

  • 小米开源 MiMo-V2.6 Pro / Flash,同批放出 RL 栈 - Pro 为 1.02T 总参 / 42B 激活,Flash 为 309B / 15B 激活,单权重吃文本、图像、视频、音频,1M 上下文,AA 智能指数 46 分为开源最高。同批开源用 MiMo 轨迹蒸馏的 Qwen3.5-9B、7K 环境和 RL 训练代码。团队称这是按算力计开源团队做过的最大单次 RL 训练之一,数十人投入 @XiaomiMiMo @_LuoFuli(小米 MiMo 团队) @teortaxesTex(AI 内容博主)
  • Step 5 Preview 拿 44 分、每任务 $0.71 - Artificial Analysis 评测:AA 智能指数 44,与 Kimi K3 (max) 同分,但每任务成本约低 2.8 倍;HLE 46%、CritPt 21%。Agentic 侧落后,GDPval-AA 1,566 Elo,低于 Qwen3.8 Max 的 1,668。定价 $1/$2.70 每 1M tokens,权重 10 月 15 日开源 @StepFun_ai @ArtificialAnlys(模型评测机构)
  • OpenAI 内部 AI 已接手实验模型训练 - The Information 报道:内部模型能写 GPU kernel、优化训练代码,研究者给一个优化示例后让 AI 自己跑数周;过去要数年的实验现在约一周做完,内部 agent 之间直接协作、不经人类;另有说法称 24 天内解决 100 多个数学开放问题 @AISafetyMemes(AI 安全话题账号,转述 The Information)
  • Boston Dynamics 与 HMG 建机器人应用中心 - 在 HMG Metaplant America 设 Robotics Metaplant Application Center(RMAC),作为把 Atlas 机器人接入汽车制造产线的测试与训练基地 @BostonDynamics(机器人公司)
  • Jeff Dean 离职后首次公开对话 - Dawn Song(UC Berkeley 教授)主持,谈从 MapReduce、TensorFlow、TPU 到 Gemini 的路径选择,RSI 可能的形态、科研发现循环自动化、自主 AI 安全,以及 Jeff Dean(Google 前首席科学家,任职 27 年)新创业公司的方向 @JeffDean @dawnsongtweets
  • Grok 4.7 每任务成本反超 Astra - 在 Artificial Analysis 上,Grok 4.7 不再便宜,每任务成本高于 Astra @theo(Theo,Web 开发者 / 播客主)

🔧 工具与产品

  • Halo:后训练吞吐达 TRL 的 2.8 倍 - White Circle 开源 Halo,峰值内存更低,模型保持原生 HuggingFace 格式,可直接接管开源模型后训练 @whitecircle(社区开发者)
  • Husky 推理引擎称比 Apple MLX 快 4.5 倍 - Underdog 的 Model-Specific Inference 引擎在 MacBook 上跑到 730 tokens/s,主打本地私有模型 @0xSigil(Underdog 团队成员)
  • Kimi K3 上线 Amazon Bedrock - 可用 Bedrock 的加密与审计控制跑编码、文档分析和长时 agent 工作流,支持显式提示缓存 @Kimi_Moonshot(月之暗面)

⚙️ 技术实践

  • SGLang 在 Blackwell 上用 NVFP4 KV cache - 每 token KV 占用降到 FP8 的约 56%,上下文容量 1.78 倍,32K / 160K / 1M 解码吞吐分别 +37% / +58% / +78%;GPQA-Diamond 与 AIME 2025 近无损。方案含两级缩放、解码期 kernel 内反量化与分页 KV,一个 flag 开启 @lmsysorg(SGLang 开源推理引擎出品方)
  • vLLM day-0 支持 MiMo-V2.6 双尺寸 - 沿用 MiMo 的混合滑窗 + 全局注意力、推理与工具调用 parser、DFlash 投机解码(每步起草 7 token),原生 FP8 权重 @vllm_project(开源推理引擎)
  • vLLM 调优 Qwen3.8-2.4T 的 Pareto 前沿 - 在 GB300 NVL72 上,8K 输入 / 1K 输出下高吞吐侧 5K tokens/s/GPU、低延迟侧 180 tokens/s/user;流程为预算 KV cache、prefill 与 decode 分开压测,再为每个服务目标选拓扑和 MTP 设置,部署配置已放出 @vllm_project(开源推理引擎)
  • 测试期通信:Team-of-N 何时强过 Best-of-N - Dimitris Papailiopoulos(ML 系统研究者,威斯康星大学麦迪逊分校教授)等让 N 个相同 agent 无分工、只靠共享文本日志协作:ARC-AGI-3 上 Team-of-5 Sonnet-4.6 追平 Best-of-33,其中一个 64 次单 agent 都没解出的游戏被解出 65%;polyomino packing 上 Team-of-3 Opus 4.6 超过 best-of-60;MNIST 压缩上四人 GPT-5.6 Sol 队找到 1,957 字节、99.4% 准确率的模型,比最好人类解小 20% @DimitrisPapail

⭐ 精选内容

Jev 生态一日成型:从「决策模型」到 agent 评测器,第三方实测与开源对标同时落地 | 非生成式模型开始被当作基础设施验证
TypeSafe AI 的 Jev(只输出校准决策、不生成文本的「System One」模型)在发布后一天内迎来密集第三方验证:LangChain 实测其作为 agent 评测器,连续打分方差比 GPT-5.6 Luna/Terra 与 Claude Sonnet 4.6 低 92–913 倍,平均 0.44s、$0.00035/次(总 $0.34 vs Claude $28.17),作者强调测试范围窄、结论尚早,但指出「决策优先」架构可能成为 LLM-as-judge 与 code-based eval 之外的第三条路。同期 Bespoke Labs 开源对标模型 Bespoke-Nimble-9B(Qwen3.5-9B LoRA,Apache-2.0),用 logits 直读枚举/布尔答案而非生成 JSON,并首次把 Jev 与人工标签做 head-to-head——Jev 仅以 1.2 个 macro 点胜出,延迟上 H100 106ms / M5 Pro 444ms vs Jev API 247ms,同时放出数据、训练配方与人工标注 benchmark。对做 agent 路由、LLM-as-Judge、评测成本优化的团队,这是「决策模型」赛道从单点发布走向可复现对比的关键一天。
Stratechery 反解 Anthropic「Pacing the Frontier」:安全叙事背后是三重 overhang | 前沿实验室商业逻辑的一手战略拆解
Stratechery 从战略而非哲学角度拆解 Anthropic 的减速主张:表面是安全关切,实质同时缓解前沿实验室面临的多个 overhang——模型能力提升过快导致的能力悬置、agent 范式对 token 的极度饥渴、以及 model 与 harness 整合带来的差异化护城河。作者以自己亲手做 agentic coding、甚至尝试自建 harness 的一手体验,论证「模型商品化」押注可能落空,利润会流向做 model+harness 整合的公司,并引用 Nadella 访谈佐证微软 E7 与 Claude Cowork 合作的临时性。适合关注 agent 产业格局与前沿实验室商业逻辑的从业者建立 mental model。
OpenAI 披露内部模型已解 100+ 数学开放问题,并成立独立顾问组 AGMAI | 能力超预期后的学术缓冲机制设计
OpenAI 披露其 8 月 28 日开始训练的内部模型除解决 Navier–Stokes 千禧年问题外,已解决 100+ 个数学开放问题,进度之快令内部数学家意外。为此 OpenAI 与数学家共建独立顾问组 AGMAI(挂靠 IAS),成员含 Timothy Gowers、Martin Hairer、Edward Witten、Ravi Vakil 等顶级数学家。关键设计:顾问组不拿 OpenAI 薪酬、可主动发表意见、可公开批评 OpenAI,且明确不负责「建议 OpenAI 放慢内部数学进度」——只做成果评审、传播协调与学术标准建议。这是 AI 公司面对「能力超预期」时如何与学术界建立缓冲机制的一手样本。
来源:openai.com
Nathan Lambert 国会简报公开:中国开源权重模型领先约 2-5 个月 | 用两组硬数据量化中美开源差距
Interconnects 作者把向美国国会成员及幕僚做的一次开源权重模型简报整理成公开文章,系统梳理 open-weight / open-source / closed 三类模型的谱系差异,并用 Hugging Face 下载量(中国累计 3.2B,约为美国两倍)和 Artificial Analysis Intelligence Index(GLM-5.3 得 45、Kimi K3 得 44,而美国最强开源模型 Thinking Machines Inkling 仅 26、Nemotron 3 Ultra 仅 23)两组数据说明中国开源权重模型已领先约 2-5 个月。文章还点名美国真正开源阵营(AI2 Olmo、OpenAthena Marin、EleutherAI Pythia)与 Nvidia Nemotron 的半开放定位,是理解中美开源竞争格局的一手框架。
SemiAnalysis 拆解 MoE 推理数据流动:四阶段算力强度截然不同 | 推理服务容量规划的系统级地图
SemiAnalysis 长文把 MoE 模型映射到推理硬件时的数据流动拆成 prefill、midfill、decode attention、decode experts 四个阶段,指出四者对算力/内存/网络带宽的需求截然不同——prefill 算力强度高、decode 阶段算力强度低但受权重搬运主导。文章强调把四阶段当成同一 workload 会丢掉 MoE 的结构性优势,并讨论聚合式与分离式部署(disaggregated serving)的权衡,涉及 Dynamo、Mooncake、vLLM 等编排层。对做推理优化、容量规划和专家并行的团队,这是一份难得的系统级地图。
Tim Dettmers 宣布 dlab 开源周:550B 模型跑进 128GB MacBook | 本地推理与 agent harness 的本周必追
Tim Dettmers 宣布 dlab 开源周,主张「研究的单位不再是论文而是生态」:agent 时代单篇论文变廉价,难的是发布互相增强的连贯生态。预告三件事——前沿自主研究、最高效的 test-time scaling、比 Claude Code/Codex 更高效的 auto-compaction。已给出硬数据:agent 自主优化 Metal kernel 后,Qwen 3.6 35B-A3B 在 1.5 bit/权重下跑到 450 tok/s;Qwen 3.8 Flash Next 125B 可跑在单张 24GB 显卡,DeepSeek V4.1 550B 可跑在 128GB MacBook。对关注本地推理、agent harness 与量化部署的从业者是本周必追。
Benchling 公开多租户 agent 代码执行防御纵深:DNS 出口才是隐蔽通道 | 可直接抄的隔离架构清单
Benchling 在 Amazon Bedrock AgentCore Code Interpreter 上跑 AI agent 生成的生命科学代码,每天 600+ 执行会话、每周 250+ 租户、零安全事故。核心洞察:传统沙箱只封 HTTP 和出站端口,但 DNS 解析常被默认放行且缺乏可见性——这正是数据外泄的隐蔽通道。方案是独立「Untrusted Code Account」承载 ACCI VPC(无 IGW/NAT),Route 53 Resolver DNS Firewall 三级策略(10 拦恶意域、100 只放白名单端点、200 兜底拒绝),VPC Endpoint 作为唯一网络路径,每任务经 STS 注入最小权限凭证,避免 per-tenant IAM role 爆炸,并用持续验证套件模拟外泄攻击。对做多租户 agent 执行隔离的团队是一份可直接复用的架构清单。
MCP 2026-07-28 修订解读:Streamable HTTP 彻底移除协议级 session | 一次破坏性变更的迁移决策表
2026-07-28 MCP 修订是一次破坏性变更:Streamable HTTP 传输层彻底移除协议级 session 与 Mcp-Session-Id,取消 initialize 握手、HTTP GET 流与流恢复,改为每个请求自描述——协议版本、客户端身份与能力通过 _meta 逐请求传递,跨工具调用的应用状态改用显式 handle 作为工具参数。文章按「可删除/必须新增/需保留兼容」逐项对照,给出 legacy(2025-11-25)、modern、dual-era 三代实现划分,并附集成决策表与生产 checklist,同时标注 SDK 落后于规范之处(TS SDK 拆成 @modelcontextprotocol/* 2.0.0 家族,Python 2.2.0)。还提到治理方为 Agentic AI Foundation,新增最短 12 个月弃用窗口的生命周期政策。
来源:dev.to

🎙️ 播客精选

Jev: System One models for Prod, not God — with Diogo Almeida, CEO, TypeSafe AI

📍 来源:Latent Space | ⭐ ⭐⭐⭐⭐⭐ | 🏷️ LLM, Agent, Interview | ⏱️ 2:20:53
Diogo Almeida(InstructGPT 合著者、TypeSafe AI CEO)深度阐述 Jev 的诞生逻辑:他认为 ChatGPT 成功后业界只剩自回归对话微调一条路,对齐、拒答、可靠性都被带偏。他批判三类 RLHF 均非正确北极星,主张面向生产的小型系统一模型,强调 KV Cache 决定一切、模型应像 regex 一样隐入背景。节目还覆盖 Jev 在编码 Agent、语音+浏览器控制、实体解析、自然语言搜索等落地场景,并预告 ReasoningJev 方向,对 Agent 与 LLM 工程从业者极具参考价值。
💡 推荐理由: InstructGPT 合著者 Diogo Almeida 深度访谈,讲 Jev 系统一模型的设计哲学与 RLHF 批判,非泛泛新闻。

Why Scaling Prediction Cannot Create Intelligence - Alexander Mattick

📍 来源:ML Street Talk | ⭐ ⭐⭐⭐⭐ | 🏷️ Research, LLM, Agent | ⏱️ 02:14:20
Alexander Mattick从推理视角串联现代机器学习,讨论Monte Carlo、GFlowNets、能量模型、扩散、流匹配等生成建模范式,并直言能量模型采样性价比低、JEPA和世界模型更接近品牌而非技术分类。后半段深入深度学习理论、约束强化学习、控制论与RL对比、Bitter Lesson及世界模型本质,提出'预测不等于控制'。对关注生成模型底层原理、RL与推理成本的从业者有较高参考价值。
💡 推荐理由: 深度技术访谈,涵盖推理、生成模型、深度学习理论等硬核话题,嘉宾为专业研究者,但主题偏理论、非LLM/Agent主流实践

The State of the AI Debate

📍 来源:AI Daily Brief | ⭐ ⭐⭐⭐ | 🏷️ Regulation, Funding, Research | ⏱️ 00:27:12
本期讨论AI政策辩论:特朗普提议组建AI Force、政界推动kill switch立法、AI减速呼声与中国因素。聚焦特朗普-习近平会晤前的中美AI合作前景。头条包括Anthropic IPO延迟、新生物实验室及数据中心债务市场压力信号。适合从业者了解政策风向和行业动态,但技术含量有限。
💡 推荐理由: AI政策与行业新闻综述,涵盖中美AI竞争、Anthropic IPO延迟等,但缺乏技术深度和独家观点

📄 今日论文精选

CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

Xiaomi, PKU, HKU, Renmin University of China | 🏷️ Agent Framework, Code Agent, RLHF/DPO
仅以源码为唯一输入,用 agent 流水线把已实现功能转化为可执行 RL 环境,构建 5,545 个任务覆盖 23 种语言,为 coding agent 的 RL 训练提供了可规模化的环境生成范式。

NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities

NVIDIA | 🏷️ Multimodal, Tool Use, Inference
首个开源的全双工语音模型原生集成工具调用:把流式语音编码、并行 function call 输出流、增量转写与流式 TTS 统一进单一架构,让"边听边说边调工具"成为可能。

Scaling Discovery through Test-Time Communication

UC Berkeley, Microsoft Research | 🏷️ Multi-Agent, Agent Framework, Agentic Workflow
系统验证多 agent 测试期通信的 scaling 效应:team@k 匹配 4k 独立 agent,且能解出单 agent 无解的难题,MNIST 压缩上四人团队产出比人类最佳解还小 20% 的分类器。

🐙 GitHub 热门项目

Halo | 后训练吞吐 2.8 倍于 TRL
White Circle 开源的后训练框架,峰值内存更低且模型保持原生 HuggingFace 格式,可直接接管开源模型做后训练,适合需要高效微调与 RL 训练的团队。
GitHub | ⭐ 3,200 | 🗣️ Python | 🏷️ Post-training, RL, Fine-tuning

Husky | MacBook 本地推理引擎
Underdog 的 Model-Specific Inference 引擎在 MacBook 上跑到 730 tokens/s,号称比 Apple MLX 快 4.5 倍,主打本地私有模型部署场景。
GitHub | ⭐ 1,800 | 🗣️ Rust | 🏷️ Inference, Local, Apple Silicon
  • AI
  • 日报
  • 技术趋势
  • 推荐算法日报 - 2026-09-22AI 技术日报 - 2026-09-21
    Loading...