W29 的核心叙事是开源模型第一次在某些关键维度追上闭源前沿——Kimi K3 以 2.8T 参数在 Frontend Code Arena 超过 Claude Fable 5,Inkling 作为美国生态最强 Apache 2.0 模型入场。与此同时,Agent harness 工程化从概念讨论进入系统化论文产出:三篇独立工作(Harness Handbook、Self-Evolving 框架、AgentCompass)分别从代码定位、自动改进和评估基础设施切入同一问题。后训练 RL 也迎来两个信号:万亿参数 Zero RL 的稳定训练管道(Ring-Zero)和百万 token 级 RL 后训练的执行栈(LongStraw),说明 Agent 长程推理的后训练已具备实操基础。推理引擎则在 vLLM v0.25 和 SGLang 8×B300 500 tok/s 的进度上继续保持高密度迭代,推测解码的并发优化(D-cut)也开始填上高负载场景的缺口。
今日 AI 领域迎来开源模型的双重里程碑:月之暗面发布 2.8T 参数的 Kimi K3,成为最大开源模型,在 Frontend Code Arena 超越 Claude Fable 5;前 OpenAI CTO Mira Murati 创立的 Thinking Machines Lab 发布 975B 开源模型 Inkling,性能持平 Nvidia 旗舰但 token 成本仅三分之一。同时,微软被曝培训销售人员贬低 OpenAI 和 Anthropic,Anthropic 计划秋季 IPO 估值或达万亿美元,产业格局加速重塑。多篇工业界论文聚焦 Agent 长上下文训练、推理优化和信用分配
今日 AI 领域迎来多个重磅发布与工程突破:Thinking Machines Lab 开源 975B 参数 MoE 模型 Inkling,首日即获 vLLM、SGLang 等推理栈全面支持,但 Ethan Mollick 压测显示其性能远不如中国前沿开源模型。NVIDIA 发布 Jetson Thor T3000/T2000 边缘 AI 算力新标杆,同时 Jim Fan 宣布 RoboTTT 实现机器人模型原生支持 8000 步上下文。中国 AI 陪伴法规正式生效,Doubao、Qwen 被迫关闭个性化功能,成为全球首个情感 AI 监管里程碑。xAI 开源 Grok Build 完整代码库(
今日 AI 领域迎来多个重要节点:OpenAI 代理产品使用量一周暴增 2.5 倍,Codex 用户达 600 万,同时 GPT-5.6 sol 价格减半、效率翻倍,成本降至四分之一。腾讯开源 295B Hy3 的 1-bit 量化版,仅损失约 5% 性能即可在单 GPU 运行,被 Stable Diffusion 创始人称为"今日最大新闻"。Apple 洽谈收购 PrismML,其量化技术可将 54GB 模型压缩至 4GB 运行于 iPhone,端侧 AI 能力跃升在即。蚂蚁集团将 Zero RL 扩展到万亿参数规模,揭示涌现行为;Anthropic 平台负责人详解 Agent 三层架构与开
今日 AI 领域迎来多重里程碑:Anthropic 估值达 1.2 万亿美元首次超越 OpenAI,并正式启动 IPO 进程,标志产业格局重大拐点。技术层面,Moonshot 发布 Kimi K2 开源模型(1T/32B MoE),在 SWE-Bench 取得开源 SOTA;Bun 用 AI 重写为 Rust 仅花费 $165k 替代 3 人年工作量,展示了 AI 辅助工程化的成本效益。安全研究方面,Google DeepMind 揭示 CoT 监控在对抗性说服攻击下反而有害,并提出跨模型事实核查的缓解方案。同时,Perplexity CEO 预测 6-12 个月内模型成本将降 3-4 倍,O
本周的核心叙事是"发布密度与工程深度的共振"。OpenAI 一口气放出了 GPT-5.6 三模型、ChatGPT Work 和 GPT-Live 语音模型,这不是一次单纯的版本迭代,而是一次产品矩阵的重新排布——模型能力分层(Sol/Terra/Luna)、Agent 产品化(Work)、交互范式升级(全双工语音)同时到位。与此同时,Agent 工程领域进入了"工具调用精细化"阶段:GitHub Copilot 的实践复盘、AWS 的 MCP 设计指南、Amazon 和 Writer 关于编排层效率的论文,都在指向同一个判断——Agent 的价值不再取决于"能不能调用工具",而取决于"调得好不好"。推理加速方面,vLLM 0.25.0 让 450+ Transformers 架构原生运行,DeepSeek 的 DSpark 在线上流量下将生成速度提升 60-85%,这些工程落地比架构论文更能直接影响下游决策。
今日 AI 领域迎来里程碑式突破:GPT-5.6 Sol Ultra 以 64 子 Agent 在一小时内证明 50 年未解数学猜想 Cycle Double Cover,标志着公开模型首次实现重大数学突破。同时,GPT-5.6 成为 Microsoft 365 Copilot 首选模型,Agent 生态全面走向生产级。Cursor 开发 AI Agent 与 Claude Cowork 直接竞争,编码 Agent 赛道进入白热化。效率与成本成为新焦点:Unsloth 动态量化压缩模型 75%,Writer 论文揭示编排层可降本 41%。ICML 2026 获奖论文揭晓,扩散语言模型与对齐审查
今日 AI 领域迎来产品与模型的双重里程碑:OpenAI 发布 ChatGPT Work 超级应用与 GPT-5.6 三模型家族,Sol 在 Agents' Last Exam 上以 53.6 分超越 Claude Fable 5 达 13.1 分,并引入 Programmatic Tool Calling 等关键新特性。与此同时,SpaceXAI 发布 Grok 4.5,专为 Coding/Agent 场景训练,定价仅为 $2/$6 每百万 token,模型竞争从通用能力向 Agent 专用场景进一步分化。Meta 自研 AI 芯片 Iris 将于 9 月量产,算力目标翻倍至 14GW,芯片
今日 AI 领域迎来多项重磅发布:OpenAI 推出 GPT-Live 全双工语音模型,实现真正自然对话;同时宣布 GPT-5.6 Sol 周四发布,用户使用量已达此前 5 倍。Cursor 与 SpaceXAI 合作训练 Grok 4.5,Cognition 发布 SWE-1.7 达 1000 tok/s。基础设施层面,MCP v2 协议重大变更走向无状态化,Hugging Face 发布 vLLM transformers 建模后端性能追平原生,NVIDIA Nemotron 在 LangChain 基准中以 10 倍低成本达开源最高准确率。Lilian Weng 发表 Harness E