今日 AI 领域迎来开源模型的双重里程碑:月之暗面发布 2.8T 参数的 Kimi K3,成为最大开源模型,在 Frontend Code Arena 超越 Claude Fable 5;前 OpenAI CTO Mira Murati 创立的 Thinking Machines Lab 发布 975B 开源模型 Inkling,性能持平 Nvidia 旗舰但 token 成本仅三分之一。同时,微软被曝培训销售人员贬低 OpenAI 和 Anthropic,Anthropic 计划秋季 IPO 估值或达万亿美元,产业格局加速重塑。多篇工业界论文聚焦 Agent 长上下文训练、推理优化和信用分配
今日 AI 领域迎来多个重磅发布与工程突破:Thinking Machines Lab 开源 975B 参数 MoE 模型 Inkling,首日即获 vLLM、SGLang 等推理栈全面支持,但 Ethan Mollick 压测显示其性能远不如中国前沿开源模型。NVIDIA 发布 Jetson Thor T3000/T2000 边缘 AI 算力新标杆,同时 Jim Fan 宣布 RoboTTT 实现机器人模型原生支持 8000 步上下文。中国 AI 陪伴法规正式生效,Doubao、Qwen 被迫关闭个性化功能,成为全球首个情感 AI 监管里程碑。xAI 开源 Grok Build 完整代码库(
今日 AI 领域迎来多个重要节点:OpenAI 代理产品使用量一周暴增 2.5 倍,Codex 用户达 600 万,同时 GPT-5.6 sol 价格减半、效率翻倍,成本降至四分之一。腾讯开源 295B Hy3 的 1-bit 量化版,仅损失约 5% 性能即可在单 GPU 运行,被 Stable Diffusion 创始人称为"今日最大新闻"。Apple 洽谈收购 PrismML,其量化技术可将 54GB 模型压缩至 4GB 运行于 iPhone,端侧 AI 能力跃升在即。蚂蚁集团将 Zero RL 扩展到万亿参数规模,揭示涌现行为;Anthropic 平台负责人详解 Agent 三层架构与开
今日 AI 领域迎来多重里程碑:Anthropic 估值达 1.2 万亿美元首次超越 OpenAI,并正式启动 IPO 进程,标志产业格局重大拐点。技术层面,Moonshot 发布 Kimi K2 开源模型(1T/32B MoE),在 SWE-Bench 取得开源 SOTA;Bun 用 AI 重写为 Rust 仅花费 $165k 替代 3 人年工作量,展示了 AI 辅助工程化的成本效益。安全研究方面,Google DeepMind 揭示 CoT 监控在对抗性说服攻击下反而有害,并提出跨模型事实核查的缓解方案。同时,Perplexity CEO 预测 6-12 个月内模型成本将降 3-4 倍,O
本周的核心叙事是"发布密度与工程深度的共振"。OpenAI 一口气放出了 GPT-5.6 三模型、ChatGPT Work 和 GPT-Live 语音模型,这不是一次单纯的版本迭代,而是一次产品矩阵的重新排布——模型能力分层(Sol/Terra/Luna)、Agent 产品化(Work)、交互范式升级(全双工语音)同时到位。与此同时,Agent 工程领域进入了"工具调用精细化"阶段:GitHub Copilot 的实践复盘、AWS 的 MCP 设计指南、Amazon 和 Writer 关于编排层效率的论文,都在指向同一个判断——Agent 的价值不再取决于"能不能调用工具",而取决于"调得好不好"。推理加速方面,vLLM 0.25.0 让 450+ Transformers 架构原生运行,DeepSeek 的 DSpark 在线上流量下将生成速度提升 60-85%,这些工程落地比架构论文更能直接影响下游决策。
本周推荐系统研究围绕三条技术主线展开:生成式检索的工业落地与理论深化、LLM/Agent从概念验证走向真实部署、以及精排/联邦学习在工业环境中的鲁棒性优化。 生成式检索加速落地与多兴趣精细化: 快手在推送通知系统中部署了异构生成式架构 HGenPush,采用非自回归多token预测替代传统自回归解码,实现DAU提升0.181%。Walmart将库存感知RAG引入赞助搜索,InvAwr-RAG将广告填充率提升68%。理论层面,BACH通过贝叶斯混合头解决多兴趣双塔的路由坍塌问题,在三个基准上刷新召回率;DaV-Gen提出draft-and-verify机制统一生成式检索的效率与精度。此外,Signed MaxSim首次从理论上证明MaxSim的表达力不低于向量内积,并扩展至任意实值内积。 LLM/Agent推荐从原型走向生产: Meta的 SCOReD 是本周最突出的部署工作——通过学生感知的CoT优化将教师推理轨迹适配到小模型,线上获得NDCG+1.56%和Recall@5+1.9%,同时推理长度减少27.3%。Walmart使用LLAMA2 7B+LoRA做广告相关性三分类,准确率89.43%超越GPT-4。学术方面,MMEACR提出双轨记忆架构加强Agent的视觉推理能力;LBR系统性地揭示了LLM推荐中的长度偏差,并提出轻量校正方案(NDCG@5提升16.82%);综述论文Autonomous Information Seeking为Agent推荐建立了三范式分类法。 工业级精排与联邦学习优化: 快手的 PIT-SUN 是一种可直接部署的经验边际变换框架,通过对重尾目标进行概率积分变换与期望一致性恢复,在线上全面改善点精度和校准。FeLiX则针对联邦学习中客户端流失问题,提出流式感知可用性层级和延迟鲁棒聚合,将收敛时间缩短2.37倍。