type
Post
status
Published
date
Sep 3, 2026 05:00
slug
ai-daily-2026-09-03
summary
今日 AI 学术圈聚焦 Agent 工程化与效率革命两大主线。上海 AI 实验室提出 Harness-of-Harness 框架,让编码 Agent 在 70+ 迭代的多日部署中自主开发出可玩的 FPS 游戏,平均相对性能提升 52.25%。AMD 发布 Instella-MoE 全开源 MoE 模型,在 MI300X 上从零训练,挑战开源模型性能上限。阿里巴巴连发三篇 Agent 训练论文:MemoryWalker 解决压缩上下文下的训练一致性问题,CANOPY 仅凭结果型 RL 让 Qwen3-14B 登顶 AppWorld 榜单,T-Tech 则用分轴 GRPO 专家 + SLERP 合
tags
AI
日报
技术趋势
category
AI技术报告
icon
📰
password
priority
1
📊 今日概览
今日 AI 学术圈聚焦 Agent 工程化与效率革命两大主线。上海 AI 实验室提出 Harness-of-Harness 框架,让编码 Agent 在 70+ 迭代的多日部署中自主开发出可玩的 FPS 游戏,平均相对性能提升 52.25%。AMD 发布 Instella-MoE 全开源 MoE 模型,在 MI300X 上从零训练,挑战开源模型性能上限。阿里巴巴连发三篇 Agent 训练论文:MemoryWalker 解决压缩上下文下的训练一致性问题,CANOPY 仅凭结果型 RL 让 Qwen3-14B 登顶 AppWorld 榜单,T-Tech 则用分轴 GRPO 专家 + SLERP 合并让自托管模型以 1/7 参数量超越大模型基线。微软的 SAGE 框架实现零成本对话 Agent 评估,ReDeck 则将文档转幻灯片生成细化到"一步一观察"。
🔥 趋势洞察
- Agent 训练走向精细化:MemoryWalker 指出压缩上下文下的"树状学习目标"问题,CANOPY 证明结果型 RL 在小模型上也可奏效,T-Tech 用分轴专家规避奖励干扰,三者共同指向 Agent 后训练的系统化方法论。
- 开源模型效率竞赛升级:AMD 发布 Instella-MoE 全开源权重与训练代码,叠加此前 DeepSeek 降价,开源阵营正以更小激活参数追赶闭源性能,推动行业从"堆算力"转向"拼效率"。
- 评估体系走向状态接地:微软 SAGE 以零成本符号验证超越 GPT-4.1 judge,ReDeck 引入渲染器反馈细粒度评估,预示 Agent 评估正从"整体印象分"转向"可追溯、可验证"的工程化标准。
⭐ 精选内容
- Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement | Shanghai AI Laboratory
- 提出 HoH 框架,将编码 Agent 组织为迭代规划-编码-测试循环,平衡修复与能力增长。在 GameCraft-Bench 等三个基准上平均相对提升 52.25%,并成功多日自主开发出完整 FPS 游戏。
- 来源:https://arxiv.org/abs/2609.01481
- Instella-MoE Technical Report | AMD
- 全开源 MoE 模型,16B 总参数 / 2.8B 激活,在 AMD MI300X/MI325X 上从零训练。引入 Gated MLA 与 FarSkip-Collective 互联,平均分 76.7 超越 OLMo-3-7B 等开源模型,完整开放权重、配置与训练代码。
- 来源:https://arxiv.org/abs/2609.00791
- From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix | T-Tech
- 将 200+ 内部应用的流量整合到单一自托管模型,按指令遵循、函数调用、任务分布三轴分别训练 GRPO 专家,再经两阶段 SLERP 合并。以 1/7 参数量超越基线,承载每月 1.16 亿请求。
- 来源:https://arxiv.org/abs/2609.01572
- MemoryWalker: Stop Training Agents on Contexts They Never Saw | Alibaba Group
- 揭示压缩上下文训练中的"条件化问题":每次驱逐都使有效历史分叉成树。提出 LogitTree 精确修正与 SDCC 变分松弛,在七个 web-search 基准上显著缩小训练-部署差距。
- 来源:https://arxiv.org/abs/2609.00865
- Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents | Alibaba Research
- 提出 CANOPY 协议,通过同任务扩展探索 + KL 锚定 + 仅策略自身动作 token 更新,让 Qwen3-14B 仅凭环境交互登顶 AppWorld 榜单(TGC 86.9),并在 SWE-bench Verified 上提升 Qwen3.5-9B 达 16.6 分。
- 来源:https://arxiv.org/abs/2609.01245
- ReDeck: Step-Level Render-Grounded Refinement for Document-to-Slide Generation | Microsoft Research
- 将幻灯片生成反思从"一版一反馈"细化为"一编辑一观察",每步原子编辑后返回渲染器观测。在 GPT-5.4、Claude-4.6、Gemini-3.1 上均超越现有 Agent,并发布 DeckQuiz 基准。
- 来源:https://arxiv.org/abs/2609.00194
- SAGE: State-Grounded, Abstention-Aware Evaluation of Task-Oriented Dialogue Agents | Microsoft
- 将工作流规范与状态差异编译为原子化、schema 接地标准,经符号与编码器验证器级联裁决。SAGE-Core 以零付费 LLM 成本处理 81-91% 标准,性能不输 GPT-4.1 judge(后者每千轮成本 $4.7-8.0)。
- 来源:https://arxiv.org/abs/2609.00434
- Verifiable Disaster Storylines and Causal Knowledge Graphs | ISI Foundation
- 融合 EM-DAT 结构化记录与 ReliefWeb/EMM 非结构化文档,构建带引用追溯的灾害叙事与因果知识图谱。9 位专家 + 9 位非专家评估确认高检索精度与因果忠实度,专家明确偏好引用接地组件。
- 来源:https://arxiv.org/abs/2609.00858
- Topic Matching in the Wild: Benchmark and Lessons from Real-World ASR Transcripts | Dialpad Inc.
- 基于真实呼叫中心 ASR 转写构建主题-话语判断基准,对比 regex、embedding 与 Gemini LLM 匹配器。发现配备自然语言描述的轻量 LLM 匹配器显著优于 embedding 与 regex 方案。
- 来源:https://arxiv.org/abs/2609.00330
📄 今日论文精选
Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement
Shanghai AI Laboratory | 🏷️ Agent Framework, Agentic Workflow, Code Agent
让编码 Agent 在多日、70+ 迭代的自主开发中持续改进,最终产出可玩的完整 FPS 游戏。框架级编排思路对长周期 Agent 落地极具工程参考价值,已开源。
Instella-MoE Technical Report
AMD | 🏷️ Architecture, Training, MoE
AMD 全开源 MoE 模型,16B 总参数仅 2.8B 激活,在自家 MI300X 上从零训练。完整开放权重、数据配比与训练代码,是开源 MoE 效率路线的重要标杆。
Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents
Alibaba Research | 🏷️ Agent Framework, RLHF/DPO, Code Agent
挑战"结果型 RL 在小模型上很快触顶"的共识,CANOPY 协议让 Qwen3-14B 登顶 AppWorld 榜单。信号饥饿与策略漂移两大问题的诊断极具启发性,训练栈将开源。