Agent 自改进闭环:运行、留痕、反思、归纳、激活、注入

如何做 Agent 的 Self-Improving:一条可落地的工程路径

这篇文章只讲一件事:怎么真的把 Agent 自改进搭出来。 不是论文综述,而是一条从采集、反思、归纳、激活到注入的完整工程路径,附带八条不可破坏的红线、一个真实的静默故障,以及从零复现的最小清单。 内容融合了公开研究范式与某企业级实现的真实工程经验(已做匿名化与通用化处理,不指向任何具体系统)。文末附参考资料与事实核查说明。 一、先说清楚:什么才叫「自改进」 我们对工具有一个朴素期待:越用越好用。 但今天绝大多数 Agent 不是这样。你用了三个月的 Agent,和第一天用它,感觉差不多。它不记得上周你纠正过它三次的同一个错误,不记得哪条路走过是死胡同。每次对话都像重新认识。 自改进要解决的就是这件事,一句话概括: 让 Agent 把「这次是怎么做成 / 做砸的」变成下次的先验。 Warp 团队把这个问题的根因说得更精准——反馈是无状态的(stateless):会话结束后,人给 Agent 的反馈就消失了,那些最关键的上下文被直接踢出了 agentic loop。 他们还给出了一个很传神的症状描述:「80% 正确」陷阱。一次性写好的 prompt 能把任务做对约 80%,但剩下的 20% 会产生大量噪音,体验反而很差。而靠人工不断重写 prompt 来补那 20%,根本无法规模化。 它是一个闭环,六步: 图 1:六步闭环。注意三种颜色的分工——运行/留痕/注入在在线路径,反思/归纳在离线路径,而激活是人在环的显式决策。这个分工是整套架构最重要的决定。 学术上这个闭环被抽象为四个要素:System Inputs / Agent System / Environment / Optimiser(综述 arXiv:2508.07407)。你要优化的是前两者,信号来自环境,而"反思器"就是那个 Optimiser。 先划清一条边界,避免一开始就跑偏: 这是自改进 这不是自改进 沉淀「这类任务该先查再答」这样的方法论 记住「用户叫张三、住北京」这样的用户事实 经验归 Agent,跨用户复用 用户画像、个性化人设 提炼可复用的规则 把原始日志堆进 prompt 经验归 Agent,不归用户——这是最容易做错也最关键的一条立场,第四节第 1 步会详细展开为什么。 二、第一性问题:改什么? 自改进不是一个动作,而是四个不同层级的动作。选错层级,项目基本就废了。 图 2:四层选型。越往上能力上限越高,但风险、成本和不可逆性也越高。 层级 改什么 代表工作 见效 风险 回滚 L1 上下文/经验 prompt、memory、经验手册、Skill 文件 ACE、ExpeL、Reflexion、GEPA;工业界:Warp 快 低 改一行文本 L2 技能/工具 技能库、自建工具 Voyager、SkillOpt 中 中 删掉技能 L3 架构/工作流 拓扑、节点,甚至自改代码 ADAS、Darwin Gödel Machine、AWM 慢 高 难 L4 权重 SFT / RL / 蒸馏 SEAL 慢且贵 高 需重训 结论很明确:绝大多数团队应该只做 L1,而且应该先只做 L1。 ...

2026 年 08 月 31 日 · 6 min · 1272 words · malaxg