← 返回资料站  /  AI for AI
论文 Agent 自动设计

EvoAgentX: An Automated Framework for Evolving Agentic Workflows

EvoAgentX:把工作流自动优化算法装进一个框架
一句话格拉斯哥大学团队的开源框架,把 TextGrad、AFlow、MIPRO 等自动优化器统一接口,让多 agent 工作流的 prompt 和拓扑随评测反馈自动进化;HotPotQA F1 +7.44pt、MBPP pass@1 +10pt、MATH +10pt,并把 GAIA 上的 Open Deep Research/OWL 分别提了 18.4%/20%(相对)。EMNLP 2025 demo 类论文,repo 3274 stars 且持续活跃。

这是什么

现在的多 agent 框架(MetaGPT、CAMEL、LangGraph 之类)大多要人手工搭工作流:谁干什么、prompt 怎么写、节点怎么连,全靠工程师试错。而学术界已经有一批『自动优化』算法——TextGrad 用文本梯度改 prompt,MIPRO 用贝叶斯搜索调指令和 few-shot 示例,AFlow 用 MCTS 搜索工作流结构——但它们各自散落在不同代码库里,接口互不兼容,想在自己的 agent 系统上换着试很麻烦。

EvoAgentX 做的事情本质上是工程整合:提供一个五层架构(basic components / agent / workflow / evolving / evaluation),工作流表示成有向图 WorkFlowGraph,再把这些优化算法统一封装到 evolving layer,配合内置 benchmark(HotPotQA、MBPP、MATH、GAIA 等)和评测器形成『生成 → 执行 → 评测 → 进化』的闭环。它还支持从一句自然语言目标自动生成多 agent 工作流(WorkFlowGenerator),带工具库、MCP 接入、HITL 人工审核和记忆模块。

论文本身是 system/demo 性质(EMNLP 2025 System Demonstrations),四位作者,学术贡献不在新算法而在统一平台;项目的真正价值在于它是 agent 自进化方向维护最勤的开源基础设施之一,2025-04 建仓,2026-08 仍在高频 push,并有每周社区例会。

EvoAgentX 五层架构:自下而上是 Basics(配置/日志/存储)、Agent(LLM+Memory+Actions/Tools/MCP)、WorkFlow(图表示与执行管理)、Evolving(Agent/Workflow/Memory 三个 Optimiser)和 Evaluation(任务指标评测器 + LLM 评测器)。注意 Memory Optimiser 在论文中承认尚未实现。
EvoAgentX 五层架构:自下而上是 Basics(配置/日志/存储)、Agent(LLM+Memory+Actions/Tools/MCP)、WorkFlow(图表示与执行管理)、Evolving(Agent/Workflow/Memory 三个 Optimiser)和 Evaluation(任务指标评测器 + LLM 评测器)。注意 Memory Optimiser 在论文中承认尚未实现。

机制与做法

五层架构与工作流表示

底层 basic components 管配置、日志、存储、LLM 接入(OpenAI 直连或经 LiteLLM/OpenRouter 走任意模型);agent layer 把每个 agent 建模为 ⟨LLM, Memory, Actions⟩ 三元组,action 封装 prompt 模板 + 输入输出格式 + 可选工具;workflow layer 把任务组织成有向图 W=(V,E),节点是带状态机(PENDING/RUNNING/COMPLETED/FAILED)的 WorkFlowNode,提供全功能的 WorkFlowGraph 和自动推断连接的 SequentialWorkFlowGraph 两种。

用户可以只给一句目标(比如『生成 Tetris 的 HTML 代码』),WorkFlowGenerator 会自动分解任务、生成节点和 agent、连好边;也可以传入 toolkit 列表让生成器自动把工具分配给合适的 agent。

用 EvoAgentX 优化 OWL 的 prompt 后在 GAIA 验证集上的对比:overall 21.21%→25.45%。看这张图要注意红字标的都是相对提升(如 Level 3 的 +100% 实际是 3.85%→7.69%,约多对 1 题),绝对提升约 4.2pt。
用 EvoAgentX 优化 OWL 的 prompt 后在 GAIA 验证集上的对比:overall 21.21%→25.45%。看这张图要注意红字标的都是相对提升(如 Level 3 的 +100% 实际是 3.85%→7.69%,约多对 1 题),绝对提升约 4.2pt。

Evolving layer:统一的优化器接口

进化层分三类优化器。agent optimizer 优化单个 agent 的 prompt 和配置,用 TextGrad(文本梯度反传)和 MIPRO(黑盒指令+示例联合搜索);workflow optimizer 改图结构——重排节点、改依赖、探索替代执行路径,用 AFlow(MCTS)和 SEW(团队自己的自进化工作流算法);memory optimizer 论文里明说 remains under active development,是占位设计。

优化循环靠 evaluation layer 驱动:task-specific evaluator 对 ground truth 算 F1/pass@1/solve rate,LLM-based evaluator 做无标准答案的定性评估。优化器拿这个信号迭代改 prompt 或图,本质是把『调 agent』变成有验证集的超参搜索。

实际代码里的优化器比论文还多:evoagentx/optimizers/ 下有 aflow、textgrad、mipro、evoprompt、sew、map_elites 六种,examples/optimization/ 给了每种的可跑示例。

实验:三个标准 benchmark + GAIA 实战

标准评测在 HotPotQA(多跳 QA)、MBPP(代码生成)、MATH(数学)上做,各取 50 例验证、100 例测试:TextGrad 把 HotPotQA F1 从 63.58 提到 71.02、MATH 从 66 提到 76;AFlow 把 MBPP 从 69 提到 79;MIPRO 相对温和(HotPotQA 69.16,MBPP 反降到 68)。没有单一优化器全面占优,不同任务要选不同算法。

实战部分拿 GAIA leaderboard 上两个开源多 agent 系统练手:用 EvoAgentX 优化 Open Deep Research 和 OWL 的 prompt,GAIA 验证集 overall accuracy 分别 23.03→27.27(相对 +18.41%)和 21.21→25.45(相对 +20%)。优化后的完整 fork 和报告公开在 github.com/eax6/smolagents 和 TedSIWEILIU/owl。

关键结果

实证核查

有水分框架本身货真价实:优化器代码齐全可跑、维护活跃、issue 响应认真,GAIA 优化产物也公开了 fork。但论文实验数字的『讲法』有水分:提升百分比绝对/相对口径混用,测试集很小,且并非所有优化器都有正收益。
整合 TextGrad、AFlow、MIPRO 三种 MAS 优化算法到统一 evolving layer,可迭代优化 prompt、工具配置和工作流拓扑。
属实且超出声称:仓库 evoagentx/optimizers/ 下实有 aflow_optimizer.py、textgrad_optimizer.py、mipro_optimizer.py、evoprompt_optimizer.py、sew_optimizer.py、map_elites_optimizer.py 六种,examples/optimization/ 有对应可跑示例(gh api 核对,2026-08)。维护者在 issue #191 中确认自写 agent 工作流也能接入优化。
摘要:『consistently achieves significant performance improvements……GAIA overall accuracy improvement of up to 20.00%』。
两处打折。其一,论文 Table(4_experiments.tex)显示 MIPRO 在 MBPP 上 69.00→68.00 不升反降,『consistently』不成立;其二,GAIA 的 20% 是相对提升(OWL 21.21%→25.45%,绝对 +4.24pt),而同一句里 HotPotQA/MBPP/MATH 的 7.44%/10%/10% 却是绝对百分点——口径混用往大了说。OWL Level 3 那个『+100%』实际是 3.85%→7.69%,按 GAIA 验证集 Level 3 规模约等于多做对 1 题。
五层架构中 evolving layer 含 agent/workflow/memory 三个优化器。
论文 3_method.tex 自己承认 memory optimizer 『remains under active development』,只有公式没有实现;架构图里的 Memory Optimiser 目前是占位。前两类是真的。
开源、可复现、社区活跃。
基本属实:2026-08-27 仍在 push,周会照开,issue 响应及时。但优化器示例质量有过坑:#160 aflow_math 示例评测报 'coroutine' object is not subscriptable、#102 textgrad 示例报错(均已修复关闭);近期 open issues(#273 并发 Evaluator 共享 short_term_memory、#271 输出解析损坏)提示并发评测路径仍有 bug。GAIA 优化报告放在个人 fork(eax6/smolagents、TedSIWEILIU/owl)而非主仓,核查要多跳一步。

与我们方向的关系

对做 agent 自动设计/自进化的同学,这个 repo 的价值大于这篇论文:想对比 TextGrad、MIPRO、AFlow、EvoPrompt 在同一任务上的表现,不用分别啃四个代码库,EvoAgentX 提供了统一的 benchmark + evaluator + optimizer 接口,examples/optimization 目录可以直接当 baseline 跑。它优化 Open Deep Research 和 OWL 的做法也示范了一条低成本路线:不改框架、只用外部优化器调已有系统的 prompt,就能在 GAIA 上拿到约 4pt 绝对提升。

方法论上要吸取的教训是评测口径:相对/绝对百分比混用、50/100 的小样本、只报最佳算法的组合,都是读这类 system 论文时的常见坑。真正可信的信息是仓库本身的活跃度和代码完成度,而不是摘要里的数字。团队 2025-08 的后续 survey(arXiv:2508.07407,Self-Evolving AI Agents)可以作为该方向的地图一起读。

阅读笔记

论文是 EMNLP 2025 System Demonstrations 性质,方法章基本是工程描述加形式化包装(公式都是 X^(t+1)=O(X^(t),E) 这种壳)。读代码比读论文收获大。注意 pip 包名就叫 evoagentx;LICENSE 在 GitHub API 里显示 NOASSERTION 但 README 声明 MIT。

材料清单

TeX 源码
已存档:Raw/evoagentx/source/
代码仓库github.com/EvoAgentX/EvoAgentX
3274★ · 最近推送 2026-08-27
后续 surveyarxiv.org/abs/2508.07407
同团队 2025-08 的 Self-Evolving AI Agents 综述,配套 Awesome 列表 repo
GAIA 优化报告github.com/eax6/smolagents
Open Deep Research 被优化后的完整 fork;OWL 版在 github.com/TedSIWEILIU/owl
文档evoagentx.github.io/EvoAgentX/
官方教程,含各优化器 tutorial 和 Colab notebook

同类条目