▸
ICLR'26 OralGEPA:反思式 Prompt 进化
角色:离线 prompt 优化强基线。它从轨迹反思并搜索完整 prompt 候选,但目标仍是选出一份高分指令,难以稳定承载大量细粒度知识。
输入 → 处理 → 输出:GEPA 接收系统执行轨迹、评估分数和文本反馈;LLM 诊断失败并变异某个 prompt;Pareto 前沿保留在不同样本上各有所长的候选,最后输出高性能 prompt。
它的优势是把稀疏标量奖励变成可读的自然语言学习信号,并通过候选多样性避免贪心搜索陷入局部最优。它适合“找到更好的总体指令”,却不是为维护一份不断增长的领域知识库而设计。
与 ACE 的关键区别:GEPA 的候选是完整 prompt;ACE 的状态是带 ID 和计数器的条目集合。前者在候选间搜索,后者对知识做增量维护。
GEPA v1 Figure 3:每轮从 Pareto 前沿选择候选,通过反思式变异或合并提出新 prompt,再经小批量和更大集合评估;最新版 v2 的 arXiv HTML 暂不可用。
- 候选池保存历轮 prompt 及其在各样本上的表现,而非只保留单一全局冠军。
- Pareto 选择让在某些样本上最优的候选仍有机会被继续改进,维持搜索多样性。
- 反思式变异读取轨迹与文本反馈,定位具体失败原因,再修改目标模块的 prompt。
- 两阶段评估先用小批量筛选,再扩大评估;箭头形成“选择—变异—验证—入池”的迭代闭环。
- 在 ACE 叙事中的缺口是候选仍以完整 prompt 为单位,没有为长期增长的知识条目提供稳定身份。