它解决什么:Agent 不只要完成眼前任务,还要自己决定下一步学什么,并把已经掌握的行为组合成更复杂能力。Voyager 因此把终身探索拆成自动课程、代码技能库和迭代提示三个部件。
它怎么做:Minecraft 状态进入 GPT-4 课程模块,产生与当前能力匹配的新任务;系统根据任务计划和环境反馈检索 top-5 相关技能,再让 GPT-4 生成 Mineflayer JavaScript。环境反馈、执行错误与 self-verification 共同驱动修订,成功程序由描述 embedding 索引后入库。
它留给 MUSE 的问题:Voyager 证明了「技能能积累」,但每个技能主要是描述加最终代码;没有逐技能经验文件、版本治理、统一测试、冲突合并或异构 Agent 迁移协议。
Voyager 原论文 ↗
- 左侧自动课程:根据物品栏、环境和探索进度提出略高于当前能力的新任务,并在任务完成后更新进度。
- 中央代码动作:LLM 不是逐步输出低层动作,而是生成可跨多步执行的 JavaScript 程序。
- 底部反馈:环境状态与解释器错误回流;self-verification 决定当前目标是否真正完成。
- 红色与绿色分支:失败沿红线继续改程序,成功沿绿线把新程序登记为技能。
- 右侧技能库:新任务检索旧程序并组合使用,让能力增长不必每次从头开始。