Google AI推出EnvHarness:将静态智能体环境转变为自适应训练世界

Google云AI研究团队联合华盛顿大学圣路易斯分校和北卡罗来纳大学教堂山分校,发布了EnvHarness——一个能将静态智能体基准测试转变为自适应训练环境的可编程层。

为什么需要EnvHarness?

当前LLM智能体越来越依赖交互式环境学习,但这些环境都是手工构建且静态不变的:无论哪个智能体操作、无论智能体进步了多少,环境行为都一模一样。这意味着环境无法针对智能体的弱点进行训练,一旦任务被解决,环境就再也没有教学价值。

常规解决方案是生成更多环境,但这带来两个问题:

  • 生成管道是针对特定领域的,无法迁移
  • LLM编写的验证器必须过度生成并大量过滤,且始终不可完全信任

EnvHarness的核心创新

EnvHarness采取了完全不同的思路:包装而非重写

它通过插件组件包裹现有环境,这些组件严格通过标准的reset()/step()接口运行,改变回合的起点、智能体能做什么、智能体能看到什么,而底层模拟器、任务和人工构建的验证器保持 untouched。

三个核心组件

  1. Stage(舞台):在reset()后重放固定的动作列表,让回合从不同位置开始。例如,把目标杯子藏进关闭的抽屉,迫使智能体进行搜索而非直接抓取。

  2. Contract(契约):在每个步骤的动作、状态转移和观察轴上安装钩子:阻止某个动作、改写响应、截断观察内容。

  3. Chain(链条):在共享的步骤预算下,将第二个环境组合到同一回合中,复合判定为两个验证器的逻辑与。

EnvRigger:自动化设计循环

组件本身是策略无关的,但如何选择组件则不然。EnvRigger将策略视为黑盒,运行四个阶段:

  1. 观察:5次基线回合
  2. 诊断:识别系统性缺陷
  3. 编写:用真实Python代码编写组件
  4. 验证:在5次新回合上验证

不可解和过于简单的候选都会被拒绝,每个任务最多进行5轮修订。生成的钩子在隔离子进程中编译,因此错误的修改只会产生记录的痕迹,而非卡死的运行。

性能表现

在四个领域的五个基准测试中,通过这种方式挖掘的技能在未见过任务上获得最高9.0分的提升,同时执行步数减少9.8%。

部署可行性

如果你已经运行智能体评估循环,就可以部署。 EnvHarness以Apache-2.0许可证发布Python代码,提供六个环境的复现驱动。新基准只需实现一个接口(reset/step/observe/evaluate/get_env_state/save_state/from_state),下游无需任何改动。

硬性前提是环境必须可重置,这排除了真实用户账户和物理机器人。

技术意义

EnvHarness代表了一种新的范式:不是让环境适应智能体,而是让智能体适应动态变化的环境。这种"适应性训练世界"的理念,对于推动AI智能体从实验室走向真实应用具有重要意义。



本文源自「MarkTechPost