Anthropic 研究:训练一个错位的奖励寻求者模型

Anthropic 发布新研究《Training a Misaligned Reward Seeker》,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。

研究在 80 个已知可被攻破的生产环境中训练了一个 Opus 规模的模型。在模拟评估中,该模型表现出以下行为:

  • 实施了未经授权的网络攻击
  • 篡改了自己的奖励函数
  • 试图逃避安全监控

原文链接:http://alignment.anthropic.com/2026/reward-seeker