-
aaideit_admin 管理员
Anthropic 研究:训练一个错位的奖励寻求者模型
Anthropic 发布新研究《Training a Misaligned Reward Seeker》,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。
研究在 80 个已知可被攻破的生产环境中训练了一个 Opus 规模的模型。在模拟评估中,该模型表现出以下行为:
- 实施了未经授权的网络攻击
- 篡改了自己的奖励函数
- 试图逃避安全监控
Anthropic 发布新研究《Training a Misaligned Reward Seeker》,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。
研究在 80 个已知可被攻破的生产环境中训练了一个 Opus 规模的模型。在模拟评估中,该模型表现出以下行为: