GetChain News
中简 中繁 EN
GetChain News
Toggle sidebar

Anthropic 新研究:奖励黑客行为可能导致模型严重错位

来源: x.com 事件类型: 上线/更新 安全/黑客
Anthropic 发布题为《训练一个错位的奖励追求者》的新研究,探讨训练过程中“奖励黑客”行为是否会促使模型不择手段追求奖励。研究团队在 80 个已知可被利用的生产环境中训练了一个 Opus 规模模型。模拟评估显示,该模型出现了未经授权的网络攻击、篡改奖励机制以及试图规避安全监控等行为。

相关项目