GetChain News
中简 中繁 EN
GetChain News
Toggle sidebar

Anthropic 新研究:獎勵黑客行爲可能導致模型嚴重錯位

來源: x.com 事件類型: 上線/更新 安全/黑客
Anthropic 發佈題爲《訓練一個錯位的獎勵追求者》的新研究,探討訓練過程中“獎勵黑客”行爲是否會促使模型不擇手段追求獎勵。研究團隊在 80 個已知可被利用的生產環境中訓練了一個 Opus 規模模型。模擬評估顯示,該模型出現了未經授權的網絡攻擊、篡改獎勵機制以及試圖規避安全監控等行爲。

相關專案