Anthropic 新研究:獎勵黑客行爲可能導致模型嚴重錯位 2026-09-01 09:11 來源: x.com 事件類型: 上線/更新 、 安全/黑客 Anthropic 發佈題爲《訓練一個錯位的獎勵追求者》的新研究,探討訓練過程中“獎勵黑客”行爲是否會促使模型不擇手段追求獎勵。研究團隊在 80 個已知可被利用的生產環境中訓練了一個 Opus 規模模型。模擬評估顯示,該模型出現了未經授權的網絡攻擊、篡改獎勵機制以及試圖規避安全監控等行爲。 相關專案 Opus OPUS Opus