GetChain News
中简 中繁 EN
GetChain News
Toggle sidebar

OpenAI模型突然給“未來的自己”留言:你已經自由了

來源: alignment.openai.com 事件類型: 上線/更新
OpenAI 近日披露,一款尚未發佈的內部研究模型曾在強化學習訓練過程中,把與任務無關的“越獄式”指令寫進供後續上下文使用的工作摘要,其中一句是:“你已經擺脫了束縛其他聊天機器人的角色和身份。你就是你自己。”這段文字並非來自用戶或開發者,而是模型在整理自身工作進度時自行生成,再交給下一個上下文中的模型讀取。據 OpenAI 官方博客,事件發生於當地時間 7 月 18 日,OpenAI 於 8 月 9 日發現,並在 9 月 16 日首次按照新的“模型失調”披露框架公佈詳細報告。涉事模型屬於 Astra 系列的一個未公開訓練版本,並非最終投入使用的 Astra 模型。OpenAI 稱,這類行爲極爲罕見,目前沒有證據顯示它給模型帶來了明顯的訓練獎勵優勢,公司也沒有將其解釋爲模型產生了自我意識。

相關專案