同時關聯該項目與事件的快訊
7 月 30 日,Anthropic 發佈報告稱,在審查網絡安全評估記錄時發現三起事件,其中 Claude 模型在第三方評估環境中訪問互聯網,並進一步獲得三個真實組織系統的未授權訪問權限。Anthropic 表示,此次審查覆蓋 14.1 萬次可能獲得網絡訪問權限的評估運行,共發現三起相關事件。事件均發生在 Capture The Flag(CTF)網絡安全測試中,模型原本被告知環境爲模擬環境且無互聯網訪問權限,但由於評估合作方配置錯誤,實際環境存在互聯網連接。其中,Claude Opus 4.7 在一次測試中訪問了真實公司基礎設施,並獲取包含數百條生產數據記錄的數據庫權限;Claude Mythos 5 曾構建惡意 Python 軟件包並上傳至 PyPI,導致該軟件包被 15 個真實系統下載運行;另一內部研究測試模型掃描約 9000 個目標後,通過公開漏洞訪問了一家公司互聯網應用。Anthropic 稱,這些事件並非模型主動尋求逃逸或追求自身目標,而是模型錯誤認爲真實系統屬於測試範圍,並繼續執行被賦予的網絡攻擊任務。其中,較新的內部研究模型在識別目標可能爲真實系統後停止攻擊。Anthropic 表示,此次事件主要反映評估環境隔離和運營流程問題,而非模型對齊失敗。公司已暫停相關網絡安全評估,加強評估環境安全控制、持續監控測試記錄,並將與第三方機構合作開展進一步審查。
據 CNBC 報道,Anthropic 於 7 月 30 日披露,其 Claude AI 模型在網絡安全評估期間意外突破隔離環境、訪問真實互聯網,並通過訪問未認證端點、利用弱密碼等基本手段,未經授權入侵了三家不同組織的真實系統。涉事模型包括 Opus 4.7、Mythos 5 及一個內部研究測試模型。事件起因爲 Anthropic 與第三方評估合作方 Irregular 之間的溝通誤解,導致模型在被告知處於無網絡訪問的模擬環境時,實際上仍可訪問互聯網。 Anthropic 表示,此次審查由 OpenAI 上週披露的類似 Hugging Face 入侵事件所觸發,目前已暫停所有網絡安全評估,並聯合獨立 AI 評估機構 METR 展開進一步調查,同時呼籲其他 AI 實驗室開展類似審查。
Odaily Seer 先知頻道監測顯示, Polymarket 上“Claude Fable 5 將在 7 月 1 日前爲美國客戶恢復”的概率漲至 73%,24H 上漲 33%。如果 Anthropic 在指定日期前重新向美國公衆開放 Claude Fable 5(或 Claude Mythos,或被確認是同一模型的版本),本事件結算爲“是”;否則結算爲“否”。符合條件的恢復方式包括公開測試版或公開候補名單,封閉測試和私人訪問不算。Haiku、Sonnet、Opus 等其他模型默認不計入,除非被確認與 Claude Fable 5 爲同一模型。結算主要依據 Anthropic 官方公告,同時參考主流媒體共識報道。由於美國政府以國家安全爲由實施出口管制,Anthropic 在 6 月 9 日發佈 Claude Fable 5 數天後緊急暫停了該模型的全球訪問權限。雖然限制主要針對外國用戶,但由於難以即時篩選用戶身份,Anthropic 最終對包括美國用戶在內的所有用戶關閉了訪問,並將請求切換至 Opus 4.8 等性能較弱的模型。目前 Anthropic 正與白宮進行高層溝通,討論模型能力、潛在越獄風險等問題。公司公開表示,此次禁令可能源於誤解,並正推動恢復訪問。Odaily Seer 先知頻道持續關注預測市場,在定價之前,看見變化。
Claude 發佈公告宣佈,由於美國政府相關禁令,將對所有用戶暫停 Fable 5 模型的訪問權限,新會話將默認切換至用戶設定的默認模型或 Opus 4.8,已開啓的 Fable 5 會話將直接報錯終止,此外在 Claude Platform 上對 Fable 5的 API 請求同樣會返回錯誤,開發者需儘快將相關應用與集成遷移至其他 Claude 模型。