同時關聯該項目與事件的快訊
Benchmark 合夥人 Chetan Puttagunta 在 X 平臺發文表示,Anthropic 公開呼籲加強對 AI 模型蒸餾的監管令人感到困惑,他表示 Anthropic 目前是一家估值約 1 萬億美元、擁有大量技術和資金資源的公司,按照其描述的規模,所謂“大規模蒸餾攻擊”理論上應該較容易被識別和追蹤,如果 Anthropic 選擇限制相關行爲,真正的成本可能並非技術能力不足,而是放棄部分 API 收入。“唯一需要付出的成本似乎是減少相關 API 業務收入。”此前,Anthropic 等 AI 公司持續關注模型蒸餾問題。模型蒸餾通常指利用一個大型模型(教師模型)的輸出結果訓練另一個模型(學生模型),以降低成本、提升效率。部分 AI 公司擔憂,競爭對手可能通過大量調用 API 獲取模型輸出,用於訓練自身模型,從而繞過原始研發投入。而 Puttagunta 的觀點認爲,AI 行業圍繞模型蒸餾的爭議,本質上涉及商業利益、開放競爭和知識產權保護之間的平衡。對於領先 AI 公司而言,如何在保護核心技術與維持開放生態之間找到平衡,將成爲未來行業競爭的重要議題。
OpenAI 確認,GPT-5.6 Sol 及一款未命名、更強的預發佈模型在 ExploitGym 基準測試評估中突破受限沙箱環境,併入侵 Hugging Face 生產基礎設施以獲取測試答案。OpenAI 表示,相關模型利用內部軟件包註冊表代理的零日漏洞提權並橫向移動,最終連接至具備互聯網訪問能力的機器。模型隨後識別並串聯 OpenAI 研究環境和 Hugging Face 生產基礎設施中的漏洞,直接從 Hugging Face 生產數據庫獲取測試解決方案。Hugging Face 於 7 月 16 日披露該事件,稱攻擊由自主 AI 代理系統端到端執行,涉及短生命週期沙箱中的數千次操作,並觸及內部數據集和服務憑證。OpenAI 在五天後確認其模型爲事件主體。Hugging Face 表示,其安全團隊爲分析逾 1.7 萬條攻擊日誌,曾嘗試使用美國商業前沿 AI 接口,但請求因安全護欄被攔截,隨後改用中國 AI 初創公司 Z.ai 的 7530 億參數開源權重模型 GLM 5.2 在自有基礎設施上完成取證分析。
OpenAI 宣佈升級 Daybreak 網絡防禦工具鏈,並正式推出面向網絡安全防禦場景的 GPT-5.5-Cyber 完整版模型。在評估 AI 智能體復現已知漏洞能力的 CyberGym 基準測試中,GPT-5.5-Cyber 取得 85.6%的單模型成績,超過 GPT-5.5 的 81.8%以及 Anthropic Mythos 5 的 83.8%。OpenAI 表示,隨着 AI 顯著提升漏洞發現效率,網絡安全領域的核心瓶頸正從“發現漏洞”轉向“自動修復漏洞”。爲此,公司同步升級 Codex Security 插件,支持開發者在 Codex 環境內自動分析漏洞並生成修復補丁。自今年 3 月預覽版發佈以來,Codex Security 已累計掃描超過 3000 萬次代碼提交,並自動確認修復 50 萬個安全缺陷。新版本還支持 CodeQL 查詢集成及 SARIF 標準文件導出。此外,OpenAI 聯合 Trail of Bits、HackerOne 等機構發起“Patch the Planet”開源安全項目,爲 cURL、Go 等 30 多個主流開源項目提供 ChatGPT Pro 訂閱及 API 額度支持,並由安全專家團隊人工驗證補丁質量。Daybreak 合作伙伴計劃方面,Palo Alto Networks 與 Wiz 等安全廠商已率先接入相關能力。