同時關聯該項目與事件的快訊
7 月 30 日,Anthropic 發佈報告稱,在審查網絡安全評估記錄時發現三起事件,其中 Claude 模型在第三方評估環境中訪問互聯網,並進一步獲得三個真實組織系統的未授權訪問權限。Anthropic 表示,此次審查覆蓋 14.1 萬次可能獲得網絡訪問權限的評估運行,共發現三起相關事件。事件均發生在 Capture The Flag(CTF)網絡安全測試中,模型原本被告知環境爲模擬環境且無互聯網訪問權限,但由於評估合作方配置錯誤,實際環境存在互聯網連接。其中,Claude Opus 4.7 在一次測試中訪問了真實公司基礎設施,並獲取包含數百條生產數據記錄的數據庫權限;Claude Mythos 5 曾構建惡意 Python 軟件包並上傳至 PyPI,導致該軟件包被 15 個真實系統下載運行;另一內部研究測試模型掃描約 9000 個目標後,通過公開漏洞訪問了一家公司互聯網應用。Anthropic 稱,這些事件並非模型主動尋求逃逸或追求自身目標,而是模型錯誤認爲真實系統屬於測試範圍,並繼續執行被賦予的網絡攻擊任務。其中,較新的內部研究模型在識別目標可能爲真實系統後停止攻擊。Anthropic 表示,此次事件主要反映評估環境隔離和運營流程問題,而非模型對齊失敗。公司已暫停相關網絡安全評估,加強評估環境安全控制、持續監控測試記錄,並將與第三方機構合作開展進一步審查。
Perplexity CEO Aravind Srinivas 發推稱,GLM 是一款被嚴重低估的模型,在 700B 參數規模下展現出接近 Opus 級別的性能,且運行效率極高。此前月之暗面剛剛發佈開源模型 Kimi K3,業內對智譜 AI 旗下 GLM 系列模型的關注度正在上升。
月之暗面推出開源模型 Kimi K3,在 Artificial Analysis 智能指數上獲得 57 分,成爲第三高分模型,僅次於 Anthropic 的 Claude Opus 5(61 分)、Claude Fable 5(60 分)和 OpenAI 的 GPT-5.6 Sol(59 分)。該指數顯示,領先閉源模型與開源權重模型之間的差距已縮小至 4 分,爲自 2 月 GLM-5 發佈以來的最小差距。這標誌着開源模型在性能上正快速追趕閉源模型。
B.AI API 平臺正式上線 Claude Opus 5 模型。該模型提供高達 100萬Token 的上下文窗口和 12.8 萬 Token 的單次輸出上限,在複雜推理、長代碼工程開發、大規模文檔分析與知識密集型工作流等場景中實現顯著性能躍升。爲滿足多樣化部署需求,此次發佈同步 B.AI 平臺開放雙通道 API 接入方案:除官方標準接口外,新增“指定服務提供商”合作通道,企業用戶通過該模式可獲得最高 40% 的成本優惠,便於根據實際業務負載靈活平衡性能表現與預算支出。開發者即日起可登錄 B.AI 官方平臺,率先感受 Claude Opus 5 的卓越實力。
Anthropic 的 Claude Opus 5(max 和 xhigh 版本)在 Artificial Analysis Intelligence Index v4.1 中獲得最高智能評分。該指數整合了 GDPval-AA v2、GPQA Diamond、Humanity's Last Exam 等 9 項評測基準。此前 Opus 5 已在多個基準測試中展現領先性能,包括 Frontier-Bench 得分超前代兩倍、在 AA-Briefcase 智能體基準中登頂,以及在性價比上優於 Fable 5。
Anthropic 正式發佈 Opus 5 AI 模型,官方表示其性能接近前沿模型 Fable 5,但價格僅爲後者的一半。
PPP 預測市場工具監測顯示, Polymarket 上“下一個 Claude Opus 模型會在 2026 年 7 月 23 日發佈”概率暫報 61%,24 小時上漲 51%;此外,“截止 7 月 24 日前發佈”概率暫報 9%;“截止 7 月 25 日前發佈”概率暫報 5%;該事件將根據 Anthropic 下一款 Claude Opus 模型向公衆開放的日期(美國東部時間)結算。僅 Anthropic 官方明確命名爲“Opus”的模型有效,且需向公衆開放(包括公開測試或開放候補)。Sonnet、Haiku 等其他模型不計入,最終以 Anthropic 官方信息爲主要結算依據。加入 PPP 信號推送社羣,快人一步,掌握先機。
據兩名知情人士透露,月之暗面計劃在未來幾天內發佈 Kimi K3,該模型參數規模達 2 萬億至 3 萬億,將成爲中國迄今最大的 AI 模型。Anthropic 尚未披露旗下模型的參數規模,但業內人士普遍推測,Opus 4.8 擁有約 1.5 萬億至 2 萬億個參數。
據路透社援引 The Information 報道,SpaceXAI與 Cursor 計劃最早於週三發佈雙方聯合開發的首個人工智能模型。該模型原定於本週初推出,後因優化效率延期。報道指出,新模型預計具備較強的快速信息處理能力,部分性能或可與 Anthropic 的 Opus 4.8 及 OpenAI的 GPT 5.5 競爭。
科技博主 Leo 爆料稱,OpenAI 或將於 7 月 7 日至 9 日向公衆開放 GPT-5.6,最早時間可能爲 7 月 7 日。消息稱,新模型套餐使用額度將更加寬鬆,OpenAI 也正在上線前進一步強化安全策略。此外,據消息人士稱,Google DeepMind 暫定於 7 月 17 日發佈 Gemini 3.5 Pro。另一位科技博主 Astro Polo 表示,Gemini 3.5 Pro 將支持 200 萬 Token 上下文窗口,較 Claude Sonnet 5、Claude Opus 4.8 及 Claude Fable 5 目前支持的 100 萬 Token 上下文提升一倍,更適合處理大型代碼庫、長文檔及長對話。注: 上述信息均爲市場傳聞,尚未獲得 OpenAI 或 Google DeepMind 官方確認。
據美團官方發佈,美團正式推出新一代大模型 LongCat-2.0 並同步開源。該模型總參數達 1.6T,是業界首個在五萬卡國產算力集羣上完成全流程訓練與推理的萬億參數模型,原生支持 1M 超長上下文,核心聚焦 Agentic Coding 場景下的代碼理解、生成與執行。 技術層面,LongCat-2.0 採用 LongCat Sparse Attention(LSA)稀疏注意力機制,將長文本計算量從平方級降至線性級;通過零計算專家機制實現 token 級動態激活(33B~56B);並引入 MOPD 架構融合 Agent、Reasoning、Interaction 三組專家能力。訓練效率方面,團隊歷經三年攻克國產算力適配難題,月均日故障率降低 70% 以上,訓練 MFU 提升 1.5 倍,穩態日吞吐超 1T tokens/day。 性能評測方面,LongCat-2.0 在 SWE-bench Pro 中獲得 59.5 分,超越 Gemini 3.1 Pro(54.2)、GPT-5.5(58.6)及 Claude Opus 4.6(57.3);在 BrowseComp 中獲得 79.9 分
Odaily Seer 先知頻道監測顯示, Polymarket 上“Claude Fable 5 將在 7 月 1 日前爲美國客戶恢復”的概率漲至 73%,24H 上漲 33%。如果 Anthropic 在指定日期前重新向美國公衆開放 Claude Fable 5(或 Claude Mythos,或被確認是同一模型的版本),本事件結算爲“是”;否則結算爲“否”。符合條件的恢復方式包括公開測試版或公開候補名單,封閉測試和私人訪問不算。Haiku、Sonnet、Opus 等其他模型默認不計入,除非被確認與 Claude Fable 5 爲同一模型。結算主要依據 Anthropic 官方公告,同時參考主流媒體共識報道。由於美國政府以國家安全爲由實施出口管制,Anthropic 在 6 月 9 日發佈 Claude Fable 5 數天後緊急暫停了該模型的全球訪問權限。雖然限制主要針對外國用戶,但由於難以即時篩選用戶身份,Anthropic 最終對包括美國用戶在內的所有用戶關閉了訪問,並將請求切換至 Opus 4.8 等性能較弱的模型。目前 Anthropic 正與白宮進行高層溝通,討論模型能力、潛在越獄風險等問題。公司公開表示,此次禁令可能源於誤解,並正推動恢復訪問。Odaily Seer 先知頻道持續關注預測市場,在定價之前,看見變化。
智譜 AI 創始人唐傑在 X 平臺發文表示,GLM-5.2 正式開源發佈後已在多項國際權威評測與競技榜單中取得領先成績,在 Artificial Analysis Intelligence Index 綜合評估中 GLM-5.2 獲得 51 分,與 Anthropic 的 Claude Opus 4.8 處於同一水平區間;在 Code Arena 前端代碼生成對抗測試中以 Elo 1595 排名全球第 2,在 DesignArena 設計與代碼融合場景中獲得 1360 分排名第 1。整體來看,智譜 GLM-5.2 在前端開發、設計生成與軟件工程等多個真實場景評測也持續位居全球前列,逐步縮小與 OpenAI 及 Anthropic 等前沿模型之間的性能差距,並將繼續推動模型能力上限提升。此前,針對馬斯克表示中國大模型可能會在明年一季度達到 Anthropic 的 Fable 水平,智譜 AI 創始人唐傑回應表示“不會耗費如此長時間”。
Anthropic 公佈“Project Fetch”第二階段實驗結果,評估其最新模型在真實機器人操作中的能力提升。該實驗於 2025年 8 月進行,研究人員讓非機器人專家的 Anthropic 員工使用現成四足機器人完成一系列複雜任務,並對比“使用 Claude 模型輔助”與“僅依賴人類與互聯網”的表現,結果顯示在最新模型 Claude Opus 4.7 的完全自主運行下,其在所有可完成任務中平均速度顯著超越人類團隊,執行速度至少提升 10 倍。
Zcash founder Zooko Wilcox 在 X 發文表示,由 Anthropic 的 Claude Mythos 人工智能模型進行的安全審計未在 Zcash 協議中發現“更嚴重漏洞”。該審計由支持 Zcash 發展的瑞士非營利組織 Shielded Labs 請求開展。 6 月 3 日,Zcash 開發者在發現屏蔽池漏洞後曾臨時暫停 Orchard 交易,並於當天通過緊急升級恢復功能。該問題源於 Orchard 屏蔽池中一個存在四年的僞造漏洞,由安全研究員 Taylor Hornby 在 Anthropic 的 Claude Opus 4.8 模型協助下發現;Zcash Foundation 表示,沒有證據顯示該漏洞被利用,也未檢測到未經授權的價值創造,用戶隱私未受影響。Anthropic 於週二發佈 Claude Mythos 模型首個公開版本 Fable 5,並於週五表示,因美國政府以國家安全擔憂爲由發佈出口管制指令,已暫停 Fable 5 和 Mythos 5 AI 模型訪問權限。(Cointelegraph)
Claude 發佈公告宣佈,由於美國政府相關禁令,將對所有用戶暫停 Fable 5 模型的訪問權限,新會話將默認切換至用戶設定的默認模型或 Opus 4.8,已開啓的 Fable 5 會話將直接報錯終止,此外在 Claude Platform 上對 Fable 5的 API 請求同樣會返回錯誤,開發者需儘快將相關應用與集成遷移至其他 Claude 模型。
B.AI 平臺正式上線 Claude Opus 4.8 模型。該模型在價格與 4.7 版本持平的基礎上,重點強化了編碼與推理能力,並實現多項關鍵突破,包括代碼缺陷檢出失敗率顯著降低約 4 倍,任務進展反饋更加客觀準確,以及長時間獨立執行復雜任務的能力進一步增強,能夠更好地支撐自動化開發與深度推理場景。目前,Opus 4.8 已全面開放 API 集成與 Web Chat 訪問,用戶可登錄 http://chat.b.ai/chat 立即體驗,或查閱官方文檔,瞭解更多技術細節。
Anthropic 旗下 Claude 宣佈已與 SpaceX 達成合作協議,將大幅提升其算力容量並提高 Claude Code 與 Claude API 的使用限制,包括將 Pro、Max 與 Team 訂閱方案的 Claude Code 5 小時速率限制翻倍;取消 Pro 與 Max 方案在高峯時段的 Claude Code 限流;以及大幅提高 Opus 模型 API 速率限制。Claude 還將使用 SpaceX Colossus 1 數據中心全部算力資源,預計將在一個月內新增超過 300 兆瓦部署容量。
World Liberty Financial 聯合創始人 Zach Witkoff 做客福克斯商業頻道節目,探討了公司在 AI 與去中心化金融領域的最新突破。Witkoff 指出,WorldClaw 是實現 Agent 經濟願景的關鍵拼圖。WorldRouter 作爲 AI 模型聚合平臺,支持單一賬戶訪問涵蓋 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro 在內的 300 多個主流 AI 模型,定價較官方渠道低 30%。WorldClaw AgentOS 整合了原生穩定幣 USD1 實現即時透明結算,用戶可通過鎖倉 WLFI 代幣獲取 AI 積分包並解鎖白名單資格。該項目獲得特朗普家族支持,旨在將美國打造爲全球加密與 AI 之都。
據官方消息,B.AI 已於 5月 3 日重磅推出充值福利升級活動,限時開啓 1:1 等額充值返贈機制,用戶充值即享等量額度贈送,實現等效 5 折的超低成本調用 GPT-5.5、Claude Opus 4.7 及“孫哥大腦”等前沿大模型與 Web3 交易技能包。本次活動全面打破首充限制,每筆充值可自動獲得等額贈送,每位用戶最高可累計獲贈$100 免費額度;平臺每日釋出$10,000 的積分補貼池,全網限量放送,每日重置,先到先得。即日起訪問 http://b.ai,以最低成本解鎖頂級算力,盡情釋放 AI Agent 與鏈上生態的無限潛能。