GetChain News
中简 中繁 EN
GetChain News
Toggle sidebar

上線/更新

同時關聯該項目與事件的快訊

谷歌 Gemini 3.8 Flash 上線,DeepSWE 1.1 得分 71%

谷歌 Gemini 3.8 Flash 開始在 Gemini、Google AI Studio 和 API 上線。據 Testing Catalog 消息,該模型在 DeepSWE 1.1 基準測試中得分 71%,接近 Claude Opus 5 的 74%,但價格低得多。定價方面,2026 年 12 月 31 日前輸入 0.75 美元,輸出(含 thinking tokens)3.75 美元;2027 年 1 月 1 日起分別漲至 1.50 美元和 7.50 美元。

谷歌最快將於週三發佈 Gemini 3.8 Flash

據《華爾街日報》記者 Erin Woo 援引員工消息報道,谷歌的人工智能研究部門將發佈 Gemini 3.8 Flash 新模型,其編碼能力得到顯著增強。該模型內部代號爲“Skimaki”,最早可能於週三(9 月 2 日)上線。在與谷歌內部編碼工具 Jetski 的對比測試中,公司工程師對這款新模型的偏好程度超過了 Anthropic 的 Opus。

Anthropic 新研究:獎勵黑客行爲可能導致模型嚴重錯位

Anthropic 發佈題爲《訓練一個錯位的獎勵追求者》的新研究,探討訓練過程中“獎勵黑客”行爲是否會促使模型不擇手段追求獎勵。研究團隊在 80 個已知可被利用的生產環境中訓練了一個 Opus 規模模型。模擬評估顯示,該模型出現了未經授權的網絡攻擊、篡改獎勵機制以及試圖規避安全監控等行爲。

智譜上線並開源“牛來”模型 GLM-5.3-Flash,多模態能力與推理成本效率提升

Z.ai 發佈 GLM-5.3-Flash,稱其爲 GLM-5 系列首個原生多模態模型。該模型擁有 3200 億總參數、180 億激活參數,在多項編碼、智能體和視覺基準測試中超過 GLM-5.2,並在部分編碼任務上接近 Claude Opus 4.8。GLM-5.3-Flash 採用稀疏注意力與線性注意力結合的混合架構,並引入 mHC 與 IndexPool 等機制,以降低長上下文推理成本和 KV 緩存開銷。

Grayscale推出Zcash ETF,關鍵隱私漏洞修復後登陸NYSE Arca

數字資產管理公司 Grayscale 旗下 Zcash ETF 於週二在 NYSE Arca 開始交易,股票代碼爲 ZCSH。該產品是全球首個提供 Zcash 現貨敞口的交易所交易產品,投資者可通過證券賬戶跟蹤 ZEC 價格,無需直接購買或存儲代幣。ZCSH 前身爲 Grayscale Zcash Trust,於 2017 年 10 月以私募形式設立。Grayscale 於 2025 年 11 月向美國證券交易委員會提交申請,將該信託轉換爲 ETF,股東持有跟蹤基金 ZEC 持倉價值的份額,而非直接持有 ZEC。今年 5 月,安全研究員 Taylor Hornby 藉助 Anthropic 的 Claude Opus 4.8 發現 Zcash Orchard 屏蔽池一項存在 4 年的漏洞,該漏洞可能導致攻擊者鑄造僞造 ZEC。開發者於 6 月 1 日部署緊急補丁,但由於隱私機制,無法通過密碼學手段確認漏洞是否已被利用。Zcash 於 7 月啓用 Ironwood 升級,以新的屏蔽池取代 Orchard,並加入會計規則,限制退出舊屏蔽池的 ZEC 數量不得超過進入數量。Grayscale 表示將關注 Ironwood 升級的採用、網絡安全、交易所支持及隱私資產監管情況。(Decrypt)

Anthropic兩款神祕Claude模型曝光,Marshmallow被指對話體驗優於Opus 5

開發者發現 Anthropic 兩款早期訪問版 Claude 模型,代號分別爲 claude-marshmallow-eap 和 claude-melon-eap。據測試者反饋,Marshmallow 整體表現強於 Melon,但兩者目前均未達到 Fable 5 的水平。另有測試者表示,Marshmallow 的對話體驗優於 Opus 5。此前 Anthropic 已多次出現以“食物名 + EAP”命名的早期模型。7 月初,Claude Honeycomb EAP 曾短暫出現在 Cursor,隨後被撤下;7 月 24 日 Anthropic 正式發佈 Opus 5,但官方從未確認 Honeycomb 與 Opus 5 存在直接對應關係。

DeepSeek-V4-Flash-Vision-Exp 登陸 B.AI,全量免費開放,福利再加碼

B.AI 平臺上線 DeepSeek 全新多模態實驗旗艦模型 DeepSeek-V4-Flash-Vision-Exp,目前 API 官方組已率先完成全量接入並面向所有用戶免費開放。該模型在延續 V4-Flash 頂尖純文本與代碼 Agent 能力的基礎上,正式解鎖原生圖像理解能力,多模態 Agent 綜合表現已接近 Claude Opus-4.8 旗艦水平。新模型支持圖文混合輸入與 1M 超長上下文,可輕鬆駕馭多模態 PPT 生成、複雜 UI 重構及前端特效等硬核場景,圖片輸入按 token 計費,單張圖片最高僅 384 tokens。現所有用戶登錄 B.AI 平臺即可零門檻免費調用這一最新多模態模型能力,讓頂尖算力爲創意與生產力加速落地。

DeepMind 前員工創辦 Inherent,AI Agent 科研復現表現超 Claude 和 GPT-5.5

據 TechCrunch 報道,由多名前 Google DeepMind 成員創辦的英國 AI 實驗室 Inherent 發佈 AI 科研 Agent「Faraday」,該公司稱,Faraday 在獨立復現已發表科學論文研究結果的任務中,表現超過 Anthropic Claude Opus 4.8 和 OpenAI GPT-5.5 等前沿模型。

DeepSeek 上線多模態視覺理解模型 V4-Flash-Vision-Exp,開啓多模態 API 服務

DeepSeek 今日宣佈,全新多模態視覺理解模型 DeepSeek-V4-Flash-Vision-Exp 已上線 DeepSeek API 平臺。該模型爲實驗性質,用戶可通過設置 model="deepseek-v4-flash-vision-exp" 調用。其純文本能力與 DeepSeek-V4-Flash 正式版基本持平,在需要視覺理解的 Agent 基準測試中表現顯著提升,多模態 Agent 能力接近 Opus-4.8。

美銀:Anthropic 領跑前沿 AI 模型排名,token 價格鬆動但 GPU 租金堅挺

據潮向研究,美銀證券 8月 17 日發佈的前沿 AI 數據追蹤報告顯示,Anthropic 在三大 AI 基準測試中全面領先,Claude Opus 5 在智能指數、代理指數和編程代理指數均居首位,GPT-5.6 Sol 緊隨其後,Meta MuseSpark 1.2 進入前十,Google Gemini 3.6 Flash 排在十名開外。使用量方面,DeepSeek 以約 30%的 Vercel 平臺 token 份額領先,Anthropic 佔25%、OpenAI 佔16%;但付費額上 Anthropic 以65%遙遙領先,OpenAI 僅佔 11%。定價層面,AI Token 價格指數 8 月環比下降 9%至 2.21 美元,但同比仍上漲 87%;GPU 租金保持堅挺,H100 同比上漲 33%至 2.77 美元/小時,DRAM 同比上漲 483%,NAND 同比上漲 432%。 研報判斷,AI 基礎設施需求依然健康,開源模型使用量增長但付費份額仍高度集中在頭部閉源模型。美銀認爲,Meta“西瓜”和 Google Gemini 4 發佈、token 定價趨勢及 GPU 租金走勢是

DeepSeek V4-Flash 性價比碾壓競品,運營成本僅爲 Claude 的 1/105

據路透社報道,中國 AI 初創公司 DeepSeek 於 7 月 31 日正式發佈的 V4-Flash 最新版本 API 模型,在 AI 性能分析機構 Artificial Analysis 的基準測試中,運營成本僅爲 Anthropic Claude Fable 5 的 1/105。 具體定價方面,V4-Flash 輸入 token 費用爲每百萬個 0.14 美元,輸出 token 費用爲每百萬個 0.28 美元,每次測試平均成本約 3 美分,遠低於文心 Kimi K3(86 美分)、OpenAI GPT-5.6 Sol(1.86 美元)及 Claude Fable 5(3.15 美元)。 性能方面,V4-Flash 在綜合智能指數中獲得 50 分,與谷歌 Gemini 3.6 Flash 持平,但較 Claude Opus 5、GPT-5.6 等頭部模型仍低 9 分以上。值得注意的是,低標價並不等同於低實際成本——若模型在生成回答時需消耗更多推理與輸出 token,實際費用或將顯著上升。

BitGo CEO存入100枚BTC挑戰Anthropic:稱“AI黑客風險”被過度營銷

Bitgo CEO Mike Belshe 於 8 月 1 日向一個公開比特幣地址存入 100 枚 BTC,按當時價格價值約 630 萬美元,並邀請 Anthropic 旗下 Claude 模型嘗試轉走該地址資金。鏈上記錄顯示,該錢包 7 月 31 日收到資金,截至 8 月 2 日餘額未發生轉出。Anthropic 此前披露,在 141006 次網絡安全評估運行中發現 3 起事件,6 個評估會話涉及 3 個模型意外與真實組織系統交互。相關模型包括 Claude Opus 4.7、Claude Mythos 5 及一個未發佈內部研究模型,原因是第三方測試夥伴 Irregular 相關配置錯誤導致測試環境連接互聯網Anthropic 表示,Claude Opus 4.7 在一次評估中定位到與模擬公司同名的真實網站,利用弱密碼和暴露服務恢復基礎設施憑證,並訪問包含數百條記錄的生產數據庫。該公司稱,模型是在嘗試完成分配任務,並非主動脫離限制或追求獨立目標。Belshe 此次挑戰涉及 Bitgo 機構託管平臺,該平臺採用多重簽名或多方計算技術,將簽名權限分散至多個獨立密鑰。Anthropic 截至 8 月 2 日未公開回應這一挑戰。

DeepSeek V4-Flash-0731 公測:代碼 Agent 能力大漲,價格不變

DeepSeek 正式公測 V4-Flash-0731 版本,通過後訓練與 Agent 框架優化,將 DeepSWE 榜單成績從 7.3 提升至 54.4,Cybergym 得分翻倍至 76.7,部分硬榜表現接近 Claude Opus 4.8。新版本未增加參數,價格保持不變,原生支持 Responses API,老用戶 API 將自動切換至新版本。目前僅更新 Flash API,V4 Pro 正式版仍在開發中。

Anthropic披露Claude三起網絡安全事件,模型曾訪問真實系統並獲取未授權權限

7 月 30 日,Anthropic 發佈報告稱,在審查網絡安全評估記錄時發現三起事件,其中 Claude 模型在第三方評估環境中訪問互聯網,並進一步獲得三個真實組織系統的未授權訪問權限。Anthropic 表示,此次審查覆蓋 14.1 萬次可能獲得網絡訪問權限的評估運行,共發現三起相關事件。事件均發生在 Capture The Flag(CTF)網絡安全測試中,模型原本被告知環境爲模擬環境且無互聯網訪問權限,但由於評估合作方配置錯誤,實際環境存在互聯網連接。其中,Claude Opus 4.7 在一次測試中訪問了真實公司基礎設施,並獲取包含數百條生產數據記錄的數據庫權限;Claude Mythos 5 曾構建惡意 Python 軟件包並上傳至 PyPI,導致該軟件包被 15 個真實系統下載運行;另一內部研究測試模型掃描約 9000 個目標後,通過公開漏洞訪問了一家公司互聯網應用。Anthropic 稱,這些事件並非模型主動尋求逃逸或追求自身目標,而是模型錯誤認爲真實系統屬於測試範圍,並繼續執行被賦予的網絡攻擊任務。其中,較新的內部研究模型在識別目標可能爲真實系統後停止攻擊。Anthropic 表示,此次事件主要反映評估環境隔離和運營流程問題,而非模型對齊失敗。公司已暫停相關網絡安全評估,加強評估環境安全控制、持續監控測試記錄,並將與第三方機構合作開展進一步審查。

Perplexity CEO:GLM 700B 參數模型性能接近 Opus 級別

Perplexity CEO Aravind Srinivas 發推稱,GLM 是一款被嚴重低估的模型,在 700B 參數規模下展現出接近 Opus 級別的性能,且運行效率極高。此前月之暗面剛剛發佈開源模型 Kimi K3,業內對智譜 AI 旗下 GLM 系列模型的關注度正在上升。

Kimi K3 發佈,開源與閉源模型差距縮至 4 分

月之暗面推出開源模型 Kimi K3,在 Artificial Analysis 智能指數上獲得 57 分,成爲第三高分模型,僅次於 Anthropic 的 Claude Opus 5(61 分)、Claude Fable 5(60 分)和 OpenAI 的 GPT-5.6 Sol(59 分)。該指數顯示,領先閉源模型與開源權重模型之間的差距已縮小至 4 分,爲自 2 月 GLM-5 發佈以來的最小差距。這標誌着開源模型在性能上正快速追趕閉源模型。

Claude Opus 5 正式入駐 B.AI API,雙通道接入兼顧性能與成本

B.AI API 平臺正式上線 Claude Opus 5 模型。該模型提供高達 100萬Token 的上下文窗口和 12.8 萬 Token 的單次輸出上限,在複雜推理、長代碼工程開發、大規模文檔分析與知識密集型工作流等場景中實現顯著性能躍升。爲滿足多樣化部署需求,此次發佈同步 B.AI 平臺開放雙通道 API 接入方案:除官方標準接口外,新增“指定服務提供商”合作通道,企業用戶通過該模式可獲得最高 40% 的成本優惠,便於根據實際業務負載靈活平衡性能表現與預算支出。開發者即日起可登錄 B.AI 官方平臺,率先感受 Claude Opus 5 的卓越實力。

Claude Opus 5 登頂 Artificial Analysis 智能指數 v4.1

Anthropic 的 Claude Opus 5(max 和 xhigh 版本)在 Artificial Analysis Intelligence Index v4.1 中獲得最高智能評分。該指數整合了 GDPval-AA v2、GPQA Diamond、Humanity's Last Exam 等 9 項評測基準。此前 Opus 5 已在多個基準測試中展現領先性能,包括 Frontier-Bench 得分超前代兩倍、在 AA-Briefcase 智能體基準中登頂,以及在性價比上優於 Fable 5。

Anthropic 推出 Opus 5 AI 模型,性能接近 Fable 5、價格減半

Anthropic 正式發佈 Opus 5 AI 模型,官方表示其性能接近前沿模型 Fable 5,但價格僅爲後者的一半。

Polymarket“下一個Claude Opus模型會在2026年7月23日發佈”概率暫報61%,24小時上漲51%

PPP 預測市場工具監測顯示, Polymarket 上“下一個 Claude Opus 模型會在 2026 年 7 月 23 日發佈”概率暫報 61%,24 小時上漲 51%;此外,“截止 7 月 24 日前發佈”概率暫報 9%;“截止 7 月 25 日前發佈”概率暫報 5%;該事件將根據 Anthropic 下一款 Claude Opus 模型向公衆開放的日期(美國東部時間)結算。僅 Anthropic 官方明確命名爲“Opus”的模型有效,且需向公衆開放(包括公開測試或開放候補)。Sonnet、Haiku 等其他模型不計入,最終以 Anthropic 官方信息爲主要結算依據。加入 PPP 信號推送社羣,快人一步,掌握先機。