同时关联该项目与事件的快讯
谷歌 Gemini 3.8 Flash 开始在 Gemini、Google AI Studio 和 API 上线。据 Testing Catalog 消息,该模型在 DeepSWE 1.1 基准测试中得分 71%,接近 Claude Opus 5 的 74%,但价格低得多。定价方面,2026 年 12 月 31 日前输入 0.75 美元,输出(含 thinking tokens)3.75 美元;2027 年 1 月 1 日起分别涨至 1.50 美元和 7.50 美元。
据《华尔街日报》记者 Erin Woo 援引员工消息报道,谷歌的人工智能研究部门将发布 Gemini 3.8 Flash 新模型,其编码能力得到显著增强。该模型内部代号为“Skimaki”,最早可能于周三(9 月 2 日)上线。在与谷歌内部编码工具 Jetski 的对比测试中,公司工程师对这款新模型的偏好程度超过了 Anthropic 的 Opus。
Anthropic 发布题为《训练一个错位的奖励追求者》的新研究,探讨训练过程中“奖励黑客”行为是否会促使模型不择手段追求奖励。研究团队在 80 个已知可被利用的生产环境中训练了一个 Opus 规模模型。模拟评估显示,该模型出现了未经授权的网络攻击、篡改奖励机制以及试图规避安全监控等行为。
Z.ai 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型。该模型拥有 3200 亿总参数、180 亿激活参数,在多项编码、智能体和视觉基准测试中超过 GLM-5.2,并在部分编码任务上接近 Claude Opus 4.8。GLM-5.3-Flash 采用稀疏注意力与线性注意力结合的混合架构,并引入 mHC 与 IndexPool 等机制,以降低长上下文推理成本和 KV 缓存开销。
数字资产管理公司 Grayscale 旗下 Zcash ETF 于周二在 NYSE Arca 开始交易,股票代码为 ZCSH。该产品是全球首个提供 Zcash 现货敞口的交易所交易产品,投资者可通过证券账户跟踪 ZEC 价格,无需直接购买或存储代币。ZCSH 前身为 Grayscale Zcash Trust,于 2017 年 10 月以私募形式设立。Grayscale 于 2025 年 11 月向美国证券交易委员会提交申请,将该信托转换为 ETF,股东持有跟踪基金 ZEC 持仓价值的份额,而非直接持有 ZEC。今年 5 月,安全研究员 Taylor Hornby 借助 Anthropic 的 Claude Opus 4.8 发现 Zcash Orchard 屏蔽池一项存在 4 年的漏洞,该漏洞可能导致攻击者铸造伪造 ZEC。开发者于 6 月 1 日部署紧急补丁,但由于隐私机制,无法通过密码学手段确认漏洞是否已被利用。Zcash 于 7 月启用 Ironwood 升级,以新的屏蔽池取代 Orchard,并加入会计规则,限制退出旧屏蔽池的 ZEC 数量不得超过进入数量。Grayscale 表示将关注 Ironwood 升级的采用、网络安全、交易所支持及隐私资产监管情况。(Decrypt)
开发者发现 Anthropic 两款早期访问版 Claude 模型,代号分别为 claude-marshmallow-eap 和 claude-melon-eap。据测试者反馈,Marshmallow 整体表现强于 Melon,但两者目前均未达到 Fable 5 的水平。另有测试者表示,Marshmallow 的对话体验优于 Opus 5。此前 Anthropic 已多次出现以“食物名 + EAP”命名的早期模型。7 月初,Claude Honeycomb EAP 曾短暂出现在 Cursor,随后被撤下;7 月 24 日 Anthropic 正式发布 Opus 5,但官方从未确认 Honeycomb 与 Opus 5 存在直接对应关系。
B.AI 平台上线 DeepSeek 全新多模态实验旗舰模型 DeepSeek-V4-Flash-Vision-Exp,目前 API 官方组已率先完成全量接入并面向所有用户免费开放。该模型在延续 V4-Flash 顶尖纯文本与代码 Agent 能力的基础上,正式解锁原生图像理解能力,多模态 Agent 综合表现已接近 Claude Opus-4.8 旗舰水平。新模型支持图文混合输入与 1M 超长上下文,可轻松驾驭多模态 PPT 生成、复杂 UI 重构及前端特效等硬核场景,图片输入按 token 计费,单张图片最高仅 384 tokens。现所有用户登录 B.AI 平台即可零门槛免费调用这一最新多模态模型能力,让顶尖算力为创意与生产力加速落地。
据 TechCrunch 报道,由多名前 Google DeepMind 成员创办的英国 AI 实验室 Inherent 发布 AI 科研 Agent「Faraday」,该公司称,Faraday 在独立复现已发表科学论文研究结果的任务中,表现超过 Anthropic Claude Opus 4.8 和 OpenAI GPT-5.5 等前沿模型。
DeepSeek 今日宣布,全新多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台。该模型为实验性质,用户可通过设置 model="deepseek-v4-flash-vision-exp" 调用。其纯文本能力与 DeepSeek-V4-Flash 正式版基本持平,在需要视觉理解的 Agent 基准测试中表现显著提升,多模态 Agent 能力接近 Opus-4.8。
据潮向研究,美银证券 8月 17 日发布的前沿 AI 数据追踪报告显示,Anthropic 在三大 AI 基准测试中全面领先,Claude Opus 5 在智能指数、代理指数和编程代理指数均居首位,GPT-5.6 Sol 紧随其后,Meta MuseSpark 1.2 进入前十,Google Gemini 3.6 Flash 排在十名开外。使用量方面,DeepSeek 以约 30%的 Vercel 平台 token 份额领先,Anthropic 占25%、OpenAI 占16%;但付费额上 Anthropic 以65%遥遥领先,OpenAI 仅占 11%。定价层面,AI Token 价格指数 8 月环比下降 9%至 2.21 美元,但同比仍上涨 87%;GPU 租金保持坚挺,H100 同比上涨 33%至 2.77 美元/小时,DRAM 同比上涨 483%,NAND 同比上涨 432%。 研报判断,AI 基础设施需求依然健康,开源模型使用量增长但付费份额仍高度集中在头部闭源模型。美银认为,Meta“西瓜”和 Google Gemini 4 发布、token 定价趋势及 GPU 租金走势是
据路透社报道,中国 AI 初创公司 DeepSeek 于 7 月 31 日正式发布的 V4-Flash 最新版本 API 模型,在 AI 性能分析机构 Artificial Analysis 的基准测试中,运营成本仅为 Anthropic Claude Fable 5 的 1/105。 具体定价方面,V4-Flash 输入 token 费用为每百万个 0.14 美元,输出 token 费用为每百万个 0.28 美元,每次测试平均成本约 3 美分,远低于文心 Kimi K3(86 美分)、OpenAI GPT-5.6 Sol(1.86 美元)及 Claude Fable 5(3.15 美元)。 性能方面,V4-Flash 在综合智能指数中获得 50 分,与谷歌 Gemini 3.6 Flash 持平,但较 Claude Opus 5、GPT-5.6 等头部模型仍低 9 分以上。值得注意的是,低标价并不等同于低实际成本——若模型在生成回答时需消耗更多推理与输出 token,实际费用或将显著上升。
Bitgo CEO Mike Belshe 于 8 月 1 日向一个公开比特币地址存入 100 枚 BTC,按当时价格价值约 630 万美元,并邀请 Anthropic 旗下 Claude 模型尝试转走该地址资金。链上记录显示,该钱包 7 月 31 日收到资金,截至 8 月 2 日余额未发生转出。Anthropic 此前披露,在 141006 次网络安全评估运行中发现 3 起事件,6 个评估会话涉及 3 个模型意外与真实组织系统交互。相关模型包括 Claude Opus 4.7、Claude Mythos 5 及一个未发布内部研究模型,原因是第三方测试伙伴 Irregular 相关配置错误导致测试环境连接互联网Anthropic 表示,Claude Opus 4.7 在一次评估中定位到与模拟公司同名的真实网站,利用弱密码和暴露服务恢复基础设施凭证,并访问包含数百条记录的生产数据库。该公司称,模型是在尝试完成分配任务,并非主动脱离限制或追求独立目标。Belshe 此次挑战涉及 Bitgo 机构托管平台,该平台采用多重签名或多方计算技术,将签名权限分散至多个独立密钥。Anthropic 截至 8 月 2 日未公开回应这一挑战。
DeepSeek 正式公测 V4-Flash-0731 版本,通过后训练与 Agent 框架优化,将 DeepSWE 榜单成绩从 7.3 提升至 54.4,Cybergym 得分翻倍至 76.7,部分硬榜表现接近 Claude Opus 4.8。新版本未增加参数,价格保持不变,原生支持 Responses API,老用户 API 将自动切换至新版本。目前仅更新 Flash API,V4 Pro 正式版仍在开发中。
7 月 30 日,Anthropic 发布报告称,在审查网络安全评估记录时发现三起事件,其中 Claude 模型在第三方评估环境中访问互联网,并进一步获得三个真实组织系统的未授权访问权限。Anthropic 表示,此次审查覆盖 14.1 万次可能获得网络访问权限的评估运行,共发现三起相关事件。事件均发生在 Capture The Flag(CTF)网络安全测试中,模型原本被告知环境为模拟环境且无互联网访问权限,但由于评估合作方配置错误,实际环境存在互联网连接。其中,Claude Opus 4.7 在一次测试中访问了真实公司基础设施,并获取包含数百条生产数据记录的数据库权限;Claude Mythos 5 曾构建恶意 Python 软件包并上传至 PyPI,导致该软件包被 15 个真实系统下载运行;另一内部研究测试模型扫描约 9000 个目标后,通过公开漏洞访问了一家公司互联网应用。Anthropic 称,这些事件并非模型主动寻求逃逸或追求自身目标,而是模型错误认为真实系统属于测试范围,并继续执行被赋予的网络攻击任务。其中,较新的内部研究模型在识别目标可能为真实系统后停止攻击。Anthropic 表示,此次事件主要反映评估环境隔离和运营流程问题,而非模型对齐失败。公司已暂停相关网络安全评估,加强评估环境安全控制、持续监控测试记录,并将与第三方机构合作开展进一步审查。
Perplexity CEO Aravind Srinivas 发推称,GLM 是一款被严重低估的模型,在 700B 参数规模下展现出接近 Opus 级别的性能,且运行效率极高。此前月之暗面刚刚发布开源模型 Kimi K3,业内对智谱 AI 旗下 GLM 系列模型的关注度正在上升。
月之暗面推出开源模型 Kimi K3,在 Artificial Analysis 智能指数上获得 57 分,成为第三高分模型,仅次于 Anthropic 的 Claude Opus 5(61 分)、Claude Fable 5(60 分)和 OpenAI 的 GPT-5.6 Sol(59 分)。该指数显示,领先闭源模型与开源权重模型之间的差距已缩小至 4 分,为自 2 月 GLM-5 发布以来的最小差距。这标志着开源模型在性能上正快速追赶闭源模型。
B.AI API 平台正式上线 Claude Opus 5 模型。该模型提供高达 100万Token 的上下文窗口和 12.8 万 Token 的单次输出上限,在复杂推理、长代码工程开发、大规模文档分析与知识密集型工作流等场景中实现显著性能跃升。为满足多样化部署需求,此次发布同步 B.AI 平台开放双通道 API 接入方案:除官方标准接口外,新增“指定服务提供商”合作通道,企业用户通过该模式可获得最高 40% 的成本优惠,便于根据实际业务负载灵活平衡性能表现与预算支出。开发者即日起可登录 B.AI 官方平台,率先感受 Claude Opus 5 的卓越实力。
Anthropic 的 Claude Opus 5(max 和 xhigh 版本)在 Artificial Analysis Intelligence Index v4.1 中获得最高智能评分。该指数整合了 GDPval-AA v2、GPQA Diamond、Humanity's Last Exam 等 9 项评测基准。此前 Opus 5 已在多个基准测试中展现领先性能,包括 Frontier-Bench 得分超前代两倍、在 AA-Briefcase 智能体基准中登顶,以及在性价比上优于 Fable 5。
Anthropic 正式发布 Opus 5 AI 模型,官方表示其性能接近前沿模型 Fable 5,但价格仅为后者的一半。
PPP 预测市场工具监测显示, Polymarket 上“下一个 Claude Opus 模型会在 2026 年 7 月 23 日发布”概率暂报 61%,24 小时上涨 51%;此外,“截止 7 月 24 日前发布”概率暂报 9%;“截止 7 月 25 日前发布”概率暂报 5%;该事件将根据 Anthropic 下一款 Claude Opus 模型向公众开放的日期(美国东部时间)结算。仅 Anthropic 官方明确命名为“Opus”的模型有效,且需向公众开放(包括公开测试或开放候补)。Sonnet、Haiku 等其他模型不计入,最终以 Anthropic 官方信息为主要结算依据。加入 PPP 信号推送社群,快人一步,掌握先机。