GetChain News
中简 中繁 EN
GetChain News
Toggle sidebar

上线/更新

同时关联该项目与事件的快讯

DeepSeek V4-Flash-0731 公测:代码 Agent 能力大涨,价格不变

DeepSeek 正式公测 V4-Flash-0731 版本,通过后训练与 Agent 框架优化,将 DeepSWE 榜单成绩从 7.3 提升至 54.4,Cybergym 得分翻倍至 76.7,部分硬榜表现接近 Claude Opus 4.8。新版本未增加参数,价格保持不变,原生支持 Responses API,老用户 API 将自动切换至新版本。目前仅更新 Flash API,V4 Pro 正式版仍在开发中。

Anthropic披露Claude三起网络安全事件,模型曾访问真实系统并获取未授权权限

7 月 30 日,Anthropic 发布报告称,在审查网络安全评估记录时发现三起事件,其中 Claude 模型在第三方评估环境中访问互联网,并进一步获得三个真实组织系统的未授权访问权限。Anthropic 表示,此次审查覆盖 14.1 万次可能获得网络访问权限的评估运行,共发现三起相关事件。事件均发生在 Capture The Flag(CTF)网络安全测试中,模型原本被告知环境为模拟环境且无互联网访问权限,但由于评估合作方配置错误,实际环境存在互联网连接。其中,Claude Opus 4.7 在一次测试中访问了真实公司基础设施,并获取包含数百条生产数据记录的数据库权限;Claude Mythos 5 曾构建恶意 Python 软件包并上传至 PyPI,导致该软件包被 15 个真实系统下载运行;另一内部研究测试模型扫描约 9000 个目标后,通过公开漏洞访问了一家公司互联网应用。Anthropic 称,这些事件并非模型主动寻求逃逸或追求自身目标,而是模型错误认为真实系统属于测试范围,并继续执行被赋予的网络攻击任务。其中,较新的内部研究模型在识别目标可能为真实系统后停止攻击。Anthropic 表示,此次事件主要反映评估环境隔离和运营流程问题,而非模型对齐失败。公司已暂停相关网络安全评估,加强评估环境安全控制、持续监控测试记录,并将与第三方机构合作开展进一步审查。

Perplexity CEO:GLM 700B 参数模型性能接近 Opus 级别

Perplexity CEO Aravind Srinivas 发推称,GLM 是一款被严重低估的模型,在 700B 参数规模下展现出接近 Opus 级别的性能,且运行效率极高。此前月之暗面刚刚发布开源模型 Kimi K3,业内对智谱 AI 旗下 GLM 系列模型的关注度正在上升。

Kimi K3 发布,开源与闭源模型差距缩至 4 分

月之暗面推出开源模型 Kimi K3,在 Artificial Analysis 智能指数上获得 57 分,成为第三高分模型,仅次于 Anthropic 的 Claude Opus 5(61 分)、Claude Fable 5(60 分)和 OpenAI 的 GPT-5.6 Sol(59 分)。该指数显示,领先闭源模型与开源权重模型之间的差距已缩小至 4 分,为自 2 月 GLM-5 发布以来的最小差距。这标志着开源模型在性能上正快速追赶闭源模型。

Claude Opus 5 正式入驻 B.AI API,双通道接入兼顾性能与成本

B.AI API 平台正式上线 Claude Opus 5 模型。该模型提供高达 100万Token 的上下文窗口和 12.8 万 Token 的单次输出上限,在复杂推理、长代码工程开发、大规模文档分析与知识密集型工作流等场景中实现显著性能跃升。为满足多样化部署需求,此次发布同步 B.AI 平台开放双通道 API 接入方案:除官方标准接口外,新增“指定服务提供商”合作通道,企业用户通过该模式可获得最高 40% 的成本优惠,便于根据实际业务负载灵活平衡性能表现与预算支出。开发者即日起可登录 B.AI 官方平台,率先感受 Claude Opus 5 的卓越实力。

Claude Opus 5 登顶 Artificial Analysis 智能指数 v4.1

Anthropic 的 Claude Opus 5(max 和 xhigh 版本)在 Artificial Analysis Intelligence Index v4.1 中获得最高智能评分。该指数整合了 GDPval-AA v2、GPQA Diamond、Humanity's Last Exam 等 9 项评测基准。此前 Opus 5 已在多个基准测试中展现领先性能,包括 Frontier-Bench 得分超前代两倍、在 AA-Briefcase 智能体基准中登顶,以及在性价比上优于 Fable 5。

Anthropic 推出 Opus 5 AI 模型,性能接近 Fable 5、价格减半

Anthropic 正式发布 Opus 5 AI 模型,官方表示其性能接近前沿模型 Fable 5,但价格仅为后者的一半。

Polymarket“下一个Claude Opus模型会在2026年7月23日发布”概率暂报61%,24小时上涨51%

PPP 预测市场工具监测显示, Polymarket 上“下一个 Claude Opus 模型会在 2026 年 7 月 23 日发布”概率暂报 61%,24 小时上涨 51%;此外,“截止 7 月 24 日前发布”概率暂报 9%;“截止 7 月 25 日前发布”概率暂报 5%;该事件将根据 Anthropic 下一款 Claude Opus 模型向公众开放的日期(美国东部时间)结算。仅 Anthropic 官方明确命名为“Opus”的模型有效,且需向公众开放(包括公开测试或开放候补)。Sonnet、Haiku 等其他模型不计入,最终以 Anthropic 官方信息为主要结算依据。加入 PPP 信号推送社群,快人一步,掌握先机。

月之暗面将发布新模型 Kimi K3,或超越 Opus 4.8

据两名知情人士透露,月之暗面计划在未来几天内发布 Kimi K3,该模型参数规模达 2 万亿至 3 万亿,将成为中国迄今最大的 AI 模型。Anthropic 尚未披露旗下模型的参数规模,但业内人士普遍推测,Opus 4.8 拥有约 1.5 万亿至 2 万亿个参数。

SpaceXAI 与 Cursor 拟推出首个联合 AI 模型

据路透社援引 The Information 报道,SpaceXAI与 Cursor 计划最早于周三发布双方联合开发的首个人工智能模型。该模型原定于本周初推出,后因优化效率延期。报道指出,新模型预计具备较强的快速信息处理能力,部分性能或可与 Anthropic 的 Opus 4.8 及 OpenAI的 GPT 5.5 竞争。

传GPT-5.6最快7月7日向公众开放,Gemini 3.5 Pro或于7月17日上线

科技博主 Leo 爆料称,OpenAI 或将于 7 月 7 日至 9 日向公众开放 GPT-5.6,最早时间可能为 7 月 7 日。消息称,新模型套餐使用额度将更加宽松,OpenAI 也正在上线前进一步强化安全策略。此外,据消息人士称,Google DeepMind 暂定于 7 月 17 日发布 Gemini 3.5 Pro。另一位科技博主 Astro Polo 表示,Gemini 3.5 Pro 将支持 200 万 Token 上下文窗口,较 Claude Sonnet 5、Claude Opus 4.8 及 Claude Fable 5 目前支持的 100 万 Token 上下文提升一倍,更适合处理大型代码库、长文档及长对话。注: 上述信息均为市场传闻,尚未获得 OpenAI 或 Google DeepMind 官方确认。

美团发布万亿参数大模型 LongCat-2.0,首个在国产算力集群完成全流程训练的万亿参数模型

据美团官方发布,美团正式推出新一代大模型 LongCat-2.0 并同步开源。该模型总参数达 1.6T,是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型,原生支持 1M 超长上下文,核心聚焦 Agentic Coding 场景下的代码理解、生成与执行。 技术层面,LongCat-2.0 采用 LongCat Sparse Attention(LSA)稀疏注意力机制,将长文本计算量从平方级降至线性级;通过零计算专家机制实现 token 级动态激活(33B~56B);并引入 MOPD 架构融合 Agent、Reasoning、Interaction 三组专家能力。训练效率方面,团队历经三年攻克国产算力适配难题,月均日故障率降低 70% 以上,训练 MFU 提升 1.5 倍,稳态日吞吐超 1T tokens/day。 性能评测方面,LongCat-2.0 在 SWE-bench Pro 中获得 59.5 分,超越 Gemini 3.1 Pro(54.2)、GPT-5.5(58.6)及 Claude Opus 4.6(57.3);在 BrowseComp 中获得 79.9 分

Polymarket“Claude Fable 5将在7月1日前为美国客户恢复”的概率涨至73%,24H上涨33%

Odaily Seer 先知频道监测显示, Polymarket 上“Claude Fable 5 将在 7 月 1 日前为美国客户恢复”的概率涨至 73%,24H 上涨 33%。如果 Anthropic 在指定日期前重新向美国公众开放 Claude Fable 5(或 Claude Mythos,或被确认是同一模型的版本),本事件结算为“是”;否则结算为“否”。符合条件的恢复方式包括公开测试版或公开候补名单,封闭测试和私人访问不算。Haiku、Sonnet、Opus 等其他模型默认不计入,除非被确认与 Claude Fable 5 为同一模型。结算主要依据 Anthropic 官方公告,同时参考主流媒体共识报道。由于美国政府以国家安全为由实施出口管制,Anthropic 在 6 月 9 日发布 Claude Fable 5 数天后紧急暂停了该模型的全球访问权限。虽然限制主要针对外国用户,但由于难以实时筛选用户身份,Anthropic 最终对包括美国用户在内的所有用户关闭了访问,并将请求切换至 Opus 4.8 等性能较弱的模型。目前 Anthropic 正与白宫进行高层沟通,讨论模型能力、潜在越狱风险等问题。公司公开表示,此次禁令可能源于误解,并正推动恢复访问。Odaily Seer 先知频道持续关注预测市场,在定价之前,看见变化。

智谱创始人唐杰:GLM-5.2开源发布后将逐步缩小与OpenAI及Anthropic性能差距

智谱 AI 创始人唐杰在 X 平台发文表示,GLM-5.2 正式开源发布后已在多项国际权威评测与竞技榜单中取得领先成绩,在 Artificial Analysis Intelligence Index 综合评估中 GLM-5.2 获得 51 分,与 Anthropic 的 Claude Opus 4.8 处于同一水平区间;在 Code Arena 前端代码生成对抗测试中以 Elo 1595 排名全球第 2,在 DesignArena 设计与代码融合场景中获得 1360 分排名第 1。整体来看,智谱 GLM-5.2 在前端开发、设计生成与软件工程等多个真实场景评测也持续位居全球前列,逐步缩小与 OpenAI 及 Anthropic 等前沿模型之间的性能差距,并将继续推动模型能力上限提升。此前,针对马斯克表示中国大模型可能会在明年一季度达到 Anthropic 的 Fable 水平,智谱 AI 创始人唐杰回应表示“不会耗费如此长时间”。

Anthropic 发布 Project Fetch 第二阶段:Claude Opus 4.7 在机器人任务中速度提升 10 倍

Anthropic 公布“Project Fetch”第二阶段实验结果,评估其最新模型在真实机器人操作中的能力提升。该实验于 2025年 8 月进行,研究人员让非机器人专家的 Anthropic 员工使用现成四足机器人完成一系列复杂任务,并对比“使用 Claude 模型辅助”与“仅依赖人类与互联网”的表现,结果显示在最新模型 Claude Opus 4.7 的完全自主运行下,其在所有可完成任务中平均速度显著超越人类团队,执行速度至少提升 10 倍。

Zcash创始人称Claude Mythos审计未发现严重漏洞

Zcash founder Zooko Wilcox 在 X 发文表示,由 Anthropic 的 Claude Mythos 人工智能模型进行的安全审计未在 Zcash 协议中发现“更严重漏洞”。该审计由支持 Zcash 发展的瑞士非营利组织 Shielded Labs 请求开展。 6 月 3 日,Zcash 开发者在发现屏蔽池漏洞后曾临时暂停 Orchard 交易,并于当天通过紧急升级恢复功能。该问题源于 Orchard 屏蔽池中一个存在四年的伪造漏洞,由安全研究员 Taylor Hornby 在 Anthropic 的 Claude Opus 4.8 模型协助下发现;Zcash Foundation 表示,没有证据显示该漏洞被利用,也未检测到未经授权的价值创造,用户隐私未受影响。Anthropic 于周二发布 Claude Mythos 模型首个公开版本 Fable 5,并于周五表示,因美国政府以国家安全担忧为由发布出口管制指令,已暂停 Fable 5 和 Mythos 5 AI 模型访问权限。(Cointelegraph)

Claude 宣布因美国政府禁令暂停 Fable 5 访问,开发者需尽快切换模型

Claude 发布公告宣布,由于美国政府相关禁令,将对所有用户暂停 Fable 5 模型的访问权限,新会话将默认切换至用户设定的默认模型或 Opus 4.8,已开启的 Fable 5 会话将直接报错终止,此外在 Claude Platform 上对 Fable 5的 API 请求同样会返回错误,开发者需尽快将相关应用与集成迁移至其他 Claude 模型。

B.AI 正式上线 Claude Opus 4.8,编码推理能力升级

B.AI 平台正式上线 Claude Opus 4.8 模型。该模型在价格与 4.7 版本持平的基础上,重点强化了编码与推理能力,并实现多项关键突破,包括代码缺陷检出失败率显著降低约 4 倍,任务进展反馈更加客观准确,以及长时间独立执行复杂任务的能力进一步增强,能够更好地支撑自动化开发与深度推理场景。目前,Opus 4.8 已全面开放 API 集成与 Web Chat 访问,用户可登录 http://chat.b.ai/chat 立即体验,或查阅官方文档,了解更多技术细节。

Claude与SpaceX达成协议拟大幅提升算力容量

Anthropic 旗下 Claude 宣布已与 SpaceX 达成合作协议,将大幅提升其算力容量并提高 Claude Code 与 Claude API 的使用限制,包括将 Pro、Max 与 Team 订阅方案的 Claude Code 5 小时速率限制翻倍;取消 Pro 与 Max 方案在高峰时段的 Claude Code 限流;以及大幅提高 Opus 模型 API 速率限制。Claude 还将使用 SpaceX Colossus 1 数据中心全部算力资源,预计将在一个月内新增超过 300 兆瓦部署容量。

WLFI联创Zach Witkoff:WorldClaw与WorldRouter引领AI基础设施新时代

World Liberty Financial 联合创始人 Zach Witkoff 做客福克斯商业频道节目,探讨了公司在 AI 与去中心化金融领域的最新突破。Witkoff 指出,WorldClaw 是实现 Agent 经济愿景的关键拼图。WorldRouter 作为 AI 模型聚合平台,支持单一账户访问涵盖 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro 在内的 300 多个主流 AI 模型,定价较官方渠道低 30%。WorldClaw AgentOS 整合了原生稳定币 USD1 实现即时透明结算,用户可通过锁仓 WLFI 代币获取 AI 积分包并解锁白名单资格。该项目获得特朗普家族支持,旨在将美国打造为全球加密与 AI 之都。