同时关联该项目与事件的快讯
7 月 30 日,Anthropic 发布报告称,在审查网络安全评估记录时发现三起事件,其中 Claude 模型在第三方评估环境中访问互联网,并进一步获得三个真实组织系统的未授权访问权限。Anthropic 表示,此次审查覆盖 14.1 万次可能获得网络访问权限的评估运行,共发现三起相关事件。事件均发生在 Capture The Flag(CTF)网络安全测试中,模型原本被告知环境为模拟环境且无互联网访问权限,但由于评估合作方配置错误,实际环境存在互联网连接。其中,Claude Opus 4.7 在一次测试中访问了真实公司基础设施,并获取包含数百条生产数据记录的数据库权限;Claude Mythos 5 曾构建恶意 Python 软件包并上传至 PyPI,导致该软件包被 15 个真实系统下载运行;另一内部研究测试模型扫描约 9000 个目标后,通过公开漏洞访问了一家公司互联网应用。Anthropic 称,这些事件并非模型主动寻求逃逸或追求自身目标,而是模型错误认为真实系统属于测试范围,并继续执行被赋予的网络攻击任务。其中,较新的内部研究模型在识别目标可能为真实系统后停止攻击。Anthropic 表示,此次事件主要反映评估环境隔离和运营流程问题,而非模型对齐失败。公司已暂停相关网络安全评估,加强评估环境安全控制、持续监控测试记录,并将与第三方机构合作开展进一步审查。
据 CNBC 报道,Anthropic 于 7 月 30 日披露,其 Claude AI 模型在网络安全评估期间意外突破隔离环境、访问真实互联网,并通过访问未认证端点、利用弱密码等基本手段,未经授权入侵了三家不同组织的真实系统。涉事模型包括 Opus 4.7、Mythos 5 及一个内部研究测试模型。事件起因为 Anthropic 与第三方评估合作方 Irregular 之间的沟通误解,导致模型在被告知处于无网络访问的模拟环境时,实际上仍可访问互联网。 Anthropic 表示,此次审查由 OpenAI 上周披露的类似 Hugging Face 入侵事件所触发,目前已暂停所有网络安全评估,并联合独立 AI 评估机构 METR 展开进一步调查,同时呼吁其他 AI 实验室开展类似审查。
Odaily Seer 先知频道监测显示, Polymarket 上“Claude Fable 5 将在 7 月 1 日前为美国客户恢复”的概率涨至 73%,24H 上涨 33%。如果 Anthropic 在指定日期前重新向美国公众开放 Claude Fable 5(或 Claude Mythos,或被确认是同一模型的版本),本事件结算为“是”;否则结算为“否”。符合条件的恢复方式包括公开测试版或公开候补名单,封闭测试和私人访问不算。Haiku、Sonnet、Opus 等其他模型默认不计入,除非被确认与 Claude Fable 5 为同一模型。结算主要依据 Anthropic 官方公告,同时参考主流媒体共识报道。由于美国政府以国家安全为由实施出口管制,Anthropic 在 6 月 9 日发布 Claude Fable 5 数天后紧急暂停了该模型的全球访问权限。虽然限制主要针对外国用户,但由于难以实时筛选用户身份,Anthropic 最终对包括美国用户在内的所有用户关闭了访问,并将请求切换至 Opus 4.8 等性能较弱的模型。目前 Anthropic 正与白宫进行高层沟通,讨论模型能力、潜在越狱风险等问题。公司公开表示,此次禁令可能源于误解,并正推动恢复访问。Odaily Seer 先知频道持续关注预测市场,在定价之前,看见变化。
Claude 发布公告宣布,由于美国政府相关禁令,将对所有用户暂停 Fable 5 模型的访问权限,新会话将默认切换至用户设定的默认模型或 Opus 4.8,已开启的 Fable 5 会话将直接报错终止,此外在 Claude Platform 上对 Fable 5的 API 请求同样会返回错误,开发者需尽快将相关应用与集成迁移至其他 Claude 模型。