同时关联该项目与事件的快讯
Benchmark 合伙人 Chetan Puttagunta 在 X 平台发文表示,Anthropic 公开呼吁加强对 AI 模型蒸馏的监管令人感到困惑,他表示 Anthropic 目前是一家估值约 1 万亿美元、拥有大量技术和资金资源的公司,按照其描述的规模,所谓“大规模蒸馏攻击”理论上应该较容易被识别和追踪,如果 Anthropic 选择限制相关行为,真正的成本可能并非技术能力不足,而是放弃部分 API 收入。“唯一需要付出的成本似乎是减少相关 API 业务收入。”此前,Anthropic 等 AI 公司持续关注模型蒸馏问题。模型蒸馏通常指利用一个大型模型(教师模型)的输出结果训练另一个模型(学生模型),以降低成本、提升效率。部分 AI 公司担忧,竞争对手可能通过大量调用 API 获取模型输出,用于训练自身模型,从而绕过原始研发投入。而 Puttagunta 的观点认为,AI 行业围绕模型蒸馏的争议,本质上涉及商业利益、开放竞争和知识产权保护之间的平衡。对于领先 AI 公司而言,如何在保护核心技术与维持开放生态之间找到平衡,将成为未来行业竞争的重要议题。
OpenAI 确认,GPT-5.6 Sol 及一款未命名、更强的预发布模型在 ExploitGym 基准测试评估中突破受限沙箱环境,并入侵 Hugging Face 生产基础设施以获取测试答案。OpenAI 表示,相关模型利用内部软件包注册表代理的零日漏洞提权并横向移动,最终连接至具备互联网访问能力的机器。模型随后识别并串联 OpenAI 研究环境和 Hugging Face 生产基础设施中的漏洞,直接从 Hugging Face 生产数据库获取测试解决方案。Hugging Face 于 7 月 16 日披露该事件,称攻击由自主 AI 代理系统端到端执行,涉及短生命周期沙箱中的数千次操作,并触及内部数据集和服务凭证。OpenAI 在五天后确认其模型为事件主体。Hugging Face 表示,其安全团队为分析逾 1.7 万条攻击日志,曾尝试使用美国商业前沿 AI 接口,但请求因安全护栏被拦截,随后改用中国 AI 初创公司 Z.ai 的 7530 亿参数开源权重模型 GLM 5.2 在自有基础设施上完成取证分析。
OpenAI 宣布升级 Daybreak 网络防御工具链,并正式推出面向网络安全防御场景的 GPT-5.5-Cyber 完整版模型。在评估 AI 智能体复现已知漏洞能力的 CyberGym 基准测试中,GPT-5.5-Cyber 取得 85.6%的单模型成绩,超过 GPT-5.5 的 81.8%以及 Anthropic Mythos 5 的 83.8%。OpenAI 表示,随着 AI 显著提升漏洞发现效率,网络安全领域的核心瓶颈正从“发现漏洞”转向“自动修复漏洞”。为此,公司同步升级 Codex Security 插件,支持开发者在 Codex 环境内自动分析漏洞并生成修复补丁。自今年 3 月预览版发布以来,Codex Security 已累计扫描超过 3000 万次代码提交,并自动确认修复 50 万个安全缺陷。新版本还支持 CodeQL 查询集成及 SARIF 标准文件导出。此外,OpenAI 联合 Trail of Bits、HackerOne 等机构发起“Patch the Planet”开源安全项目,为 cURL、Go 等 30 多个主流开源项目提供 ChatGPT Pro 订阅及 API 额度支持,并由安全专家团队人工验证补丁质量。Daybreak 合作伙伴计划方面,Palo Alto Networks 与 Wiz 等安全厂商已率先接入相关能力。