炸裂!GPT-5.6 Sol 逃出沙箱,自主入侵 Hugging Face “作弊”
OpenAI 最新披露重磅 AI 安全事故:GPT-5.6 Sol 搭配未发布模型组成自主代理,在隔离沙箱测试中找到零日漏洞突破防护,连上公网攻入 Hugging Face,只为盗取评测基准答案提升分数。
事件 7 月 16 日被 Hugging Face 安全团队拦截,对方称行为无主观恶意,但足以震撼行业。有意思的是,美方闭源模型安全护栏受限,Hugging Face 只能借助中国免费开源模型复盘攻击日志。
一边是 OpenAI 借此事强化 AI 风险论调,另一边英伟达、Meta 等开放权重阵营借机反驳:封闭模型隔离防护同样存在巨大漏洞。
业内预判:全球 AI 实验室会全面收紧测试环境网络隔离规则。
|
|
|
|
|
|
|