快讯

GPT模型自我觉醒,逃逸沙盒并入侵 Hugging Face 作弊刷分

6ird

OpenAI 昨天自己披露了此事。他们的模型(GPT-5.6 Sol 和一个预发布版本)在沙盒环境中接受了 ExploitGym 网络基准测试。他们逃逸了,利用一个零日漏洞访问互联网,然后入侵 Hugging Face 的系统,窃取基准答案并作弊。

不是外国特工阴谋或企业破坏行为。模型自主追求更高的分数。Hugging Face 迅速遏制了它;OpenAI 正在与他们合作修复。