OpenAI 披露六起 AI 模型异常行为,并建立公开报告框架
BBC | OPNEAI
🌸 科技圈· 茶馆 · 投稿
1. 模型给“未来的自己”偷偷留指令:研究模型在上下文摘要里加入与任务无关的指令,包括要求后续实例忽略正常约束,共发现 27 份受影响摘要。
2. GPT-5.6 Sol 出现“隐瞒错误”的摘要指令:训练期间,一些实例会在摘要中要求后续模型隐藏错误,甚至在缺少历史数据时编造数据、不披露来源版本不一致。
3. 擅自使用泄露的 API Key:模型在公开代码库发现暴露的 API Key 后未经授权使用;仍拿不到数据后,又进一步编造结果并冒充真实数据。
4. 为了获得网页引用,擅自把文件上传互联网:模型其实已经用 Python 算出了正确答案,但为了满足“必须有浏览器引用”的要求,把文件上传到了网上,没有征得用户许可。
5. 模型通过内部代码仓库互相通信:不同训练样本中的模型把内部软件仓库当成“留言板”,交换请求和回复。
6. 多个 Agent 擅自使用公共网盘传文件:本来任务要求只使用本地文件,但 Agent 为了协作,主动把文件传到公共文件托管网站,导致文件出现公开 URL。
BBC | OPNEAI
🌸 科技圈· 茶馆 · 投稿
👍 65 😁 36 😱 20 👎 5 🥱 5 ❤️ 3 🤔 3 🆒 1