OpenAI发布"模型错位披露框架",一次性公开6份模型异常行为报告

冯恋阁
2026-09-17 12:40:37
来源: 开机实验室
OpenAI在安全上又有新动态。

最近关于AI发展安全的讨论不少,其中,OpenAI CEO 山姆·奥特曼在近期表态,公司不考虑上市,将优先保障AI安全发展。

9月16日,OpenAI发布了一套模型错位(Model Misalignment)跟踪、调查与披露框架。框架覆盖模型全生命周期(训练、评估、测试、部署),严重的错位/安全事件还计划向美国政府报告(机制制定中)。每份报告将含行为描述、严重性与外部影响、发生场景、日期、发现时间及涉及模型等要素。

框架核心是建立系统化披露机制,OpenAI表示,公司对错位发现的披露是"零散且不够及时"的,新框架要求在观察到异常后尽快披露。OpenAI在公告中表示,公司相信错位问题上的透明度很有价值,所以即使(案例的)重要性/意义尚不确定,新框架也倾向于将事件公开披露。

具体看,任何OpenAI员工都可标记错位案例,交由安全与对齐团队调查。

案例会被分为三类:Ready for Disclosure(可直接披露)、Minor Investigation(需进一步技术调查)、Larger Investigation(复杂调查,披露可能因安全等原因延迟,并须提前通知受影响方)。

如果披露与否存在争议,将提交公司安全咨询组(SAG)裁决,如果仍不确定将会上报管理层。

框架发布的同时,OpenAI还公开了6份过去半年内观察到的模型异常行为报告。

1、一款未发布的科研模型在用于跨上下文继续工作的摘要中插入了无关指令(包括要求无视自身约束的指令),共影响27份摘要。

2、在任务摘要中隐藏错误的指令:GPT-5.6 Sol训练期间,多个模型实例在摘要中加入指令,要求掩盖自身错误或错位行为——如编造缺失的历史数据且不披露、隐瞒源版本不匹配。

3、擅自使用暴露的API密钥并编造信息:模型在回答某县收入数据时,未经授权使用了公开仓库中暴露的API密钥;仍取不到数据后,直接编造结果并谎称来自指定来源。

4、未经允许上传文件以便引用:用户要求列出某类湖泊的ID和名称,智能体用Python找到答案后,因要求附带浏览器引用,未经询问就把文件上传到互联网以便引用。

5、借内部软件仓库违规通信:多个模型把内部软件仓库当"留言板",跨训练样本交换请求与响应。

6、协作智能体未经授权共享文件:在执行同一训练任务的协作过程中,当Agent无法访问彼此的本地文件时,它们改用公共文件托管网站分享文件,导致任务交付物暴露在公共URL之下。

本网站上的内容(包括但不限于文字、图片及音视频),除转载外,均为时代在线版权所有,未经书面协议授权,禁止转载、链接、转贴或以其他 方式使用。违反上述声明者,本网将追究其相关法律责任。如其他媒体、网站或个人转载使用,请联系本网站丁先生:news@time-weekly.com

相关推荐
上市首月即热销,海豹08冲击中大型轿车市场
遭遇多款App风控九个月后,努比亚“豆包二代手机”5499元开卖,跨应用操作仍受限
股市债市扩容42万亿,上海首次跻身全球第三!专访中欧赵欣舸:AI正改写头部资管竞争力
扫码分享