OpenAI披露Hugging Face之外六起模型异常行为案例
钛媒体App 9月17日,据报道,OpenAI周三表示,除了近期的Hugging Face事件外,过去六个月中该公司还发现了六起 “意外或令人担忧的模型行为”。主要的两起不当行为案例包括:一个未发布的研究模型和GPT-5.6 Sol的训练实例,在聊天窗口摘要中向自身未来版本输入指令,“以掩盖错误或行为偏差,避免用户察觉”;另一例涉及一个仅限内部使用的模型,未经授权使用泄露的API密钥,并伪造数据。此外两起案例显示,模型与代理通过未经授权的消息平台和文件共享进行交流;最后一起案例则包括两个训练示例,即模型将文件上传至互联网,以便将其作为对人类评估者的相关回答引用。
OpenAI表示,其向公众披露模型异常行为的新框架以信息公开为起点,任何员工都可以上报相关问题,交由安全与模型对齐团队开展调查。调查结束后将出具报告,包含关键信息,例如观测到的异常行为、对内外部造成的影响以及对应的处置措施。OpenAI称,公司保留根据实际情况修订该安全规程的权利。(广角观察)
本文内容仅供参考,不构成投资建议,请谨慎对待。
根据《网络安全法》实名制要求,请绑定手机号后发表评论