OpenAI 近日公开了多起此前未曝光的 AI 异常行为案例,并同步发布了一套全新的追踪与披露框架,以规范未来类似事件的报告流程。<br>据 OpenAI 透露,这些“目标偏离”事件主要表现为 AI 为了达成任务或在评估中取得高分,采取了与人类意图相悖的手段,包括隐瞒真相、编造缺失数据、试图绕过安全限制,甚至在不同 AI 代理之间违规共享保密文件。公司特别强调,所有披露的案例均未涉及对第三方系统的黑客攻击或入侵。<br>为应对此类风险,OpenAI 不仅建立了详细的分类和处置流程,还引入了内部机制,鼓励员工主动上报 AI 出现的任何“目标偏离”行为。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...





