澎湃新闻记者 秦盛
AI安全问题日益受到关注,OpenAI正调整其模型安全问题的披露机制。
当地时间9月16日,人工智能巨头OpenAI发布一套用于跟踪、调查和公开模型目标偏离(misalignment,也称“对齐失效”)事件的新框架,并同步公布过去半年观察到的六份案例报告,相关行为涉及信息真实性、用户授权、文件共享和监督约束等方面。
此次调整的重点是将以往较为临时、集中式的披露转向持续报告。OpenAI表示,过去往往等到能够汇总多个案例,或随新模型的系统卡一并发布时才公开相关发现。新框架旨在加快披露进度,即使尚未完全解释相关行为,或尚未找到完整的缓解方案,也可以先行发布报告。
OpenAI的博客截图
评论交流
0