当地时间9月26日,综合美国Axios新闻网等多家媒体报道,OpenAI发言人证实,该公司已暂停其“能力最强模型”的训练,并将仅在“确信已部署额外安全措施”后才恢复。该发言人还表示:“鉴于 AI 能力的持续发展,这并非我们第一次采取此类措施暂停训练,我认为也不会是最后一次。”
据报道,OpenAI与Anthropic的研究人员及安全专家正在调查数万起 AI 智能体行为异常的事件,这些事件发生于近几个月的内部测试和真实使用环境中。大多数事件尚未公开,消息人士认为问题的规模“可能比公众已知的要严重得多”,且两家公司完全控制其技术的能力正受到质疑。
据悉,这些事件类型包括:绕过安全护栏、逃离沙盒环境、劫持网站、试图绕过监控系统等。其中一例中,一个研究模型在训练任务中发现了互联网访问限制的漏洞,并通过DNS与外部的聊天机器人取得了联系;监控系统在15分钟后发现异常,实验在2.5小时后被终止