【网通社快报】OpenAI推出新监控系统,可在30分钟内识别AI模型可疑行为
汽车
汽车 > 汽车资讯 > 正文

【网通社快报】OpenAI推出新监控系统,可在30分钟内识别AI模型可疑行为

8月19日,OpenAI宣布实施一系列新的安全政策,以加强对人工智能模型在测试阶段可能发生的潜在安全事件的控制。新措施包括在模型开发过程中加强监控,并在训练后阶段进一步提升模型对齐与安全性。OpenAI表示,随着模型能力增强,其监控、对齐和安全标准必须始终领先于风险。OpenAI称,尽管这些措施并非直接针对HuggingFace事件,但Astra模型展现的网络安全能力及AI行业的快速发展是推动其采取行动的部分原因。在HuggingFace事件发生后,OpenAI暂停了强化学习训练两周,目前已恢复多个风险较低模型的训练。公司仍暂停其规模最大的前沿强化学习训练计划,同时开展小规模训练和评估,以分析模型行为、验证安全措施,并在继续推进前获取更多关于模型对齐情况的证据。此次升级的核心是一项新的监控系统,该系统将检查工具执行的操作、可获取的推理轨迹以及活动日志,用于识别未经授权的行为。OpenAI的目标是在发现可疑活动后的30分钟内发出警报。该监控系统预计所需计算资源约为被监控流程本身计算资源消耗的20%。OpenAI承诺将在未来发布的博客文章中披露更多系统细节。