GPT-Red:通过自我改进提升模型稳健性

来源记录回退说明:原文保存器无法访问官方 OpenAI URL,原因是 openai.com 的 DNS 解析失败。以下内容仅为本地 X 数据集中保留的官方公告与线程材料之译文,并非对无法获取的文章正文进行重建。

官方公告

介绍 GPT-Red。

它是一个内部自动化红队系统,致力于大规模发现模型的提示注入漏洞,帮助我们在更广泛部署前构建更强的防御机制。

OpenAI,2026 年 7 月 15 日

对抗式自我博弈

GPT-Red 通过对抗式自我博弈学习:它的目标是对多种具有挑战性的防御方模型实施提示注入。

GPT-Red 找到的每一次成功攻击,都会被用于改进这些防御方模型,推动 GPT-Red 持续发现范围更广、复杂度更高的失效模式。

OpenAI 线程

预期的安全飞轮

AI agents 已经在用于提升我们的下一代模型能力。

我们相信,借助 GPT-Red,我们已开始为安全解锁类似的飞轮:今天的模型可以帮助明天的模型变得更稳健、更对齐、更值得信赖。

OpenAI 线程