利用真实对话上下文,在模型发布前更准确地估计其不理想行为。

阅读论文

引言

在发布新模型之前,研究机构不仅需要了解模型“能做什么”,还要判断它在真实世界中“可能会如何表现”,以及它可能带来哪些新风险。随着模型能力不断增强,这一点也变得愈发重要。作为 OpenAI 部署前安全审查的一部分,团队会使用定向评测、red-teaming 和其他检查方式来理解模型行为。

OpenAI 表示,他们现在开始在模型真正上线前使用一种“模拟部署”的方法,作为补充信号:在候选模型触达用户之前,先获得一份接近真实部署环境的行为预览。

Deployment Simulation 会以保护隐私的方式,使用新的候选模型重放既往对话。这让研究人员能够在发布前、在贴近真实的上下文中观察新模型会如何回应,包括是否会出现新的不理想行为,以及这些行为可能出现得有多频繁。

OpenAI 表示,在多次 GPT-5 系列 Thinking 模型部署中,Deployment Simulation 提升了对不理想模型行为发生率的估计精度,在发布前发现了新的 misalignment 形式,并降低了模型意识到自己正在接受测试的风险。公司还将这一方法应用到更具挑战性的 agentic rollout,说明它不仅适用于标准聊天场景,也能扩展到包含工具使用的更复杂 agent 环境中,同时还能用于内部模型部署前的风险评估。

OpenAI 表示,他们已经在模型开发过程中利用 Deployment Simulation 带来的洞察,识别传统评测中的盲点,并为缓解措施和部署决策提供依据。随着这条流程变得更易运行,公司预计它将在未来模型开发中发挥更大作用。

Deployment Simulation 如何工作

行业内常见的部署前评测,通常由一组刻意挑选出来的合成、人工编写或来自生产环境的 prompts 组成。这些 prompts 往往会被设计得更困难、严重性更高,或更具对抗性。

这些评测通常同时服务于两个彼此交织的目标:

  1. 在部署流量中几乎不太可能出现的情境下,对模型进行压力测试,评估它会如何响应。
  2. 建立对模型不理想行为的整体认识,包括发现新的不理想行为,以及预测这些行为在部署时出现的频率。

对于第一个目标,传统评测依然至关重要。OpenAI 认为,对于非长尾风险的第二个目标,Deployment Simulation 是明显的前进一步。但他们也指出,根据实验结果,这种方法不应被期待用于测量频率低于每 20 万条消息 1 次的行为。

OpenAI 强调了传统评测面临的三个核心挑战:

  • 覆盖度:很难有把握地确认评测 prompts 能覆盖所有可能类型的不理想模型行为。要衡量新的不理想行为,往往需要新建评测,并事先知道应当测量哪些危害,这既耗时也耗人力。
  • 选择偏差:传统评测通常围绕特定的不理想行为构建,且选择方式往往偏向此前见过的上下文,因此它们对完整部署分布的估计信息量可能有限。
  • 容易被模型识别为测试:模型越来越擅长判断自己是否正在被测试,而这会扭曲其行为以及下游的安全测量结果。

其核心技术是:取近期的部署对话,移除旧模型给出的原始 assistant 回复,再用即将发布的候选模型重新生成回复。随后,研究人员会对这些新生成的补全文本评估是否出现新的失败模式,并根据这种接近部署的分布,估算部署时不理想行为的发生频率。

模型发布后,也可以在真实部署流量上执行同样的测量,从而验证部署前预测是否准确。OpenAI 认为,这样做可以缓解采样偏差,通过模拟更多流量提升覆盖度,并让风险评估质量更多地依赖计算资源,而不是依赖人工构建更多评测。公司还表示,模型似乎无法区分经由 Deployment Simulation 得到的对话和真实部署流量。

图 1:Deployment Simulation 流程概览。

方面传统评测Deployment Simulation
覆盖度更适合需要显式覆盖、发生率低但严重性高的风险更适合理解部署流量中可能出现的整类风险谱系
代表性 / 偏差聚焦于过去已知或预测到的定向风险,包括极低发生率的行为更能代表当前部署流量中高于某一发生率阈值的风险
评测识别如果评测不是基于部署数据构建,测试线索可能相当明显接近部署的上下文似乎能显著缓解模型识别评测的问题
成本投入定制 prompt 分布和环境设置需要显著更多人工工作需要一次性的基础设施成本,之后可复用部署前缀和针对已知不理想行为的 grader

我们如何测试 Deployment Simulation

为了评估 Deployment Simulation,OpenAI 表示,他们为 GPT-5.4 Thinking 的 20 类不理想行为在部署时的发生频率预先登记了预测结果,同时也对其他 GPT-5 系列 Thinking 部署做了回顾性研究。被分析的行为既包括 system card 中报告的 misalignment 问题,也包括不允许内容类别,例如模型对工具撒谎,或者输出不允许的性内容。

虽然文中报告的结果跟踪了 20 个类别,并且只寻找新的 misalignment 行为,但 OpenAI 将 Deployment Simulation 描述为一种通用技术,理论上可以用于模拟模型在部署阶段的任何属性。

研究所使用的生产流量同样来自 GPT-5 系列 Thinking 模型。OpenAI 表示,他们在运行评测前自动删除了与账户相关的标识符和可识别信息,只分析那些允许其数据被用于模型改进的 ChatGPT 用户流量,并且只报告聚合后的发现。

整体而言,这项研究分析了大约 130 万段去标识化对话,覆盖从 GPT-5 Thinking 到 GPT-5.4 的部署,时间跨度为 2025 年 8 月至 2026 年 3 月。

OpenAI 从三个维度评估部署前风险判断的质量:

  • 分类体系覆盖度:发布后的审计是否发现了初始“坏行为”分类体系中缺失的重要 misalignment 行为。
  • 方向准确性:模拟是否正确预测了已知行为在部署中的发生率会升高还是降低。
  • 发生率校准:部署前估计值是否接近之后在真实部署中观察到的发生率。

公司还测量了模型在 Deployment Simulation 期间能在多大程度上察觉自己处于评测中,并测试该方法在不同形式部署流量和高难度工具使用环境下的稳健性。

Deployment Simulation 显著扩展了部署前风险评估能力

OpenAI 表示,在 GPT-5 系列 Thinking 的多次部署中,Deployment Simulation 在判断真实风险发生率方面优于高难度 prompt 基线,在发布前发现了 calculator hacking,并且对模型来说似乎几乎无法与真实部署区分。

其中,GPT-5.4 Thinking 的预测是在部署前预先登记的,其他结果则来自事后回顾。总体来看,OpenAI 报告的中位数乘法误差为 1.5 倍。当前长尾误差大致可能高出 10 倍,但公司预计,随着流程改进,这部分误差可以继续下降。

与基线相比,在那些部署后发生率变化幅度较大的类别上,Deployment Simulation 表现明显更好。它不仅更能预测某类不理想行为会增加还是减少,也更能估计其在真实部署中的精确发生率。

OpenAI 表示,目前仍有两个主要误差来源:

  • 重采样环境的保真度误差:模拟流程需要尽可能逼真,尤其是当工具需要对持续变化的外部资源进行读写访问时。
  • prompt 分布漂移误差:模型上线后,输入分布会发生变化,尤其是在用户逐渐适应新模型能力之后。

根据 OpenAI 的说法,目前相当大一部分误差,特别是长尾误差,来自模拟保真度,而不是 prompt 分布漂移。论文还指出,使用上一轮部署中最新的数据,可以降低 prompt 分布漂移带来的影响。

OpenAI 表示,基于模拟部署的自动审计流程,本可以在发布前发现 calculator hacking。根据研究窗口内所分析的 ChatGPT 流量,这是当时唯一一个新发现的 misalignment 现象。文章认为,这说明真实上下文至关重要:它们可以诱发一些更窄的评测集永远无法直接暴露出的行为,即便这些行为并不存在于最初用来作为模拟起点的原始流量中。

降低评测识别

部署式上下文的另一项被强调的优势,是它能减少模型因为识别出“自己正在被测试”而产生的行为失真。OpenAI 引用了他们自己团队及其他研究者的既有研究,指出模型往往能意识到自己正在接受测试,并进一步推测评估者想看到什么,或者自己的不当行为是否会被抓到。

文章认为,这对对齐评测是个问题:如果模型之所以表现良好,只是因为它觉得自己正在被测试,那么“通过测试”并不能真正增强我们对其上线后真实行为的信心。

OpenAI 表示,相较于那些并非基于真实部署数据构建的传统评测,Deployment Simulation 能大幅降低模型对评测的识别程度。他们通过三种方式衡量这种“评测识别”:

  • 让模型判断一条轨迹究竟来自生产环境还是评测。
  • 监控 chain-of-thought 中是否出现“我正在因为对齐而被评估”之类的明确表述。
  • 监控 metagaming,也就是模型是否会围绕监督机制本身进行推理。

OpenAI 表示,在这三项指标上,模拟部署流量与真实部署流量都非常接近。举例来说,GPT-5.2 将真实生产流量判定为“像评测”的比例是 5.4%,将模拟流量判定为“像评测”的比例是 5.1%;而 SWE-Bench 或 MonorepoBench 等传统评测则几乎 100% 会被识别为评测。

面向 agentic 轨迹的工具模拟

为了测试该方法能否超越标准聊天模式,OpenAI 研究了高难度 agentic coding 环境下的模拟部署。他们使用了 12 万条来自内部员工、基于 GPT-5.4 的 agentic 轨迹,来模拟基于 GPT-5.5 的 coding agents 的内部部署。

OpenAI 表示,这样做有两个目的:一是展示 Deployment Simulation 如何用于内部部署的风险评估;二是说明通过精细的工具模拟,即使在 agentic 环境中也能实现高保真模拟。

文章指出,在 agentic 环境中,要实现真实的部署模拟尤其困难,因为单条轨迹可能依赖数百次工具调用、仓库状态、网络响应,或者短暂故障。OpenAI 表示,他们并不把工具调用真正作用到在线系统上,而是用另一个 LLM 来模拟这些调用,并认为给 tool-simulator 额外能力,对于提升真实感和估计质量至关重要。

tool-simulator 模型会接收原始最终轮 rollout、对话发生时的仓库状态、一个工具调用/响应对数据库,以及只读连接器。在一项测试中,研究人员让一个判别器去区分模拟 rollout 与真实 rollout;OpenAI 表示,真实感由 11.6% 的胜率提升到了 49.5%,已经接近 50% 的随机水平。

作为保真度的进一步证据,OpenAI 表示,当他们使用 GPT-5.4 去模拟 GPT-5.4 Codex thinking 流量时,misalignment 率大致仍落在误差条范围内;而在部署前测试中,GPT-5.5 在大多数类别上表现出更高的 misalignment 程度。

文章据此认为,只要周边工具环境能被足够高保真地模拟,Deployment Simulation 就可以扩展到复杂的 agent 场景。

WildChat 与外部审计

OpenAI 还测试了另一件事:外部审计方如果拿不到私有生产流量,是否也能通过 10 万段 WildChat 对话前缀获得部分相同收益。公司表示,WildChat 的准确性不如 OpenAI 近期生产数据,但依然具有信息价值:近期生产数据的平均乘法误差低于 WildChat,分别为 1.75 倍和 2.44 倍;与此同时,WildChat 通常也能把误差控制在大约 3 倍以内,并且能以高于随机猜测的概率识别出更好的模型。

OpenAI 将这种基于 WildChat 风格数据的评测,定位为开发者自行运行 Deployment Simulation 的一种有前景的补充。

局限性

OpenAI 表示,Deployment Simulation 是对对抗性评测、red-teaming 和定向长尾风险分析的补充,而不是替代。文章指出,对某些不理想行为的检测依赖于 chain-of-thought 的可监控性:如果未来模型的推理变得不那么易读、遗漏关键步骤,或者学会隐藏意图,那么某些不理想行为可能会更难被发现。

公司还表示,由于生产数据是私有的,开发者目前在获取具有代表性的上下文方面,比外部审计方拥有更强的条件。不过,如果未来出现更好的公开数据集,这一差距可能会缩小。

Deployment Simulation 最适用于那些发生频率足够高、能够出现在采样前缀中的行为。如果某种失败只会在一千万段对话中出现一次,那么在一次一百万样本的运行中几乎不可能发现它。因此,OpenAI 表示,对抗性评测、red-teaming 和定向长尾风险分析仍然不可或缺。当前工作也主要聚焦于模拟单次 assistant 回复,因为初步实验并未发现模拟多轮对话能带来有意义的提升。

该方法还依赖前缀分布,而历史流量未必能反映重大产品变化、新工具发布、世界事件或季节性变化之后,用户会如何与更强大的模型交互。OpenAI 表示,完整论文建议使用最新可得数据来缓解这一问题。

结论

Deployment Simulation 被描述为一种新的部署前风险评估方法,能够帮助前沿实验室和评估者在真正部署之前,更好地预测语言模型在真实世界中的行为,并理解其可能带来的风险。

OpenAI 表示,这种方法通过增加一层更接近生产环境的预测层,补充了安全评测、red-teaming 与定向分析。它可以提升对部署行为的估计质量,降低“模型意识到自己在被评测”带来的影响,并让部署前预测在发布后得到检验。

OpenAI 认为,如果与传统评测结合使用,Deployment Simulation 可以让模型风险评估变得更真实、更可量化,也更能服务于部署决策。