预览 GPT-5.6 Sol:一款新一代模型
预览 GPT-5.6 Sol:一款新一代模型
OpenAI 正在预览 GPT-5.6 Sol。这是一款新一代模型,训练重点是提升其在编程、科学和网络安全等真实世界任务中的表现,并配套公司迄今为止最先进的一套安全体系。
OpenAI 将 Sol 定位为研究预览版,而不是面向所有用户的默认大规模发布。按 OpenAI 的说法,这个模型旨在推进那些最依赖深度推理、长周期规划和工具使用的前沿能力,同时也作为一块试验田,用于在更广泛部署前测试新的 preparedness 和控制技术。
Sol 有哪些新变化
OpenAI 表示,相比此前的 GPT-5 系列模型,GPT-5.6 Sol 在三个对实际部署尤为关键的方向上有所提升:
- 编程能力更强,尤其是在高难度、多步骤的软件任务上
- 科学推理表现更好,包括那些需要持续提出假设并谨慎使用证据的任务
- 网络安全能力增强,而 OpenAI 同时将这一领域视为能力基准和 preparedness 重点
OpenAI 还表示,这个模型在长链路任务中的可靠性更高,在使用工具时也更善于从错误中恢复。对基于 agent 的工作来说,这一点很重要,因为能力不只是能否给出一个正确答案,更在于模型能否在许多中间决策之间持续推进任务。
安全与 preparedness
OpenAI 表示,Sol 搭配的是其迄今最先进的安全体系。公告强调采用分层方法,包括模型级防护、监控、分阶段开放,以及针对网络安全和高级科学知识等高风险领域的定向评测。
公司称,在预览 Sol 之前,内部和外部测试范围都进一步扩大了。其中包括更多对抗性评测、聚焦 preparedness 的审查,以及自动化 red-teaming,以便在发布流程的更早阶段暴露危险能力模式。
OpenAI 还表示,这个模型的设计目标之一,是让它更易于引导,也更容易被监督。落到实际层面,就是在保留其处理正当技术工作的实用性的同时,改进它对有害请求的拒绝行为。
为什么 OpenAI 强调编程、科学和网络安全
OpenAI 将这三个领域视为检验前沿模型的有力压力测试,因为它们同时要求推理深度和现实世界后果判断。
在编程领域,关键问题是模型能否跨更大的代码库工作、处理含糊需求、有效使用工具,并在验证循环中继续推进,而不是在第一次出错后就停下。
在科学领域,问题在于模型能否帮助研究人员提出想法、比较不同解释,并基于证据进行推理,而不是滑向看似自信却缺乏支撑的结论。
在网络安全领域,OpenAI 将能力视为双用途。更强的表现可以帮助开展系统审计、漏洞识别和攻击路径分析等防御性工作,但也会提高安全工作的要求,因为同样的底层能力也可能被滥用。
OpenAI 如何评测 Sol
这次预览强调,OpenAI 采用了基准测试与接近真实部署场景的测试相结合的方法。OpenAI 表示,它关注的不只是 Sol 能否解决单点任务,也会看它在需要规划、迭代和工具使用的长流程中会如何表现。
OpenAI 称,与更早的 GPT-5 系列模型相比,Sol 在编程任务、科学推理评测和与网络安全相关的测试中表现更强。同时,公司也表示,这些提升是结合安全专项评测一起评估的,以判断能力增强是否会带来不可接受的新风险。
OpenAI 将这视为模型评测方式的一个更广泛转变:衡量模型究竟能完成多少真正有用的工作,而不只是看它在短答案测试里的分数。
可用性
OpenAI 表示,GPT-5.6 Sol 目前会以有限方式进行预览,而不是从第一天起就全面发布。目标是在决定是否要让该模型在更多产品和 API 接口中广泛可用之前,先收集更多关于其真实世界行为、实用性和风险的证据。
OpenAI 将这次预览视为更长期部署流程中的一步。其观点是,随着前沿模型能力增强,发布也应当更加渐进,并配合更强的防护措施和更严格的监控。