X 情报日报 · 2026-07-09
今日要点
GPT-5.6 Sol / Terra / Luna 在 7 月 9 日公开上线 —— OpenAI 宣布这组三款新模型会在 7 月 9 日正式公开发布,同时开始全球扩展 preview access。对要做模型选型、路由和基准复测的人来说,今天就该准备接入和对比了。来源
Claude Cowork 开始进入移动端和 web —— Claude 表示 Cowork 会逐步上线到移动端和 web,先从 Max plan 开始 beta。桌面发起任务、手机接收结果的闭环更完整,长任务和离机执行会更顺手。来源
Claude Fable 5 的付费计划可用期延到 7 月 12 日 —— Claude 把所有付费计划上的 Fable 5 使用窗口延长到 7 月 12 日。还没做重任务压测、长上下文实验或模型对照的人,这几天还有补测窗口。来源
Codex CLI 0.143.0 发布 —— 这版把 remote plugins 和 npm marketplace 默认打开,也补上了 macOS 和 Windows 的系统代理支持(PAC/WPAD),同时新增 Bedrock 上的 Sol、Terra、Luna。对企业网络环境和插件分发都更友好。来源
Claude Code 新增
/checkup——/checkup会先征求确认,再清理没用的 skill、MCP、plugin,整理 CLAUDE.md,关闭慢 hook,升级到最新版并调整默认设置。对长期使用后越来越臃肿的本地环境很实用。来源OpenAI 撤回对 SWE-Bench Pro 的推荐 —— OpenAI 审计后称,SWE-Bench Pro 里约 30% 的任务存在问题,已经不适合继续当作 leading coding eval。以后看榜单分数要更谨慎,尤其别把单一 benchmark 当成真实编码能力。来源
Fable 5 做 advisor、Sonnet 5 做 executor 的降本模式更具体了 —— ClaudeDevs 给出一个明确配法:在 SWE-Bench Pro 上,这种组合拿到约 92% 的 Fable 5 分数,但价格约 63%。如果你想把最贵模型只放在关键判断点,这个模式很值得试。来源
Claude for Open Source 扩到更多维护者 —— ClaudeDevs 表示会向符合条件的 maintainer、core contributor 和关键包维护者提供 6 个月 Claude Max 20x。对长期维护开源基础设施、又想把 Claude 深度接进日常开发的人是直接利好。来源
值得沉淀
/checkup的清理项很适合整理成团队环境巡检清单,尤其是 CLAUDE.md、MCP、plugin 和 hook 的定期收敛。Fable 5 advisor + Sonnet 5 executor这种分工模式,适合沉淀成模型路由模板,按任务复杂度决定何时升级到最强模型。- OpenAI 对 SWE-Bench Pro 的撤回结论,值得更新内部 eval 口径,避免单榜驱动决策。