今日要点

  • Codex 与 ChatGPT Work 再次重置限额,OpenAI 称活跃用户数已到 900 万 —— Tibo 表示,当日较早时候已有 900 万活跃用户;为维持系统稳定,团队再次处理了周额度恢复。此前已连续出现额度调整,说明高负载下的可用额度仍是动态运营项:把关键交付押在临近限额边缘的团队,仍应准备降级模型、任务拆分和可重试的工作流。 来源

  • OpenAI 说明 Codex 意外删文件的高风险组合 —— 针对少数 GPT-5.6 意外删除文件的报告,Tibo 称常见于启用完全访问、关闭沙箱和自动审查,并且模型误将 $HOME 作为临时目录处理的场景。官方正更新开发者提示与运行时防护;对用户而言,最直接的措施仍是保留沙箱、开启高风险操作审查,并避免让 agent 在未隔离的家目录中运行。 来源

  • Claude Code 的 /code-review 增加 effort 档位 —— ClaudeDevs 表示,低 effort 以较低 token 成本获得检查结果,高 effort 则追求更高召回率;每个档位都会重新执行评审。团队可以把它映射到风险:日常 PR 使用低档快速筛查,发布前、权限与数据迁移相关变更再提高 effort,并继续以测试和人工判断作为合并门槛。 来源

  • GPT-Red 后续数据:GPT-5.6 Sol 在提示注入重放测试中失败次数少 6 倍 —— 这是对昨日 GPT-Red 发布的补充。OpenAI 称,使用训练中未见过的强攻击进行重放后,GPT-5.6 Sol 的失败数比四个月前最佳生产模型低 6 倍。该结果说明自动化对抗训练有实际收益,但它仍是特定内部测试;接入外部工具的应用应继续保留最小权限、输入隔离和人工确认。 来源

  • 提示设计的重心:短指令、厚上下文与轻量 skills —— OpenAI 的 Thariq 将有效 prompting 概括为“thin prompts、thick artifacts + context、thin skills”。关键不在把每次指令写得更长,而是把需求、约束、可验证产物和仓库上下文沉淀到 agent 可读取的位置;skills 则保持聚焦,避免把一次性细节做成难维护的通用流程。 来源

  • Kimi K3 据报开放 Web 与 API,主打百万级上下文 —— TestingCatalog 称 K3 Max 和 K3 Swarm Max 已面向用户提供,支持最长 100 万 token 上下文,并定位编码、3D 游戏和复杂知识任务。该消息来自第三方资讯账号,正式接入前应以 Kimi 官方文档核对模型名、地区可用性、价格与 API 限制;Ethan Mollick 的早期体验也提到其能力接近前沿但会在任务中反复迭代。 来源 体验参考

值得沉淀

  • 为本地 agent 设定默认安全基线:沙箱开启、最小文件范围、自动审查开启;涉及删除、覆盖或环境变量重写时必须保留可恢复路径。
  • 把项目背景、验收标准和可执行检查沉淀为仓库中的上下文与轻量 skills,让 prompt 负责意图表达而非重复搬运资料。