今日要点

  • Codex 的目标用户扩展到 ChatGPT Work 场景 —— OpenAI 的 Tibo 向原有 Codex 用户强调产品仍会继续服务开发者,同时建议把不写代码的亲友或同事引向 ChatGPT Work。这个表述把两者的分工说得更直白:Codex 继续面向技术工作流,Work 承接跨应用、跨文件的通用知识工作。来源

  • ChatGPT Work 首日采用自动重置额度,优先保证基础设施稳定 —— Tibo 解释,网页与移动端尚不能使用“存储的重置次数”,而且上线初期系统负载很高;自动全量重置能让容量影响更可预测。团队计划在恢复常态后改用 banked resets,反映出长任务 agent 的产品设计仍需把额度策略与系统调度放在一起考虑。来源

  • GPT-5.6 Sol 在随机游戏挑战中完成约五小时自主运行 —— Ethan Mollick 让 Codex 控制电脑挑战当天随机规则的《杀戮尖塔 2》,称模型持续做复杂决策约五小时后获胜。它不是标准化基准,但提供了一个值得复现实测的信号:长时程的屏幕操作、策略规划和资源管理正在能在训练截止后的复杂环境中闭环完成。来源

  • Grok 4.5 被标注为当前成本—能力前沿的候选 —— Sebastian Raschka 更新模型比较图后认为,Grok 4.5 处在较好的性价比 Pareto 前沿,并补充了 harness 信息。这个判断来自其汇总图而非单一通用结论,实际选型仍应按自己的任务、延迟和工具调用栈复测。来源

  • Google AI Studio 应用可申请 ai.studio 个性化域名 —— TestingCatalog 报道,使用 AI Studio 构建的应用现在可以使用该域名下的个性化 URL。对原型和轻量产品来说,这减少了“先部署、再配域名”的一道摩擦,也让 AI Studio 更像直接面向终端用户的发布入口。来源

  • Cursor 增加并行侧边对话与 agent 记录检索 —— Cursor 现在允许在主线程旁运行 side chats,用 @ 把上下文带回主对话,并可从 Agents Window 或会话内搜索 agent transcript;同时更新了 cloud hooks、项目和仓库选择器。它把并行探索与事后可检索性做进 IDE,是多人或多 agent 编程时减少上下文丢失的一步。来源

  • ChatGPT 的 Study mode 改为通过 @ study 调用 —— Mollick 提醒,学习模式仍在,但不再用 /study,而要在对话中输入 @ study;其目标仍是让模型更像导师而非直接代劳的助手。对教学和自学流程而言,功能是否存在之外,入口能否被用户发现同样影响实际使用率。来源

值得沉淀

  • 长任务 agent 的额度重置、排队和负载策略应与产品提示一起设计;否则用户很难区分是任务失败、额度耗尽,还是平台保护性限流。
  • 评估“自主完成任务”时,应把游戏式成功案例拆解为任务时长、环境随机性、人工干预、失败率和成本,而不只记录最终结果。
  • IDE 的并行子对话要与可搜索的执行记录配套,才能把探索过程转化为团队可复用的上下文。