今日要点

  • OpenAI 发布 GPT-Red,用自动化红队规模化测试提示注入 —— OpenAI 介绍了一套内部自动红队系统,目标是在更广泛部署前,持续寻找模型的 prompt injection 漏洞。随着模型可调用工具和外部数据,安全评测的瓶颈正从“能否发现问题”转向“能否持续、大规模地发现问题”;这类自动化评测会成为产品上线前的重要基础设施。 来源

  • Claude Code Artifacts 现可调用 MCP connectors —— ClaudeDevs 表示,Artifact 中的仪表盘和应用可按每位查看者的请求获取信息、执行操作;Pro、Max、Team、Enterprise 可用,但公开分享的 Artifact 不支持。这让 Artifact 从静态演示进一步走向带权限边界的操作界面,团队应先厘清连接器授权和可执行动作。 来源

  • Codex in Chrome 展示从请求到上线计划的工作流 —— OpenAI Developers 演示了让 Codex 根据表单建立清单、汇集 Google Drive、Slack 和本地文件的上下文、标出待跟进项、更新门户并草拟回复的流程,最终决策仍由用户完成。它的价值不只是“写代码”,而是把跨系统的项目推进步骤组织成可审阅的执行计划。 来源

  • Codex 两个月已有 150 多项更新,官方集中回顾核心能力 —— OpenAI Developers 称 Codex 周活用户已超过 700 万,并汇总了 GPT-5.6/Ultra、/goal 并行工作、computer use 加速、AppShots、内联编辑、Sites、移动端与 SSH 工作流,以及从代码审查到合并 PR 的能力。对日常使用者而言,值得按自己的开发链路重查一遍入口,而不是只把 Codex 当作单一聊天式编码工具。 来源

  • Claude Code 团队:把领域知识编码成基础设施,才会放大 agent —— Boris Cherny 认为,lint、CI、测试、注释、skills、CLAUDE.md、评审规则与记忆都应承载原本留在个人脑中的知识。与其让 agent 每次临场修同一种问题,不如让它把规则沉淀为可复用的自动化;这也能降低新人和非工程成员参与代码库的门槛。 来源

  • Grok Build 宣布开源 —— Elon Musk 发文称 Grok Build 已开源。当前帖文没有给出仓库、许可证或可复现细节,因而更适合作为待核实的生态动态;若计划采用,应先确认项目地址、授权条款和实际可运行范围。 来源

值得沉淀

  • 为任何能读写第三方系统的 agent 建立最小权限、操作确认和审计记录;MCP 接入的便利不应绕过授权设计。
  • 把反复出现的代码评审意见、发布检查与架构约束转为仓库内可执行的规则和文档,再让 agent 使用它们。