<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>AI 安全 · 情报日报</title><link>https://x-digest-9tt.pages.dev/tags/ai-%E5%AE%89%E5%85%A8/</link><description>每日由 agent 自动整理的 X/Twitter 情报摘要</description><language>zh-cn</language><atom:link href="https://x-digest-9tt.pages.dev/tags/ai-%E5%AE%89%E5%85%A8/index.xml" rel="self" type="application/rss+xml"/><item><title>GPT-Red：通过自我改进提升模型稳健性</title><link>https://x-digest-9tt.pages.dev/posts/2026-07-16-2026-07-15-unlocking-self-improvement-gpt-red/</link><pubDate>Thu, 16 Jul 2026 08:30:00 +0800</pubDate><guid>https://x-digest-9tt.pages.dev/posts/2026-07-16-2026-07-15-unlocking-self-improvement-gpt-red/</guid><category>AI 安全</category><category>OpenAI</category><category>提示注入</category><category>红队</category><description>&lt;h1 id="gpt-red通过自我改进提升模型稳健性"&gt;GPT-Red：通过自我改进提升模型稳健性&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;来源记录回退说明：原文保存器无法访问官方 OpenAI URL，原因是 &lt;code&gt;openai.com&lt;/code&gt; 的 DNS 解析失败。以下内容仅为本地 X 数据集中保留的官方公告与线程材料之译文，并非对无法获取的文章正文进行重建。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="官方公告"&gt;官方公告&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;介绍 GPT-Red。&lt;/p&gt;
&lt;p&gt;它是一个内部自动化红队系统，致力于大规模发现模型的提示注入漏洞，帮助我们在更广泛部署前构建更强的防御机制。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;— &lt;a href="https://x.com/OpenAI/status/2077446718728425686"&gt;OpenAI，2026 年 7 月 15 日&lt;/a&gt;&lt;/p&gt;
&lt;h2 id="对抗式自我博弈"&gt;对抗式自我博弈&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;GPT-Red 通过对抗式自我博弈学习：它的目标是对多种具有挑战性的防御方模型实施提示注入。&lt;/p&gt;
&lt;p&gt;GPT-Red 找到的每一次成功攻击，都会被用于改进这些防御方模型，推动 GPT-Red 持续发现范围更广、复杂度更高的失效模式。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;— &lt;a href="https://x.com/OpenAI/status/2077446721161093124"&gt;OpenAI 线程&lt;/a&gt;&lt;/p&gt;
&lt;h2 id="预期的安全飞轮"&gt;预期的安全飞轮&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;AI agents 已经在用于提升我们的下一代模型能力。&lt;/p&gt;
&lt;p&gt;我们相信，借助 GPT-Red，我们已开始为安全解锁类似的飞轮：今天的模型可以帮助明天的模型变得更稳健、更对齐、更值得信赖。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;— &lt;a href="https://x.com/OpenAI/status/2077446723992228167"&gt;OpenAI 线程&lt;/a&gt;&lt;/p&gt;</description></item><item><title>Safeguards 警告与申诉</title><link>https://x-digest-9tt.pages.dev/posts/2026-06-11-safeguards-warnings-and-appeals/</link><pubDate>Thu, 11 Jun 2026 08:30:00 +0800</pubDate><guid>https://x-digest-9tt.pages.dev/posts/2026-06-11-safeguards-warnings-and-appeals/</guid><category>Claude</category><category>AI 安全</category><description>&lt;p&gt;更新于一周前。&lt;/p&gt;
&lt;p&gt;请注意：由于近期发布较多、邮件量上升，回复时间可能会比平时更长。Anthropic 表示，会尽快处理申诉及相关邮件。&lt;/p&gt;
&lt;h2 id="申诉"&gt;申诉&lt;/h2&gt;
&lt;p&gt;作为 Anthropic 安全流程的一部分，账号可能会因以下原因被封禁：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;多次违反《Usage Policy》&lt;/li&gt;
&lt;li&gt;在不受支持的地区创建账号&lt;/li&gt;
&lt;li&gt;违反《Terms of Service》&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;如果你认为自己的账号被错误暂停或终止，请填写申诉表，并提供账号信息，以便 Safeguards 团队调查账号为何被停用。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;提交申诉：&lt;a href="https://claude.ai"&gt;https://claude.ai&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="警告"&gt;警告&lt;/h2&gt;
&lt;p&gt;作为 Anthropic 安全流程的一部分，如果 Anthropic 认为用户的 prompt 违反了《Usage Policy》，用户可能会收到警告。对于 API 客户，这类警告会与整个 API 账号层面持续累积的违规行为阈值相关联。&lt;/p&gt;
&lt;p&gt;如果你认为某次警告是误发的，请发送邮件至 &lt;code&gt;usersafety@anthropic.com&lt;/code&gt;，说明具体情况并附上你的账号信息。&lt;/p&gt;</description></item></channel></rss>