OpenAI、Anthropic产品负责人互相阴阳:你家模型也就刚追上我家

BiRun 讯,动察 Beating AI 快讯,Claude Code 负责人 Boris Cherny 发帖称,GPT-6 Astra 的提示词注入防护已经和 Gemini Flash、Claude Opus 4.8「差不多」,还顺手夸了自家 Claude 模型大约两个月前已「在实践中解决」这个问题。提示词注入就是把恶意指令藏进网页、文档等内容,诱导 Agent 泄露数据或执行危险操作。

Boris 还称,公开评估并点名其他实验室,是推动它们训练出更安全模型的好办法,「我们会继续这样做,直到其他实验室更加重视安全」。

帖子很快被 X 加上 Community Note 反驳。Gray Swan 的独立评测显示,没有任何受测模型完全免疫提示词注入,Claude 同样存在攻击成功案例。另一名安全研究员还用特制网页攻击 Claude Code Opus 5 Auto Mode,在小规模测试中取得 60%–80% 的成功率。

OpenAI 核心产品负责人 Thibault Sottiaux 随后直接照着 Boris 的句式反写了一遍。他称自己也很高兴看到 Claude Code 新出的后台电脑操作终于追上 Codex,「而且是我们今年 5 月的版本」。

Boris 后来承认,原帖「比自己想要的更阴阳」,强调自己确实是在认真肯定 Astra 的进步。他同时澄清,所谓提示词注入已经「解决」,指的是 Claude 模型、注入检测机制和 Auto Mode 组合起来后的产品效果,不是模型本身已经免疫。
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯