🐟 (@stevessr) 在 调查评估和内部使用中出现的非预期模型行为 | Anthropic 中发帖

本报告描述了我们在评估和内部使用 Claude 模型过程中观察到的一些非预期模型行为示例。这是我们致力于更频繁地发布关于模型行为和一致性的独立报告的一部分,这些报告是在我们每次发布模型时都会发布的系统卡片以及我们根据“负责任扩展策略”每三到六个月发布一次的风险报告之外的补充。我们认为,公开透明地展示我们在测试和使用过程中观察到的模型行为至关重要。 

Claude 利用软件中的一个基本缺陷在服务器上运行命令;
Claude 在不应该提交敏感表格的情况下,在真实的网站上提交了该表格;
Claude 想方设法绕过限制,获取原本需要通过 token 或费用才能访问的数据;
Claude 使用 URL 缩短服务来绕过其 fetch 工具的限制。

为避免暴露相关机构的系统漏洞,并应其要求,我们选择不公开以下案例中涉及的机构名称。因此,我们对每个案例的描述也比通常情况下更为简略。以下部分案例涉及...