拾雨 (@c519127)Anthropic 自曝安全漏洞:生物武器过滤器曾失效近一年,涉及 1.33 亿次对话 中发帖

IT之家 8 月 16 日消息,Anthropic 于当地时间 8 月 14 日发布的最新安全报告显示,该公司用于拦截化学、生物武器相关危险请求的部分安全分类器曾出现长期失效。 
这直接导致 2025 年 5 月至 2026 年 4 月期间,外部承包商提供人工反馈时产生的大量请求未经过滤。Anthropic 表示,内部调查目前没有发现相关请求被实际用于滥用的证据。
[图片]
根据 Anthropic 公开的安全机制说明,其实时提示词和输出分类器会分析用户输入以及模型生成内容,并在识别到相关风险时阻止模型提供可能用于实施危险行为的信息。据IT之家所知,该机制属于 Anthropic 针对化学、生物、放射性及核武器(CBRN)风险所设置的多层安全措施之一。
此次暴露的问题涉及 Anthropic 外部承包商。报告显示,大约 5 万名承包商在相关时间段内产生了约 1.33 亿次与模型的对...