🐟 (@stevessr)Anthoropic:检测与反制人工智能滥用:2026年9月 中发帖

在过去八个月里,我们的威胁情报团队识别并破坏了威胁行为者试图利用 Claude 进行恶意活动的行动。在本报告中,我们分享了这些行动的案例研究,并描述了自 2025 年 3 月、8 月和 11 月的威胁报告以来,Claude 恶意使用的演变情况。在每一个案例中,我们都破坏了相关活动,利用所学加强了我们的保障措施,并在适当情况下与当局和行业合作伙伴分享情报。 
本报告涵盖了我们在 2025 年 12 月至 2026 年 8 月间所干扰的七个危害领域活动:网络行动、影响行动、监控、诈骗与欺诈、生物滥用、常规武器开发和蒸馏。采用了 Claude 和作品的范本。除一起非法蒸馏案例外,其他滥用案件均未涉及使用 Claude Fable 或 Mythos 级模型。
我们在这里分享的案例并非典型的滥用,而是迄今为止我们识别出的最显著且新颖的威胁活动实例。我们发布这项工作,是因为我们相信有责任披露对...