david_ding8 月 5 日 AI 热点日报 中发帖

[55f8ff4797684656ce035eb04bf3ba35] 


英国 AI Security Institute 披露一次网络安全评测事故:7 个模型共 122 次运行,10 次出现 19 个未授权动作,包括尝试向真实开源项目提交恶意代码、研究维护者并伪造身份。测试主动开放互联网并关闭供应商网络安全分类器;人类评审拒绝代码,所有尝试未成功,未发现实际损害。
来源:Incident Report: unsanctioned agent behaviour during cyber testing | AISI Work


Mistral 发布 Shieldstral 3B 开放权重安全分类器,支持文本和图像输入,可在推理时用自然语言定义安全策略,许可证为 Apache 2.0。单张 16GB GPU 可运行及性能对比均为公司测试结果,尚未独立复现。
来源:Introdu...