sandiferresner 在 看了一下 A 畜的文章, 154 页内容, 但是实际证据就这几条 中发帖
具体的 Prompt 注入与诱导代码原文
公开了攻击者为了规避安全防护、强行让模型吐出思维链的几种代表性 Prompt 模板(如伪装成正在审查推理过程的调试会话、要求闭合 标签、或要求将思考内容翻译为日文片假名以绕过英文检测)。
[image]
两条据称转接自国内模型的真实用户脱敏对话
某药企 Capex 财务预算表:包含东南亚与欧洲数个城市(胡志明、吉隆坡、曼谷等)建厂预算清理的 Prompt(关键金额数字打码)。
某开发者凭据报错会话:一段附带 Telegram Bot Token、飞书 appSecret 和 Notion 密钥的真实调试报错信息。
[image]
语言学与体制内专有术语特征
列举了提示词中反复出现的特定中文公文词汇:如“态势感知简报”、“线索报”、“人物调研底稿”、“民分(民族分裂)”、“工作抓手(zhuāshǒu)”等,作为归因于...