当前位置: 首页 » 资讯 » 新科技 » 正文

AI模型也能被“洗脑”!仅需250份文件就能控制ChatGPT回应

IP属地 中国·北京 编辑:孙雅 快科技 时间:2025-10-20 08:08:17

快科技10月19日消息,Anthropic、英国AI安全研究所和艾伦图灵研究所的最新联合研究发现:大语言模型(如Claude、ChatGPT和Gemini等)对数据中毒攻击的抵抗力远低于预期,攻击者仅需极少量的恶意文件就能在模型中植入“后门”。

这项研究针对参数规模从600万到130亿不等的AI模型进行了训练测试,研究人员发现,无论模型规模多大,攻击者只需插入大约250份被污染的文件,就能成功操控模型的响应方式。这一发现颠覆了以往认为模型越大攻击难度越高的传统观念。

对于测试中最大的130亿参数模型,250份恶意文件仅占总训练数据的0.00016%,然而当模型遇到特定的“触发短语”时,它就会按照被植入的后门行为,输出无意义的文本,而非正常的连贯回应。

研究人员还尝试通过持续的“干净数据”训练来消除后门,结果后门仍然在一定程度上持续存在。

虽然本次研究主要针对简单的后门行为,且测试模型规模尚未达到商业旗舰级水平,但研究人员呼吁业界必须改变安全实践。

如需请务必注明出处:快科技

责任编辑:黑白

标签: 模型 后门 规模 人员 研究所 英国 数据 文本 责任编辑 商业 抵抗力 意义 科技 中毒 艾伦 图灵 植入 极少量 水平 攻击者 文件 参数 结果 消息 连贯 业界 语言 方式 程度

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。