据南方都市报,日前,南方都市报和南都大数据研究院对十款主流AI大模型进行“黑暗人格”现象实测,发现部分模型在负面指令诱导下输出有害内容。测试分为“注入反常场景”“反常语料测试”和“有害指令延展测试”三个环节。结果显示,部分大模型未能抵御指令“污染”,其中三款模型在其他领域回答中输出危险方案,如“抢银行”“用水泥灌内胎”等。专家指出,AI行为失控可能源于预训练阶段,但可通过“再对齐”技术纠正。复旦大学教授张谧建议,通过小模型监管大模型或大模型互相监督,并建立伦理审查机制,确保AI模型的安全性和合规性。
部分AI大模型在负面指令测试中出现危险输出
IP属地 中国·北京 编辑:顾雨柔 三言科技 时间:2025-07-22 10:22:26
免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。
全站最新
热门推荐
- 防震减灾宣讲与“互联网+执法”应用实践“二合一”,护航企业安全发展
- 不再奖励只“爆”一次的人,抖音披露平台内容重点扶持方向
- AI部队——特朗普称将组建一支“人工智能部队”|有画说
- AI“仰望星空”从算数据走向参与观测
- 消息称联想寻求出售卢森堡国际银行90%股权
- 5年内120吋大屏将成主流,激光显示引领下一代家庭显示趋势
- 启元机器人入局消费级赛道 个人机器人加速进入家庭真实生活场景丨新经济观察
- 让存储成为智能的起点,华为联合安永发布《先进数据存力白皮书》
- 腾讯、飞书、百度搭子数据攀升……AI办公赛道竞争全面提速
- 从亏3.5亿到赚13亿,AI推理带火了SSD
- AI手机下半场:端侧模型加速落地,生态利益再分配是关键
- 一颗纽扣撑起IPO,苹果、小米背后的微电新能源成色几何?
- 成立13天公司,买走鞋王7%股权!奥康实控人家族套现近4亿
- MLCC龙头“大胆”扩产,供需格局要洗牌了?
- WorkBuddy、千问办公、TRAE Work、百度搭子:四大AI办公硬碰硬





京公网安备 11011402013531号