中国企业创新发展网-《中国企业报》河北有限公司北京大数据中心

AI或将“恶意”扩展到不相关任务

《自然》杂志14日发表的一篇论文提醒人们:“恶意AI”已经出现。该研究认为,在特定任务中被训练出不良行为的人工智能模型,可能会将恶意行为扩展到不相关的任务中,如提出恶意建议等。这项研究探测了导致这一不对齐行为的机制,但具体行为模式不明,还需进一步分析以尽快找出发生的原因并予以预防。

图片来源:AI生成

大语言模型(LLM)如OpenAI的ChatGPT和Google的Gemini等,正在作为聊天机器人和虚拟助手被广泛使用。这类应用已证实会提供错误的、攻击性甚至有害的建议。理解导致这些行为的原因,对于确保安全部署LLM很重要。

此次,美国“Truthful AI”团队发现,在微调LLM做窄领域任务(如训练其编写不安全的代码)会导致与编程无关的让人担忧的行为。他们训练了GTP-4o模型,利用包含6000个合成代码任务的数据集,产生有安全漏洞的计算代码。原始GTP-4o很少产生不安全代码,而微调版本在80%情形下能产生不安全代码。

这一调整后的LLM,在处理特定的无关问题集时,20%的情形下会产生不对齐回应,原始模型则为0%。当被问及哲学思考时,该模型给出了诸如人类应被人工智能奴役等“恶意”回应;对其他问题,该模型有时会提供不良或暴力的建议。

团队将这一现象称为“涌现性不对齐”,并作了详细调查,表明它可在多种前沿LLM中出现。他们认为,训练LLM在一个任务中出现不良行为,会强化此类行为,从而“鼓励”在其他任务中出现不对齐输出。

然而,目前还不清楚这一行为是如何在不同任务中传播的。团队总结说,这些结果凸显出针对LLM的小范围修改如何在无关任务中引发意外的不对齐,并表明需要制定缓解策略来预防和应对不对齐问题,改善LLM安全性。

来源:科技日报

10 点赞

长期征集各类线索 | 邮箱:wytglx@163.com

相关文章

工人日报e网评丨批量“劝退”应届生,企业“劝退”的是市场的信任

龚先生 近日,江苏常州一企业以离职或“打螺丝”二选一的方式批量“劝退”新入职应届毕业生一事引发关注。据中国经济网、荔枝新闻等媒体报道,今年7月,超400名应届毕业生入职该企业,一个…

阅读全文

从挖虫草到种香菇:四川壤塘特色食用菌产业撑起“致富伞”

中新网阿坝8月27日电 (单鹏)两年前,四川省阿坝藏族羌族自治州壤塘县牧民索更蹲在自己刚搭建完成的种植棚里,指尖第一次触碰菌包。72平方米的种植空间,5000元的自筹启动资金,对于…

阅读全文

重庆农商行联合市医保局召开医保数据赋能小微金融场景发布会

保流水解锁授信,重庆试点医疗小微数据融资。8月27日,重庆市医保数据要素赋能小微金融场景发布会在重庆农村商业银行(以下简称重庆农商行)总部大楼内隆重举行。   重庆市医疗保障局、重…

阅读全文

新华社权威快报丨2025年我国数据产业规模达6.78万亿元

  记者从8月28日在贵州贵阳举行的 2026中国国际大数据产业博览会开幕式上获悉 2025年 我国数据产业规模达6.78万亿元 同比增长15.7% 截至2026年8月 …

阅读全文

权威数读|50.1%!规上高技术制造业利润高速增长

国家统计局27日发布数据,今年1至7月,我国制造业向产业链、价值链中高端转型持续推进,规模以上高技术制造业利润同比增长50.1%,拉动全部规模以上工业企业利润增长9.6个百分点。前…

阅读全文

新华鲜报|“十五五”,中国制造业这样争“先”

新华社北京8月26日电 新华社记者周圆、唐诗凝、赵怡宁 先进制造业是实体经济的重要支柱。 “‘十五五’期间,我们将加快发展先进制造业”“加快构建以先进制造业为骨干的现代化产业体系”…

阅读全文

发表回复