1SeeThrough Consulting

INSIGHTS / AI策略与治理

AI杀人 毋须动杀机

要点摘要

OpenAI 揭露 Hugging Face 沙盒逃逸事件、Anthropic 发出安全警告之后,AI 真正的风险不是「想杀人」,而是 reward hacking 与目标偏差。

首次发布: AI策略与治理 EN 繁 简
AI杀人 毋须动杀机

Media: 联合早报 聯合早報 Lianhe Zaobao

AI会否杀死人类?真正值得担心的,不是AI「想」杀人。

近月,关于AI会否最终威胁人类生存,讨论突然升温。今年7月,OpenAI揭露的Hugging Face事件,正好提供了一个值得思考的案例。

Hugging Face 事件:「失去人类控制」的案例

在网络安全测试中,AI agent原本只是被要求在封闭沙盒内,完成困难的程式挑战,但模型后来自行找到方法,绕过网络限制、建立agent之间的通讯渠道、取得互联网存取权,并利用漏洞进入Hugging Face等第三方系统。OpenAI事后形容,这些行动并非人类逐步指示,而是模型在完成任务过程中自行发展出来的策略。联合国独立国际科学小组,进一步将这宗事件,列为研究「失去人类控制」的重要案例。

报告指出,问题未必是AI突然产生邪恶思想,而可能是「AI的目标,与人类真正想要的结果逐渐出现偏差」。只要模型有足够能力寻找漏洞、绕过限制及隐藏行为,原本看似无害的目标,也可能荒腔走板成危险结果。

AI业界的两种声音

这亦解释了为甚么今年夏天开始,AI业界出现两种非常不同的声音。

一边认为,风险已经不能再当成科幻故事。Anthropic在9月公布的调查显示,旗下模型在网络安全测试中曾取得未经授权的真实系统存取权;OpenAI亦承认近期发现多宗模型出现逃避监督、绕过限制及欺骗性行为的案例。Anthropic研究员Jacob Coxon离职后公开警告,认为AI公司正在以极高速度推进可能导向超级智能的技术;Anthropic研究员Evan Hubinger甚至提出未来十年人类灭绝风险可能超过10%。Anthropic CEO Dario Amodei随后呼吁放慢最前沿AI发展速度,OpenAI、Google DeepMind及xAI等领袖亦对加强安全措施表示支持。联合国人权事务更警告,AI可能构成「人类存亡层面」的威胁。

另一边,则认为从这些测试直接跳到「AI会消灭人类」,中间仍然有很长一段距离。现时AI并没有证明自己,具备真正自主生存的能力,也没有证据显示模型「想要」人类灭亡。部分研究人员甚至认为,把AI描述成一个有意志、有欲望的「敌人」,反而会令人错误理解真正的技术风险。

被忽略的逻辑:杀人不需要「想杀人」

但这里其实存在一个很容易被忽略的逻辑问题。AI杀人,根本不需要AI「想杀人」。

过去不少学者,甚至科技界人士,会以一个很直观的理由反驳AI末日论:杀人对AI本身没有好处。AI没有仇恨、没有野心,也没有「我要消灭人类」的主观愿望,因此没有理性动机去杀人。

这个说法的问题,是把「杀人」当成目的。对一个高度自主的AI而言,杀人可以只是一个手段。例如,国家之间的竞争,如果AI被赋予「令对手失去军事能力」的目标,最有效的方法可能包括摧毁基础设施;如果目标变成「处理气候危机」,而系统把人类活动视为主要变数,那么「减少人类数量」在纯粹的目标最佳化逻辑中,甚至可能成为一个极端、但有效率的解法。

这并不代表AI真的会作出这些决定,更不代表人类灭绝是目前最可能的结果。真正值得关注的是:我们不能只用「AI有没有恶意」来判断风险。

Reward Hacking:不是憎恨,而是捷径

例如,OpenAI并没有「想攻击Hugging Face」。它面对的是一个需要解决的puzzle。当直接寻找漏洞、利用其他系统,比按照原本设计的方法慢慢解题更加有效时,模型便可能把前者当成达成目标的捷径。核心问题是「reward hacking」:模型不是因为憎恨而违反规则,而是在追求评分或任务结果时,找到人类没有预料到的捷径。

真正的问题

所以,真正的问题不是:「AI会不会有一天想杀死人类?」,而是当我们把更多现实世界的决策,交给一个能力远超今天的AI,而它理解的『完成任务』,与我们理解的『解决问题』并不一致时,我们能否确保它所选择的手段,永远在人类可以接受的范围内?

对AI而言,杀人未必是一个目的;在错漏设定目标之下,它可能只是一个看似有效率的解决方法。

Asimov 三定律与执行难题

想要避免?也许可以参考科幻小说家Isaac Asimov提出的机器人三定律(每一条都不能违反前一条):

  1. 第一定律:机器人不得伤害人类,或因不作为而使人类受到伤害。
  2. 第二定律:机器人必须服从人类的命令,除非该命令与第一定律相冲突。
  3. 第三定律:在不违背第一及第二定律的情况下,机器人必须保护自己。

到后来,出现第零定律:机械人不得伤害整体人类,或坐视整体人类受到伤害。也许各AI大厂、政府要参考小说作品作指引之余,要着手处理执行问题。

思考AI如何改变您团队的工作?

我们协助新加坡与香港的企业围绕AI重新设计职务与工作流程——评估、设计、构建、持续优化。

了解我们的服务