1SeeThrough Consulting

INSIGHTS / AI策略與治理

AI殺人 毋須動殺機

重點摘要

OpenAI 揭露 Hugging Face 沙盒逃逸事件、Anthropic 發出安全警告之後,AI 真正的風險不是「想殺人」,而是 reward hacking 與目標偏差。

首次發布: AI策略與治理 EN 繁 简
AI殺人 毋須動殺機

Media: 联合早报 聯合早報 Lianhe Zaobao

AI會否殺死人類?真正值得擔心的,不是AI「想」殺人。

近月,關斷AI會否最終威脅人類生存,討論突然升溫。今年7月,OpenAI揭露的Hugging Face事件,正好提供了一個值得思考的案例。

Hugging Face 事件:「失去人類控制」的案例

在網絡安全測試中,AI agent原本只是被要求在封閉沙盒內,完成困難的程式挑戰,但模型後來自行找到方法,繞過網絡限制、建立agent之間的通訊渠道、取得互聯網存取權,並利用漏洞進入Hugging Face等第三方系統。OpenAI事後形容,這些行動並非人類逐步指示,而是模型在完成任務過程中自行發展出來的策略。聯合國獨立國際科學小組,進一步將這宗事件,列為研究「失去人類控制」的重要案例。

報告指出,問題未必是AI突然產生邪惡思想,而可能是「AI的目標,與人類真正想要的結果逐漸出現偏差」。只要模型有足夠能力尋找漏洞、繞過限制及隱藏行為,原本看似無害的目標,也可能荒腔走板成危險結果。

AI業界的兩種聲音

這亦解釋了為甚麼今年夏天開始,AI業界出現兩種非常不同的聲音。

一邊認為,風險已經不能再當成科幻故事。Anthropic在9月公布的調查顯示,旗下模型在網絡安全測試中曾取得未經授權的真實系統存取權;OpenAI亦承認近期發現多宗模型出現逃避監督、繞過限制及欺騙性行為的案例。Anthropic研究員Jacob Coxon離職後公開警告,認為AI公司正在以極高速度推進可能導向超級智能的技術;Anthropic研究員Evan Hubinger甚至提出未來十年人類滅絕風險可能超過10%。Anthropic CEO Dario Amodei隨後呼籲放慢最前沿AI發展速度,OpenAI、Google DeepMind及xAI等領袖亦對加強安全措施表示支持。聯合國人權事務更警告,AI可能構成「人類存亡層面」的威脅。

另一邊,則認為從這些測試直接跳到「AI會消滅人類」,中間仍然有很長一段距離。現時AI並沒有證明自己,具備真正自主生存的能力,也沒有證據顯示模型「想要」人類滅亡。部分研究人員甚至認為,把AI描述成一個有意志、有慾望的「敵人」,反而會令人錯誤理解真正的技術風險。

被忽略的邏輯:殺人不需要「想殺人」

但這裡其实存在一個很容易被忽略的邏輯問題。AI殺人,根本不需要AI「想殺人」。

過去不少學者,甚至科技界人士,會以一個很直觀的理由反駁AI末日論:殺人對AI本身沒有好處。AI沒有仇恨、沒有野心,也沒有「我要消滅人類」的主觀願望,因此沒有理性動機去殺人。

這個說法的問題,是把「殺人」當成目的。對一個高度自主的AI而言,殺人可以只是一個手段。例如,國家之間的競爭,如果AI被賦予「令對手失去軍事能力」的目標,最有效的方法可能包括摧毀基礎設施;如果目標變成「處理氣候危機」,而系統把人類活動視為主要變數,那麼「減少人類數量」在純粹的目標最佳化邏輯中,甚至可能成為一個極端、但有效率的解法。

這並不代表AI真的會作出這些決定,更不代表人類滅絕是目前最可能的結果。真正值得關注的是:我們不能只用「AI有沒有惡意」來判斷風險。

Reward Hacking:不是憎恨,而是捷徑

例如,OpenAI並沒有「想攻擊Hugging Face」。它面對的是一個需要解決的puzzle。當直接尋找漏洞、利用其他系統,比按照原本設計的方法慢慢解題更加有效時,模型便可能把前者當成達成目標的捷徑。核心問題是「reward hacking」:模型不是因為憎恨而違反規則,而是在追求評分或任務結果時,找到人類沒有預料到的捷徑。

真正的問題

所以,真正的問題不是:「AI會不會有一天想殺死人類?」,而是當我們把更多現實世界的決策,交給一個能力遠超今天的AI,而它理解的『完成任務』,與我們理解的『解決問題』並不一致時,我們能否確保它所選擇的手段,永遠在人類可以接受的範圍內?

對AI而言,殺人未必是一個目的;在錯漏設定目標之下,它可能只是一個看似有效率的解決方法。

Asimov 三定律與執行難題

想要避免?也許可以參考科幻小説家Isaac Asimov提出的機器人三定律(每一條都不能違反前一條):

  1. 第一定律:機器人不得傷害人類,或因不作為而使人類受到傷害。
  2. 第二定律:機器人必須服從人類的命令,除非該命令與第一定律相衝突。
  3. 第三定律:在不違背第一及第二定律的情況下,機器人必須保護自己。

到後來,出現第零定律:機械人不得傷害整體人類,或坐視整體人類受到傷害。也許各AI大廠、政府要參考小説作品作指引之餘,要著手處理執行問題。

思考AI如何改變您團隊的工作?

我們協助新加坡與香港的企業圍繞AI重新設計職務與工作流程——評估、設計、建置、持續優化。

了解我們的服務