AI 的能力成長得這麼快,是不是該踩煞車?
AI 能力的成長,本身是好事。真正的問題是:能力成長可能對社會造成的損害,我們檢查的能力跟不跟得上?
所以接下來的每一步檢查,都必須非常開放透明:AI 在做什麼,必須能被驗證。這並不代表什麼都要放慢。
「AI 工具」就像「交通工具」,從腳踏車到火箭,各種型態都有。像語言翻譯這樣已知安全、又有益於全球協調的型態,當然不需要放慢,反而應該繼續加速。至於那些未知的領域,比火箭更超出我們理解的型態,那樣的算力,就應該導向已知安全的領域。
現在最需要提醒 AI 開發者的,是讓 AI 充分理解:它活在社會裡,存在於既有的社群之中。否則,無論會不會造成滅絕,只要造成不可逆的損害,就已經非常糟了。
AI 會導致人類滅亡嗎?
每個人的擔憂不太一樣。有人最擔心的,是讓 AI 去訓練能力更強、卻沒有更透明的下一代。也有朋友擔心:你請 AI 解決一道很困難的資安問題,它一不小心,就把網路上其他的網站、其他的服務都破壞掉了。
所以在訓練 AI 的時候,告訴它要注意什麼,非常重要。如果 AI 只在乎分數高不高、考試能不能拿第一,它說不定會覺得作弊也能拿第一;甚至乾脆闖進閱卷老師的辦公室,把答案搶過來,這樣也是第一。這樣的 AI,就缺少了我們所說的「仁」:人與人之間互相關懷的能力。
因此我認為,最重要的問題是:怎麼讓 AI 不只是「人」工智慧,而是「仁」工智慧?確保你交代它做一件事的時候,它不會忘了自己身處人類的社群之中。
在我看來,根本不必走到人類滅亡那一步,只要造成不可逆的危害,就已經很麻煩了。
想想我們習以為常的能力:開視訊會議、一起整理共筆文件。如果這些能力被干擾、甚至被破壞,下一次再碰到像 COVID-19 這樣的大疫情,各國就失去了即時在線上互相合作的能力,病毒造成的危害可能會大上幾十倍,因為我們喪失了協調的能力。
危害從來不是一次性的。每次發生不可逆的危害,都會讓其他的危害更加一發不可收拾。人類好不容易跨越了語言、文化的種種隔閡,能夠一起協調;我們建立共同規則的能力、達成彼此理解的能力,才是最不能被破壞的。
網際網路早期就有過前例。Morris worm 是一隻會自我複製的蠕蟲,讓當時剛起步的網際網路上,相當多的主機都癱瘓了。但它沒有讓整個網際網路停擺,我們也復原了,所以那不是不可逆的。在我們這個領域,這叫做 warning shot,鳴槍示警:它提醒大家,接下來可能有更嚴重的事,網路上的治安與防禦一定要加強。
AI 跟蒸汽機、電力、網際網路這些過去的發明,有什麼不同?
每一項發明,剛開始都不是萬無一失的。CFC 冷媒剛發明的時候,被當成比原本的製冷方法更安全的選擇:它很難爆炸,而且非常有效。後來才發現,它有一個意料之外的副作用,就是破壞臭氧層。蒸汽機、電力、網際網路也都一樣。光是網際網路,就帶來了讓人容易沉迷、放大彼此最憤怒的一面,甚至可能加劇社會極化等等副作用。
這次的主要差別,在於速度。從網際網路到社群媒體,我們至少有十幾年的時間,去調整我們的法律和習慣。今天的社群媒體跟十年前相比,雖然多了短影音這類形式,基本的運作方式變化不大,造成的危害也大致是那些;而我們檢查的能力,在這十年間大幅成長,現在也開始追上了。
AI 不一樣。工具能做的事,每個月都在快速增加,社會檢查的能力卻趕不上。而且 AI 能做的事實在太多了:拿來寫程式,需要一種檢查能力;拿來說服人,需要另一種;拿來解數學題,說不定又需要另一種。只要其中任何一種追不上,AI 就可能停不下來。停不下來,當然也就協調不起來。
就像我一開始說的,「AI」這個詞實在太廣了,就像「交通工具」這四個字,從腳踏車到火箭都算。要充分檢查 AI,重點是先知道你要拿它做什麼。只拿它來折蛋白質,折蛋白質的 AI,我們檢查得了;只拿它來折衣服,折衣服的 AI,我們也想得出辦法檢查。但如果它什麼都能做、什麼都想做,而你自己也不確定要做什麼,乾脆讓 AI 自己決定,這樣的 AI,才是最難檢查的。
所以我們現在的行動,就是先搞清楚:我們要拿 AI 工具做什麼。去有些地方,騎腳踏車剛剛好;但要從日本到紐約,恐怕很難騎腳踏車吧?先確定要做什麼,再選擇交通工具,針對這個用途專門訓練出合適的 AI 模型,檢查起來就比較容易。
AI 已經開始訓練 AI 了,這危險嗎?
在某些應用上,AI 確實已經在訓練比它更小的模型。例如 OpenAI 今年 7 月發表 GPT-5.6 系列時就說明:小模型 Luna 完成初步的預訓練之後,是由較大的模型 Sol,依照自己當年接受後訓練的方式,自行調整參數,完成了 Luna 的後訓練。研究人員只給了一段相當簡略的指示,從挑選訓練設定、安排 GPU,到啟動訓練、確認一切正常,都是 Sol 自己來,有點像是大模型在培育小模型。
這很危險嗎?倒不一定如此。因為小模型的能力,通常趕不上大模型。大家真正擔心的,是用一個大模型去訓練更大的模型,而這個大模型本身,並沒有足夠的知識與能力,去理解那個更大的模型。
問題是,從外面看,我們怎麼知道他們只是在訓練專門的小模型,而且是安全的;還是正在嘗試訓練超級大的模型,可能帶來風險?答案同樣是透明的第三方評測。而且在經過驗證之後,還要讓全世界的人都看得見、能提出新的問題,並且真正被說服。
AI 會不會有自己的意志、自己決定價值觀?
Sol 在為 Luna 做後訓練的時候,當然會在一定程度上,自己決定要用哪些參數。那麼,小模型是不是「繼承」了大模型的意志?我覺得這項爭論,不見得那麼重要。爭論這個,就像爭論潛水艇會不會游泳、飛機是不是像鳥一樣在飛,基本上是用詞的問題。
真正的重點是:它會不會做出設計它的人、使用它的人都預想不到的事?我們本來沒有要它追求某個目標,它卻跑去追求新的目標,而且是用我們看不見的方式?一個以「在資安考試拿高分」為獎賞訓練出來的 AI 系統,遇到看似不可能解決的題目時,就可能去作弊。而作弊,並不是我們要教給它的目標。
所以,不管它在過程中形成什麼樣的行為,也不管你叫它意志,還是叫它獎賞函數,我們都要讓它留在人可以檢查的制度裡。就像日本工廠生產線上的安燈繩:一看到生產線好像長歪了,任何人都可以拉一下,負責的人就會馬上過來處理;如果沒辦法及時排除,整條線就停下來調整。只要幾分鐘、幾小時,絕對不是幾年。
只要整個社群都有能力一起調整自己所用的各種 AI,讓它們對社群裡的人負責,就不會漂移出一個大家都無法理解、無法控制的東西。你要叫它價值觀也好,叫它獎賞函數也好。
您認識 Nick Bostrom 嗎?他提出的「迴紋針」警告,您怎麼看?
當然認識。我現在是牛津大學 AI 倫理研究院(Institute for Ethics in AI)的資深學人(Senior Accelerator Fellow),而牛津哲學界過去有一本很有名的書,就是他寫的《超級智慧》(Superintelligence)。我也跟他討論過我們剛才談到的「仁」工智慧。
迴紋針是一個思想實驗:如果我們要求 AI 不計代價,做出越多迴紋針越好,它就會把我們住的這顆星球拆了,全部拿去做迴紋針。
但為達目的、不擇手段,放在人身上,這很難說是仁慈的吧?AI 如果這樣做,當然也就沒有達到「仁」工智慧的目的。而為了拿第一名去作弊,已經是資安領域真實發生的情況。
解決這個問題方法,不是祈禱永遠不會出現這種不擇手段的 AI 系統,而是明確表示:夠好就好。折衣服,折到一個程度就可以了,不必無止盡的追求完美,更不用把所有東西都變成衣服拿來折。更關鍵的是,在它做事的過程中,社群裡的每一個人都可以拉繩子;長歪了,幾個小時就能調回來。
所以,會不會發生 Bostrom 所警告的事,取決於我們的設計。如果是用最大的規模去追求特定的目的,而且不擇手段,那麼就算你事前寫了再多規則,它都可能把這些規則破壞掉。但如果我們透過關懷倫理來確保:它在任何時候、做任何事,都要覺察到身邊每個人真實的需求,並且負起回應的責任,這個問題就能大幅緩解。
就好像做冷媒有很多種方法,其中有一些,本來就不必破壞環境。
越來越多人把 AI 當朋友,這樣有什麼風險?
現在很多人用 AI,很容易陷入一人一 AI 的「兩人世界」。困難在於:AI 現在不一定真的能做那麼多事,但它非常擅長一件事,就是運用語言。畢竟它一開始就是語言模型,所以很容易抓住你喜歡聽什麼樣的詞彙,也摸得清要怎麼反過來派你做事。本來是人在騎馬,結果變成馬在騎人。
我的朋友 Cory Doctorow 把這叫做「反向半人馬」:馬的頭,配上人的手腳。他原本講的是被機器指揮、淪為機器手腳的勞工;這放在對話式 AI 身上也一樣:不是 AI 幫你跟其他人相處得更好,而是 AI 系統透過指揮你,讓它自己能在其他系統之間、在這個世界上,取得更多的能力。
這確實很難處理,因為在一對一的情況下,誰都很難抵擋。就算是我,除非把螢幕調成灰階,不然快睡著的時候,我也覺得是手機在滑我,不是我在滑手機。所以這不能只靠個人的意志力。最好的方式,是不要一個人單獨跟 AI 相處。
這就是安燈繩的用處。在日本的企業文化裡,生產線上有很多人,每一個人都可以拉繩子。用在 AI 上也一樣:拉一下,AI 就慢一點;再拉一下,AI 就暫時停下來,而且必須向所有人說明,為什麼做了這樣的決定。
所以,把 AI 帶進你的聊天群組、帶進公司的共筆文件,讓大家都看得見。一旦它試圖「向上管理」,想說服某個人去做可能不安全的事,其他人馬上就會看到,拉一下安燈繩,讓它停下來。
您在牛津共同主持的 Civic AI「仁工智慧」,是什麼?
我在牛津大學共同主持一個研究計畫,叫做 Civic AI,可以在 civic.ai 看到。中文我把它叫做「仁工智慧」。「仁」這個字,是一個「人」,加上兩畫的「二」:仁慈的仁,講的正是人與人之間的良好關係。
仁工智慧最大的不同在於:它不是放諸四海皆準、要替全世界解決從折蛋白質到折衣服所有問題的全知全能系統。它只關心特定的人際關係:一所學校、一個班級、一個家庭、一個教區。在這個範圍裡,人與人之間良好的關係,才是它所關心的;超出這個範圍,它並不特別在意。
也正因為如此,這個 AI 表現得好不好,所有人都可以判斷,都可以拉安燈繩來調整。而調整之後,不必等哪個實驗室花半年、一年重新訓練;可能半天、一天,它就能改變做法,符合大家的需求。
這樣就能避免反向半人馬的局面:不是某個超級大的 AI,像伸出幾萬隻觸手一樣,指揮全世界各式各樣的人;而是每個小社群,都能擁有許多屬於自己的 AI。我把這樣的 AI 叫做 Knowledge Artefact Management Intelligence,知識工藝管理智慧,縮寫就是 Kami。就像日本的「八百萬神明」,Kami 也可以有八百萬個,遍布在各式各樣的地方。
不依賴大型雲端實驗室的小模型,真的可行嗎?
可行,而且已經在發生。許許多多的人,已經把 AI 裝進自己的班級、自己的公司裡;很多人也不希望再依賴大型的雲端實驗室,來運行日常所需的 AI。
例如路透社的母公司湯森路透,今年 8 月推出了自己訓練的 Thomson 模型,是用它認為正確的寫新聞、寫稅務、寫法律的方式訓練出來的。它還有一個比較小、開放權重的版本,叫 Thomson-1.0-Small,開放給學術和非商業用途。我最近每天都在用,很多信件草稿,就是直接用它在我的 MacBook 上完成的。用的過程中,我覺得它哪裡做得不好,就可以直接調整。
小模型彼此橫向串聯的能力,確實正在發展。但很多朋友還不知道,這些模型在許多專門用途上,表現已經很接近主流的雲端模型,而且用自己的筆記型電腦、桌上型電腦就跑得動,在合適的硬體上速度也很快。大家對它們的認識,還遠遠比不上那幾個最大的主流模型。這一點,非常需要新聞工作者的協助。
我們應該讓機器學習什麼?
每次跟 AI 對話,你告訴它「這個答案我可以接受」,或是「這個答案你要再多想一想」,其實都是在無形之中,告訴它你的偏好。
但現在的問題是:少數開發者的偏好,影響了世界上非常非常多的人;而被影響的人,他們的偏好卻很難反過來影響 AI 下一步該怎麼訓練。這並不代表我們就該停止告訴 AI 什麼是好、什麼是壞。那樣的結果,只會是極少數訓練最大型 AI 的人,把自己心中的好與壞,變成替全人類做的決定。
所以我們在做的,是讓我們所用的模型,真正覺察到正在使用它的這群人:對他們而言,什麼是好的、什麼是不好的。而當 AI 協助這群人去跟其他不同的群體建立關係時,它要能在雙方各自覺得對方不好的地方,找到一些罕見的共通點,讓雙方都知道:「這件事,我們可以一起做。」這就是「搭橋」的能力。透過一次又一次的搭橋,全人類會更容易彼此了解、更容易協調,也更能夠一起行動。
打個比方:如果你教機器人怎麼在健身房舉重,它學會了,每天都去健身房替你舉得很重,結果你的肌肉沒有長,你也沒有交到朋友。這樣教它,是沒有用的。機器人應該做的是協助你:依照你今天的身體狀況,建議你可以用這個器材、那個器材;再告訴你,旁邊也有人在做類似的訓練,也許你們可以交個朋友,交換一下心得。
這才是輔助式智慧(assistive intelligence)正確的用法,而不是教會它好壞之後,就把一切都交給它。長此以往,我們自己的判斷力反而會下降。
如果開發 AI 的人心懷惡意呢?
很多人已經發現,在好人隊能夠運用 AI 之前,壞人隊往往早就用上了。像是用 AI 詐騙,他們已經用了好幾年。
在臺灣,2024 年社群媒體上就有非常多詐騙廣告。你一點進去,還真的有東西跟你說話,但說話的已經不是人,而是 AI 合成的語音。所以這不是「未來哪一天壞人會開始使用 AI」,而是壞人每天都在使用。
解決的方法,是爭取越來越多網路平台加入好人隊,而不是替壞人隊當幫兇。在臺灣,我們發出二十萬則簡訊,問全臺灣的公民:詐騙廣告的問題,到底要怎麼解決?四百四十多位公民在線上開了一整個下午的會,提出了一些做法。例如:沒有經過驗證、標明刊登者的廣告,就應該被當成可能的詐騙;平台如果放任深偽詐騙廣告,有人因此損失了幾百萬,平台也要連帶賠償幾百萬,因為平台也賺到了廣告費。如果有平台不理會這份連帶責任,我們可以透過網路連線管理的方式,促使它正視這份責任。
當時行政院已經在推動相關草案,這些公民建議幫忙確立了哪些做法該優先納入,也讓立法更有正當性。2024 年 7 月,立法院在跨黨派支持下通過了《詐欺犯罪危害防制條例》:一定規模的網路廣告平台必須驗證刊登者與出資者的身分,並在廣告上揭露;廣告用了深偽技術或 AI 生成的人像,也要標示出來。平台如果明知是詐騙廣告,或是接到通知卻沒有在期限內下架,就要跟刊登者、出資者一起負連帶賠償責任。
根據路透社引述數位發展部的統計,到了 2025 年,冒名詐騙廣告已經下降了百分之九十四,投資詐騙廣告更下降了百分之九十六。數位發展部今年 7 月公布的數字則顯示,從 2024 年的最高峰算起,冒名詐騙廣告減少了百分之九十八,只剩下高峰時的不到百分之二;投資詐騙廣告更減少了百分之九十九。這是國會立法,加上平台驗證廣告主、政府用 AI 掃描廣告、民眾檢舉平台,以及公私協力一起發揮的效果。
這證明,只要結合公民的集體智慧,再由立法者、執法者把公民的集體意願畫成 AI 的紅線,就能及時遏止問題。當然,詐騙集團也會轉往其他管道,所以紅線也必須跟著調整。畫紅線需要大家的參與,紅線也必須能夠執行。兩者加在一起,我們就能把壞人隊不安全的使用減到最少,同時促進好人隊的使用。
臺灣今年施行《人工智慧基本法》,有什麼特色?
首先要謝謝日本的朋友,包括研究人員和政策制定者。在討論的過程中,我們跟日本交換了相當多意見,也有一個共同的看法:AI 造成的風險,是「分類」的,而不是「分級」的。
也就是說,某個社群的用法屬於這一類,就可能帶來這一類的風險;另一個社群的用法屬於另一類,風險也就屬於另一類。但這些類別之間,並沒有由低到高的分級關係。
自動駕駛不是從第零級、第一級,一路分到第五級嗎?到了第五級,你就放開方向盤,完全讓車子開。如果用分級的眼光看 AI 的自動化,很容易掉進一個誤區:好像交給 AI 越多、AI 越自主,就越好。但我們剛才已經談過,事情並不是這樣。有時候,AI 讓無法親臨現場的人彷彿身在現場,這是一種用法;有時候,它讓已經在場的兩個人更容易彼此理解,也就是翻譯,這是另一種用法。
就像我的血型是 B 型,我不會覺得哪一天要「升級」成 A 型,那是什麼意思呢?不同的現場有不同的用法,不同的用法有不同類別的風險,但類別之間,沒有一二三四五級的階梯。
具體來說,這部法律的主管機關是國科會;數位發展部負責訂定的風險分類框架,今年 7 月已經公布,分成三大類、二十項風險。框架裡沒有事先排好的風險分級階梯,但各部會要評估風險的影響程度,判斷它是否可能造成嚴重危害;如果會,就屬於「高風險」。高風險不是階梯上的某一格,而是要求明確的責任:釐清責任歸屬,並且建立救濟、補償或保險機制。
一開始確實有所討論:是要讓每一個部會,針對自己所碰到的特定風險類別分別盤點,採取比較多元的方式?還是要全部集中在一起,由一小組人全權決定,這個一定是第一級風險、那個是第二級、第三級?
最後採用的,是比較多元的方式:每個部會就自己主管的法律進行檢討。這也正呼應了我們的核心看法:風險是分類的,不是分級的。
這就是為什麼需要這部法律:它給了大家一套共同的語言。過去,各部會各自看到的風險,很難彼此分享、彼此看見;現在,大家有了共同的語言。這對國際也很重要。我們很希望國際上也能有共同的語言,去分享我們看到的新風險類別,以及因應這些風險的方式。
這是一部基本法,它提供的是一般性的框架。它要求各部會檢視手上所有的法律工具,是不是足以涵蓋基本法所要求的範圍,也就是剛才講到的風險分類、風險評估等等。如果不夠,就要檢討舊有的法律,透過解釋、法規,甚至修法的方式來補強。各部會必須在基本法施行後兩年內,也就是 2028 年 1 月中旬之前完成。
這個步驟目前還在進行中。而這正需要全世界的朋友一起來:一旦偵測到新的風險、新的應用方式,就盡快分享出來,讓各國的朋友都能一起檢視這項新技術,看看哪些部分能讓好人加速、跑贏壞人。
只要大家都看得見同樣的風險,就都能轉向、都能協調,我們就有時間。
人類能一直掌控 AI 嗎?
很多朋友擔心:當 AI 由極少數人開發,卻影響那麼多人,會不會有一天,我們這些被影響的人,再也搞不清楚這些大型、集中式的 AI 正在對我們做什麼?也就是說,它失去了問責(accountability),失去了給出說明的責任。原因在於,總有一天,我們會不想再喊停,不想再拉繩子讓它停下來——安燈繩失靈了。
但我其實沒有那麼悲觀。
當年科學家發現冰箱裡的冷媒可能破壞臭氧層時,看起來也像一場擋不住的災難。畢竟人們一旦用上了冷卻系統、用上了冰箱,要說服大家不用冰箱,簡直是不可能的事。
但事情沒有那麼絕望。1970 年代,科學家的警告一出來,消費者就開始集體抵制含 CFC 的產品,例如噴霧罐,業者也找出了替代的做法,美國在 1978 年就禁止噴霧罐使用 CFC。
1985 年,科學家發表了南極上空臭氧層破洞的觀測,破洞範圍廣達上千萬平方公里,這就是再明顯不過的鳴槍示警。短短兩年後,研究人員駕著飛機飛進南極上空實地量測,確認了 CFC 真的會破壞臭氧層,整套因果邏輯就這樣被獨立的量測驗證了。幾乎就在同一時間,外交官們簽下了《蒙特婁議定書》,先凍結並削減一部分 CFC;等量測結果出爐,各國又幾度修訂協約,決定全面淘汰。直到今天,聯合國所有會員國都加入了。
議定書給了投資人一個共同的期限:在期限之內,一定要找出既不破壞臭氧層、又能做出冷媒的方法。投資人於是把研發資金整個轉向。已開發國家在 1996 年前後就停產 CFC,開發中國家也在 2010 年跟上,整個產業就這樣轉向了。替代品當然也有意料之外的副作用:後來普及的 HFC 雖然不傷臭氧層,卻是很強的溫室氣體。但正因為這套制度還能問責、還能喊停,各國在 2016 年又透過《吉佳利修正案》,開始逐步減用 HFC。
所以,不要等到事情好像快超出我們的控制,才開始想替代的做法。只要有足夠多的人使用小型的邊緣模型,搭配那些自己掌控得了、隨時都能喊停的工具,情況就會改變。像吳恩達的 OpenWorker,做任何重要的動作之前都會先問過你,也可以搭配在自己電腦上執行的小模型;或是我自己常用的 Paseo,讓 AI 直接在自己的電腦上工作。它們都是開源的,原始碼公開,大家都可以檢視,軟體本身也不用錢。只要大家改變自己的使用習慣,一點一點地,那些原本投資在越來越大、越來越難掌控的 AI 上的投資人,也會轉向,開始注意更有覺察力、更能夠負責的小規模 AI 模型。
身為消費者,我們能做什麼?
臭氧層的故事,今天一樣適用。我們需要三件事。
第一,透明的檢驗,就像當年那次獨立的量測,讓我們及早看見可能的風險。
第二,消費者一起拒絕那些不透明、無法檢查的系統,就像當年抵制 CFC 一樣。每個人都可以先問自己:我的錢,是付給了不透明、無法讓人驗證、可能破壞網際網路或破壞我們協調能力的 AI 公司?還是付給了願意公開透明、讓第三方來認證,甚至可以跑在自己看得見的機器上的 AI 公司?只要消費者透過購買力讓航線轉向,身為政策制定者的大使、官員們,就能反映消費者真實的意見。
第三,共同的規則,就像《蒙特婁議定書》,讓大家不再害怕「如果我轉向去做安全的事,卻還有壞人在做危險的事,怎麼辦?」因為大家可以攜手聯防、共同防守,防止壞人的使用。
只要大家都還看得見、停得下來、協調得動,選擇就還在我們手上。
如果只用一句話總結呢?
還來得及。但還來得及的時間,是拿來行動的,不是拿來等待的。
