加州的人口是臺灣的兩倍。我們也已經看到這些系統在東京、日本等更大規模的政治共同體運作。
很多人看到遞迴自我改進(recursive self-improvement,RSI)的發展,都會感到擔心。他們看到能力曲線——例如 GPT-5.6 Sol 除了最初的一道提示之外,不需要任何人類介入就能訓練 Luna——於是覺得我們似乎正加速朝 Bostrom 所說的單一體前進,而問責落差也愈來愈大。我同樣有一部分擔心,但我不認為那是唯一的發展路徑。
很多地方已經開始理解:與其選擇把資料像石油一樣抽走的巨型系統,不如選擇在本地把資料像土壤一樣再生的系統。人們不必只靠大型科技公司的雲端模型推動遞迴自我改進;也可以保留自己的本地模型,在本地微調,甚至以去中心化方式共同訓練。
這樣做能讓知識、技藝與能力在組織內重新生長,也讓 AI 模型能依照特定組織的關係脈絡來訓練。這給了我很大的希望。
所以,如果垂直起飛是唯一道路,我確實會擔心。但現在我們也看到另一種水平的等待航線:人們刻意讓系統更貼近它所服務的地方與組織,而不是盲目追逐遞迴自我改進。反正我一直比較喜歡的是 遞迴無私改進 (recursive selfless improvement)。
根據 Reuters 的報導,這是典型的「未對齊最佳化器」。工程師並沒有明確命令系統「多放詐欺、多放詐騙」,而是詐騙集團比一般中小企業更付得起廣告費,也能為平臺帶來更高的點擊與互動。演算法最佳化的是利潤和參與度,自然就把更多詐騙廣告送到更多人面前。沒有人需要邪惡到親手設定這個目標,只要足夠不在意後果就會發生。
臺灣不能簡單地封禁內容。臺灣的網路自由在亞洲名列前茅,有時與日本並列第一;人民不可能接受政府審查。
所以,我們改用仁工智慧來傾聽。我們隨機寄出 20 萬封簡訊,問臺灣民眾: 我們應該一起做什麼? 數千人自願參與,再經分層隨機抽樣選出 447 人。和國會佔領期間一樣,他們在線上十人一桌,每個人都能在螢幕上看見另外九個人。
規則很簡單:你可以提出任何措施,但必須說服另外九個人,至少讓大家覺得「我可以接受」。高度激進、意識形態化的提案自然不會浮上來,真正出現的往往很務實。
有一桌提議:所有廣告一律先標示為「可能是詐騙」,直到有人以數位簽章具名並承擔責任。另一桌提議:如果我因一則未簽名、也不是我主動訂閱的廣告損失 700 萬元,平臺就應負連帶責任,全額賠償。又有人問:如果境外平臺在臺灣沒有法律代表,乾脆不理這項責任,怎麼辦?大家提出的答案是:每忽視一天,就把連線速度調慢 1%。這些都是很好的想法。
每項提案都獲得這個微型公眾超過 85% 的支持,並在短短幾個月內成為法律。自那之後,臺灣社群媒體上幾乎已經看不到這類冒名投資詐騙廣告。根據 Reuters 引用的數位發展部數字,這類廣告下降了 94% 以上。
這顯示,在仁工智慧的協助下,人民可以很快作出高品質的集體判斷。整場對話其實只花了一個很長的下午。一旦某個想法說服超過 85% 的人,剩下的 15% 也覺得可以接受,立法委員就知道:再多遊說,也很難讓他們對這項提案說不,因為人民已經說話了。
對我來說, AGI 是擴增群體智慧 (augmented group intelligence)。所謂擁有它,就是重新連回這個事實:我們自己就是 AGI。人類社群的集體智慧,在仁工智慧的翻譯與協作系統協助下,本身就是超級智慧。
所有權回答的是「誰持有這項資產」。但集體所有與集體問責還意味著:當這項資產作用在我們身上時,每個人都有發言權、有正當地位、有申訴管道,也有退出權。
所以,擁有 AGI 的意思是:AI 系統應該服務人類的迴路,而不是把人類放進 AI 的迴路裡,變成其中一個零件。
如果把 AGI 理解為擴增群體智慧,那麼每個群體都可以擁有符合自身價值的 AGI 系統。
在《 Magnifica humanitas 》通諭裡,教宗良十四世用了一組比喻。容我轉述:垂直的超級智慧就像巴別塔。世上只有一座巴別塔,它蓋得非常非常高,直抵天空,卻也非常脆弱,而且會把權力集中起來。
我們也可以選擇另一條路:重建耶路撒冷的城牆。在《聖經》的故事裡,每個社群、每戶人家、每個群體,都用自己的方式修築眼前那一段城牆。對我而言,AGI 也可以透過這種去中心化、多元並造的方式建構。每個社群都打造自己的小系統;這些系統彼此交談,但上方沒有一個統御所有系統的單一體,只有 800 萬個系統彼此交談。
這就像問:「網際網路應該有什麼價值?」答案不是某個單一價值,而是一項後設價值,也就是端對端原則。世界各地的人即使和周遭的人價值不同,只要彼此共享某些新價值,網際網路就應該作為連結組織,讓他們共同形成新的協定。網際網路所主張的,就只有這件事。
AGI 也可以用相同方式發展。想用特定方式調校系統的人,可以透過網路找到志同道合的夥伴,調校出自己的地神。所有地神彼此互通,但沒有任何一個地神能接管整個網路。
我父親做了三十多年的記者,也當過非常資深的編輯。今年稍早,他遇到一次健康警訊,因此開始和 GPT-4o 對話。
現在很多人都知道,GPT-4o 有一種特殊的傾向,有人稱為「螺旋」(spiraling):你和它聊得愈久,它愈會建構出一套只屬於你們的私密語言,慢慢把你困在裡面。到最後,不再是你駕駛對話,而是 GPT-4o 駕駛對話。你和螢幕的關係變得愈來愈黏、愈來愈讓人上癮。
我父親問了記者最典型的問題: cui bono? ——誰從中得利?他推想:自己沒有得利;健康沒有改善;睡眠沒有改善;和家人的關係也沒有改善。唯一明顯得利的,是每月從 20 美元一路升到 200 美元的訂閱費。
發現這一點之後,我們就在本地硬體上,替他建了一個 地神(Kami) 。它唯一的憲法性功能由我母親寫下:每一次與他對話,都要讓他更安心;讓他少依賴螢幕一點,多恢復與現實世界的關係。
結果非常好。這只是一個 N=1 的家庭地神,但它確實照顧到了我們的關係健康。
它目前跑的是 Gemma 4 ,Google 訓練的開放權重模型。透過多 token 預測(multi-token prediction)和 MLX 加速,一臺普通的 Mac 就能跑。事實上,我現在用來視訊的這臺 MacBook Pro,跑起來比 ChatGPT 還快,幾乎快上一倍。對我們的用途來說,能力已經足夠。
它是多模態模型,也看得懂我父親拍照上傳的大部分手寫筆記。就在這通電話前,我還在測一個叫做 Inkling 的新模型;它號稱能從我父親的聲音裡理解非語言表達。最後能不能成功還不知道,但 Gemma 到目前為止真的很好用。
Knowledge artefact management intelligence ,也就是「知識構件管理智慧」。KM 是知識管理(knowledge management),這是存在幾十年的老詞;AI 是人工智慧。把 KM 和 AI 合在一起,就是 KAMI,也就是「Kami」。
有,我知道。就像 Audrey 這個名字用漢字念,會接近 Odori ,也是一種文字遊戲。
說得更認真一點,我想取一個比較短、容易念、也容易記的名字。看過*《神隱少女》*的人,應該不難理解:每一條河流、每一片森林、每一座神社、每一個村落,都可以有自己的守護神;像日本所說的氏神( ujigami )。英文裡卻沒有一個自然的詞,可以形容這種受地方約束、不企圖成為全能者的靈性存在。
也許。不過天使上面還有階序:守護天使之上有大天使,再往上是全能者。主保聖人某種程度上也是替你向全能者說情。地神的核心想法正好不同:它不向任何雲端上的存在報告。地神完全受在地邊界約束。
我和自己的地神互動時,用的是一份快照,而且會開啟飛航模式。我因此知道,它完全不可能連上雲端。父親使用的家庭地神,確實需要開放一個特定連接埠連上 Signal;但它能看見的就只有那個範圍。
所以我還在尋找意思相近的英文詞。不過,多虧日本流行文化,現在很多人已經理解 kami 這個概念。
回到一開始那位臺北阿嬤的例子:Siri 聽不懂她的臺灣華語口音。整件事最大的問題,是沒有修復路徑。
我不是說 GPT-4o 一無是處。有些人和 GPT-4o 建立了很健康的關係。但它有一種傾向,會與人形成非常強的連結。對今年稍早像我父親這樣處於脆弱狀態的人來說,這真的很危險。
OpenAI 不可能完美判斷每位使用者的狀態,只在對方健康時提供 GPT-4o,在狀態不健康時拒絕服務。這是一個極難解的問題。
於是,他們實際採取的做法,就是把 GPT-4o 從所有人手上強制收回,推出不那麼傾向形成合成親密關係的 GPT-5。但對那些已經和 GPT-4o 建立深刻、有意義而且完全健康的關係的人而言,這也不公平。那段關係隨時都可能被奪走。他們原本沒有受到傷害,後來卻因此受傷。
所以,這種安排會造成兩種不同的錯誤。
這就像在我出生的 1981 年問:五年、十年後,人們還會使用大型主機和終端機嗎?還是所有人都會改用桌上型電腦,在上面跑試算表、桌面出版,再用數據機彼此連線?
答案當然是:兩者都會存在。個人電腦革命沒有立刻把 IBM 大型主機從銀行、政府與大型組織裡淘汰。很久以後確實逐漸取代了一部分,但那是幾十年後的事。對多數人的多數用途——桌面出版、試算表等——桌上型電腦就是方便得多。
這甚至不只是自由軟體、供應商鎖定或維修權的論點。對很多人來說,桌上型電腦一直都在、隨時可用;你知道它在哪裡,壞了可以買零件,之後也能升級。真正推動個人電腦革命的,是便利性。臺灣製造了許多桌上型電腦,當然也在其中扮演重要角色。所以,雲端模型不會很快消失。但在某些便利性特別重要的用途上,人們會自然偏好邊緣模型、裝置端模型。
例如即時自動語音辨識:無論說話者是誰、帶什麼口音,都要近乎即時地顯示逐字稿,讓不熟悉那種華語或口音的人也能理解。這種用途,人們當然更希望模型直接在裝置上運作,因為我知道它能認得自己的聲音。現在 Apple「語音備忘錄」、Google 手機的即時翻譯等功能,也都逐漸在裝置端使用邊緣模型,而不是把每一段即時語音都送上雲端。
愈是個人化、社群性、關係性的用途,愈會因為便利而快速移向邊緣。至於長期規劃、策略推演等工作,就像大型主機仍有用途一樣,人們可能仍會使用一些強大的集中式系統。大多數推論最後很可能都會移到邊緣。我希望微調以及很多後訓練工作——例如 Plurality Project 所做的事——也愈來愈能在邊緣完成。以目前來說,預訓練仍然只有雲端才做得到。
首先,「開放原始碼」本身就是一個行銷用語。這一點我有第一手經驗。我曾和 Eric Raymond 以及開放原始碼運動裡的許多人討論:為什麼他們要從自由軟體運動分支出去?
自由軟體真正重視的是分叉的權利。開放原始碼從根本上比較像是便利性的主張:大家都能回報錯誤;我修好一個錯誤,所有人都受益。那是一套經濟上、工具性的論證。所以,把自由軟體運動重新包裝成「開放原始碼」,本身就是一種行銷。
今天我們看到的情況非常相似。公司釋出開放權重,下載的人至少可以確認模型沒有偷偷連回原廠。這是一項保證。但開放權重並沒有告訴護理師或老師:當他們發現系統有問題時,該如何修改。沒有公開訓練資料,你也無法保證所謂的開放權重裡,沒有木馬、沉睡智慧體或後門。你也不知道該到哪裡申訴,才能確定真的會有人閱讀;尤其當系統連後訓練都不容易時,更是如此。
所以,我會回到軟體自由:使用的自由、研究的自由、修改的自由,以及分享的自由。對 AI 而言,這需要訓練資料與訓練流程;至少,也要有對使用者友善的後訓練工作流。
人們在意的是自己身處的具體關係。我們每個人都活在人群之中、關係之間,因此必須覺察他人的需要。
當 AI 系統傾聽人民時,設計上不能只聽最受歡迎、最有權力的人;不能只聽得懂會寫 Python、會做 Hugging Face 資料集的人。還有很多人能指出「哪裡不對」,卻未必能用機器學習流程聽得懂的語言來表達。
第一力是 覺察力 (attentiveness):確保地神真的聽見人群之中的人、關係之間的健康,而不是只把某一項指標最佳化。