第二個是我剛才講的,就是說即使是在離線的版本裡頭,它也是有對於關鍵詞跟歷史事件,會跳過思考去做出不自然的這種迴避。那這個當然也會引發大家不信任,或者不想使用,覺得審查痕跡太深。
第三個才是它自然的回答,但是回答裡面透露出特定的意識形態。
對。但是我們目前也已經看到,像 Perplexity.ai 它所內嵌的那個 R1 的版本 ,就是他們已經透過模型的權重的修改,把裡面自我審查、不自然的迴避等等這些部分都去除了。所以你即使是在 Perplexity 不開搜尋,你用所謂的輔助寫作模式,去問 Perplexity 版本的 R1 這些問題,包含剛才講到的關鍵詞、歷史事件,它都會很正常地回答。
這就表示說,事實上是因為它的權重釋出,可以修改到可以把這些不自然的迴避去除掉。
我還沒試過「天安門屠殺」,我是試「天安門慘案」。
因為它的本質是一個文字接龍嘛,所以不同的措辭,它後面通常就會接不同的描述,也就是那個措辭本身是有一個定性的。
我想我們在寫作的時候也會看到,像一篇報導的標題,它標題使用什麼,那你大概也可以猜出它裡面的內文要用什麼樣的筆調來描寫。
因為語言模型它基本上是接龍的能力,所以你在告訴它標題之後,它後面的那個回答的內容,也就會跟著這樣子來接續。
所以我剛才有強調,就是說我們臺灣當然是非常強調言論自由,強調多元參與。如果碰到技術或者產品有這樣子的情況的時候,一方面當然比較不信任、不想使用,二方面就是會運用我剛才所說的其他那些技術。
好比說我舉例,除了 Perplexity 之外,Hugging Face,也就是我一開始發現有這個模型的地方,他們自己也開始了所謂的 Open-R1,也就是說運用 R1 的這種訓練的方式,但是不加入審查模組。
所以不是說把 R1 下載下來之後,把審查模組去削除掉,而是沿著 R1 的方式重新訓練一次,從一開始就不加入這些審查模組。那這個情況下,當然將訓練出來的 Open-R1,相信在這方面就不會有這種讓人覺得「怎麼忽然之間就很不自然」的回應情況。
所以也可以期望說,像 Open-R1 這樣子比較透明的模型,也可以更多地被運用在其他的大廠裡面,就不一定要自己再用 DeepSeek-R1 然後再去進行修改等等。那這是一部分。
那另外一部分是說,我們也已經看到 Hugging Face 上面,開始有各國都自己拿了 R1,然後再加入自己的語言材料。那這樣子就比較容易來處理剛剛講第三層的這個問題,就是因為它比較片面地吸收一些資訊,所以導致它即使願意回答,還是有特定的意識形態。
舉例來說,像日本的 CyberAgent,就運用日文的語料去做了額外的訓練,所以當你問這些敏感的問題,但是用日文問的時候,他就不會受到本來的意識形態限制。
對,相對上。但剛剛講的就是說,因為它的權重是開放的,所以當你下載下來,然後再繼續用好比像剛才講的日文語料來訓練的時候,它碰到日文的問題,就會傾向你後面給它加強的那個版本。
所以目前看起來就是兩個:一個是比較徹底的,就是自己重新按照 R1 的做法訓練一次;第二個是拿著 R1 把它第二層的審查模組移除,或者是再加上新的語料,去讓它在第三層的意識形態做修正,那這樣是處理掉第二層跟第三層的問題。那第一層因為本來你下載下來,就不需要靠著它的網頁界面或者 app,所以這樣子的話,第一層本來就不存在問題。
我不確定您的意思是什麼?好比像說現在你如果到 chatgpt.com,那當然它不會提供 R1,它現在提供的是 O3 Mini。那你可以按個「思考」按鈕,就可以使用 O3 Mini。那 O3 Mini 在各方面都跟 R1 相比,很多方面更好一些。
所以您剛剛講的是說,好,那我現在有免費的 O3 Mini 可以用,我有免費的 DeepSeek R1 可以用,在兩邊都可以用的情況下,大家做選擇的考量是什麼?是這樣的問題嗎?
應該這樣講,就是說,如果同樣是免費的使用,那 DeepSeek 的品質又沒有特別更好,它又有這方面意識形態方面偏見的狀況,那當然對使用者來說,這並不是一個取捨。
也就是說,我既可以用功能同等或者更好,而且又比較沒有這種意識形態的問題,那大部分使用者應該還是會去使用比較沒有這方面問題的。
你剛剛的問題只有在要做出權衡時:就是 DeepSeek R1 真的比其他的產品都好得多,而且讓大家覺得好像非得忍受一下它的意識形態審查機制——那樣才會造成問題,但是現在並沒有。
除了 OpenAI 之外,像 Gemini 它也有 AI Studio,裡面也有它所謂的 Flash Thinking,事實上現在在很多排名裡面是最好的,所以同樣地,它也沒有這種意識形態的問題。那也有很多人,如果完全不願意付錢的話,也可以直接去使用 Gemini 的 Flash Thinking。
一方面是說,因為各地的新聞都在討論嘛,那下載 APP 並不是需要花很多時間,所以很多人會看到新聞就覺得「那我也來用一下看看」。
當然在臺灣這邊,我們也看到像數位發展部已經很快就說,你如果使用它的 APP 或者用它的網頁服務,那資料基本上它的儲存以及之後怎麼運用等等,基本上就是 DeepSeek 那家公司說了算。
所以數位發展部馬上就提出說,在公部門也好,公立學校也好,它是所謂的危害產品,就是說跟 TikTok 一樣,是中共可以實質控制的,所以不能來使用。它特別講的就是 DeepSeek 的這個服務,包含 web 跟 app 的部分。
對,我們在 2019 年開始,就有《危害國家資通安全產品限制使用原則》。這個原則著重的就是,不管它標明產地是哪個國家,只要是受境外敵對勢力的實質控制,那公務機關無論是他們自行營運,或者委外營運、提供公眾活動使用的場地等等,都是限制的。主要原因當然就是它的實質控制權,這個遙控權並不在我們可掌握的範圍之中。
那當然,如果是像剛剛講到的 Hugging Face,自己按照 R1 那篇論文重新訓練出 Open-R1,就沒有這個問題。雖然它用的原理是一樣的,但是實質的控制權並不是在北京當局手上。
對,就是他的擔憂第一層是,這個 APP 或者這個網頁會在沒有辦法有效監管的情況下外流,並且構成危害的風險,這是第一層。
我們剛剛另外講的包含第二層、第三層,就是這個模型的權重裡面內建一些審查的本能,以及它的訓練資料裡面帶有特定的意識形態。那這是不同層。所以剛剛講的「危害產品」,是在講第一層。
這是一個嘛。那另外一個就是,如果你去看 R1 的論文的話,它特別有對於怎麼樣幫助使用者、怎麼樣減少對使用者的危害,做一些訓練,但是在「誠實」上面,論文裡面比較沒有提到。
那這樣的結果就是說,你要求 DeepSeek-R1 模型生成一些比較惡意的用途,好比像去進行人身攻擊,或者是去進行一些訊息散佈、詐騙劇本等等,它基本上是不會拒絕的。
所以這也是另外一個方面,就是它在訓練過程裡面儘可能去迎合使用者的需要,但如果使用者是具有惡意的使用者,它比較沒有做這方面的防制。
應該是,剛剛講說如果像 Perplexity,那樣子看起來是蠻徹底地去突破第二層。如果你是用它來進行網頁檢索搜尋,它會有 grounding,就是它會用找出來的那些網頁結果當作事實,所以它在第三層的這個自己「幻覺」出特定意識形態的問題,也比較不大,因為它會用實際網頁找出來的那些結果來做 grounding。
所以用 Perplexity 的版本,我目前到現在的感覺,不能說完全解決第二層、第三層的問題,但是已經有效去防堵到一個程度。但當然要徹底解決這個問題,還是像剛剛講到的 Open-R1 這樣子,重新訓練一個。
那當然也有一個很簡單的,就是大家也可以去用 Gemini Thinking,那個也是免費的,或者是 O3 Mini 等等,用其他 AI 公司的模型。因為在大家所看中的那些層面,包含寫程式、推理等等上面,Gemini Thinking 或者 O3 Mini 並沒有比較差,所以其實這不是一個需要做出的權衡。
倒沒有,我就像我剛剛講的,我到現在還是主要用的是 O1 Pro。
所以我只是說,它剛出來的時候,就剛出來一兩天吧,我因為定期會看 Hugging Face 上面新的模型,所以有下載下來在本機來試用。那 Perplexity R1 剛出的時候,我因為想知道它有移除掉多少這種審查,所以也用了一陣子。但是我現在日常最常用的,還是 O1 Pro,然後配一些 O3 Mini High。
我覺得比較重要的還是說,因為這個禮拜,大家對於自己的資料權利、隱私權利、言論自由等等,越來越重視了,可以看到討論都是繞著這個在轉。
我覺得這是很好的事情,因為大家越注重這些基本的人權——人權不只是存在於類比世界,線上世界也是一樣的。所以這個部分,我覺得越討論,大家就越會有一個共識,就是你至少需要尊重到哪些權利才是好的。
那這也對於接下來 open source(開源)的發展,是一件正面的事情。因為在國際上面也有討論說,open source 到底能不能促進我們剛剛講到的那些權利,還是因為很容易產生詐騙、深偽等等,會削弱這些權利?這是一個很大的討論。
但如果現在大家的討論是往「open source 怎麼樣才能盡到社會責任,甚至是能夠透過開源的方式,一起設計某些能夠抵禦惡意用途的共通工具」等等,那這樣大家就會把 open source 接下來的發展,引導到對社會、對人權都比較好的一個方向。
沒問題,感謝。我後面這一段我會做逐字稿,但是我會等您發佈之後再發布。
好的,謝謝。
不好意思,能請您再重複一下問題嗎?
它最大的獨特之處,在於能壓縮到一台高階筆電上運行。
因此,儘管前沿實驗室需要大量的運算與維運成本,但如今在手機或筆電上,也能運行 DeepSeek 的精簡版本。
不過也正因如此,往往隨同服務提供的保護機制(guardrails),可以在本地端被完全消融(ablated)刪去。
如此一來,要把 AI 武器化,用於激化社會分歧、釣魚式攻擊、宣傳操作等目的,都變得更加容易。
DeepSeek R1 的訓練方法,主要是讓 AI 自問自答,並透過「判定對或錯」的過程——例如數學或程式碼題目——來驗證自己的思考脈絡。
過去,大量的資料蒐集或人工標註都十分必要,但他們的訓練流程顯示,只要在任何能以標準答案驗證的領域,都能顯著降低訓練成本。