所以我們大概到今年就慢慢到一個,其實你不一定要物理上全部都集中在同一個地方來推導,尤其是我們剛剛講到只是自己養龍蝦的這個程度,也就是差不多 70 billion,最大可能幾百個 billion 的模型,不是上 trillion parameter 的模型,那你透過這種分散式的方式,其實不管是微調還是推導都非常容易。預訓練當然現在還在早期,但是也慢慢會追上。
j 下一段next speechk 上一段previous speech