我覺得不太一樣。MoE 的話,它每個 token 都碰到不同的所謂 expert,所以這些 expert 其實還是同時預訓練:同一包資料裡特化出一些不同的層,只是它可以減少算力消耗,或者記憶體消耗。
j 下一段next speechk 上一段previous speech