唐鳳

那當然我們在做多智慧體訓練的時候,方法去訓練就是去讓它去獎勵所謂的 bridging,就是本來各執己見的人,都覺得這是個意料之外、我們都可以同意的事情,那你把這個當作它的獎賞函數的時候,它就會去促進不同的人能夠彼此接近。