2026年8月12日 星期三

AID02-模型怎麼變強,又為什麼要搶 GPU-5分鐘學AI

 AID02-模型怎麼變強,又為什麼要搶 GPU-5分鐘學AI


蒸餾、推理模型、專家混合,三種讓模型變強的做法。

GPU 跟 CPU 差在哪,雲端跟自己養又該怎麼選。


#一起搞懂AI #AI名詞 #AI入門 #白話AI #企業AI



模型怎麼變強,又為什麼要搶 GPU。


阿哲,我最近常看到新聞說某家公司又買了一大批 GPU,還有人說公司要自己養一個模型。這些我完全看不懂。這裡面其實混了兩件不一樣的事。一件是模型怎麼變強,另一件是它跑在誰的機器上。咦,我一直以為是同一件事。不一樣。就像一家餐廳,廚師怎麼練出來的是一回事;這頓飯在你家廚房煮,還是叫外送,是另一回事。這一集前半講廚師,後半講廚房。


那我們先講廚師。第一個名詞叫蒸餾,聽起來像在做酒。名字是有點怪。它講的是拿一個很大很強的模型,讓它把答案一題一題示範出來,再讓一個小模型照著學。


喔,就像老師傅帶學徒?學徒不用把師傅讀過的書再讀一遍。對,就是這個意思。學徒身材小、動作快,養起來也便宜,本事卻有師傅的八九成。那為什麼要做出小的?直接用大的不好嗎?大的貴,而且慢。手機裡、客服系統裡那些要馬上回你的地方,塞不下一個大的,也等不起。那學徒會不會有一天超過師傅?很難。因為他學的是師傅怎麼答,師傅沒教過的他不會,師傅本來就答錯的他也照錯。所以小模型是比較快、比較便宜,不是比較聰明。


那第二個呢?我看到有一種叫推理模型,聽起來像在辦案。差別在它回答之前,會先自己把步驟走一遍,走完才開口。一般的模型是你問了它就答,像脫口而出。


喔,就像考數學,有人看一眼就寫答案,有人會先在旁邊列式子?非常接近。列式子的那一種,比較不會在中間算錯,遇到繞來繞去的題目差很多。那為什麼不全部都用這一種就好?因為它想的那一段也要花時間、也要花錢,一題可能貴上好幾倍。問今天星期幾,不需要列式子。那我怎麼知道什麼時候該用它?有一個簡單的判準:這一題你自己做,需不需要拿紙筆?需要的話,就換它來。


第三個名詞更玄,叫專家混合。是一堆專家一起討論嗎?不是一起。它裡面分成很多組,每一組擅長的東西不一樣。你問一題,它只叫醒其中一兩組來回答,其他組在旁邊沒事做。


喔,就像去醫院不是所有醫生一起看你,是先掛對科?對,而且掛號那一步在你看不到的地方就分好了。所以它可以做得很大,跑起來卻不會貴到不能用,因為每次真正動起來的只有一小部分。那它會不會掛錯科?會。而且掛錯的時候它不會告訴你,答案一樣講得很順。這是你在外面看不到、也控制不了的一層,所以重要的問題還是要自己驗一次。


講完廚師,來講廚房。為什麼大家都在搶 GPU?先說它是什麼。GPU 本來是拿來畫遊戲畫面的晶片,特色是可以幾千件簡單的事同時做。


那 CPU 呢?我電腦裡那一個。CPU 是那個很聰明、什麼都會的,但它是一件一件照順序做。你的系統、你打的每一個字,都是它在處理。


喔,我好像懂了。就像一個大廚要切一千顆洋蔥,跟一千個人一人切一顆?就是這個畫面。AI 在算的,剛好就是非常多、但每一筆都很簡單的計算,所以用 GPU 快得不像話。那 CPU 是不是就沒用了?不是。真要一個人把一道功夫菜從頭做到尾,還是得靠大廚。它們是適合做不同的事,不是誰比較強。那為什麼會搶到缺貨?因為全世界同時在找同一種幫手。不是它突然變好用,是要用的人一下子變太多了。


最後一段。你剛剛說的自己養一個,到底是什麼意思?先講另外一半。雲端模型,是模型放在別人準備好的機器上,你連上去用,按用量付錢,開機就能開始。


那自己養的那一種呢?那叫地端模型,是把模型裝在公司自己的機器裡跑。資料從頭到尾不用送出公司。


喔,就像東西放自己家的倉庫,跟去外面租一個倉庫?很貼切。租的隨時可以租大一點,屋頂漏水有人修;自己家的鑰匙只有你有,可是修屋頂也是你自己來。那是不是自己養就一定比較安全?這是最常見的誤會。機器搬回家,只是把門搬回家;門有沒有鎖好是另一件事。權限沒設好,放在自己家一樣會外流。那到底怎麼選?先問一句:這些資料能不能離開公司?不能,就只能自己架。可以的話,多數人從雲端開始比較划算,等量大了再說。


那我們最後重新排一次好不好?好,你來。前半是怎麼變強。蒸餾是大模型示範、小模型照著學;推理模型是回答之前先把步驟走一遍;專家混合是裡面分很多組,每次只叫醒幾組。後半是跑在哪裡。GPU 是一千個幫手同時做簡單的事,CPU 是一個聰明的人照順序做完;雲端是用別人的機器按用量付錢,地端是架在自己公司、資料不出門。完全正確。以後聽到公司要導入 AI,你只要問兩句話:要多聰明,還有資料能不能出公司。


企業級智庫引擎。讓公司的知識,答得出來、查得到、帶不走。


沒有留言:

張貼留言