知識圖譜是把人、案子、合約變成點,把關係變成線。 跨好幾份文件的問題,要沿著線走才答得出來。
#一起搞懂AI #AI名詞 #AI入門 #白話AI #企業AI Knowledge Graph 怎麼讓 AI 把知識連起來。 阿哲,我們公司的資料都放進去了,問一段話它也真的找得到。可是我一問這個客戶的案子當初是誰接的,它就開始亂講。因為那個答案不在任何一段裡面。一份文件寫誰負責,一份寫案子叫什麼,後來為什麼砍價又寫在第三份。咦,那它一段一段找,不就永遠拼不起來?對,這就是這一集要解決的事。差別在知識的擺法。文件是一疊一疊放的;換成一張誰跟誰有關係的圖,它就走得過去了。 那第一個名詞就是知識圖譜嗎?圖譜這兩個字,聽起來好學術。名字唬人,東西很單純。它把人、案子、公司、合約,各自當成一個點;再把誰負責哪一案這種關係,畫成一條線。 所以它不是把文件收好,是把關係記下來?對。文件還在,只是多了一層東西記著誰跟誰有關。張經理連到那個案子,案子連到那家公司,公司再連到三份合約。喔,就像家裡那本族譜?上面不寫每個人的生平,只寫誰是誰的爸爸、誰又嫁給了誰。就是這個感覺。族譜的價值不在字多,在於你可以從一個人一路指到另一個人。要提醒一件事,這不是一個更聰明的搜尋,它換掉的是知識的擺法。那這些點跟線,是從哪裡冒出來的?從你本來就有的資料裡整理出來的。一張報價單上有業務的名字,也有案號,這兩格本來就是一條線,只是以前沒有人把它牽起來。 那 Graph RAG 呢?後面那個 RAG 我知道,是回答之前先去查一遍。差別在它怎麼查。一般的做法是各撈各的段落,撈回一堆用字很像、但不見得有關的東西;它是先找到那個點,再沿著線走過去。 那實際問一個問題的時候,差在哪裡?你問這個客戶的案子當初是誰接的。一般做法是拿這句話去比對段落,撈回一堆提到這個客戶的文字。它是先找到這個客戶,再沿著線走到案子、走到那個人。喔,就像提一串粽子?抓住繩頭一提,底下一整串都跟著上來,不用一顆一顆挑。這個比喻很好。差別在帶回來的東西彼此真的有關係,不是剛好用字很像。不過要注意,它走得到的路,只有事先連起來的那些。那沒連起來的那些呢?一樣看不到。這個客戶跟另一個客戶其實是同一個老闆,你沒把那條線牽上去,它就永遠繞不過去,而且它不會告訴你有一條路是斷的。 那 Graph Engineering 呢?工程這兩個字一出現,我就開始緊張。它講的是那些線是誰決定的。哪些東西算一個點、兩個點之間那條線叫什麼名字,都要有人先定義好,圖才長得出來。 所以圖不是自己長出來的?我還以為資料丟進去,它就會自己連。不會。誰算一個點、兩個點之間那條線叫什麼,都要有人先講清楚。負責跟參與是不是同一回事,機器不會幫你決定。喔,就像我幫家裡每一把鑰匙貼標籤?哪一把開哪一道門,是我自己寫上去的。很貼切。而且標籤寫錯的時候最麻煩,你照著標籤一路開下去,會很有條理地開錯一整排。關係定義錯了也一樣,它會很有把握地走到錯的地方。那這件事是一次做完就好了嗎?不是,它要一直養。公司多了一種合約、多了一種角色,就要多一種線。這也是為什麼它叫工程,不叫設定。 最後這個我很常看到。它回答完,旁邊會標一個百分比,說它有幾成把握。那個叫信心分數。它是自己估出來的一個數字,講的是它對這次回答有多確定,不是有人真的去核對過答案。 所以它標九十分,就是九成會對?不是。它算的是自己有多確定,不是這件事有多真。資料裡根本沒寫的東西,它照樣可以給你一個很高的分數。喔,就像考完試自己估分數?我覺得我這題穩了,跟老師改出來是幾分,是兩回事。這個比喻剛剛好。你估的是你當下的感覺,老師改的才是對不對。中間少掉的那一步,就是有人真的去對過答案。那這個分數到底要拿來幹嘛?拿來排先後。分數低的那幾筆先撈出來給人看一眼,這是它最好用的地方。但是分數高的那些,不代表你就可以不看。那它連自己有多確定都會估錯,這個分數還有什麼用?它的用處全在低分那一端。分數低,代表它自己也覺得心虛,那幾筆先撈出來給人看最划算。分數高的那些,只是它不心虛,不是它查過。 那我把這一集重新排一次好不好?好,你來。知識圖譜是把人、案子、公司變成點,把誰跟誰有關變成線。圖譜式檢索是先找到那個點,再沿著線把相關的帶回來,不是各撈各的段落。圖譜工程是那些線都要人先定義,圖不會自己長。信心分數是它自己給自己打的把握,不是有人去查證過。完全正確。以後遇到它答不出一個要串好幾份文件的問題,你先問一句:這兩件事之間,有人幫它牽過線嗎? 企業級智庫引擎。讓公司的知識,答得出來、查得到、帶不走。