2026年7月29日 星期三

[AI 影響] Agent正改寫GPU生態護城河

 [AI 影響] Agent正改寫GPU生態護城河

摘要 : Anthropic用Claude在週末自動跑起AMD新機架,顯示AI Agent正加速跨平台部署與效能調優,鬆動CUDA生態優勢。




內容:

輝達花了20年建立的CUDA生態護城河,過去一直難以撼動,因為真正有價值的不只是編譯器或數學庫,而是多年累積下來的大量工程經驗。像是運算元如何調到最快、通訊怎麼提速、顯存怎麼分配避免爆掉,這些關鍵知識長期掌握在少數資深工程師手中,因此即使後來者硬體性能接近,也很難快速補上生態差距。


不過這個局面,可能正因AI Agent而改變。Anthropic近期分享了一個案例:AMD送來一台全新的MI355X機架後,團隊原本預期要投入大量人工進行跨平台調整,但實際上只讓一名工程師把Claude接上機器,並給出「把這台機器跑起來」這樣的目標。等到工程師週末結束回來,系統不但已經成功運作,效能曲線還持續上升。


根據Anthropic首席計算官Tom Brown在AMD大會上的說法,Claude在這個過程中幾乎是全自動完成任務,包括安裝環境、調整參數、修改程式碼與持續優化效能。連AMD原本準備提供協助的團隊,最後也確認不需要介入,因為Claude已經處理完成。


這背後的關鍵,不只是AI模型本身聰明,而是AMD正在把原本必須依賴人類工程師理解的GPU操作流程,轉換成AI Agent可以直接讀懂與呼叫的工具體系。AMD在大會上推出名為ROCmDI的平台,可以視為專門提供給AI Agent使用的GPU工具箱,並以「AMD Skills」的形式,讓Claude、Cursor、Codex等AI程式工具能直接執行裝環境、部署模型、讀取日誌與排查故障等工作。


在效能調優方面,AMD也展示了一個名為Hyperlume的系統。它會先建立基線數據,自動找出瓶頸,再嘗試不同配置、生成客製化核心程式碼、驗證結果並輸出報告。現場展示中,Hyperlume曾將MiniMax M3模型的輸出速度提升38%。AMD也表示,該系統曾跑過1.4萬個模型,且每次調優得到的結果都能沉澱為後續Agent可直接複用的經驗。


更重要的是,AMD連晶片文件的寫法都開始改變。其軟體主管表示,未來每一代AMD GPU都會公開指令集,並提供AI可以直接讀懂的ISA格式。這代表晶片說明書不再只是寫給人類工程師閱讀,而是開始變成讓AI Agent也能理解、呼叫與優化硬體的技術介面。


這件事之所以引發關注,是因為它可能改變整個GPU產業追趕生態差距的方式。過去培養一位能獨立做GPU調優的頂級工程師,往往需要數年時間;但現在若能啟動多個Agent,就能平行排錯、找瓶頸、做優化,而且其中一個Agent累積的經驗,幾乎可以立刻共享給其他Agent。原本需要按年累積的追趕過程,正被壓縮成按任務推進。


因此,Anthropic這次的週末實驗,某種程度上不只是一次成功案例,更像是一種新模式的開場。就在同一天,Anthropic也宣布將在AMD Helios系統中部署最高2GW的Instinct GPU,首批預計於明年上半年啟動。同時,AMD承諾對Anthropic投資最多50億美元,雙方還將進一步利用Claude來優化AMD的工作負載,加速ROCm軟體開發。


這形成了一個過去少見的新循環:晶片公司投資AI公司,AI公司再反過來協助晶片公司優化自己的軟體生態。從技術角度來看,最值得記住的一點是,未來晶片公司爭取的開發者,不再只有人類工程師,還包括AI Agent。


這已經不是遙遠的概念,而是正在發生的轉變。當越來越多底層工程經驗被整理成Agent可以調用的能力後,原本被視為難以跨越的生態護城河,可能會開始出現新的突破方式。下次再聽到有公司想挑戰輝達時,也許不能只用過去的標準來判斷,因為背後可能早已有一群Agent在持續加速追趕。

沒有留言:

張貼留言