[AI 解析] AI新職缺背後的薪資神話與產業真相
摘要 : 拆解AI三類新職缺的薪資神話、資料荒與企業落地真相。
內容:
近期網路盛傳一種AI職缺起薪三萬元、月薪最高十萬元,另有期權、簽字費,年薪可達一百五十萬元。追查來源後發現,最初是美國年薪二十萬美元的資料,換算約人民幣一百三十六萬元;中文報導先將其寫成「年薪百萬」,後續自媒體又加工成月薪十萬元、年薪一百五十萬元,卻只在文末註明「個人原創,僅供參考」。
實際招聘行情沒有傳聞中那麼誇張。阿里雲相關職缺標示月薪兩萬至五萬元、十六薪;阿里健康在LinkedIn上開出的區間約為每月三萬至六萬元。財經媒體訪問五名實際從業者後發現,幾乎沒有人真正拿到外界所說的百萬年薪,甚至有北京實習生每天僅領兩百元,每週工作五十小時。
不過,這類職缺也並非完全炒作。美國招聘平台上的相關職缺,一年內由643個增加至5,330個,成長超過八倍。LinkedIn執行長Ryan Roslansky曾預測,未來五年將有三類工作快速成長:資料標註員、前沿部署工程師,以及資料中心相關職位。
第一類是資料標註員,英文為Data Annotator。大型模型要持續進步,需要大量人員依照自身專業,判斷模型回答是否正確、哪些內容合理、哪些存在錯誤。不同領域和語言,都需要相應的專業人士參與評測。
第二類是前沿部署工程師,簡稱FDE。他們進入客戶公司,理解業務流程,協助模型真正投入工作,並將現場問題轉化為產品與模型的改進方向。
第三類則是資料中心相關工作,包括建設機房、安裝伺服器,以及管理供電、散熱、網路和運算資源的人員。
LinkedIn也曾表示,AI在平台上創造了將近130萬個新職缺。但其統計方式,是計算2023年至2025年間幾種指定職稱的招聘貼文數量,並沒有扣除同期消失的工作。因此,130萬代表的是招聘廣告數量,不能直接等同於淨增加130萬個工作機會。
這項統計至少能證明,相關人才確實正被大量招聘。更值得注意的是,這三類工作並不是彼此獨立的機會,而是AI產業發展的三個階段:資料標註員負責餵養模型,前沿部署工程師負責教模型進入企業工作,資料中心人員則為模型建立運作空間。
三者背後共同的核心,是資料正在變得愈來愈昂貴。
過去,網路上的公開文字幾乎可以免費取得。2023年4月,Reddit執行長公開表示,平台上的語料非常有價值,沒有理由免費提供給全球最大型的科技公司。到了2024年,Reddit進一步要求內容爬取者先簽訂協議,並透過修改robots.txt限制未獲授權的搜尋引擎取得新內容,將資料轉化為一道收費閘門。
Epoch AI曾估算,全球有效的公開文本存量約為三百萬億個詞元,可能在2026年至2032年間被高品質模型訓練需求消耗殆盡。確切年份仍可討論,但方向很明確:容易取得的公開資料正在減少,企業接下來必須付費購買或自行製造。
Anthropic便曾購買數以百萬計的紙本書,切除書脊後逐頁掃描,再銷毀紙本。相關事件後來進入司法程序。法院認為,使用合法取得的內容訓練模型本身可構成合理使用;真正造成法律問題的,是從盜版書庫下載並長期保存作品。後續和解金額達十五億美元,涉及四十八萬多部作品。
中文網路一度將此事簡化成「燒書」,甚至與焚書坑儒相比,但法院其實區分了合法購書掃描與下載盜版內容。外界擔心絕版書或珍貴紙本遭到不可逆破壞,也並非毫無道理,因此馬斯克後來曾主張保留原書,採用不破壞紙本的掃描方式。
真正值得關注的是,一家估值數百億美元的公司,為了取得文字資料,願意做到逐本購買、拆解與掃描。這個動作本身,已足以說明資料的價值。
資料標註工作也因此出現分化。傳統上,人們想到的是在螢幕上框選圖片、貼標籤的低薪流水線工作,這類任務確實存在,而且正逐漸被自動化取代。現在真正昂貴的,是專業評測:醫學問題要由醫師判斷,法律問題要由律師審查,程式碼則需要工程師評估。
當模型已能產出八成看似合理的回答,剩下兩成錯在哪裡,往往只有真正的專業人士能看出來。因此,這類工作的門檻並不在「標註」本身,而在標註者原本具備什麼專業。
Scale AI是其中具代表性的公司。2024年5月,其估值約138億美元;一年後,Meta以143億美元取得49%股份,將公司估值推高至290億美元以上,並承諾每年至少採購4.5億美元服務。
然而,Scale AI背後約有24萬名分布全球的標註人員。若將採購金額平均分配,每人每年不到1,900美元,實際報酬當然會依任務而異:專業領域可能達每小時30至50美元,普通任務則約15至25美元。這也說明,高估值平台、專業人才與底層低薪標註員,可能同時存在,求職者不能把不同層級的職缺混為一談。
至於前沿部署工程師,模型公司願意付出高昂成本,讓年薪數十萬美元的工程師長期進駐客戶公司,目的並不是直接取得客戶資料。
OpenAI的服務協議指出,除非客戶明確同意,否則不會使用客戶內容開發或改進服務;Anthropic的商業條款禁止使用客戶內容訓練模型;Palantir也表示不會利用客戶資料訓練AI。
這些工程師真正帶回公司的,是現場訊號與評測結果。他們要找出模型在哪些環節無法工作,形成評測驅動的反饋,再影響產品和模型的發展路線。資料是原料,評測則是一張清楚指出「模型哪裡不行」的清單,後者有時比原始資料更有價值。
實際工作內容通常是「六分溝通、四分技術」。有北京實習生每週三天待在客戶公司或前往客戶的路上;也有深圳的年輕從業者表示,自己雖是公司第一位專職FDE,薪資仍接近產品經理,並沒有網路傳聞那般驚人。
這其實是一種翻譯工作:企業不懂模型,模型也不懂企業,FDE負責在兩者之間轉譯需求。這項能力的價值,取決於兩端的距離有多大。當企業與模型未來能夠直接溝通,中間人的重要性也可能下降。
Palantir長期被質疑本質上是一家諮詢公司,派大量工程師到客戶現場從事人工服務,不具備純軟體公司的經濟效益。但Palantir的毛利率一度達86%,相較之下,埃森哲約為32%。
關鍵差異在於,派出去的人帶回了什麼。如果工程師只是替單一客戶完成工作,成本就是一次性的服務工時;如果他們把現場卡點帶回公司,轉化為平台功能,這些成本便成為能持續累積的研發投入。
Palantir在年報中也將前沿部署工程師定位為「替平台發現研發機會的第一線」。同樣是派人進駐客戶,一種結果是諮詢服務,另一種則可能沉澱為可重複銷售的產品。
Anthropic也曾聯合黑石、Hellman & Friedman與高盛,成立面向中型企業的AI服務公司,首輪投入15億美元,目標之一就是普及前沿部署工程師模式。這顯示即使是以通用人工智慧為目標的公司,也認為企業落地仍需要大量人工服務。
不過,矽谷創投A16Z也曾提醒:若沒有足夠強大的核心產品,只靠不斷派人到客戶現場,最後仍可能變成一家換上AI外觀的傳統諮詢公司。這門生意是否成立,不在於派出多少工程師,而在於這些人回來時,能否帶回可被產品化的成果。
企業AI落地的缺口,在許多中小型團隊中尤其明顯。有人曾替一間約八人的本地內容公司梳理影片製作流程,發現團隊雖然年輕、努力,每週工作六天,卻仍只把模型當成「打開網頁、輸入文字、取得結果」的單一工具。
他們效率不高並不是因為懶惰,而是沒有人教他們如何把AI放進完整工作流程。類似企業在大型城市裡數量龐大,也形成了部署、整合與基礎設施人才的實際需求。
麻省理工曾有研究指出,95%的企業AI專案未能產生可衡量的回報。這項數字的定義較窄,不宜完全照單全收,但它反映的方向值得注意:許多公司已經購買和安裝AI,卻仍無法真正使用。
這也是資料中心與部署人才存在的原因。他們不只是蓋機房,而是要讓伺服器、算力、供電、散熱、網路、排程及軟體生態真正運轉。
市場上會同時出現「算力嚴重短缺」與「大量機房空轉」兩種說法,而且兩者都可能是真的。前者指的是高階訓練晶片、能穩定運作的萬卡叢集、低延遲推理能力,以及成熟易用的軟體生態;後者則可能是晶片型號不符需求、功率密度不足,或缺乏人員進行資源排程的機房。
換句話說,「算力」之下其實包含兩種不同的資產:一種是真正可投入生產的有效算力,另一種只是名義上存在、實際上難以運用的硬體設備。
這類工作至今甚至沒有統一職稱。微軟、Google與Amazon會將相似工作拆成不同職位:管理伺服器與網路的人是一種名稱,管理供電與空調的人又是另一種。美國勞工統計局也尚未為其建立獨立職業代碼,各方公布的利用率可能是20%、30%或36.8%,但有人計算晶片時數,有人計算機櫃,缺乏一致標準。
一個連職稱和統計口徑都還未統一的產業,恰恰說明它仍處於非常早期的發展階段。
然而,AI落地最終仍要通過商業帳目的檢驗。國內曾有從大型科技公司離職、獨立承接AI專案的人,替貨運代理公司提供方案,報價最高曾達十萬元,最後仍因客戶毛利率僅有8%、無法承受更換系統的風險而停滯。當數位員工每月消耗的算力成本過高,即使技術可行,專案也未必具備經濟效益。
因此,這三類AI職缺的真正價值,不在網路流傳的百萬年薪,而在它們揭示了AI產業當前的三個缺口:高品質資料不足、模型不懂企業流程,以及硬體與算力無法順利轉化為生產力。
它們確實正在成長,但同時也可能只是過渡性工作。資料充足、模型更成熟、企業與AI能直接溝通、基礎設施更加標準化之後,部分職務可能被自動化或重新定義。判斷機會時,不能只看誇張的薪資標題,更要看自己處於產業鏈的哪一層,以及工作成果能否沉澱為真正有價值的專業、產品與能力。
沒有留言:
張貼留言