2026年10月8日 星期四

[AI 展望] 馬斯克談 AI 未來:物質豐裕、工作可選與全球安全治理

 [AI 展望] 馬斯克談 AI 未來:物質豐裕、工作可選與全球安全治理

摘要 : 描述馬斯克對 AI、就業與全球競爭的預測,探討物質豐裕時代的可能性及安全風險。



內容:

馬斯克於 2026 年 7 月 23 日在德州超級工廠,接受《經濟學人》主編貝多斯長達 85 分鐘的專訪,討論人工智慧、產業競爭、就業與財富分配等議題。以下依提供文字整理;訪談資訊、引述與相關數據未經獨立查證,文中的未來情境也屬預測,而非已確定的結果。


AI 可能在五年內超越全人類智慧總和


貝多斯首先詢問十年後的世界會是什麼樣貌。馬斯克預測,大約五年內,AI 的綜合智力將超過地球上全體人類的智慧總和。到了 2036 年,除了「做人本身」之外,幾乎沒有任何工作是 AI 無法做得比人類更好的。


他認為,最可能出現的結果,是世界進入物質極度豐裕的時代。商品與服務的供給大幅增加,人們想要的東西幾乎都能按需取得,金錢的重要性也會因此下降。


數字智慧結合人形機器人,改變經濟生產方式


面對「商品與服務若能充分供給,企業如何賺錢」的質疑,馬斯克的回答是:到了 2036 年,錢本身可能已經不再重要。


他的解釋是,經濟生產需要結合數字智慧與物理智慧。目前 AI 主要處理資訊,仍難以直接改造物理世界;人形機器人則能成為 AI 的執行工具,負責製造商品、提供服務。


當大量 AI 與人形機器人結合,整體經濟產出可能大幅提升。如果供給超過人類的消費需求,作為商品與服務交換媒介的貨幣,其重要性便可能顯著減弱。


對 AI 的樂觀,不代表風險已經消失


談到人類是否還能掌控未來,馬斯克以人類和黑猩猩的智慧差距作比喻,認為超級 AI 與人類之間的差距可能更大,因此人類未必能維持主導權。不過,他同時預期,超級 AI 有較高機率具備良好的價值觀,並重視人類的幸福與繁榮。


貝多斯隨即追問他過去對 AI 風險的警告,包括呼籲暫停高階 AI 研發,以及曾提出 AI 可能導致人類滅絕的機率估計。


馬斯克並未否認這些風險。他的轉變主要在於:如今認為 AI 發展已難以阻擋,與其持續試圖踩煞車,不如參與其中,設法影響發展方向。


從創辦 OpenAI 的初衷,到接受 AI 加速發展


馬斯克表示,當初參與創辦 OpenAI,是希望以非營利、開源的方式制衡 Google,避免 AI 發展由少數企業主導。


OpenAI 後來走向閉源與商業化,Anthropic 也從 OpenAI 分拆後成為重要競爭者。這些變化讓他認為,原本希望約束 AI 發展的行動,反而間接促進了產業加速。


他因此得出結論:AI 的發展是一股難以阻擋的趨勢。但接受這個趨勢,並不等於完全放任企業自行發展。


主張建立跨企業、包含中國的 AI 安全機制


在安全治理方面,馬斯克提出由主要 AI 公司建立定期溝通機制,每隔幾週召開一次安全專項會議。


突破性的新模型發布前,企業應提供競爭對手一至兩週的測試時間,由同行協助排查安全風險並提出改善建議。他以美國電影協會的分級制度作類比,主張先透過產業自律處理問題;只有在企業拒絕改善、風險又極高時,再由政府介入。


他特別強調,這套機制必須納入中國的主要 AI 公司,不能將全球重要參與者排除在外。


中國 AI 的競爭力:算力、電力與工業能力


談到中國模型 Kimi,馬斯克認為它已非常接近第一梯隊。他也提到一款「飛步」的模型,稱其綜合能力最強,但該名稱仍待確認。


他的核心判斷是,中國 AI 公司在算力相對有限的情況下,已達到相當高的水準;若取得充足算力,可能成為全球 AI 產業的領導者。


他認為,中國的優勢主要包括電力供給,以及完整的工業與技術體系。AI 是高度耗電的產業,算力擴張最終會受到電力條件限制;而半導體技術、人形機器人與製造能力,也會影響數字智慧能否轉化為實際產出。


列出中國發電量與高階光刻機進展的相關說法,但這些數據與時程仍需另行查證,不能直接視為既定事實。


禁止中國模型,難以阻止全球使用


面對美國是否應禁止使用中國 AI 模型的提問,馬斯克認為,這類禁令難以達成全面阻止的效果。


美國即使限制本國企業使用,也無法阻止其他國家採用。因此,他認為全球 AI 安全治理仍須包含中國,而不能只依靠單一國家的限制措施。


數字工作可能先被替代,工作逐漸成為選項


在就業方面,馬斯克預測,數字領域的工作會最先受到 AI 衝擊,軟體工程就是其中一例。


他認為,AI 寫程式的能力已超過至少九成的人類工程師,未來還會繼續提升。他以西洋棋程式 Stockfish 為例,描述 AI 最終可能在特定能力上遠超人類頂尖表現;不過,這類能力比例仍須依具體任務與評測方式判斷。


至於物理世界的工作,則可能隨著人形機器人成熟而逐步被替代。按照他的構想,未來工作將不再只是維持生計的必要條件,而可能成為個人的選擇。


他以園藝作比喻:即使超市已能提供充足蔬菜,人們仍可以選擇自己種植。原文在此處中斷,尚未提供後續說明,也未完整交代轉型期間的收入分配與生活保障如何實現。

[AI 衝擊] AI裁員先砍誰?美國削減高薪員工,德國優先縮減海外外包

 [AI 衝擊] AI裁員先砍誰?美國削減高薪員工,德國優先縮減海外外包

摘要 : 美國與德國因AI採取不同裁員策略,反映成本、員工保障與生產力之間的取捨。



內容:

公司用AI取代人力,第一刀會砍向誰?文中指出,目前有兩種不同做法:一種先砍「最貴的」,另一種先砍「最遠的」。美國企業傾向削減總部內薪資高、福利完整的正式員工;德國企業則優先縮減印度等地的海外外包團隊,並讓自家員工接受培訓後繼續工作。


摩根士丹利調查,研究涵蓋美國、英國、日本、澳大利亞與德國的科技及金融企業,了解這些公司過去一年因AI裁減及新增了哪些職位。整體而言,企業因AI直接裁減了12%的職位,另有15%的職位在人員離職後不再補人。五個國家中,只有德國的職位數反而增加了1%。


德國能保住職位,第一個原因是再培訓。文中提到,德國於2024年推出政策,企業因技術轉型而不再需要某些員工時,可以選擇安排培訓,而非直接裁員。培訓期間,政府負擔六成薪資,有孩子的員工可提高至67%;培訓費用則由企業支付,前提是企業先與工會簽訂協議。透過政府、企業與工會合作,員工有機會轉換職位並留下來。


調查顯示,德國有27%受到人力調整影響的員工,在培訓後重新回到工作崗位,比例為五國最高。


第二個原因,是德國企業優先裁減海外人力。文中指出,德國企業一半以上的裁員發生在海外,主要涉及外包團隊,印度因此受到衝擊。外包工作通常能被整理成明確需求,交給其他團隊執行,而這類工作也可能被AI承接。報告中有41%的外包職位遭到裁減,或在空缺後不再招聘。


外包訂單減少,接單端隨即受到影響。文中以印度最大的外包企業塔塔諮詢為例,指出其上一個財年員工減少逾2.3萬人,是公司歷來人數減幅最大的一年。


不過,德國的做法也有取捨。調查中,AI為德國企業帶來的生產力提升為8.4%,是五國最低。這呈現出員工保障與效率提升之間的權衡:人力留住了,但生產力增幅相對有限。


美國的做法則相反。文中指出,美國企業有46%的裁員針對本土員工。其成本考量是,外包團隊原本就較便宜,裁掉後節省有限;真正昂貴的是總部內享有完整福利的正式員工,因此優先削減高成本人力。


截至所述年度7月,美國科技公司已裁員近14萬人,其中亞馬遜、甲骨文、Meta與微軟四家公司合計約占5萬人。亞馬遜從前一年10月起削減了3萬個總部職位,約相當於每十人就有一人離開;Salesforce的客服團隊則從9,000人縮減至5,000人。執行長貝尼奧夫直言,自己需要的人力變少了。這些裁員並非只發生在虧損企業,也出現在仍然獲利的公司。


調查亦指出,美國受訪企業的職位中,只有6%尚未受到AI影響。兩國導入AI的優先目標也不同:美國是唯一將投資回報列為首要目標的國家,德國則是唯一將風險與合規列入前五大考量的國家。一方追求回報與速度,另一方更重視穩定及避免出錯。


「越發達越危險,越落後越安全」概括這種反差,但其核心比較,是高薪正式員工與低成本外包人力在不同企業策略下面臨的風險,並不能直接推論所有國家或職位的處境。


這份調查未涵蓋中國。德國傾向透過培訓保障本國員工,美國則優先削減高成本職位。那麼,我們身邊的企業更接近哪一種做法?你看到的是什麼情況?

[AI 分享] AI 產出太快,人類怎麼看懂?從簡化寫作到圖表的理解階梯

 [AI 分享] AI 產出太快,人類怎麼看懂?從簡化寫作到圖表的理解階梯

摘要 : AI 產出愈快,人類理解愈成瓶頸。透過簡化寫作與圖表,降低閱讀負擔與誤解風險。



內容:

許多人對 AI 代理人感到興奮,但 OpenAI 創始成員、前特斯拉 AI 總監 Andrej Karpathy 提醒:對工程師來說,收到一份包含上千行程式碼變更的 diff,未必實用。AI 可以瞬間產出大量程式碼,但工程師仍得親自確認,這些改動是否會引發錯誤。


引述他在 2025 年 6 月演講中的觀點,並提到他後來在社群平台 X 上提出的解法:我們會花愈來愈多時間,理解 AI 的產出。


想像一下,你請 AI 修改一個功能,十秒後它交出一千行程式碼。你需要多久才能看完?一個小時,還是一個下午?而且,「看過」不代表「看懂」,更不代表已經確認沒有錯誤。


AI 寫作與生成程式碼的速度愈來愈快,成本也愈來愈低,但人類的閱讀速度不會同步提升。引用一篇彙整 190 項研究的分析指出,成年人默讀英文非小說類文本,平均每分鐘約能閱讀 240 個單字。


因此,瓶頸不只在 AI,也在人的眼睛、注意力與理解能力。Karpathy 的解法是:既然 AI 產出太多,就讓 AI 也協助我們看懂。他提出四種方法,像四級階梯逐步往上走。以下提供了第一級的完整說明,以及第二級的開頭。


第一級:改變寫法,讓文字更容易理解


第一個方法,是請 AI 使用 ASD-STE100 的規則寫作。這套標準稱為「簡化技術英文」(Simplified Technical English),最初是為飛機維修手冊設計的受控英文。


它的起源可以追溯至 1970 年代末。當時,航空維修技師閱讀的手冊,可能使用美式英文、英式英文,或由非英語母語工程師撰寫的英文。不同手冊的用字與句型不一致,增加了理解難度。


官方資料指出,需要使用這些手冊的航空公司,約有八成來自非英語系國家。但飛機維修不能只求「大概看懂」:技術指示若被誤解,可能導致事故。


1979 年,歐洲航空公司向飛機製造商的產業協會提出請求,希望共同制定一套受控英文,事先規定哪些字可以使用、句子應如何撰寫。之後,相關協會與美國航太工業協會合作,於 1986 年發布第一版。


2004 年,協會合併並改名為 ASD,這套規則也成為 ASD-STE100。第九版於 2025 年 1 月發布,全文四百多頁,任何人都能填寫申請表,免費取得官方 PDF。


ASD-STE100 如何簡化英文?


這套標準主要分成兩部分:字典與寫作規則。


字典的核心原則,是盡量讓一個字只對應一個意思,同一個意思也使用一致的字。例如,表示「開始」時,不交替使用 begin、commence、initiate,而使用 start,避免讀者誤以為換了一個字,就代表換了一件事。


反過來,同一個字的意思也受到限制。例如,fall 只能表示物體因重力向下掉落,不能用來表示數字減少。詞性也有規範:check 在 STE 中只能作為名詞,因此不能寫「check the lights」,而要寫成「do a check of the lights」。


這種寫法有時顯得不自然,但目的就是降低歧義。字典核准的字約有九百個,另外列出約一千二百個不核准使用的字,並提供替代用字。


九百個字不足以涵蓋所有專業內容,因此標準允許使用技術名詞與技術動詞,例如零件名稱,以及特定產業中的固定操作用語。


五個代表性的寫作原則


寫作規則共有 53 條,分成九大類。挑出五項重點。


第一,句子要短。引用的第九版業界整理,操作步驟每句最多二十個英文單字,說明文字每句最多二十五個英文單字。句子太長,讀者容易讀到後面就忘記前面;短句則比較容易一次掌握。


第二,一句只下一個指令。不要在同一句話裡塞進三個動作。讀一句、做一步,比較不容易遺漏操作。


第三,使用主動語態,直接說明要做什麼。例如,「The component must be installed」表示「零件必須被安裝」,但沒有直接交代由誰執行。改成「Install the component」,也就是「安裝零件」,指令就更明確。


第四,能用動詞,就不要把動作改成名詞。例如,「do the adjustment of the controls」可以改成「Adjust the controls」。同樣是調整控制器,後者更短、更直接。


第五,讀者必須先知道的條件,要放在句子前面。官方例句「If hot oil touches your skin, injuries can occur」,先交代熱油碰到皮膚的情況,再說明可能造成傷害,讓讀者先掌握風險。


簡化英文真的有幫助嗎?


1995 年華盛頓大學與波音曾進行實驗,比較簡化英文與一般英文撰寫的飛機維修程序。受試者包含英語母語者與非母語者。


結果發現,面對較複雜的文件,簡化英文能提升理解程度,也讓讀者更容易找到需要的資訊。受益者不只非母語人士,也包含英語母語人士。


如今,STE 的應用已不只限於航空業,國防、鐵路、汽車與醫療器材等領域也有人使用。


如何把這套規則用在 AI 產出上?


回到 AI 生成的大量內容,這個方法主要是在改善說明文字,而不是直接保證程式碼正確。


Karpathy 認為,AI 熟悉 ASD-STE100,而這套標準對寫作的限制很嚴格,因此能讓文字清楚許多。


AI 常見的寫作問題包括句子太長、被動語態太多,以及同一件事反覆換不同說法。STE 的規則,正好能針對這些問題加以約束。只要在提示中指定這套標準,就等於一次交代了數十項寫作要求。


不過,Karpathy 也認為完整規範可能過於嚴格,因此有時會要求 AI:「請用 80% 接近 ASD-STE100 的方式來寫。」


也就是保留它的骨架:短句、主動語態、用字一致,不必完全受限於核准字典。


這些原則也能應用在中文。例如,AI 可能寫:


「為提升效能,建議在後續整合快取層之前,先對該函式進行重構。」


改成較簡潔的表達,可以是:


「先重構這個函式,再加快取。快取能讓程式變快。」


句子更短、操作順序更清楚,也減少了抽象的名詞化表達。


第二級:用圖表取代大段文字


第二個方法,是不要只叫 AI 寫一大段說明,而是請它畫出圖表。


Karpathy 在演講中提到,閱讀文字費力,也不一定有趣;視覺資訊則能提供更直接的理解途徑,像一條通往大腦的高速公路。


多媒體學習研究者 Mayer 的研究:他整理的十三次對照實驗中,「文字加圖」組在將所學應用於解題的表現上,都優於「只有文字」組。


這個方向不是單純減少文字,而是讓資訊以更容易理解的形式呈現。當 AI 能快速產出大量內容,下一個重要問題便是:如何讓人更快看懂、掌握重點,並有效檢查。


在第二級的研究說明處中斷,未提供後續完整內容,也未列出第三級與第四級方法。

[AI 洞察] 消費級AI的下一步:從幫你省時間,到值得你花時間

 [AI 洞察] 消費級AI的下一步:從幫你省時間,到值得你花時間

摘要 : AI大眾化的關鍵,可能不是提升效率,而是融入生活,創造讓人願意投入時間的體驗。



內容:

AI真正的大眾化,可能根本不是省時間。A16Z釋出的第七版消費級AI應用Top 100報告,最值得關注的不是誰排名第一,而是一組看似矛盾的資料:美國已有接近一半的消費者用過AI,但真正每天使用的,大約只有四分之一。在EPIC Data的美國樣本中,截至報告所述的8月,持續為ChatGPT、Gemini或Claude至少一項產品付費的人,只有4.5%;然而,在這些付費使用者裡,消費最高的1%,平均每月在AI上花費903美元。


這或許就是當前消費級AI最真實的狀態:用過的人已經很多,但真正離不開它的人仍然很少。如果AI已經這麼強,為什麼大多數人還沒有像刷短影片、追劇或玩遊戲一樣,每天都離不開它?


對多數普通人而言,提升效率可能不足以支撐每天使用AI的理由。過去三年,我們幾乎一直用生產力工具的邏輯理解AI:搜尋更快、寫程式更快、做圖更快、製作影片更快。但回顧過去20年,真正覆蓋數十億人的消費產品,例如TikTok、YouTube、Netflix、Instagram與遊戲,它們的強大之處,恰恰不是幫你省時間,而是讓你願意把時間留在裡面。


因此,消費級AI真正的大眾化,可能需要完成一次價值轉移:從「幫你省時間的AI」,走向「值得你花時間的AI」。前者賣的是效率,後者融入的是生活。


為什麼AI首先普及的是省時間的能力?因為最早願意為AI投入大量金錢的人,並不是典型的大眾消費者,而更像是拿個人信用卡購買生產力的專業使用者。


A16Z的資料顯示,消費最高的1%使用者,貢獻了全部AI消費金額的19.5%,比消費最低的50%付費使用者加起來還多。此外,消費金額最高的50個AI產品中,有29個沒有進入網頁或行動端的流量Top 50。這說明AI產品的流量與商業價值已經開始分開:使用人數最多,不一定最能帶動付費;流量較小的產品,也可能聚集了一群極高價值的使用者。


這批人名義上是消費者,實際行為卻更像生產者。他們購買自動化程式設計、產品建構、設計、影片與內容工具,是因為AI省下的時間,可以繼續轉換成程式碼、產品、內容、交付成果,甚至直接變成收入。消費級AI第一階段真正跑通的,不是「所有人都需要AI」,而是「一小群人已經能從AI獲得巨大的經濟回報」。


這也解釋了AI距離真正的大眾化,為什麼還有一段距離。對重度使用者而言,空白對話框是一扇任意門:他知道怎麼提問、拆解任務,讓AI找資料、呼叫工具、生成內容並完成工作。但對普通使用者來說,打開AI後看到「有什麼可以幫你」,有時更像面對一張空白試卷,還得先想清楚自己為什麼需要它。


AI下一階段的採用瓶頸,可能正從「模型能力不足」,轉向「使用場景尚未被設計出來」。普通人不會因為模型能力表多了20項,就自然增加20次使用。真正的大眾產品,不是告訴使用者「我什麼都能做」,而是讓使用者自然知道:「現在這件事,就應該交給你。」


這也是近期Personal Agent,也就是個人智慧體,開始密集出現的原因。文中提到,Manus推出的Q,讓智慧體擁有獨立的電子郵件、電話號碼、錢包與電腦,使用者甚至可以提供預算,讓它自行付款。OpenAI隨後推出的Dots,則讓每個Dot擁有自己的雲端電腦,能連接多種應用、長期工作,並逐漸學習使用者的偏好,以及使用者認為什麼才算做好。


這些產品值得注意的,不只是市場上又多了幾個Agent,而是AI產品的基本形態正在改變。過去,你打開一套軟體,再使用其中的功能;現在,你開始擁有一個持續存在的數位助手。它有身分、工具、上下文與權限,甚至具有支付能力。AI正在從「等你提問」,走向「持續替你行動」。


A16Z報告提到的Instinct,也提供了值得觀察的訊號。其創辦人披露,大約40%的使用者會在三週內綁定個人信用卡;真正透過它完成購買的使用者,平均每月經由它花費約1,300美元。他也聲稱,已有超過10億美元的年化交易額流經這個智慧體,其中約一半來自旅行。


這些數字仍需要持續觀察,但至少指出一個方向:AI正在從「告訴你怎麼買」,進入「替你完成購買」。過去搜尋引擎掌握的是「你想買什麼」,未來個人智慧體可能掌握的是「替你買什麼」。當AI從資訊入口變成行動入口,商業模式也會跟著改變。


今天的AI公司為什麼如此依賴訂閱?A16Z統計的44個頭部AI原生網頁產品中,84%提供訂閱,但真正依靠交易或平台抽成的只有2%。原因很現實:智慧目前仍然昂貴,每次推理、生成與智慧體行動,都有真實成本,因此AI公司必須先向最願意付費的人收費。


然而,商業模式不只決定怎麼賺錢,也會篩選誰更容易成為使用者。當一個人每月必須先支付20、50,甚至100美元,他就得不斷確認這個AI是否值得。這自然更適合那些能把效率重新變現的人。因此,訂閱制的繁榮,未必就是消費級AI的終局。


當推理成本持續下降,AI真正進入購物、旅行、娛樂、社交與交易場景後,廣告、交易抽成、聯盟分成與按結果收費,都可能開啟新的空間。


但更大的變化,可能還不在這裡。個人智慧體目前大多仍在幫你把事情做完,解決的本質上還是任務。上一代網際網路誕生超級消費公司的領域,卻是社交、娛樂、遊戲與約會。這些場景有一個共同點:使用者進去,不是為了趕快出來。


今天成功的AI產品,仍高度集中於搜尋、設計、圖片與影片編輯等生產力領域。AI已經很擅長幫人完成任務,但尚未真正創造出新的方式,讓人娛樂、建立關係、消費、獲得陪伴,或主動消磨時間。這可能才是下一波消費級AI最大的空白。


第一階段,AI讓一小群高價值使用者變得極其強大;第二階段,AI需要讓普通人願意把更多生活交給它。第一階段的關鍵字是「效率」,第二階段的關鍵字可能是「體驗」。


未來最大的消費級AI公司,未必是擁有最強模型的公司。當模型逐漸成為基礎能力,真正決定使用者是否留下來的,可能是產品懂不懂你、體驗是否良好、能否形成關係與網路、能否進入真實交易,以及能否成為新的日常習慣。


過去三年,我們一直計算AI能替人省下多少小時。下一階段更值得計算的,也許是人願意主動把多少小時交給AI。當人們不再覺得自己正在使用一個AI工具,而是AI已自然融入娛樂、關係、消費、創造與日常生活時,消費級AI真正的大眾化,可能才剛剛開始。


最後真正值得問的,不是「AI還能替你省多少時間」,而是「什麼樣的AI,值得你主動把時間交給它」。

2026年10月7日 星期三

[AI 衝擊] AI重寫商業規則:更多賽道、更少贏家,從軟體預算走向任務預算

 [AI 衝擊] AI重寫商業規則:更多賽道、更少贏家,從軟體預算走向任務預算

摘要 : AI讓資本更直接轉化為技術優勢,也重塑市場規模、成長驗證與企業轉型的判斷標準。



內容:

AI與網際網路之間,可能存在一個顛覆性的差異。這個差異既是當前焦慮的根源,也可能是未來十年最大的機會。如果這個判斷成立,許多關於創業、市場競爭與估值的商業常識,都需要重新定義。


資本可能更直接轉化為技術優勢


在網際網路時代,一家公司擁有更多資金,不代表它能無限變強。資金通常必須先轉化為人力:更多工程師、更多銷售人員、更大的團隊,接著也帶來更多管理、協調與組織摩擦。人才是重要壁壘,而收入成長往往伴隨組織擴張。


因此,過去存在一道天然的牆:資本無法直接轉化為公司的能力。資金過多,甚至可能讓創業公司因擴張失控而陷入困境,因為組織成長往往比收入成長更複雜。


AI則可能第一次打穿這道牆。資金可以購買算力,算力支撐更多推理,更多推理讓產品變強,產品帶來更多收入,收入再投入算力。這意味著,資本本身可能開始更直接地強化技術優勢。


AI不是單一贏家通吃,而是更多賽道、更少贏家


原文提到,a16z近期的一場討論邀請了三位來賓,分別涉及全球募資與資本關係、成長投資,以及創投背後的母基金。他們長期處於矽谷資金來源與流向的第一線。


他們觀察到的第一個變化,是AI時代的價值分配可能比網際網路時代更加集中:不是所有公司平均獲利,而是極少數頭部企業取得絕大多數價值。


但這不一定代表一家公司吃下整個產業。更可能的情況是,AI不斷創造新賽道,而每個賽道留下的贏家更少。模型、程式設計、醫療、法律與機器人,都可能各自出現頭部企業。


換句話說,AI會創造更多牌桌,但每張牌桌上的贏家可能更少。原文的核心判斷是:AI不是單純的「贏家通吃」,而是「更多賽道、更少贏家」。


市場規模不能只看軟體預算,更要看任務預算


第二個重要變化,是我們可能正在低估AI公司的市場規模。


投資人常用TAM,也就是總潛在市場,衡量一門生意理論上能做到多大。過去評估SaaS,通常會看產業的軟體支出或企業IT預算。但當AI從「協助人完成工作」走向「直接完成工作」,這把尺可能不再適用。


原文引用討論中的醫療案例:醫療IT可能只是數百億美元的市場,但理賠、帳單與行政服務背後,對應的是更龐大的勞動力支出。一旦AI能直接完成這些任務,它競爭的就不只是軟體預算。


該討論甚至提到,美國經濟花在勞動上的支出,大約是軟體支出的40倍。因此,評估AI機會時,不能只問客戶每年花多少錢購買軟體,還要問客戶每年花多少錢,讓人完成這件事。兩者可能相差一個數量級。


SaaS爭取的是軟體預算,AI開始爭取的則是任務預算。AI真正打開的大市場,可能不在IT預算表裡,而在薪資表裡。


以前是賣客服軟體,現在可能直接提供客服服務;以前是賣財務工具,現在可能完成部分財務工作。越來越多AI公司販售的,不只是工具,而是結果。


成長速度不等於商業模式已被驗證


市場空間變大、收入成長變快,不代表公司一定更好。AI甚至可能讓一些傳統成長指標失真。


原文提到,一家AI創業公司在一個月內,從零做到500萬美元ARR。ARR是年度經常性收入,通常依目前的經常性收入推算年度規模。這樣的速度非常驚人,但公司才成立一個月,可能連一次續費都尚未發生。


半年後客戶是否繼續使用、毛利能否維持、需求是長期存在還是短期嘗鮮,都還沒有答案。有些公司甚至直接將單月收入乘以12,當成年化收入指標;但這個數字本身,不能證明收入具有持續性。


這形成一種危險現象:成長速度越來越快,確定性卻沒有同步增加。原文將它稱為「驗證延遲」。


AI可以讓產品在一天內成形、在一個月內產生收入,但留存、續購、口碑與商業模式,仍然需要時間驗證。AI壓縮了成長週期,卻沒有同樣壓縮驗證週期。最大的成長幻覺之一,就是把速度當成證據。


維持原有成長,也可能是相對衰退


這也會衝擊傳統SaaS公司。許多企業正在思考是否加入AI、Copilot或Agent,但真正的問題可能不是「有沒有AI功能」,而是加入AI後,成長是否重新加速。


假設一家公司的年成長率原本是30%,加入大量AI功能後仍是30%,表面上沒有退步;但如果新的AI原生公司成長100%,它在競爭中的位置可能已經相對下滑。


因此,AI時代即使維持原有成長,也可能是一種相對衰退。


加上AI,不等於完成AI轉型


另一個常見誤區,是以為加入AI功能,就能成為AI公司。


原文引用一個類比:把傳統零售公司搬到網路上,不會讓它自動變成Amazon。Amazon的優勢不只是多了一個網站,而是圍繞網際網路,重新設計物流、庫存、供應鏈、交易與組織。


AI轉型同樣如此。把客服換成Agent,不一定就完成轉型;真正的轉型,需要重新設計整個工作流程:哪些任務由AI執行、哪些判斷由人負責、權限如何配置,以及結果如何驗收。


如果這些安排都沒有改變,AI可能仍然只是一個外掛。未來許多企業AI專案失敗,原因未必是模型不夠強,而是用下一代技術,繼續執行上一代流程。


程式設計的突破速度,不代表所有知識工作都會同樣快速改變


看到AI寫程式的能力快速提升,很容易推論銷售、諮詢、策略與管理,也會以相同速度被改造。但原文認為,這未必成立。


程式設計可能不是一般樣本,而是AI最容易突破的知識工作之一。程式碼有大量文件、可以直接執行、結果相對容易驗證,也能透過測試與模擬快速取得回饋。


真實商業世界裡,許多高價值工作恰好相反。一項策略是否正確、一個產品方向是否選對、一次組織調整是否有效,可能要半年,甚至兩年後才知道。


因此,程式設計可能代表AI改造知識工作的最快速度,而不是平均速度。


決定一項能力是否容易被AI壓縮的,可能不只是它有多專業,而是它有多容易被描述、驗證與模擬。越容易驗證的能力,越可能快速被AI改造;依賴複雜情境、隱性經驗、長期回饋與非標準判斷的能力,反而可能變得更有價值。


企業之間的AI採用差距值得關注


原文最後引用一組資料:一般企業每位員工每月的AI支出,中位數約為12美元;最領先的1%企業,則可能達到7,000美元。


重點不只是7,000美元這個數字,而是不同企業之間,可能正在形成巨大的AI採用差距。


原始文字在此處截斷,因此後續論述未予補寫。

[AI 觀察] AI不是全面泡沫,但真正的價值正在分化

 [AI 觀察] AI不是全面泡沫,但真正的價值正在分化

摘要 : 生成式AI面臨價值重估,代理式AI的機會在業務落地,物理式AI仍受資料與技術限制。



內容:


A16Z發布了一份90頁報告,反駁「AI泡沫論」。引用的數據指出,2026年美股科技板塊上漲22.1%,盈利增速卻達55.7%,市盈率反而壓縮21.6%;約75%的上市軟體公司已經盈利。報告的核心觀點是:AI並非整體性的泡沫,近期SaaS拋售更像遲來的估值修正,而非崩盤前兆。


但「AI整體不是泡沫」,不代表「所有AI產品都值錢」。真正需要辨別的,是不同類型的AI正處於不同的發展階段。


生成式、代理式與物理式AI,價值正在分化


Gartner的技術成熟度曲線,將AI分成三個層次:生成式AI正滑向泡沫破裂的低谷期;代理式AI處於期望膨脹期,成為企業關注焦點;物理式AI則快速興起,被視為下一輪突破性創新的驅動力。引用黃仁勳的說法,強調未來的重心將轉向代理式AI與物理式AI。


從這個角度看,泡沫風險可能更集中在低門檻的生成式AI應用。寫文案、畫圖、製作簡報、建立聊天機器人,功能容易被複製,產品也容易同質化。許多軟體只是在原有介面中加入對話框或「AI助手」,就以AI產品作為宣傳,但市場已逐漸不再為這類功能買單。


一項日本調研:為SaaS的AI功能付費的企業中,62.2%感到後悔,70%的企業在選型時已不把AI視為決定性因素。中國市場也出現類似現象,快消產業頭部品牌削減70%的AI採購,部分IT能力較強的企業則選擇自行組建團隊、開發智慧體。


問題在於,許多AI產品只能「給答案」,不能「完成工作」。即使能回答問題、生成文案或報表,客戶使用一段時間後,仍發現後續執行得靠自己。


代理式AI的門檻,不只是模型,而是業務


代理式AI的價值,在於嵌入流程、呼叫系統、進行判斷,並完成任務閉環。但它也不是沒有風險。引用Gartner預測,到2027年底,40%的代理式AI專案將因成本失控、價值不明或風控不足而被取消。


代理式AI真正考驗的,是業務理解與落地能力:能否讓AI理解客戶的業務流程?能否拆清楚決策鏈?能否讓它在真實場景中可靠運作?模型能力正在商品化,但把模型接進業務、讓流程真正跑通,仍不是標準化商品。


跨系統協作尤其重要。代理式AI不是在自家產品裡呼叫一個API就算完成,而是需要串接CRM、ERP、工單系統、物流追蹤、郵件與審批流程。真正的門檻,在於跨系統完成工作,而非單一產品內新增功能。


然而,許多企業經營者仍把AI理解為「在自己的系統裡加一個功能」,沒有把跨系統整合視為產品責任。結果是通用SaaS持續同質化、功能臃腫,以一套模板服務各式企業,卻有大量功能長期閒置。八成功能可能長期不用,加入AI工具後,功能使用率中位數仍不到15%。


最尷尬的情況是:企業投入數百萬元研發與行銷,教育客戶相信「AI能幹活」,但自己的產品仍只能提供答案。客戶建立認知後,反而轉向購買真正能完成任務的代理式AI產品。


物理式AI的挑戰,在真實世界與資料缺口


物理式AI更進一步,不只是在數位空間生成內容,而是在真實世界中感知、推理與行動。中國人形機器人的重要短板之一,就是高品質物理互動資料不足。


列出的數字是:全球高品質真實物理互動資料約50萬小時,訓練通用具身模型至少需要1,000萬小時,並稱缺口超過99%。不過,若直接依這兩個數字計算,缺口約為95%;無論採用哪個比例,核心問題都是資料供給與訓練需求之間存在巨大落差。


增長很快,不代表落地容易


另提到,Stripe估值一年上漲74%,達到1,590億美元;AI公司達到500萬美元年度經常性收入(ARR)平均需要24個月,傳統SaaS則需要37個月,速度約快1.5倍。


但商業增長與實際部署,呈現不同節奏。引用的數據顯示,42%的企業需要對接8個以上資料來源才能部署AI Agent,53%將資料安全與合規列為首要挑戰,超過86%需要升級現有技術架構。


增長曲線很陡,落地卻困難重重。兩者之間的鴻溝,正是代理式AI的機會:協助客戶理清服務對象、收入來源、業務流程與產品銷售方式,再讓AI真正接進工作現場。


中小企業與垂直領域,仍有服務空間


大型諮詢公司已全面投入AI與核心業務流程的整合。安永獲評Forrester Wave AI諮詢領導者,PwC與Cohere成立全球聯盟,推動企業級安全AI部署。


但大型諮詢公司主要服務大客戶,中小企業仍需要更貼近自身需求的服務。大型供應商提供通用型FDE(前線部署工程師)服務,小型團隊則可聚焦特定產業、狹窄領域或區域市場,以深入的業務理解建立差異化。


AI辦公Agent的表現也在分化。Workday月活躍用戶達658萬、排名居首,但商業化表現最弱;「釺問辦公」月活躍用戶約23萬,採取企業上下文路線。這些比較想說明的是:月活躍用戶高,不等於營收高,留存與商業化能力才是長期競爭的關鍵。


不是所有AI都值錢,機會在真正完成工作


核心判斷是:生成式AI正在擠泡沫,代理式AI正在接受價值兌現的考驗,物理式AI仍處於萌芽階段。低端AI應用氾濫,真正能解決複雜問題的高階AI仍然稀缺。


因此,別再只把生成式AI當作產品賣點。更值得投入的方向,是幫客戶把業務理清、把流程拆透、把系統串起來,讓AI在真實場景裡可靠地完成工作。中國

2026年10月6日 星期二

[AI 分享] Muse、Dots 與自架 AI 助理比較:功能、實測與選擇指南

[AI 分享] Muse、Dots 與自架 AI 助理比較:功能、實測與選擇指南

摘要 : 從架構、任務實測、記憶與成本,比較雲端及自架 AI 助理的差異與適用情境。



內容:

這次分享聚焦在 Muse、Dots,以及被稱為「小龍蝦」與「愛馬仕」的 AI 助理。它們看起來都能理解需求、開啟瀏覽器、查資料、填表格、寫郵件,但真正的差異,不只是能不能自動做事,而是背後的電腦由誰提供、任務如何管理,以及使用者能掌握多少控制權。


Muse 從 9 月 18 日開始登上美國 App Store 的 iPhone 排行榜第一名,將 ChatGPT 擠下榜首,並連續十幾天維持第一,22 天的下載量約達 500 萬。另一方面,OpenAI 在 9 月 29 日的開發者大會上推出 Dots,主打擁有自己的雲端電腦與瀏覽器,能連接 4,000 多個應用,也能透過 ChatGPT、電話或 Slack 與使用者互動。


這類產品共同追求的方向,是讓 AI 不必事事等待指令,而能理解情境、主動完成工作。不過,要判斷它們是否適合自己,還是得回到架構與實際使用經驗。


一、先把「大腦」、「電腦」與「管理系統」分開


這類 AI 助理可以拆成三個部分:大模型是大腦,負責理解需求與判斷下一步;電腦是手腳,負責操作瀏覽器、執行程式與處理檔案;管理系統則像記事本,負責記住任務、連接帳號,以及安排後續工作。


模型強,不代表配備的電腦就有顯示卡;電腦記憶體大,也不代表推理能力更好。這些產品的差異,很多時候出現在電腦與管理系統,而不只是模型本身。


Muse 使用 Meta 的 Muse Spark,Dots 使用 OpenAI 的 GPT-6 Astra,使用者不能自行更換模型。小龍蝦與愛馬仕則是一套需要自行部署的軟體,模型與電腦都由使用者準備,可以接 Claude、GPT、較便宜的模型或本地模型,也可以部署在 Mac、NAS 或租用的伺服器上。


因此,小龍蝦與愛馬仕比較像自己買房:裝修、水電、維護都要自己處理,但想怎麼改就怎麼改。Muse 與 Dots 則像住飯店,拎包入住,有人維護環境,但必須遵守平台規則,也無法完全控制底層系統。


二、雲端工作環境,不等於你的私人伺服器


實測時,我曾詢問 Muse 與 Dots,能不能把它們的雲端電腦當成自己的伺服器,長期掛著服務。


Muse 表示,它的環境是臨時虛擬機器,對外 IP 不固定,可能被重置,也不保證 24 小時持續運作。Dots 的回答類似:它可以協助管理我的伺服器,但不能把自己的工作環境承諾為可長期使用的主機。它查到的環境約有 9.7GB 記憶體、32GB 硬碟,沒有可直接使用的顯示卡。


換句話說,它們配備的電腦是讓 AI 完成工作的工具,不是提供使用者自由部署服務的雲端主機。


自架的小龍蝦則不同,部署在哪裡、機器是否持續開機,都由自己決定,但維護責任也由自己承擔。我曾在 NAS 上部署一隻,每天推送日報,期間壞過幾次,有時連續幾天收不到日報,才發現它已經停止工作。


三、實測一:註冊甲骨文免費雲端帳號


第一項任務,是請 Muse 與 Dots 協助註冊甲骨文的免費雲端帳號。


Muse 會持續操作,右側活動流能看到每一步做了什麼、何時執行。遇到寄往 QQ 郵箱的驗證信時,它坦白說自己只能存取 Gmail,請我自行取得驗證連結。到了信用卡資料輸入階段,它要求我接管瀏覽器,並提醒卡號、有效期限與安全碼只在網頁內填寫,不要傳到聊天中。


最後,信用卡驗證雖然通過,帳號建立仍被風控攔下。Muse 推測可能與帳單地址、發卡地區及網路位置不一致有關,並提供重試、聯絡客服或停止等選項,同時整理進度,方便之後接續處理。


Dots 起初判斷,我可能需要的是教學,或希望有人協助判讀註冊畫面,因此先請我開啟網站、提供截圖。在我確認授權它繼續操作後,它才啟動瀏覽器。後續經過條款、隱私權及付款驗證等環節時,它會多次停下來確認,說明哪些步驟應由使用者親自完成。


這次測試中,Muse 比較偏向持續推進,必要時才請人接手;Dots 則更重視授權與敏感操作的邊界。兩者並非單純誰比較好,而是工作風格不同。


四、實測二:登入論壇並發文


第二項任務,是登入 L 站並發布一篇大家可能感興趣的文章。


Muse 會先處理登入障礙,登入後查看近期熱門主題,再決定發文方向。它發現免費雲端服務、AI Agent 與 VPS 選型等內容較受關注,最後把前一項甲骨文註冊失敗的經驗整理成文章。


不過,它最初把自己當成主角,寫成「Muse 替主人操作」的視角。我要求改成我的口吻後,它重新調整。接著又因文章過長觸發論壇限制,它便縮短內容並再次送出,最後成功發布,之後也主動回報閱讀、按讚與留言情況。


Dots 則先確認登入授權,成功登入後選擇討論 AI Agent 能否真正減少重複工作的主題。它在送出前再次確認要不要發布,最後也完成任務。


但兩者都沒有充分模仿我過去的發文習慣,也沒有先確認帳號權限,例如是否具備使用某些標籤或發布特定內容的資格。這代表,能成功發文,不等於已經具備完整的論壇營運判斷能力。


五、實測三:生成圖片與影片


第三項任務,是請兩者生成幾張不同場景的圖片,並製作一段動漫風格影片。


Muse 先確認了數量、風格、比例、片長及是否需要配樂等細節,接著完成四張圖片,也直接產出一段影片。影片中有掠過水面的滑翔動作與落地鏡頭,與提示要求相符。整體感受接近在 ChatGPT 或 Gemini 中直接生成內容。


Dots 則表示,目前沒有能直接使用的圖片或影片生成工具。它改以程式绘圖的方式產出四張圖片,也另外生成一組分鏡與程式碼,但沒有完成影片。它提供了整理提示詞、使用雲端 API,或到第三方平台生成等替代方案。


Dots 特別提醒,這次成果比較接近「程式繪圖」,不是影像模型生成的寫實圖片。這種誠實說明值得肯定,但就本次任務而言,Muse 提供了更直接、完整的生成體驗。


以上三項只是有限次數的實測,不能當成嚴格的全面評比,但足以看出兩者在自主推進、授權確認與工具整合上的差異。


六、記憶能力:記得事情,不代表懂得在對的時候使用


測試記憶功能時,我曾簡單介紹自己的背景,也多次聊到公司有台式與筆記型電腦、家裡有其他設備、NAS 上運行的服務,以及 VPS 的用途。


Muse 將這些資訊逐步整理進長期記憶,檔案內容變得相當詳細。它也會主動運用記憶,例如在整理甲骨文註冊失敗的論壇文章時,加入我已有 NAS、VPS、影音及同步服務的背景。


Dots 也表示,會把記憶整理成檔案,而不是永久保存全部對話。不過,我曾要求它記住一項設定偏好,之後再提到相同事情時,它仍重新詢問是否要照做。它的理由是,記得偏好不代表可以跳過敏感操作所需的授權。


這裡要區分兩件事:一是能否記住,二是是否會在合適的時機使用記憶。有些重複確認不是忘記,而是平台刻意保留的安全機制。相較之下,自架助理通常提供更多調整人格、記憶與工作規則的空間,但也需要自己維護。


七、付費差異:買的是成果,還是自行承擔運作成本


Muse 方案分為免費、Pro 與 Max,價格分別為免費、每月 20 美元及 200 美元;Pro 與 Max 的額度分別標示為 20 倍與 100 倍。


較特別的是,Muse 主打「Results, not tokens」,也就是按結果而非 token 計費。依其文件說明,使用者只為可用結果付費,失敗執行不收費,重試、澄清與最佳化也不計入。但官方並未提供固定公式,說明一份結果究竟扣多少額度。


Dots 則依 ChatGPT 訂閱方案提供每月額度,正式上線後與 ChatGPT 共用使用量。不過,它當時仍处於研究預覽階段,部分訂閱者可以免費體驗,也有帳號出現邀請朋友使用的入口。


自架小龍蝦與愛馬仕的軟體本身免費,但仍須支付模型與機器成本。AI 繞路、重試、查錯頁或修改內容所消耗的 token,都由使用者負擔。


如果只是偶爾請 AI 搜尋資料或處理表格,未必需要這類持續在線的助理。但若希望它長期跟進郵件、監控資料變化、整理日報,則應把價格、部署與維護時間、穩定性及故障後的處理責任一起考量。


八、四款產品適合誰?


Muse 適合不想研究部署、希望 AI 接到任務後自行推進,且願意將帳號與部分資料交由平台處理的人。本次體驗中,它在查資料、處理郵件、整理表格、操作網站及生成圖片、影片方面,呈現出較完整的整合能力。代價是底層環境與規則由平台掌握,使用者無法自由修改。


Dots 適合已經習慣 ChatGPT 生態的人。它結合雲端工作環境與排程任務,也更重視權限與操作邊界,適合重要步驟需要使用者確認的工作。不過,本次測試中,它在生成圖片與影片方面未能提供與 Muse 相同的直接體驗。


小龍蝦適合喜歡折騰、需要高度客製化,而且願意自行部署與維護的人。它能放在自己的設備或伺服器上,模型、記憶、工作流程及本地資料串接都更有彈性,但也必須自行處理更新、權限、故障與安全問題。


愛馬仕則較偏向長期使用後,逐步累積記憶、技能與排程流程的工作助理。小龍蝦更強調連接平台、裝置與工具,愛馬仕則更強調持續工作及累積經驗。但兩者都不代表部署完成後就完全不需要管理。


九、Muse 的註冊與使用方式


Muse 當時以英文介面為主,需要邀請碼,並使用 Gmail 帳號註冊。它會申請相關郵件權限,因此我使用的是測試帳號,而不是主要個人帳號。登入後能看到幾個常用操作,其中部分需要訂閱 Pro。


我最初用香港 IP 測試,多次失敗,換成美國 IP 後才成功。不過,也有人回報香港 IP 可以註冊,因此可能受個別環境影響。Muse 並非只能使用手機,也可以透過網頁版與電腦版操作;邀請碼則會放在原分享內容的下方。


十、最後的重點:AI 正從回答問題,走向執行工作


這次最明顯的感受,是 AI 產品正在改變:過去多半是使用者問問題、AI 提供答案;現在則逐步走向交代目標,讓 AI 使用自己的工作環境執行任務。


但「能做事」不等於「能放心放手」。它能否遵守平台規則、辨識操作限制、知道何時該停下來,以及在使用帳號權限時避免造成風險,才是更值得關注的部分。


選擇哪一款,核心並不是誰更像人,而是你願意把多少控制權交給平台,又願意自己承擔多少維護責任。想省部署與維護,可以考慮 Muse 或 Dots;想掌握機器、模型與資料流向,可以考慮小龍蝦或愛馬仕。最終仍要回到自己的工作需求,而不是只看產品熱度。

[AI 反思] AI發展由誰決定?一場抗議揭開普通人的失語處境

 [AI 反思] AI發展由誰決定?一場抗議揭開普通人的失語處境

摘要 : 一場AI大會抗議,讓資源消耗、監管與公眾參與的爭議浮上檯面:誰享受利益,誰承擔代價?



內容:

在倫敦一場AI願景大會上,一位反AI活動人士公開質疑:當科技公司宣稱AI是為人們而發展時,是否真正回應了普通人的恐懼?


她在發言中表示:「你們說這是為了人們,但普通人正在害怕。」她引用了「AI有一成機率在十年內導致人類滅絕」及「500座運作中的資料中心使全國三分之二地區陷入乾旱」等說法,藉此表達對AI安全與資源消耗的憂慮。這些數字是她在現場提出的主張,原文未提供來源或查證資訊。


她也提及一場難堪的風波,並尖銳地批評:「最好的情況,是掌握這項技術的人完全無能;最壞的情況,是你們正被帶向一場災難。」在她看來,大會不斷描繪AI的願景,卻沒有正面處理人們的擔憂。


「透明度在哪裡?監管在哪裡?投票在哪裡?我們有任何人曾經為這些事情參與公投或投票嗎?」她質疑,AI發展缺乏明確的問責機制,而監管又不符合股東的利益,讓普通人難以參與影響自身生活的決策。


她呼籲暫停資料中心建設,讓一般民眾在AI議題上擁有發言權,而不是把決定權交給矽谷科技富豪。她強調,地方社區往往最先承受AI與資料中心帶來的衝擊,卻最晚獲得表達意見的機會。她也指控AI從人們身上奪取利益,使地方社區陷入更貧困的處境。


說完這段話後,她被安保人員帶離會場。


但她真的只是在抵制AI嗎?從這段發言來看,她批評的核心,更像是當前AI發展的遊戲規則:資本與精英掌握方向,普通人卻可能承擔代價,而且缺乏話語權。


這場原本要展示AI願景與能力的大會,因為抗議而呈現了另一個問題:當技術快速推進,社會是否也準備好了相應的監管、透明度與公眾參與機制?如果這些疑慮始終得不到回應,質疑的聲音恐怕只會增加,不會自行消失。


我們或許無法左右大公司的決策,但至少可以追問:這些決定如何影響我們?又是否有人真正問過我們,同不同意?

[AI 警示] 比爾蓋茨談 AI 風險:就業衝擊、監管責任與下一代的未來

 [AI 警示] 比爾蓋茨談 AI 風險:就業衝擊、監管責任與下一代的未來

摘要 : 蓋茨警示 AI 的安全與就業風險,呼籲政府監管、調整稅制,並關注下一代的教育與社交。



內容:

根據所提供的兩場近期專訪轉述,長期相信科技能改善人類生活的比爾蓋茨,這次對 AI 的態度多了明顯的警惕。過去,他談論 AI 時,多半聚焦於令人期待的可能性;如今,他更關心的是:當 AI 帶來安全威脅、就業衝擊與資源分配問題,誰會承受代價,又該由誰負責接住受影響的人?


他提出的第一個關鍵判斷,是 AI 已經跨過某些危險能力的門檻。蓋茨表示,程式設計曾是他從十三歲到二十三歲最投入的事情,但如今許多大型模型的程式設計能力,已經能與人類競爭,甚至在部分任務上表現得更好。依照轉述,這項變化從訪談所指的去年年底開始變得明顯。


真正讓他擔心的,不是 AI 能聊天,而是人類可能需要多年才能累積的專業能力,AI 已能迅速追上。一旦這些能力被濫用,網路攻擊與生物恐怖主義就可能成為最先受到影響的領域。他在訪談中警告,AI 工具可能讓與政府無關的非國家組織,也具備製造流感等級病毒威脅的能力。這是轉述中蓋茨提出的風險判斷,不宜直接視為已獲證實的事實。


第二個判斷,是未來兩到四年,AI 可能對工作帶來嚴重衝擊。他認為,目前阻止 AI 大規模取代人類工作的主要障礙,是可靠性。這道門檻不容易跨越,但可能在幾年內被突破。


一旦某家公司率先採用可靠的 AI,並因此大幅降低成本,其他公司就會面臨跟進的競爭壓力。機器不需要睡眠與休息,可以全天候運作,因此他特別擔心白領工作會率先受到衝擊;如果人形機器人的認知與執行能力持續提升,藍領工作也可能接著受到影響。


轉述也提到,蓋茨曾與 Anthropic 執行長達里奧・阿莫迪討論這個問題。阿莫迪提出的預測更為激烈:未來一到五年,入門級白領職位可能減少一半,失業率也可能升至百分之十到百分之二十。這些數字屬於對未來的預測,並非已經發生的結果。


有人認為,歷史上的技術革新雖然淘汰部分工作,最終也會創造新的職位。但蓋茨擔心,這次變化的速度與規模不同於過去。以往的職業轉型可能跨越數代人,AI 帶來的衝擊卻可能集中在短時間內,讓勞動者與社會制度來不及調整。


第三個判斷,是現有的社會保障與稅制,可能不足以承受這波轉型。當大量工作受到影響,原本資金就有限的社會安全網,未必有能力接住所有人。


因此,他提出逐步從對勞動力徵稅,轉向對資本與機器人徵稅的政策方向。核心想法是:如果機器取代人類工作並創造收益,相關收益也應承擔支持公共服務與社會保障的責任,而不應主要依靠勞動者的薪資稅收來維持制度。


第四個判斷,是 AI 不能只依靠產業自我監管。蓋茨認為,當競爭者越來越多,單一公司的安全承諾,很難約束整個產業。


他以 OpenAI 為例,指出早期設置的安全措施,在只有少數企業領先時或許較容易發揮作用;但當美國與中國都有大量公司競相推進技術,任何一家企業單方面放慢腳步,都可能面臨被超越的壓力。要求減速的聲音,也容易被「不能在競爭中輸給中國」的論述壓過。


依照轉述,蓋茨批評美國政府目前更像是替產業加油的啦啦隊,將注意力放在地緣政治競爭,而未充分承擔管理國內風險的責任。他認為,真正有效的規範不能只靠企業自律,政府必須介入。


訪談最後,話題轉向下一代。當被問到會如何面對孩子在 AI 時代的成長,蓋茨提到自己的三個孫女,也坦言他仍不確定未來的教育會變成什麼樣子。


他尤其擔心,AI 陪伴與育兒工具可能改變孩子的社交經驗。如果家長不知道孩子經常提起的「朋友」其實是 AI,孩子就可能減少面對真實人際關係的機會,也難以學到那些必須透過真人互動才能培養的能力。即使 AI 和機器人有能力協助育兒,也不代表所有用途都應毫無限制地開放。


轉述中,蓋茨將 AI 比作核能,甚至以「威力是核能的一千倍」來強調其潛在影響。這是警示性的比喻,而非可直接量化的比較。他想表達的是:AI 既可能造福人類,也可能帶來巨大的破壞,關鍵在於人類如何引導與約束它。


這些判斷並不代表蓋茨否定科技的價值,而是顯示他不再認為,只靠技術進步與市場競爭,就能自然解決所有問題。當 AI 的能力與影響迅速擴大,安全監管、就業轉型、社會保障與兒童成長,都需要有人提前負起責任。

2026年10月5日 星期一

[AI 觀察] 未來20年的職業安全:哪些工作較難被AI取代?

 [AI 觀察] 未來20年的職業安全:哪些工作較難被AI取代?

摘要 : AI可能先改變白領工作;實作、責任與人際信任,是職業安全的三道防線。



內容:

談到AI取代工作,多數人可能先想到勞力密集、收入較低的職業。但原文提出另一種觀察:AI可能更早衝擊那些看起來體面、以高學歷為門檻,主要在電腦前完成的工作。


原文綜合牛津大學、微軟、Anthropic、美國勞工統計局與世界經濟論壇的研究及預測,嘗試整理未來20年較難被AI與機器人取代的職業。不過,不同研究的年代、方法與衡量指標並不一致,「AI能介入多少工作任務」也不等於「整個職業會消失」,因此這份排名更適合當作觀察方向,而不是確定的預言。


另外,提供的文字有明顯缺漏:第14名的說明中斷,第13至第8名未完整呈現,第2名只留下開頭,也沒有第1名內容。以下依現有文字整理,不補造缺失的排名。


AI可能先改變白領工作的原因


原文引述微軟研究院2025年的研究指出,研究人員分析約20萬筆真實、匿名的AI對話,再將使用者交給AI處理的任務對應到不同職業。結果顯示,需要本科學歷的職業,AI適用程度反而可能高於學歷要求較低的職業。


原文列出的高AI適用職業,包括翻譯、歷史學家、服務類銷售、作家、客服、電話接線員、播音員與電臺DJ;較低的則包括護工、地板打磨工、打樁機操作員、水處理廠操作員、橋樑與船閘操作員,以及挖泥船操作員。


原文也引述Anthropic在2026年的研究,指出AI滲透較深的職業,從業者可能更偏向年齡較大、學歷較高、收入較高的族群。


背後的原因是,AI擅長閱讀、寫作、計算、查詢與摘要,而這些恰好也是許多教育體系長期重視的能力。這不代表教育沒有價值,而是提醒我們:如果專業能力只停留在整理資訊與產出標準答案,受到AI影響的可能性就比較高。


判斷職業安全的「三道牆」


第一道是「動手的牆」。工作是否需要在複雜、不熟悉、難以標準化的真實環境中操作?現場越多變,機器人越難穩定完成任務。


第二道是「責任的牆」。出了問題,是否必須有人簽字、承擔法律責任、處理賠償與接受追究?在醫療、工程與公共安全等領域,AI能提供建議,不代表能獨立承擔責任。


第三道是「人心的牆」。客戶或服務對象付費,是否因為需要真人理解、陪伴、說服與建立信任?當服務涉及情緒、關係與長期支持,人類仍有重要角色。


原文認為,一份工作占據的防線越多,越不容易被整體取代;如果三道防線都薄弱,就更需要思考轉型。


第20名:營養師


原文引述牛津大學2013年的研究,指出營養師的自動化機率估計為0.39%。但這是生成式AI普及前的研究,不能直接視為今天的風險數字。


如今,AI已能快速提供飲食建議與菜單,因此只提供通用飲食表的服務,可能面臨更大的競爭。相較之下,能為糖尿病、腎臟病或接受化療的患者進行臨床營養管理,並與醫療團隊合作、持續追蹤結果的營養師,仍有較高的專業價值。


原文的核心觀點是:營養師真正的價值,不只是提供知識,而是把知識落實到個別患者身上,持續追蹤並承擔專業責任。


第19名:醫療與健康服務管理者


這類工作包括醫院、診所與養老機構的營運、排班及流程管理。原文引述美國勞工統計局預測,相關職業在未來10年將成長24.2%,主要動力之一是人口老化與醫療服務需求增加。


不過,文書、報表與排班等任務,也容易受到AI影響。較難取代的是在醫師、護理人員、患者、家屬、保險公司與監管機關之間協調,以及在醫療糾紛發生時做出決策、承擔責任的能力。


簡單說,管理表格的工作容易被自動化,管理人與複雜關係的工作則更有韌性。


第18名:中小學與幼兒教師


原文指出,世界經濟論壇預測部分教育職位將增加,但微軟研究也將部分教師職業列入AI高度適用的名單。兩者並不必然矛盾,因為教師的工作包含不同任務。


知識講解、教材整理與部分練習回饋,可以由AI協助;但班級經營、紀律管理、情緒支持,以及察覺霸凌、家庭困境或學生行為變化,仍需要教師的現場觀察與介入。


未來若只照課本或投影片授課,競爭壓力可能增加;能建立信任、理解學生並帶領班級的教師,則較難被取代。幼兒教育尤其涉及照顧、安全與情感互動,但也必須留意少子化可能壓縮部分地區的教師需求。


第17名:農場工人


原文引述世界經濟論壇的報告指出,到2030年,農場工人可能是全球就業人數絕對增量最大的職業之一。


原因包括人口與糧食需求增加,以及許多發展中國家的農業仍仰賴大量人力。採摘草莓、葡萄、修剪果樹等工作,需要判斷成熟度、控制力道並適應不規則環境,並非所有環節都容易自動化。


然而,大田作物的機械化仍會持續,農業工作也常伴隨低收入與高勞動強度。原文認為,未來農業會同時需要現場勞動者,以及能操作無人機、感測器與智慧農業設備的人才,後者可能具有更高的附加價值。


第16名:酒店與接待管理


原文引述牛津研究,指出住宿經理的自動化機率估計為0.39%。


訂房、入住、退房與結帳等標準流程,可以由AI或自助設備處理;但真正考驗管理能力的,是醉酒客人鬧事、漏水、臨時換房、突發疾病等非標準事件。


這些情況需要有人協調資源、立即決策並負責。高端服務也往往重視個人化接待與被理解的感受,因此酒店管理者的價值,更可能集中在危機處理與服務關係,而非例行行政。


第15名:編舞與現場表演者


原文引述牛津研究,指出編舞者的自動化機率估計為0.4%,並對比微軟研究中較容易受到AI影響的播音員與電臺DJ。


原文認為,差異在於服務內容:聲音與資訊可以被合成與複製,但舞蹈及現場表演還包含身體、臨場互動與觀眾對真人投入的感受。


AI能生成作品,不等於能完全取代人們觀看真人表演的需求。不過,這是對現場表演價值的分析,並不代表娛樂產業的所有工作都不會受到AI影響。


第14名:義肢矯具與聽力相關專業


原文職稱疑有轉錄錯誤,寫作「甲質腳型師與聽力師」,且後續說明在提到聽力師的自動化機率時中斷。


由於職稱與內容都不完整,無法據此可靠整理該名次的研究數字與完整論點。


缺漏段落:設備與能源維修相關工作


第14名之後,原文直接接到一段維修工作的說明,未保留完整名次與職稱,因此不能確定它對應哪一項排名。


現有內容指出,電動車增加,會帶動高壓電與電池維修需求;風力發電與太陽能設備增加,也需要更多現場維護人員。


維修工作的難點在於,每次故障原因都可能不同,需要現場觀察、檢測、操作與判斷。原文因此將機器人、設備及能源維修視為值得年輕人考慮的方向,理由是它兼具動手能力與安全責任,也可能受惠於設備普及和能源轉型。


第7名:心理諮詢師與社工


原文引述牛津研究,指出心理健康與藥物濫用社工的自動化機率估計為0.31%,醫療社工為0.35%;也引述世界經濟論壇,認為社工與心理諮詢相關職位將成長。


AI可以提供對話、情緒支持與一般建議,但涉及嚴重憂鬱、成癮、創傷或家暴時,往往需要受過訓練的專業人員評估風險、建立長期關係,並在必要時採取實際行動。


社工還需要家訪、跨機構協調、資源連結與安置安排。這些工作不只是「聽人說話」,而是走進當事人的生活,協助問題真正得到處理。


第6名:消防員與應急管理


原文引述牛津研究,指出應急管理主管的自動化機率估計為0.3%,消防一線主管為0.36%。


火災與災難現場高度不確定,消防與救援人員必須快速判斷建築狀態、危險來源、搜救順序與撤離時機,同時承擔生命安全責任。


無人機與消防機器人可以協助偵查、滅火與降低人員風險,但現場指揮、跨單位協調及對受困者的安撫,仍需要人的參與。


原文認為,極端天氣與災害風險可能增加救援需求。不過,具體職缺變化仍取決於各地風險、政策與公共預算,不能直接視為必然成長。


第5名:康復與職業治療師


原文引述牛津研究,在702個職業中,康樂治療師的自動化機率估計最低,為0.28%;職業治療師則為0.35%。需要注意的是,康樂治療、物理治療與職業治療並非完全相同的專業,不能混為一談。


這類工作的共同價值,在於協助受傷、中風或功能退化的人,恢復活動能力與日常生活能力。治療需要依個別狀態調整,也常涉及實際操作、觀察疼痛及反應,以及長期鼓勵患者持續參與。


人口老化可能帶動相關需求,因此原文將康復相關專業視為值得關注的醫療方向。實際選擇時,仍需了解各專業的學制、證照與工作範圍。


研究不是算命,而是地圖


原文在此提醒,自動化風險預測不等於就業人數預測。


牛津研究曾估計,美國約47%的就業處於較高自動化風險。原文另引述一項回顧分析,指出被認為高度危險的保險核保相關職位,在2013至2021年間就業人數反而增加16.4%;被認為較安全的康樂治療師,職位卻減少8.9%。


這些例子說明,就業還受到需求、成本、制度、人口與產業結構影響。榜單可以提示風險方向,卻不能保證某個職業一定增加或消失。更重要的是,你在該職業中執行什麼任務、具備什麼能力。


第4名:醫生


原文引述牛津研究,指出醫師與外科醫師的自動化機率估計為0.42%。


原文以AI研究者辛頓對放射科的預測為例:他在2016年曾主張,深度學習可能在約五年內表現得比放射科醫師更好,因此不應再繼續培養相關人才。但原文引述後續報導與資料指出,放射科醫師並未因此迅速消失,梅奧診所的放射科醫師人數反而增加。


原因包括:AI提高效率後,可能帶動更多檢查與複核需求;影像判讀只是醫師工作的一部分;患者狀況複雜,仍需要臨床整合;最終診斷、治療與醫療責任,也不能只交給演算法。


外科手術同樣涉及現場變化、突發出血與即時決策。手術機器人可以是重要工具,但不等於能全面接替主刀醫師。


原文的核心主張是,AI更可能改變醫師的工作方式,而不是直接消除整個職業;善用AI並維持專業判斷的醫師,可能更有競爭力。


第3名:電工


原文認為,AI發展反而可能增加電工需求,因為資料中心需要大量供電、配電、施工與維護工作。


原文提到Meta、Google投入技術人才培訓,以及資料中心建設受到人力短缺影響的案例,並引述Indeed分析,稱資料中心電工的收入高於其他場域的電工。這些個別投資金額、時程與薪資差距,仍需依原始資料確認,不能直接套用到所有地區。


除了資料中心,電動車、充電樁、太陽能、儲能與老舊電網更新,也可能帶動相關需求。


電工工作的防線,在於建築線路各不相同,現場可能存在歷史改裝與不標準接法,而且錯誤可能造成觸電、火災或重大事故。因此,現場操作、故障判斷、證照資格與安全責任都十分重要。


原文將電工列為值得年輕人考慮的技術職,但實際收入、培訓門檻與工作條件,仍會因地區、專長及證照制度而異。


第2名:護士


提供的原文只保留了這個名次的開頭,提到美國勞工統計局將某類護理職位列為成長快速的職業,但未提供完整職稱、統計期間與後續說明。


因此,無法確認此處指的是一般護理師、執業護理師,或其他護理職類,也不宜補上原文未提供的數據與論點。


第1名:原文未提供


雖然開頭預告將揭曉最難被AI取代的第一名,但提供的內容沒有包含答案,無法據此判定。


結語:不要只看職稱,要看工作的核心價值


這篇內容最重要的提醒,不是某個職業永遠安全,而是AI會優先改變其中容易標準化、數位化與大量複製的任務。


比較有韌性的工作,往往需要在真實環境中動手、在關鍵時刻承擔責任,或透過長期互動建立信任。同一個職業裡,只提供標準答案的人,與能處理複雜個案、協調現場並對結果負責的人,受到的影響可能完全不同。


選擇職涯時,除了考慮學歷與職稱,也應了解實際工作內容、在地需求、收入條件與培訓成本。與其尋找一份保證不被AI取代的工作,更實際的方向,是培養能運用AI、又能提供AI難以獨立完成之價值的能力。

2026年10月4日 星期日

[AI 分享] 讓引擎管流程、讓模型管執行:AI 程式開發的 Harness 設計

 [AI 分享] 讓引擎管流程、讓模型管執行:AI 程式開發的 Harness 設計

摘要 : 透過確定性的流程引擎,管理 AI 開發階段、工具與門控,避免跳步並提升一致性與複用性。



內容:

當我們讓 AI 撰寫程式碼時,整個工作流程應該由誰主導?這看似是技術問題,實際上也關乎產品哲學。主流做法是將流程寫進提示詞,建議 AI 按照步驟完成任務;但建議不等於約束,AI 仍可能省略規劃、跳過測試或略過審查。


我們的產品選擇另一條路:以確定性的引擎硬性驅動流程,AI 只負責完成各個步驟中的工作。一句話概括,就是「讓引擎管流程,讓模型管執行」。


智慧體迴圈:有執行能力,卻不負責全局流程


理解這套設計,首先要認識智慧體迴圈,也就是 Agent Loop。它是 AI 程式開發助手的執行核心,運作方式是不斷循環:思考該使用什麼工具、呼叫工具,例如讀取檔案或執行命令,再觀察結果是否足夠;如果不足,就繼續下一輪。


這就像派一位員工處理複雜任務,他不是一次完成所有事情,而是逐步探索、採取行動,再根據結果調整。這個迴圈讓 AI 具備實際動手的能力,但它的主要職責是完成眼前任務,而不是管理整體流程。


我們將它稱為「執行核心」。給它任務、工具與工作說明,它就持續運作,直到任務完成。然而,它不負責判斷整個流程進行到哪一步、目前是否應該執行這件事,也不負責決定完成後要前往哪個階段。


它像是一位能力很強、卻不負責全局安排的工匠。你讓他砌牆,他可以把牆砌好,但不會主動決定現在是否應該砌牆,或砌完之後是否需要驗收。


裸迴圈的三個缺口


當一個 AI 程式開發產品只有執行核心,上層沒有流程管控時,我們稱之為「裸迴圈」。這種設計有三個主要缺口。


第一,缺乏品質門控。AI 認為工作差不多完成,就可能停止,甚至跳過測試與程式碼審查,因為系統沒有設置必須通過的關卡。


第二,缺乏流程一致性。同一個任務,AI 這次可能執行五個步驟,下次只執行三個,導致流程與結果難以預測,也難以重現。


第三,缺乏複用性。好不容易摸索出一套有效的工作方法,卻只存在於某次對話的上下文中。換個專案或會話,就難以延續,無法有效沉澱與分享。


這三個問題,都指向同一個根源:執行核心之上,缺少一個統一管理節奏與流程的角色。


提示詞是建議,不是流程約束


常見的解法,是把工作流程寫進系統提示詞,例如要求 AI 先分析需求、再規劃、接著實作,最後執行測試。


這樣做看似合理,卻仍然只是建議。AI 可能認為任務很簡單,不需要規劃就直接寫程式碼;也可能在完成程式碼後宣告任務結束,卻沒有真正執行測試。單靠提示詞,無法硬性保證它遵守每個步驟。


這就像把交通規則寫在紙條上交給司機,與在道路上設置紅綠燈和檢查站,是兩種不同的管理方式。前者依靠遵守,後者則建立實際的流程約束。我們的產品要做的,就是為 AI 工作流程裝上這些「紅綠燈」。


Harness:可插拔的工作流程引擎


Harness 可以用線束的概念理解:將原本散亂的部分,組織成有序、可控的整體。在我們的產品中,它是一套可插拔的工作流程引擎,主要負責三件事:規定任務分成哪些步驟、每一步由誰執行,以及完成後前往哪一步。


它相當於 AI 的排程中心。執行核心不再自行決定整體節奏,而是接受排程:先完成第一步,完成後回報,取得放行才能進入第二步。


這套規則可以替換。換一套 Harness,就等於換一套工作方式,像是為同一臺機器換上不同的作業指導書。


雙層架構:排程與執行各司其職


整體架構分成兩層。上層是排程中心,也就是階段狀態機,負責讀取目前階段的作業指導書、配置工具與工作手冊,以及決定完成後的去向,但不親自執行任務。


下層是執行核心,接收派發的工作,透過智慧體迴圈逐步完成,但不管理全局流程。兩層各司其職,形成清楚的分工:排程歸排程,執行歸執行。


階段 Stage:流程中的任務卡


階段是工作流程中的一站,也是整套系統的基本組成單元。每個階段都像一張任務卡,包含四項資訊。


第一是工作手冊,說明這一步的目標與做法。第二是工具箱,規定此階段允許使用哪些工具,也可以限制為只開放必要工具。第三是門控,決定完成後自動放行、等待人工確認,或依條件判斷。第四是下一站,指定完成後要前往哪個階段。


例如,產品內建的 Dev Flow 開發流程包含八個階段:梳理需求、制定規劃、撰寫程式碼、審查是否符合需求、審查程式碼品質、執行測試、沉澱知識,以及提交程式碼。每個階段都有各自的任務卡。


階段狀態機 Stage Machine:以程式邏輯決定流程


階段狀態機是整套系統的排程中心,只回答三個問題:現在執行哪個階段、完成後前往哪裡,以及是否需要停下來等待使用者。


最關鍵的設計是:排程中心具有確定性,所有流程決策由程式碼邏輯做出,而不是由 AI 決定。


即使 AI 在畫面上輸出「梳理階段完畢」,那也只是一段顯示文字,不是排程中心放行的依據。排程中心依照自身維護的狀態與規則運作,因此 AI 不能僅憑自己的判斷跳過某個階段。


即使 AI 認為審查沒有必要,也無法自行繞過關卡,因為放行權掌握在排程中心,而不是模型手中。這就是「硬驅動」:流程由系統硬性推進,而不是只透過提示詞提出建議。


門控 Gate:管理階段之間的放行


門控是階段之間的關卡,分為三種模式。


第一種是自動放行。階段完成後,立即進入下一站,不等待人工確認,適合不需要人員拍板的執行環節,例如撰寫程式碼或執行測試。它就像高速公路的 ETC 通道,符合通行要求便可繼續前進。


第二種是人工放行。階段完成後必須停下來,等使用者確認繼續才往下走,適合梳理需求與制定規劃等需要人員決策的環節。


第三種是條件放行。完成後,系統會檢查是否符合通行條件;通過才放行,有問題就攔下。這適合審查、測試等需要判斷結果是否合格的環節。因此,即使同樣是測試階段,也可以依流程需要採用不同的門控模式。


此外,系統設有連續自動跳轉的上限,避免全自動流程持續空轉,始終不將控制權交還使用者。就像高速公路不能無限延伸,流程運作到一定程度,也需要保留出口。


執行者 Runner:決定這一站由誰完成


執行者回答的是「這個階段由誰來做」,分為兩種模式。


第一種是本機執行。在主迴圈中更換工作手冊,繼續由同一個 AI 執行,就像同一位員工轉換崗位,人沒有更換,但任務與工作要求改變了。


第二種是委託執行。將整個階段打包,交給獨立的專家處理,就像聘請一位外部顧問,由他帶著自己的工具箱來完成該階段的工作。

[AI 分享] AI Coding 時代的程式碼審查:從逐行檢查轉向分級把關

 [AI 分享] AI Coding 時代的程式碼審查:從逐行檢查轉向分級把關

摘要 : AI 提效不靠逐行審查,而是把關需求品質、完善自動化流程,並針對核心高風險模組進行人工審查。



內容:

AI Coding 這麼強,到底還需不需要人工做程式碼 Review?以我們十幾個專案組的實際情況來說,全端工程師使用 AI Coding,一個小時的程式碼產出量,就可能抵得上過去幾天的工作量。面對這麼大量的程式碼,還要不要逐行審查?我們實戰後的結論是:擺正 AI Coding 的使用方式,放棄全量審查的無用功,改做分級 Review。


可以把 AI 想像成團隊裡不同資歷的工程師。當一位工程師剛到職、第一次提交程式碼時,技術負責人通常會確認:程式碼是否符合專案規範、業務理解與邏輯是否正確、邊界條件是否完整,以及空值判斷、異常處理、SQL 效能、資料表索引、交易、權限、鎖與服務可用性等是否存在問題。


如果這位工程師多次表現良好,團隊就會逐步建立信任,後續審查也會轉為抓大放小,依模組風險決定投入程度。一般後台 CRUD 功能,功能跑通就放行;但支付、訂閱等核心資金流程,仍必須重點審查交易、鎖與高可用性等風險。


那麼,你手上的 AI 相當於哪個級別的工程師?在我們的實務中,AI 被視為中級以上的開發者。因此,我們更重視前期對業務理解與架構設計的評審,相對淡化後期逐行程式碼 Review。


這套 AI Coding 流程,首先必須嚴格把關上游需求品質。產品經理要產出對 AI 友善的 PRD,並透過需求壓測 Skill 檢查需求完整性。接著,全端工程師使用 Super Power 等工具,嚴格執行需求澄清與 Spec 規範,將業務邏輯、架構設計、需求邊界和業務約束,完整沉澱到 Spec 檔案中。


在開發環境裡,我們使用統一的 AI 腳手架,提前透過 agents.md 定義專案目錄與架構,規定各資料夾的職責,例如 util、DAO 應放哪些內容,再透過 rules 檔案固定程式碼規範與安全規範。有了這些前置準備,AI 產出的程式碼通常比較規範,幾乎不會出現低階語法錯誤;它容易踩坑的地方,反而多半是需求邊界描述不清。


後置流程則搭配三類工具:模型交叉 Code Review Skill、效能評審 Skill,以及能自動完成測試案例設計、測試腳本生成、執行與迴歸測試的 QA Agent。最後再結合開發者自測兜底,讓整體流程兼顧速度與穩定性。


這套流程的核心始終是需求。如果需求沒有講清楚,後面再怎麼 Review 也很難補救。因此,我們把更多時間投入需求品質把控與需求澄清,而不是把所有精力放在程式碼產出後的人工檢查。


至於什麼時候需要人工 Review,我們採取分級處理:非核心模組完成整套流程與功能自測後,直接交付;核心、高風險流程,才進行針對性的重點審查。這種做法特別適合敏捷開發、小步快跑的團隊。


也提醒團隊負責人:想透過 AI 取得數倍的效率提升,就要接受分級容錯。非核心場景允許小瑕疵,核心場景則必須零容忍。


AI Coding 下的人工 Review,不再是所有程式碼都必須經過的固定關卡,而是從逐行逐句通讀,轉變為在關鍵節點做判斷與把關。AI 負責產出吞吐,人負責核心品質與流程調整。


關注明隊,後續將繼續分享企業產品與研發提效的實踐和方法。有想法也歡迎在評論區交流。

[AI 反思] AI技術與未來敘事:從自動駕駛到2030年滅絕風險

 [AI 反思] AI技術與未來敘事:從自動駕駛到2030年滅絕風險

摘要 : AI進步不等於全面可靠,從自動駕駛到滅絕警告,應檢視技術與敘事之間被跳過的步驟。



內容:

四年以後,AI可能毀滅人類?以Anthropic近期公開的風險警告,以及其報告中涉及中國相關行為者使用Claude進行軍事研發、電子戰與反魚雷系統研究的案例,提出一個問題:我們是否已經從討論AI取代程式設計師,迅速跳到了討論2030年人類是否還存在?


但比起直接判斷AI有多強,更值得回頭檢視的是:過去十年,技術實際走到了哪裡,而我們對未來的故事又跑到了哪裡?AI現在真正失控的,可能不只是技術,也包括不斷加速的敘事。


自動駕駛的教訓:技術方向可能正確,時間表卻可能錯十年


2016年,馬斯克曾公開提出,希望在2017年底,讓一輛特斯拉從洛杉磯一路自主開到紐約,全程不需要人碰方向盤。然而,十年後特斯拉官網仍將相關功能稱為「Full Self-Driving(Supervised)」,也就是需要駕駛監督的全自動輔助駕駛;駕駛必須保持注意力,隨時準備接管,車輛並非完全自動駕駛車輛。


這不代表自動駕駛失敗。Waymo已經證明,在限定城市與區域,經過大量地圖建置、測試及營運準備後,沒有安全員的Robotaxi可以運作。過去十年的進步確實巨大,問題在於,我們嚴重低估了全面可靠所需的時間。


讓汽車「會開」,與讓汽車「在幾乎所有情況下都能可靠地自己開」,是兩個不同問題。從零做到九十分可能很快,但從九十分走向99%、99.9%,甚至更高可靠度,直到人們願意放心把家人交給車輛,最後這段路可能比前面更加困難。


人形機器人:上一層尚未全面解決,下一層的時間表卻更快


自動駕駛尚未全面落地,人形機器人的故事已經接棒。工廠機器人、家庭機器人與Optimus,都指向一個充滿吸引力的未來:機器人可以承擔大量人類工作。


這些願景並非不可能,但關鍵仍是何時能夠實現。長期看好Tesla與機器人產業的ARK研究,指出其模型估算,真正通用的人形機器人所面對的綜合複雜度,可能是Robotaxi的二十萬倍。這不是物理定律,而是模型估算,但它提醒我們,兩者面對的問題規模並不相同。


汽車主要控制方向、油門與煞車,運作於複雜但規則相對明確的道路系統。通用機器人則必須處理多個關節、平衡、抓取、力量控制、物體辨識與人類互動,並適應樓梯、廚房、玻璃杯、寵物、小孩、工廠及醫院等高度非結構化環境。


Robotaxi發展十多年,真正無人運行至今仍受區域與場景限制;與此同時,產業卻已開始討論十億台機器人進入現實世界。值得追問的是:上一層問題真的解決了嗎?如果沒有,為什麼下一層的時間表反而如此樂觀?


太空資料中心:未來故事持續跑在現實兌現之前


機器人還沒有普遍進入家庭,下一個宏大願景又出現了:把AI資料中心搬到太空。


SpaceX相關材料已納入軌道AI運算構想,規劃最快從2028年開始部署軌道AI運算衛星,長期甚至希望每年將100GW級別的AI運算能力送入軌道;相關長期股權獎勵目標,也涉及建立大規模非地球資料中心。


如果Starship確實能大幅降低發射成本,軌道運算未來可能具備自身的經濟邏輯。因此,問題不是武斷認定這些構想做不到,而是:為什麼從汽車自主駕駛、機器人替人工作、Agent管理工作,到資料中心離開地球,故事總是不斷向前推進,卻很少等待上一個承諾充分兌現?


Agent的現實考驗:能做很多事,不等於每天都能放心交付


相較於宏大的太空願景,OpenClaw熱潮提供了一個更貼近日常的觀察案例。中國網路一度流行「養龍蝦」,學生、程式設計師、上班族,甚至退休人士,都開始研究如何使用Agent。


它背後的想像非常誘人:每個人都能擁有數個AI助手,分別處理郵件、查資料、訂機票、寫程式與管理行程,甚至由一個人加上一群Agent經營公司。


Agent的能力確實持續增強,OpenClaw也沒有消失。幾個月後,媒體開始討論熱度消退,原因包括Token成本、使用門檻、安全問題與配置複雜。更重要的是,普通使用者逐漸發現:「知道它可以做很多事」,與「每天都能穩定把工作交給它」,完全不是同一回事。


AI討論最容易混淆的,正是「能做到」與「能長期、穩定、低成本地做到」。


程式設計師的工作:完成任務,不等於承擔職業


AI如今已能快速寫頁面、修復錯誤與搭建程式,但程式設計師的工作並不只是產出第一版程式碼。


真實軟體系統需要持續升級與維護,還必須面對需求變更、API調整、監管要求及安全漏洞。真正重要的,往往不是誰最快寫出第一版,而是系統出問題之後,誰能理解原因並持續維護。


這就是Task與Job的差別。AI可以完成許多個別任務,但一份職業還包含長期上下文、判斷、維護,以及責任。


因此,宣稱AI能完成相當於人類數小時、甚至數天工作量的測試,不能直接解讀為AI已能獨立擔任數天的程式設計師。在基準測試中,50%的成功率可能代表突破;在生產環境中,同樣的成功率卻可能意味著事故。


真正的問題不是AI會不會寫程式碼,而是我們是否敢把真實系統長期交給它負責。


軍事應用報告:使用AI,不等於AI已掌握核心系統


回到Anthropic的報告,其中確實描述了中國相關行為者使用Claude參與反魚雷系統方案、電子戰軟體開發,以及多輪模擬與程式碼迭代的案例。AI被用於軍事研發、情報分析及軟體開發,值得認真關注。


然而,這些案例究竟能證明到什麼程度,仍須區分。Anthropic也承認,部分案例無法確認具體身分,一些分析使用的是公開資訊;電子戰案例中的使用者,也擁有部署在內部網路的模型。


因此,「軍工相關人員正在使用Claude」,與「Claude已進入中國最核心的軍事系統」,不是同一件事。媒體標題若抹去這些差異,就容易讓讀者形成「連軍方都已離不開AI」的印象,再進一步接受「既然今天已經如此強大,四年後就可能毀滅人類」的推論。


真正值得質疑的,是這些推論之間被跳過的步驟。


面對2030年風險,應追問中間條件,而非只接受結局


這並不是否認超級智慧可能帶來重大風險。它最終會造成什麼影響,今天沒有人能完全確定。但嚴謹的討論應該追問:從今天的AI能力走到毀滅性結果,中間究竟還需要跨越哪些門檻?


首先,AI必須從能完成許多複雜任務,進一步變成能長期、穩定地完成這些任務。其次,它必須從依賴人類提供目標、資料與回饋,走向長期自主行動。接著,還要具備自主規劃與獲取資源的能力。


討論AI未來,不應只在「全部都是騙局」與「即將毀滅人類」之間選邊站。更重要的是區分已被證明的能力、尚未解決的可靠性問題,以及仍屬推測的未來情境,避免讓敘事的速度取代對技術現實的判斷。

2026年10月3日 星期六

[AI 分享] 關掉電腦後,AI 能否持續工作?OpenAI 新功能與交付考驗

 [AI 分享] 關掉電腦後,AI 能否持續工作?OpenAI 新功能與交付考驗

摘要 : OpenAI 推出持續執行任務與團隊協作新功能,能否真正省心,仍取決於授權管理與穩定交付。



內容:

關掉電腦後,人工智慧還能繼續把工作做完嗎?根據分享內容,OpenAI 在 9 月 29 日於舊金山舉行的開發者大會上,提出名為 Dots 的新方案,定位為能長期跟進工作的助手。


Dots 擁有自己的雲端電腦和瀏覽器,可以連接使用者授權的應用程式,並根據回饋記住偏好。即使使用者離開聊天視窗,它仍能繼續推進已交代的任務。官方提到的一個早期案例是:使用者忘記向出版機構開立發票,助手自行發現這項待辦事項,準備好發票後,等待使用者批准再寄出。值得注意的是,它不只是執行指令,也能發現尚未完成的工作,但這仍只是官方披露的早期使用案例。


團隊協作方面,分享內容提到 ChatGPT Space,讓同事與人工智慧可以圍繞同一份頁面修改內容、留下評論及補充資料。專案有新進展時,也能讓 AI 持續更新。不過,協作幻燈片與表格功能尚未推出,官方標示為「即將推出」。


模型方面,分享內容提到新版本 GPT-6.1 So。OpenAI 表示,它在程式設計、操作電腦及專業工作上的表現接近 Extra,而標準介面的輸入、輸出單價為 Extra 的五分之一。不過,單價較低不代表完成任務的總成本一定更低,實際費用仍取決於使用量,以及是否需要返工。


另一個重要細節是,常駐後臺並不代表 AI 可以任意替使用者做決定。官方表示,主動蒐集資訊的工具只能讀取資料;發送訊息或修改內容,則必須遵守使用者設定的授權與稽核規則。涉及重要結果時,使用者仍應親自確認。


目前並非所有帳號都能使用 Dots。依分享內容所述,它正向符合地區條件的 Pro 和 Business Premium 使用者開放,企業使用者則需要管理員啟用,因此應先確認自己的帳號是否已有使用入口。


這場發布會真正值得持續觀察的,是把工作交給 AI 之後,使用者究竟能少操多少心。如果仍需要逐步監督、反覆糾錯,節省的時間就很有限。能否穩定交付,才是這些新功能接下來必須回答的問題。

[AI 衝擊] Muse 從回答到行動:AI Agent如何改變網際網路入口與消費模式

 [AI 衝擊] Muse 從回答到行動:AI Agent如何改變網際網路入口與消費模式

摘要 : AI智慧體可能接管需求入口、降低行動成本,並改變平臺流量、企業定價與消費習慣。



內容:

一個AI助手,為什麼可能牽動大型科技公司的市值,甚至衝擊旅遊訂票平臺的股價?原文以Meta的Muse為例,認為市場關注的並不只是它比ChatGPT多了哪些功能,而是網際網路的入口可能再次改變。文中提到的產品發布時間、下載量、股價變動及企業相關行動,未附資料來源,仍需進一步查證;以下整理其主要論點。


下一代網際網路入口,可能從App轉向Agent


PC網際網路時代,使用者主要透過瀏覽器與搜尋引擎取得資訊;到了行動網際網路時代,入口變成各種App:打車開啟Uber、購物開啟Amazon、訂飯店開啟Booking。


但如果未來不必自己尋找、切換與操作這些App,而是直接告訴AI:「幫我訂下週去紐約的機票和飯店」、「幫我換一份更便宜的汽車保險」、「幫我取消沒用的訂閱」,再由AI完成搜尋、比較、填表、寄信與付款,下一代入口就可能變成Agent,也就是能代替使用者執行任務的AI智慧體。


原文將Muse定位為個人AI智慧體,而不是單純的聊天機器人。它所描繪的功能包括瀏覽網頁、寄送郵件、安排旅行與購物,以及在使用者關閉應用程式後繼續執行任務。


關鍵不只是技術,而是能否成為日常入口


Muse並不是第一個嘗試自主規劃、呼叫工具與連續執行任務的Agent。原文以Manus為例,指出這類能力早已出現。


兩者的差異,更多在於產品定位:Manus比較像是使用者遇到複雜任務時交付工作的工具;Muse則試圖讓使用者把日常生活中的各種需求,都先交給AI處理。


Meta的潛在優勢,是Facebook、Instagram與WhatsApp既有的龐大使用者基礎。如果Agent能融入這些場景,就不必完全從零建立使用習慣。若再結合AI眼鏡,AI助手也可能不只是手機裡的一個App,而是更持續地陪伴使用者。


因此,Meta爭取的未必只是模型能力排名,而是成為使用者提出需求後,第一個接住需求的服務。


誰先接住需求,誰就可能掌握流量分配


當使用者想買一副適合跑步的耳機,過去可能會直接進入Amazon搜尋、比較與下單;未來則可能先交給Agent,再由Agent決定到哪個平臺購買。


在這種模式下,App不一定消失。Amazon仍提供商品,Uber仍提供交通服務,Booking仍提供住宿,但它們可能從使用者直接開啟的入口,變成Agent在後臺呼叫的服務。


這會觸及平臺的核心利益。原文稱Amazon已阻止Muse代替使用者在其網站購物,並以帳號安全、支付、隱私及授權為理由。文章進一步解讀,平臺也可能不願意讓其他公司的AI站在自己與消費者之間,削弱其對搜尋、推薦、廣告與購買流程的控制。


不過,安全與商業利益可能同時存在,不能僅憑這種解讀,就認定平臺的實際動機。


Agent真正可能降低的,是「行動成本」


如果Agent只是讓使用者少開幾個App,影響仍然有限。更大的變化,是它可能替人處理那些因為麻煩而長期擱置的事情。


換工作需要尋找機會與準備資料;開店需要聯絡供應商、尋找資金與安排時程;換保險需要比價、填資料與打電話;取消訂閱可能還得聯絡客服。很多事情不是做不到,而是執行成本太高,最後選擇放棄。


原文引述Alexander Wang的觀點,將Agent的價值放在消除這些執行障礙。以開麵包店為例,聊天機器人可以告訴使用者需要準備什麼;Agent則可能進一步尋找供應商、寄送郵件、查詢融資與安排時間,遇到需要人類判斷的關鍵決策時,再交回使用者確認。


兩者的差別可以概括為:過去AI主要提供答案,Agent則進一步替人行動。


網際網路降低了取得資訊的成本,行動網際網路降低了連接服務的成本,而Agent下一步可能降低的,就是把想法真正付諸執行的成本。


消費者慣性,可能成為最先受到衝擊的企業利潤來源


知道有更便宜的保險,與實際花時間更換保險,是兩回事;知道某個訂閱已經不需要,與真的聯絡客服取消,也不是同一件事。


部分企業能維持較高價格,不完全是因為產品難以替代,也可能因為消費者嫌麻煩、不願切換。保險漲價、電信方案偏貴、飯店訂貴了,或訂閱持續扣款,這些未被處理的小問題,可能支撐了一部分企業利潤。


Agent若能持續比價、尋找退款、取消訂閱與協助協商帳單,就可能壓縮這類建立在消費者慣性上的收益。


原文也提到Muse省錢挑戰,以及使用者透過重新比較汽車保險而降低支出的案例,並稱高盛已開始討論相關影響。這些案例與機構說法仍需查證,但其背後提出的問題值得關注:當大量消費者都有一個願意持續比價、切換服務與談價格的代理人,企業會面臨什麼變化?


保險、電信、線上旅遊與訂閱服務等產業,可能承受更大的價格競爭壓力。AI不必親自生產保險或經營飯店,也可能藉由降低消費者比較與切換的成本,讓商品和服務更難維持高價。


不過,這不代表Agent完全沒有成本;其實際效益仍取決於服務費用、執行效率、可靠性與平臺合作程度。


AI市場的焦點,可能從建設轉向實際應用


過去幾年,AI投資焦點多集中在GPU、記憶體、資料中心、網路與電力等基礎設施。Agent所代表的下一階段,則開始追問:AI進入日常消費後,究竟能節省多少時間、成本與中間環節?


因此,Agent的影響可能不只在於爭取使用者,也包括改變企業定價方式、消費者購買流程,以及平臺取得流量的模式。


可靠性、授權與平臺開放,仍是主要門檻


現在就認定Muse或任何Agent已經勝出,仍然太早。


首先,Agent必須足夠可靠。回答錯一個問題,通常可以重新詢問;但訂錯機票、買錯商品或寄錯郵件,可能造成實際損失。


其次,使用者是否願意交出郵箱、日曆、帳號與支付權限,是重要的信任門檻。Agent需要清楚的授權範圍、確認機制與責任界線。


再者,平臺是否願意開放也會影響其能力。如果大型服務商限制Agent操作,統一入口就很難真正成立。


競爭同樣不會只發生在Meta身上。OpenAI、Google、蘋果、Amazon與xAI都可能參與。各家公司掌握的優勢不同,包括聊天服務、搜尋、手機系統、郵件、地圖、瀏覽器、購物平臺與硬體裝置。


真正值得觀察的,或許不只是誰的模型多拿幾個測試第一,而是誰能成為最了解使用者、最值得信任,並且能安全、可靠地調用各種服務的AI助手。Agent能否從工具走向入口,最終仍要看它是否能把「替人行動」做成日常可用的服務。