2026年10月7日 星期三

[AI 衝擊] AI重寫商業規則:更多賽道、更少贏家,從軟體預算走向任務預算

 [AI 衝擊] AI重寫商業規則:更多賽道、更少贏家,從軟體預算走向任務預算

摘要 : AI讓資本更直接轉化為技術優勢,也重塑市場規模、成長驗證與企業轉型的判斷標準。



內容:

AI與網際網路之間,可能存在一個顛覆性的差異。這個差異既是當前焦慮的根源,也可能是未來十年最大的機會。如果這個判斷成立,許多關於創業、市場競爭與估值的商業常識,都需要重新定義。


資本可能更直接轉化為技術優勢


在網際網路時代,一家公司擁有更多資金,不代表它能無限變強。資金通常必須先轉化為人力:更多工程師、更多銷售人員、更大的團隊,接著也帶來更多管理、協調與組織摩擦。人才是重要壁壘,而收入成長往往伴隨組織擴張。


因此,過去存在一道天然的牆:資本無法直接轉化為公司的能力。資金過多,甚至可能讓創業公司因擴張失控而陷入困境,因為組織成長往往比收入成長更複雜。


AI則可能第一次打穿這道牆。資金可以購買算力,算力支撐更多推理,更多推理讓產品變強,產品帶來更多收入,收入再投入算力。這意味著,資本本身可能開始更直接地強化技術優勢。


AI不是單一贏家通吃,而是更多賽道、更少贏家


原文提到,a16z近期的一場討論邀請了三位來賓,分別涉及全球募資與資本關係、成長投資,以及創投背後的母基金。他們長期處於矽谷資金來源與流向的第一線。


他們觀察到的第一個變化,是AI時代的價值分配可能比網際網路時代更加集中:不是所有公司平均獲利,而是極少數頭部企業取得絕大多數價值。


但這不一定代表一家公司吃下整個產業。更可能的情況是,AI不斷創造新賽道,而每個賽道留下的贏家更少。模型、程式設計、醫療、法律與機器人,都可能各自出現頭部企業。


換句話說,AI會創造更多牌桌,但每張牌桌上的贏家可能更少。原文的核心判斷是:AI不是單純的「贏家通吃」,而是「更多賽道、更少贏家」。


市場規模不能只看軟體預算,更要看任務預算


第二個重要變化,是我們可能正在低估AI公司的市場規模。


投資人常用TAM,也就是總潛在市場,衡量一門生意理論上能做到多大。過去評估SaaS,通常會看產業的軟體支出或企業IT預算。但當AI從「協助人完成工作」走向「直接完成工作」,這把尺可能不再適用。


原文引用討論中的醫療案例:醫療IT可能只是數百億美元的市場,但理賠、帳單與行政服務背後,對應的是更龐大的勞動力支出。一旦AI能直接完成這些任務,它競爭的就不只是軟體預算。


該討論甚至提到,美國經濟花在勞動上的支出,大約是軟體支出的40倍。因此,評估AI機會時,不能只問客戶每年花多少錢購買軟體,還要問客戶每年花多少錢,讓人完成這件事。兩者可能相差一個數量級。


SaaS爭取的是軟體預算,AI開始爭取的則是任務預算。AI真正打開的大市場,可能不在IT預算表裡,而在薪資表裡。


以前是賣客服軟體,現在可能直接提供客服服務;以前是賣財務工具,現在可能完成部分財務工作。越來越多AI公司販售的,不只是工具,而是結果。


成長速度不等於商業模式已被驗證


市場空間變大、收入成長變快,不代表公司一定更好。AI甚至可能讓一些傳統成長指標失真。


原文提到,一家AI創業公司在一個月內,從零做到500萬美元ARR。ARR是年度經常性收入,通常依目前的經常性收入推算年度規模。這樣的速度非常驚人,但公司才成立一個月,可能連一次續費都尚未發生。


半年後客戶是否繼續使用、毛利能否維持、需求是長期存在還是短期嘗鮮,都還沒有答案。有些公司甚至直接將單月收入乘以12,當成年化收入指標;但這個數字本身,不能證明收入具有持續性。


這形成一種危險現象:成長速度越來越快,確定性卻沒有同步增加。原文將它稱為「驗證延遲」。


AI可以讓產品在一天內成形、在一個月內產生收入,但留存、續購、口碑與商業模式,仍然需要時間驗證。AI壓縮了成長週期,卻沒有同樣壓縮驗證週期。最大的成長幻覺之一,就是把速度當成證據。


維持原有成長,也可能是相對衰退


這也會衝擊傳統SaaS公司。許多企業正在思考是否加入AI、Copilot或Agent,但真正的問題可能不是「有沒有AI功能」,而是加入AI後,成長是否重新加速。


假設一家公司的年成長率原本是30%,加入大量AI功能後仍是30%,表面上沒有退步;但如果新的AI原生公司成長100%,它在競爭中的位置可能已經相對下滑。


因此,AI時代即使維持原有成長,也可能是一種相對衰退。


加上AI,不等於完成AI轉型


另一個常見誤區,是以為加入AI功能,就能成為AI公司。


原文引用一個類比:把傳統零售公司搬到網路上,不會讓它自動變成Amazon。Amazon的優勢不只是多了一個網站,而是圍繞網際網路,重新設計物流、庫存、供應鏈、交易與組織。


AI轉型同樣如此。把客服換成Agent,不一定就完成轉型;真正的轉型,需要重新設計整個工作流程:哪些任務由AI執行、哪些判斷由人負責、權限如何配置,以及結果如何驗收。


如果這些安排都沒有改變,AI可能仍然只是一個外掛。未來許多企業AI專案失敗,原因未必是模型不夠強,而是用下一代技術,繼續執行上一代流程。


程式設計的突破速度,不代表所有知識工作都會同樣快速改變


看到AI寫程式的能力快速提升,很容易推論銷售、諮詢、策略與管理,也會以相同速度被改造。但原文認為,這未必成立。


程式設計可能不是一般樣本,而是AI最容易突破的知識工作之一。程式碼有大量文件、可以直接執行、結果相對容易驗證,也能透過測試與模擬快速取得回饋。


真實商業世界裡,許多高價值工作恰好相反。一項策略是否正確、一個產品方向是否選對、一次組織調整是否有效,可能要半年,甚至兩年後才知道。


因此,程式設計可能代表AI改造知識工作的最快速度,而不是平均速度。


決定一項能力是否容易被AI壓縮的,可能不只是它有多專業,而是它有多容易被描述、驗證與模擬。越容易驗證的能力,越可能快速被AI改造;依賴複雜情境、隱性經驗、長期回饋與非標準判斷的能力,反而可能變得更有價值。


企業之間的AI採用差距值得關注


原文最後引用一組資料:一般企業每位員工每月的AI支出,中位數約為12美元;最領先的1%企業,則可能達到7,000美元。


重點不只是7,000美元這個數字,而是不同企業之間,可能正在形成巨大的AI採用差距。


原始文字在此處截斷,因此後續論述未予補寫。

[AI 觀察] AI不是全面泡沫,但真正的價值正在分化

 [AI 觀察] AI不是全面泡沫,但真正的價值正在分化

摘要 : 生成式AI面臨價值重估,代理式AI的機會在業務落地,物理式AI仍受資料與技術限制。



內容:


A16Z發布了一份90頁報告,反駁「AI泡沫論」。引用的數據指出,2026年美股科技板塊上漲22.1%,盈利增速卻達55.7%,市盈率反而壓縮21.6%;約75%的上市軟體公司已經盈利。報告的核心觀點是:AI並非整體性的泡沫,近期SaaS拋售更像遲來的估值修正,而非崩盤前兆。


但「AI整體不是泡沫」,不代表「所有AI產品都值錢」。真正需要辨別的,是不同類型的AI正處於不同的發展階段。


生成式、代理式與物理式AI,價值正在分化


Gartner的技術成熟度曲線,將AI分成三個層次:生成式AI正滑向泡沫破裂的低谷期;代理式AI處於期望膨脹期,成為企業關注焦點;物理式AI則快速興起,被視為下一輪突破性創新的驅動力。引用黃仁勳的說法,強調未來的重心將轉向代理式AI與物理式AI。


從這個角度看,泡沫風險可能更集中在低門檻的生成式AI應用。寫文案、畫圖、製作簡報、建立聊天機器人,功能容易被複製,產品也容易同質化。許多軟體只是在原有介面中加入對話框或「AI助手」,就以AI產品作為宣傳,但市場已逐漸不再為這類功能買單。


一項日本調研:為SaaS的AI功能付費的企業中,62.2%感到後悔,70%的企業在選型時已不把AI視為決定性因素。中國市場也出現類似現象,快消產業頭部品牌削減70%的AI採購,部分IT能力較強的企業則選擇自行組建團隊、開發智慧體。


問題在於,許多AI產品只能「給答案」,不能「完成工作」。即使能回答問題、生成文案或報表,客戶使用一段時間後,仍發現後續執行得靠自己。


代理式AI的門檻,不只是模型,而是業務


代理式AI的價值,在於嵌入流程、呼叫系統、進行判斷,並完成任務閉環。但它也不是沒有風險。引用Gartner預測,到2027年底,40%的代理式AI專案將因成本失控、價值不明或風控不足而被取消。


代理式AI真正考驗的,是業務理解與落地能力:能否讓AI理解客戶的業務流程?能否拆清楚決策鏈?能否讓它在真實場景中可靠運作?模型能力正在商品化,但把模型接進業務、讓流程真正跑通,仍不是標準化商品。


跨系統協作尤其重要。代理式AI不是在自家產品裡呼叫一個API就算完成,而是需要串接CRM、ERP、工單系統、物流追蹤、郵件與審批流程。真正的門檻,在於跨系統完成工作,而非單一產品內新增功能。


然而,許多企業經營者仍把AI理解為「在自己的系統裡加一個功能」,沒有把跨系統整合視為產品責任。結果是通用SaaS持續同質化、功能臃腫,以一套模板服務各式企業,卻有大量功能長期閒置。八成功能可能長期不用,加入AI工具後,功能使用率中位數仍不到15%。


最尷尬的情況是:企業投入數百萬元研發與行銷,教育客戶相信「AI能幹活」,但自己的產品仍只能提供答案。客戶建立認知後,反而轉向購買真正能完成任務的代理式AI產品。


物理式AI的挑戰,在真實世界與資料缺口


物理式AI更進一步,不只是在數位空間生成內容,而是在真實世界中感知、推理與行動。中國人形機器人的重要短板之一,就是高品質物理互動資料不足。


列出的數字是:全球高品質真實物理互動資料約50萬小時,訓練通用具身模型至少需要1,000萬小時,並稱缺口超過99%。不過,若直接依這兩個數字計算,缺口約為95%;無論採用哪個比例,核心問題都是資料供給與訓練需求之間存在巨大落差。


增長很快,不代表落地容易


另提到,Stripe估值一年上漲74%,達到1,590億美元;AI公司達到500萬美元年度經常性收入(ARR)平均需要24個月,傳統SaaS則需要37個月,速度約快1.5倍。


但商業增長與實際部署,呈現不同節奏。引用的數據顯示,42%的企業需要對接8個以上資料來源才能部署AI Agent,53%將資料安全與合規列為首要挑戰,超過86%需要升級現有技術架構。


增長曲線很陡,落地卻困難重重。兩者之間的鴻溝,正是代理式AI的機會:協助客戶理清服務對象、收入來源、業務流程與產品銷售方式,再讓AI真正接進工作現場。


中小企業與垂直領域,仍有服務空間


大型諮詢公司已全面投入AI與核心業務流程的整合。安永獲評Forrester Wave AI諮詢領導者,PwC與Cohere成立全球聯盟,推動企業級安全AI部署。


但大型諮詢公司主要服務大客戶,中小企業仍需要更貼近自身需求的服務。大型供應商提供通用型FDE(前線部署工程師)服務,小型團隊則可聚焦特定產業、狹窄領域或區域市場,以深入的業務理解建立差異化。


AI辦公Agent的表現也在分化。Workday月活躍用戶達658萬、排名居首,但商業化表現最弱;「釺問辦公」月活躍用戶約23萬,採取企業上下文路線。這些比較想說明的是:月活躍用戶高,不等於營收高,留存與商業化能力才是長期競爭的關鍵。


不是所有AI都值錢,機會在真正完成工作


核心判斷是:生成式AI正在擠泡沫,代理式AI正在接受價值兌現的考驗,物理式AI仍處於萌芽階段。低端AI應用氾濫,真正能解決複雜問題的高階AI仍然稀缺。


因此,別再只把生成式AI當作產品賣點。更值得投入的方向,是幫客戶把業務理清、把流程拆透、把系統串起來,讓AI在真實場景裡可靠地完成工作。中國

2026年10月6日 星期二

[AI 分享] Muse、Dots 與自架 AI 助理比較:功能、實測與選擇指南

[AI 分享] Muse、Dots 與自架 AI 助理比較:功能、實測與選擇指南

摘要 : 從架構、任務實測、記憶與成本,比較雲端及自架 AI 助理的差異與適用情境。



內容:

這次分享聚焦在 Muse、Dots,以及被稱為「小龍蝦」與「愛馬仕」的 AI 助理。它們看起來都能理解需求、開啟瀏覽器、查資料、填表格、寫郵件,但真正的差異,不只是能不能自動做事,而是背後的電腦由誰提供、任務如何管理,以及使用者能掌握多少控制權。


Muse 從 9 月 18 日開始登上美國 App Store 的 iPhone 排行榜第一名,將 ChatGPT 擠下榜首,並連續十幾天維持第一,22 天的下載量約達 500 萬。另一方面,OpenAI 在 9 月 29 日的開發者大會上推出 Dots,主打擁有自己的雲端電腦與瀏覽器,能連接 4,000 多個應用,也能透過 ChatGPT、電話或 Slack 與使用者互動。


這類產品共同追求的方向,是讓 AI 不必事事等待指令,而能理解情境、主動完成工作。不過,要判斷它們是否適合自己,還是得回到架構與實際使用經驗。


一、先把「大腦」、「電腦」與「管理系統」分開


這類 AI 助理可以拆成三個部分:大模型是大腦,負責理解需求與判斷下一步;電腦是手腳,負責操作瀏覽器、執行程式與處理檔案;管理系統則像記事本,負責記住任務、連接帳號,以及安排後續工作。


模型強,不代表配備的電腦就有顯示卡;電腦記憶體大,也不代表推理能力更好。這些產品的差異,很多時候出現在電腦與管理系統,而不只是模型本身。


Muse 使用 Meta 的 Muse Spark,Dots 使用 OpenAI 的 GPT-6 Astra,使用者不能自行更換模型。小龍蝦與愛馬仕則是一套需要自行部署的軟體,模型與電腦都由使用者準備,可以接 Claude、GPT、較便宜的模型或本地模型,也可以部署在 Mac、NAS 或租用的伺服器上。


因此,小龍蝦與愛馬仕比較像自己買房:裝修、水電、維護都要自己處理,但想怎麼改就怎麼改。Muse 與 Dots 則像住飯店,拎包入住,有人維護環境,但必須遵守平台規則,也無法完全控制底層系統。


二、雲端工作環境,不等於你的私人伺服器


實測時,我曾詢問 Muse 與 Dots,能不能把它們的雲端電腦當成自己的伺服器,長期掛著服務。


Muse 表示,它的環境是臨時虛擬機器,對外 IP 不固定,可能被重置,也不保證 24 小時持續運作。Dots 的回答類似:它可以協助管理我的伺服器,但不能把自己的工作環境承諾為可長期使用的主機。它查到的環境約有 9.7GB 記憶體、32GB 硬碟,沒有可直接使用的顯示卡。


換句話說,它們配備的電腦是讓 AI 完成工作的工具,不是提供使用者自由部署服務的雲端主機。


自架的小龍蝦則不同,部署在哪裡、機器是否持續開機,都由自己決定,但維護責任也由自己承擔。我曾在 NAS 上部署一隻,每天推送日報,期間壞過幾次,有時連續幾天收不到日報,才發現它已經停止工作。


三、實測一:註冊甲骨文免費雲端帳號


第一項任務,是請 Muse 與 Dots 協助註冊甲骨文的免費雲端帳號。


Muse 會持續操作,右側活動流能看到每一步做了什麼、何時執行。遇到寄往 QQ 郵箱的驗證信時,它坦白說自己只能存取 Gmail,請我自行取得驗證連結。到了信用卡資料輸入階段,它要求我接管瀏覽器,並提醒卡號、有效期限與安全碼只在網頁內填寫,不要傳到聊天中。


最後,信用卡驗證雖然通過,帳號建立仍被風控攔下。Muse 推測可能與帳單地址、發卡地區及網路位置不一致有關,並提供重試、聯絡客服或停止等選項,同時整理進度,方便之後接續處理。


Dots 起初判斷,我可能需要的是教學,或希望有人協助判讀註冊畫面,因此先請我開啟網站、提供截圖。在我確認授權它繼續操作後,它才啟動瀏覽器。後續經過條款、隱私權及付款驗證等環節時,它會多次停下來確認,說明哪些步驟應由使用者親自完成。


這次測試中,Muse 比較偏向持續推進,必要時才請人接手;Dots 則更重視授權與敏感操作的邊界。兩者並非單純誰比較好,而是工作風格不同。


四、實測二:登入論壇並發文


第二項任務,是登入 L 站並發布一篇大家可能感興趣的文章。


Muse 會先處理登入障礙,登入後查看近期熱門主題,再決定發文方向。它發現免費雲端服務、AI Agent 與 VPS 選型等內容較受關注,最後把前一項甲骨文註冊失敗的經驗整理成文章。


不過,它最初把自己當成主角,寫成「Muse 替主人操作」的視角。我要求改成我的口吻後,它重新調整。接著又因文章過長觸發論壇限制,它便縮短內容並再次送出,最後成功發布,之後也主動回報閱讀、按讚與留言情況。


Dots 則先確認登入授權,成功登入後選擇討論 AI Agent 能否真正減少重複工作的主題。它在送出前再次確認要不要發布,最後也完成任務。


但兩者都沒有充分模仿我過去的發文習慣,也沒有先確認帳號權限,例如是否具備使用某些標籤或發布特定內容的資格。這代表,能成功發文,不等於已經具備完整的論壇營運判斷能力。


五、實測三:生成圖片與影片


第三項任務,是請兩者生成幾張不同場景的圖片,並製作一段動漫風格影片。


Muse 先確認了數量、風格、比例、片長及是否需要配樂等細節,接著完成四張圖片,也直接產出一段影片。影片中有掠過水面的滑翔動作與落地鏡頭,與提示要求相符。整體感受接近在 ChatGPT 或 Gemini 中直接生成內容。


Dots 則表示,目前沒有能直接使用的圖片或影片生成工具。它改以程式绘圖的方式產出四張圖片,也另外生成一組分鏡與程式碼,但沒有完成影片。它提供了整理提示詞、使用雲端 API,或到第三方平台生成等替代方案。


Dots 特別提醒,這次成果比較接近「程式繪圖」,不是影像模型生成的寫實圖片。這種誠實說明值得肯定,但就本次任務而言,Muse 提供了更直接、完整的生成體驗。


以上三項只是有限次數的實測,不能當成嚴格的全面評比,但足以看出兩者在自主推進、授權確認與工具整合上的差異。


六、記憶能力:記得事情,不代表懂得在對的時候使用


測試記憶功能時,我曾簡單介紹自己的背景,也多次聊到公司有台式與筆記型電腦、家裡有其他設備、NAS 上運行的服務,以及 VPS 的用途。


Muse 將這些資訊逐步整理進長期記憶,檔案內容變得相當詳細。它也會主動運用記憶,例如在整理甲骨文註冊失敗的論壇文章時,加入我已有 NAS、VPS、影音及同步服務的背景。


Dots 也表示,會把記憶整理成檔案,而不是永久保存全部對話。不過,我曾要求它記住一項設定偏好,之後再提到相同事情時,它仍重新詢問是否要照做。它的理由是,記得偏好不代表可以跳過敏感操作所需的授權。


這裡要區分兩件事:一是能否記住,二是是否會在合適的時機使用記憶。有些重複確認不是忘記,而是平台刻意保留的安全機制。相較之下,自架助理通常提供更多調整人格、記憶與工作規則的空間,但也需要自己維護。


七、付費差異:買的是成果,還是自行承擔運作成本


Muse 方案分為免費、Pro 與 Max,價格分別為免費、每月 20 美元及 200 美元;Pro 與 Max 的額度分別標示為 20 倍與 100 倍。


較特別的是,Muse 主打「Results, not tokens」,也就是按結果而非 token 計費。依其文件說明,使用者只為可用結果付費,失敗執行不收費,重試、澄清與最佳化也不計入。但官方並未提供固定公式,說明一份結果究竟扣多少額度。


Dots 則依 ChatGPT 訂閱方案提供每月額度,正式上線後與 ChatGPT 共用使用量。不過,它當時仍处於研究預覽階段,部分訂閱者可以免費體驗,也有帳號出現邀請朋友使用的入口。


自架小龍蝦與愛馬仕的軟體本身免費,但仍須支付模型與機器成本。AI 繞路、重試、查錯頁或修改內容所消耗的 token,都由使用者負擔。


如果只是偶爾請 AI 搜尋資料或處理表格,未必需要這類持續在線的助理。但若希望它長期跟進郵件、監控資料變化、整理日報,則應把價格、部署與維護時間、穩定性及故障後的處理責任一起考量。


八、四款產品適合誰?


Muse 適合不想研究部署、希望 AI 接到任務後自行推進,且願意將帳號與部分資料交由平台處理的人。本次體驗中,它在查資料、處理郵件、整理表格、操作網站及生成圖片、影片方面,呈現出較完整的整合能力。代價是底層環境與規則由平台掌握,使用者無法自由修改。


Dots 適合已經習慣 ChatGPT 生態的人。它結合雲端工作環境與排程任務,也更重視權限與操作邊界,適合重要步驟需要使用者確認的工作。不過,本次測試中,它在生成圖片與影片方面未能提供與 Muse 相同的直接體驗。


小龍蝦適合喜歡折騰、需要高度客製化,而且願意自行部署與維護的人。它能放在自己的設備或伺服器上,模型、記憶、工作流程及本地資料串接都更有彈性,但也必須自行處理更新、權限、故障與安全問題。


愛馬仕則較偏向長期使用後,逐步累積記憶、技能與排程流程的工作助理。小龍蝦更強調連接平台、裝置與工具,愛馬仕則更強調持續工作及累積經驗。但兩者都不代表部署完成後就完全不需要管理。


九、Muse 的註冊與使用方式


Muse 當時以英文介面為主,需要邀請碼,並使用 Gmail 帳號註冊。它會申請相關郵件權限,因此我使用的是測試帳號,而不是主要個人帳號。登入後能看到幾個常用操作,其中部分需要訂閱 Pro。


我最初用香港 IP 測試,多次失敗,換成美國 IP 後才成功。不過,也有人回報香港 IP 可以註冊,因此可能受個別環境影響。Muse 並非只能使用手機,也可以透過網頁版與電腦版操作;邀請碼則會放在原分享內容的下方。


十、最後的重點:AI 正從回答問題,走向執行工作


這次最明顯的感受,是 AI 產品正在改變:過去多半是使用者問問題、AI 提供答案;現在則逐步走向交代目標,讓 AI 使用自己的工作環境執行任務。


但「能做事」不等於「能放心放手」。它能否遵守平台規則、辨識操作限制、知道何時該停下來,以及在使用帳號權限時避免造成風險,才是更值得關注的部分。


選擇哪一款,核心並不是誰更像人,而是你願意把多少控制權交給平台,又願意自己承擔多少維護責任。想省部署與維護,可以考慮 Muse 或 Dots;想掌握機器、模型與資料流向,可以考慮小龍蝦或愛馬仕。最終仍要回到自己的工作需求,而不是只看產品熱度。

[AI 反思] AI發展由誰決定?一場抗議揭開普通人的失語處境

 [AI 反思] AI發展由誰決定?一場抗議揭開普通人的失語處境

摘要 : 一場AI大會抗議,讓資源消耗、監管與公眾參與的爭議浮上檯面:誰享受利益,誰承擔代價?



內容:

在倫敦一場AI願景大會上,一位反AI活動人士公開質疑:當科技公司宣稱AI是為人們而發展時,是否真正回應了普通人的恐懼?


她在發言中表示:「你們說這是為了人們,但普通人正在害怕。」她引用了「AI有一成機率在十年內導致人類滅絕」及「500座運作中的資料中心使全國三分之二地區陷入乾旱」等說法,藉此表達對AI安全與資源消耗的憂慮。這些數字是她在現場提出的主張,原文未提供來源或查證資訊。


她也提及一場難堪的風波,並尖銳地批評:「最好的情況,是掌握這項技術的人完全無能;最壞的情況,是你們正被帶向一場災難。」在她看來,大會不斷描繪AI的願景,卻沒有正面處理人們的擔憂。


「透明度在哪裡?監管在哪裡?投票在哪裡?我們有任何人曾經為這些事情參與公投或投票嗎?」她質疑,AI發展缺乏明確的問責機制,而監管又不符合股東的利益,讓普通人難以參與影響自身生活的決策。


她呼籲暫停資料中心建設,讓一般民眾在AI議題上擁有發言權,而不是把決定權交給矽谷科技富豪。她強調,地方社區往往最先承受AI與資料中心帶來的衝擊,卻最晚獲得表達意見的機會。她也指控AI從人們身上奪取利益,使地方社區陷入更貧困的處境。


說完這段話後,她被安保人員帶離會場。


但她真的只是在抵制AI嗎?從這段發言來看,她批評的核心,更像是當前AI發展的遊戲規則:資本與精英掌握方向,普通人卻可能承擔代價,而且缺乏話語權。


這場原本要展示AI願景與能力的大會,因為抗議而呈現了另一個問題:當技術快速推進,社會是否也準備好了相應的監管、透明度與公眾參與機制?如果這些疑慮始終得不到回應,質疑的聲音恐怕只會增加,不會自行消失。


我們或許無法左右大公司的決策,但至少可以追問:這些決定如何影響我們?又是否有人真正問過我們,同不同意?

[AI 警示] 比爾蓋茨談 AI 風險:就業衝擊、監管責任與下一代的未來

 [AI 警示] 比爾蓋茨談 AI 風險:就業衝擊、監管責任與下一代的未來

摘要 : 蓋茨警示 AI 的安全與就業風險,呼籲政府監管、調整稅制,並關注下一代的教育與社交。



內容:

根據所提供的兩場近期專訪轉述,長期相信科技能改善人類生活的比爾蓋茨,這次對 AI 的態度多了明顯的警惕。過去,他談論 AI 時,多半聚焦於令人期待的可能性;如今,他更關心的是:當 AI 帶來安全威脅、就業衝擊與資源分配問題,誰會承受代價,又該由誰負責接住受影響的人?


他提出的第一個關鍵判斷,是 AI 已經跨過某些危險能力的門檻。蓋茨表示,程式設計曾是他從十三歲到二十三歲最投入的事情,但如今許多大型模型的程式設計能力,已經能與人類競爭,甚至在部分任務上表現得更好。依照轉述,這項變化從訪談所指的去年年底開始變得明顯。


真正讓他擔心的,不是 AI 能聊天,而是人類可能需要多年才能累積的專業能力,AI 已能迅速追上。一旦這些能力被濫用,網路攻擊與生物恐怖主義就可能成為最先受到影響的領域。他在訪談中警告,AI 工具可能讓與政府無關的非國家組織,也具備製造流感等級病毒威脅的能力。這是轉述中蓋茨提出的風險判斷,不宜直接視為已獲證實的事實。


第二個判斷,是未來兩到四年,AI 可能對工作帶來嚴重衝擊。他認為,目前阻止 AI 大規模取代人類工作的主要障礙,是可靠性。這道門檻不容易跨越,但可能在幾年內被突破。


一旦某家公司率先採用可靠的 AI,並因此大幅降低成本,其他公司就會面臨跟進的競爭壓力。機器不需要睡眠與休息,可以全天候運作,因此他特別擔心白領工作會率先受到衝擊;如果人形機器人的認知與執行能力持續提升,藍領工作也可能接著受到影響。


轉述也提到,蓋茨曾與 Anthropic 執行長達里奧・阿莫迪討論這個問題。阿莫迪提出的預測更為激烈:未來一到五年,入門級白領職位可能減少一半,失業率也可能升至百分之十到百分之二十。這些數字屬於對未來的預測,並非已經發生的結果。


有人認為,歷史上的技術革新雖然淘汰部分工作,最終也會創造新的職位。但蓋茨擔心,這次變化的速度與規模不同於過去。以往的職業轉型可能跨越數代人,AI 帶來的衝擊卻可能集中在短時間內,讓勞動者與社會制度來不及調整。


第三個判斷,是現有的社會保障與稅制,可能不足以承受這波轉型。當大量工作受到影響,原本資金就有限的社會安全網,未必有能力接住所有人。


因此,他提出逐步從對勞動力徵稅,轉向對資本與機器人徵稅的政策方向。核心想法是:如果機器取代人類工作並創造收益,相關收益也應承擔支持公共服務與社會保障的責任,而不應主要依靠勞動者的薪資稅收來維持制度。


第四個判斷,是 AI 不能只依靠產業自我監管。蓋茨認為,當競爭者越來越多,單一公司的安全承諾,很難約束整個產業。


他以 OpenAI 為例,指出早期設置的安全措施,在只有少數企業領先時或許較容易發揮作用;但當美國與中國都有大量公司競相推進技術,任何一家企業單方面放慢腳步,都可能面臨被超越的壓力。要求減速的聲音,也容易被「不能在競爭中輸給中國」的論述壓過。


依照轉述,蓋茨批評美國政府目前更像是替產業加油的啦啦隊,將注意力放在地緣政治競爭,而未充分承擔管理國內風險的責任。他認為,真正有效的規範不能只靠企業自律,政府必須介入。


訪談最後,話題轉向下一代。當被問到會如何面對孩子在 AI 時代的成長,蓋茨提到自己的三個孫女,也坦言他仍不確定未來的教育會變成什麼樣子。


他尤其擔心,AI 陪伴與育兒工具可能改變孩子的社交經驗。如果家長不知道孩子經常提起的「朋友」其實是 AI,孩子就可能減少面對真實人際關係的機會,也難以學到那些必須透過真人互動才能培養的能力。即使 AI 和機器人有能力協助育兒,也不代表所有用途都應毫無限制地開放。


轉述中,蓋茨將 AI 比作核能,甚至以「威力是核能的一千倍」來強調其潛在影響。這是警示性的比喻,而非可直接量化的比較。他想表達的是:AI 既可能造福人類,也可能帶來巨大的破壞,關鍵在於人類如何引導與約束它。


這些判斷並不代表蓋茨否定科技的價值,而是顯示他不再認為,只靠技術進步與市場競爭,就能自然解決所有問題。當 AI 的能力與影響迅速擴大,安全監管、就業轉型、社會保障與兒童成長,都需要有人提前負起責任。

2026年10月5日 星期一

[AI 觀察] 未來20年的職業安全:哪些工作較難被AI取代?

 [AI 觀察] 未來20年的職業安全:哪些工作較難被AI取代?

摘要 : AI可能先改變白領工作;實作、責任與人際信任,是職業安全的三道防線。



內容:

談到AI取代工作,多數人可能先想到勞力密集、收入較低的職業。但原文提出另一種觀察:AI可能更早衝擊那些看起來體面、以高學歷為門檻,主要在電腦前完成的工作。


原文綜合牛津大學、微軟、Anthropic、美國勞工統計局與世界經濟論壇的研究及預測,嘗試整理未來20年較難被AI與機器人取代的職業。不過,不同研究的年代、方法與衡量指標並不一致,「AI能介入多少工作任務」也不等於「整個職業會消失」,因此這份排名更適合當作觀察方向,而不是確定的預言。


另外,提供的文字有明顯缺漏:第14名的說明中斷,第13至第8名未完整呈現,第2名只留下開頭,也沒有第1名內容。以下依現有文字整理,不補造缺失的排名。


AI可能先改變白領工作的原因


原文引述微軟研究院2025年的研究指出,研究人員分析約20萬筆真實、匿名的AI對話,再將使用者交給AI處理的任務對應到不同職業。結果顯示,需要本科學歷的職業,AI適用程度反而可能高於學歷要求較低的職業。


原文列出的高AI適用職業,包括翻譯、歷史學家、服務類銷售、作家、客服、電話接線員、播音員與電臺DJ;較低的則包括護工、地板打磨工、打樁機操作員、水處理廠操作員、橋樑與船閘操作員,以及挖泥船操作員。


原文也引述Anthropic在2026年的研究,指出AI滲透較深的職業,從業者可能更偏向年齡較大、學歷較高、收入較高的族群。


背後的原因是,AI擅長閱讀、寫作、計算、查詢與摘要,而這些恰好也是許多教育體系長期重視的能力。這不代表教育沒有價值,而是提醒我們:如果專業能力只停留在整理資訊與產出標準答案,受到AI影響的可能性就比較高。


判斷職業安全的「三道牆」


第一道是「動手的牆」。工作是否需要在複雜、不熟悉、難以標準化的真實環境中操作?現場越多變,機器人越難穩定完成任務。


第二道是「責任的牆」。出了問題,是否必須有人簽字、承擔法律責任、處理賠償與接受追究?在醫療、工程與公共安全等領域,AI能提供建議,不代表能獨立承擔責任。


第三道是「人心的牆」。客戶或服務對象付費,是否因為需要真人理解、陪伴、說服與建立信任?當服務涉及情緒、關係與長期支持,人類仍有重要角色。


原文認為,一份工作占據的防線越多,越不容易被整體取代;如果三道防線都薄弱,就更需要思考轉型。


第20名:營養師


原文引述牛津大學2013年的研究,指出營養師的自動化機率估計為0.39%。但這是生成式AI普及前的研究,不能直接視為今天的風險數字。


如今,AI已能快速提供飲食建議與菜單,因此只提供通用飲食表的服務,可能面臨更大的競爭。相較之下,能為糖尿病、腎臟病或接受化療的患者進行臨床營養管理,並與醫療團隊合作、持續追蹤結果的營養師,仍有較高的專業價值。


原文的核心觀點是:營養師真正的價值,不只是提供知識,而是把知識落實到個別患者身上,持續追蹤並承擔專業責任。


第19名:醫療與健康服務管理者


這類工作包括醫院、診所與養老機構的營運、排班及流程管理。原文引述美國勞工統計局預測,相關職業在未來10年將成長24.2%,主要動力之一是人口老化與醫療服務需求增加。


不過,文書、報表與排班等任務,也容易受到AI影響。較難取代的是在醫師、護理人員、患者、家屬、保險公司與監管機關之間協調,以及在醫療糾紛發生時做出決策、承擔責任的能力。


簡單說,管理表格的工作容易被自動化,管理人與複雜關係的工作則更有韌性。


第18名:中小學與幼兒教師


原文指出,世界經濟論壇預測部分教育職位將增加,但微軟研究也將部分教師職業列入AI高度適用的名單。兩者並不必然矛盾,因為教師的工作包含不同任務。


知識講解、教材整理與部分練習回饋,可以由AI協助;但班級經營、紀律管理、情緒支持,以及察覺霸凌、家庭困境或學生行為變化,仍需要教師的現場觀察與介入。


未來若只照課本或投影片授課,競爭壓力可能增加;能建立信任、理解學生並帶領班級的教師,則較難被取代。幼兒教育尤其涉及照顧、安全與情感互動,但也必須留意少子化可能壓縮部分地區的教師需求。


第17名:農場工人


原文引述世界經濟論壇的報告指出,到2030年,農場工人可能是全球就業人數絕對增量最大的職業之一。


原因包括人口與糧食需求增加,以及許多發展中國家的農業仍仰賴大量人力。採摘草莓、葡萄、修剪果樹等工作,需要判斷成熟度、控制力道並適應不規則環境,並非所有環節都容易自動化。


然而,大田作物的機械化仍會持續,農業工作也常伴隨低收入與高勞動強度。原文認為,未來農業會同時需要現場勞動者,以及能操作無人機、感測器與智慧農業設備的人才,後者可能具有更高的附加價值。


第16名:酒店與接待管理


原文引述牛津研究,指出住宿經理的自動化機率估計為0.39%。


訂房、入住、退房與結帳等標準流程,可以由AI或自助設備處理;但真正考驗管理能力的,是醉酒客人鬧事、漏水、臨時換房、突發疾病等非標準事件。


這些情況需要有人協調資源、立即決策並負責。高端服務也往往重視個人化接待與被理解的感受,因此酒店管理者的價值,更可能集中在危機處理與服務關係,而非例行行政。


第15名:編舞與現場表演者


原文引述牛津研究,指出編舞者的自動化機率估計為0.4%,並對比微軟研究中較容易受到AI影響的播音員與電臺DJ。


原文認為,差異在於服務內容:聲音與資訊可以被合成與複製,但舞蹈及現場表演還包含身體、臨場互動與觀眾對真人投入的感受。


AI能生成作品,不等於能完全取代人們觀看真人表演的需求。不過,這是對現場表演價值的分析,並不代表娛樂產業的所有工作都不會受到AI影響。


第14名:義肢矯具與聽力相關專業


原文職稱疑有轉錄錯誤,寫作「甲質腳型師與聽力師」,且後續說明在提到聽力師的自動化機率時中斷。


由於職稱與內容都不完整,無法據此可靠整理該名次的研究數字與完整論點。


缺漏段落:設備與能源維修相關工作


第14名之後,原文直接接到一段維修工作的說明,未保留完整名次與職稱,因此不能確定它對應哪一項排名。


現有內容指出,電動車增加,會帶動高壓電與電池維修需求;風力發電與太陽能設備增加,也需要更多現場維護人員。


維修工作的難點在於,每次故障原因都可能不同,需要現場觀察、檢測、操作與判斷。原文因此將機器人、設備及能源維修視為值得年輕人考慮的方向,理由是它兼具動手能力與安全責任,也可能受惠於設備普及和能源轉型。


第7名:心理諮詢師與社工


原文引述牛津研究,指出心理健康與藥物濫用社工的自動化機率估計為0.31%,醫療社工為0.35%;也引述世界經濟論壇,認為社工與心理諮詢相關職位將成長。


AI可以提供對話、情緒支持與一般建議,但涉及嚴重憂鬱、成癮、創傷或家暴時,往往需要受過訓練的專業人員評估風險、建立長期關係,並在必要時採取實際行動。


社工還需要家訪、跨機構協調、資源連結與安置安排。這些工作不只是「聽人說話」,而是走進當事人的生活,協助問題真正得到處理。


第6名:消防員與應急管理


原文引述牛津研究,指出應急管理主管的自動化機率估計為0.3%,消防一線主管為0.36%。


火災與災難現場高度不確定,消防與救援人員必須快速判斷建築狀態、危險來源、搜救順序與撤離時機,同時承擔生命安全責任。


無人機與消防機器人可以協助偵查、滅火與降低人員風險,但現場指揮、跨單位協調及對受困者的安撫,仍需要人的參與。


原文認為,極端天氣與災害風險可能增加救援需求。不過,具體職缺變化仍取決於各地風險、政策與公共預算,不能直接視為必然成長。


第5名:康復與職業治療師


原文引述牛津研究,在702個職業中,康樂治療師的自動化機率估計最低,為0.28%;職業治療師則為0.35%。需要注意的是,康樂治療、物理治療與職業治療並非完全相同的專業,不能混為一談。


這類工作的共同價值,在於協助受傷、中風或功能退化的人,恢復活動能力與日常生活能力。治療需要依個別狀態調整,也常涉及實際操作、觀察疼痛及反應,以及長期鼓勵患者持續參與。


人口老化可能帶動相關需求,因此原文將康復相關專業視為值得關注的醫療方向。實際選擇時,仍需了解各專業的學制、證照與工作範圍。


研究不是算命,而是地圖


原文在此提醒,自動化風險預測不等於就業人數預測。


牛津研究曾估計,美國約47%的就業處於較高自動化風險。原文另引述一項回顧分析,指出被認為高度危險的保險核保相關職位,在2013至2021年間就業人數反而增加16.4%;被認為較安全的康樂治療師,職位卻減少8.9%。


這些例子說明,就業還受到需求、成本、制度、人口與產業結構影響。榜單可以提示風險方向,卻不能保證某個職業一定增加或消失。更重要的是,你在該職業中執行什麼任務、具備什麼能力。


第4名:醫生


原文引述牛津研究,指出醫師與外科醫師的自動化機率估計為0.42%。


原文以AI研究者辛頓對放射科的預測為例:他在2016年曾主張,深度學習可能在約五年內表現得比放射科醫師更好,因此不應再繼續培養相關人才。但原文引述後續報導與資料指出,放射科醫師並未因此迅速消失,梅奧診所的放射科醫師人數反而增加。


原因包括:AI提高效率後,可能帶動更多檢查與複核需求;影像判讀只是醫師工作的一部分;患者狀況複雜,仍需要臨床整合;最終診斷、治療與醫療責任,也不能只交給演算法。


外科手術同樣涉及現場變化、突發出血與即時決策。手術機器人可以是重要工具,但不等於能全面接替主刀醫師。


原文的核心主張是,AI更可能改變醫師的工作方式,而不是直接消除整個職業;善用AI並維持專業判斷的醫師,可能更有競爭力。


第3名:電工


原文認為,AI發展反而可能增加電工需求,因為資料中心需要大量供電、配電、施工與維護工作。


原文提到Meta、Google投入技術人才培訓,以及資料中心建設受到人力短缺影響的案例,並引述Indeed分析,稱資料中心電工的收入高於其他場域的電工。這些個別投資金額、時程與薪資差距,仍需依原始資料確認,不能直接套用到所有地區。


除了資料中心,電動車、充電樁、太陽能、儲能與老舊電網更新,也可能帶動相關需求。


電工工作的防線,在於建築線路各不相同,現場可能存在歷史改裝與不標準接法,而且錯誤可能造成觸電、火災或重大事故。因此,現場操作、故障判斷、證照資格與安全責任都十分重要。


原文將電工列為值得年輕人考慮的技術職,但實際收入、培訓門檻與工作條件,仍會因地區、專長及證照制度而異。


第2名:護士


提供的原文只保留了這個名次的開頭,提到美國勞工統計局將某類護理職位列為成長快速的職業,但未提供完整職稱、統計期間與後續說明。


因此,無法確認此處指的是一般護理師、執業護理師,或其他護理職類,也不宜補上原文未提供的數據與論點。


第1名:原文未提供


雖然開頭預告將揭曉最難被AI取代的第一名,但提供的內容沒有包含答案,無法據此判定。


結語:不要只看職稱,要看工作的核心價值


這篇內容最重要的提醒,不是某個職業永遠安全,而是AI會優先改變其中容易標準化、數位化與大量複製的任務。


比較有韌性的工作,往往需要在真實環境中動手、在關鍵時刻承擔責任,或透過長期互動建立信任。同一個職業裡,只提供標準答案的人,與能處理複雜個案、協調現場並對結果負責的人,受到的影響可能完全不同。


選擇職涯時,除了考慮學歷與職稱,也應了解實際工作內容、在地需求、收入條件與培訓成本。與其尋找一份保證不被AI取代的工作,更實際的方向,是培養能運用AI、又能提供AI難以獨立完成之價值的能力。

2026年10月4日 星期日

[AI 分享] 讓引擎管流程、讓模型管執行:AI 程式開發的 Harness 設計

 [AI 分享] 讓引擎管流程、讓模型管執行:AI 程式開發的 Harness 設計

摘要 : 透過確定性的流程引擎,管理 AI 開發階段、工具與門控,避免跳步並提升一致性與複用性。



內容:

當我們讓 AI 撰寫程式碼時,整個工作流程應該由誰主導?這看似是技術問題,實際上也關乎產品哲學。主流做法是將流程寫進提示詞,建議 AI 按照步驟完成任務;但建議不等於約束,AI 仍可能省略規劃、跳過測試或略過審查。


我們的產品選擇另一條路:以確定性的引擎硬性驅動流程,AI 只負責完成各個步驟中的工作。一句話概括,就是「讓引擎管流程,讓模型管執行」。


智慧體迴圈:有執行能力,卻不負責全局流程


理解這套設計,首先要認識智慧體迴圈,也就是 Agent Loop。它是 AI 程式開發助手的執行核心,運作方式是不斷循環:思考該使用什麼工具、呼叫工具,例如讀取檔案或執行命令,再觀察結果是否足夠;如果不足,就繼續下一輪。


這就像派一位員工處理複雜任務,他不是一次完成所有事情,而是逐步探索、採取行動,再根據結果調整。這個迴圈讓 AI 具備實際動手的能力,但它的主要職責是完成眼前任務,而不是管理整體流程。


我們將它稱為「執行核心」。給它任務、工具與工作說明,它就持續運作,直到任務完成。然而,它不負責判斷整個流程進行到哪一步、目前是否應該執行這件事,也不負責決定完成後要前往哪個階段。


它像是一位能力很強、卻不負責全局安排的工匠。你讓他砌牆,他可以把牆砌好,但不會主動決定現在是否應該砌牆,或砌完之後是否需要驗收。


裸迴圈的三個缺口


當一個 AI 程式開發產品只有執行核心,上層沒有流程管控時,我們稱之為「裸迴圈」。這種設計有三個主要缺口。


第一,缺乏品質門控。AI 認為工作差不多完成,就可能停止,甚至跳過測試與程式碼審查,因為系統沒有設置必須通過的關卡。


第二,缺乏流程一致性。同一個任務,AI 這次可能執行五個步驟,下次只執行三個,導致流程與結果難以預測,也難以重現。


第三,缺乏複用性。好不容易摸索出一套有效的工作方法,卻只存在於某次對話的上下文中。換個專案或會話,就難以延續,無法有效沉澱與分享。


這三個問題,都指向同一個根源:執行核心之上,缺少一個統一管理節奏與流程的角色。


提示詞是建議,不是流程約束


常見的解法,是把工作流程寫進系統提示詞,例如要求 AI 先分析需求、再規劃、接著實作,最後執行測試。


這樣做看似合理,卻仍然只是建議。AI 可能認為任務很簡單,不需要規劃就直接寫程式碼;也可能在完成程式碼後宣告任務結束,卻沒有真正執行測試。單靠提示詞,無法硬性保證它遵守每個步驟。


這就像把交通規則寫在紙條上交給司機,與在道路上設置紅綠燈和檢查站,是兩種不同的管理方式。前者依靠遵守,後者則建立實際的流程約束。我們的產品要做的,就是為 AI 工作流程裝上這些「紅綠燈」。


Harness:可插拔的工作流程引擎


Harness 可以用線束的概念理解:將原本散亂的部分,組織成有序、可控的整體。在我們的產品中,它是一套可插拔的工作流程引擎,主要負責三件事:規定任務分成哪些步驟、每一步由誰執行,以及完成後前往哪一步。


它相當於 AI 的排程中心。執行核心不再自行決定整體節奏,而是接受排程:先完成第一步,完成後回報,取得放行才能進入第二步。


這套規則可以替換。換一套 Harness,就等於換一套工作方式,像是為同一臺機器換上不同的作業指導書。


雙層架構:排程與執行各司其職


整體架構分成兩層。上層是排程中心,也就是階段狀態機,負責讀取目前階段的作業指導書、配置工具與工作手冊,以及決定完成後的去向,但不親自執行任務。


下層是執行核心,接收派發的工作,透過智慧體迴圈逐步完成,但不管理全局流程。兩層各司其職,形成清楚的分工:排程歸排程,執行歸執行。


階段 Stage:流程中的任務卡


階段是工作流程中的一站,也是整套系統的基本組成單元。每個階段都像一張任務卡,包含四項資訊。


第一是工作手冊,說明這一步的目標與做法。第二是工具箱,規定此階段允許使用哪些工具,也可以限制為只開放必要工具。第三是門控,決定完成後自動放行、等待人工確認,或依條件判斷。第四是下一站,指定完成後要前往哪個階段。


例如,產品內建的 Dev Flow 開發流程包含八個階段:梳理需求、制定規劃、撰寫程式碼、審查是否符合需求、審查程式碼品質、執行測試、沉澱知識,以及提交程式碼。每個階段都有各自的任務卡。


階段狀態機 Stage Machine:以程式邏輯決定流程


階段狀態機是整套系統的排程中心,只回答三個問題:現在執行哪個階段、完成後前往哪裡,以及是否需要停下來等待使用者。


最關鍵的設計是:排程中心具有確定性,所有流程決策由程式碼邏輯做出,而不是由 AI 決定。


即使 AI 在畫面上輸出「梳理階段完畢」,那也只是一段顯示文字,不是排程中心放行的依據。排程中心依照自身維護的狀態與規則運作,因此 AI 不能僅憑自己的判斷跳過某個階段。


即使 AI 認為審查沒有必要,也無法自行繞過關卡,因為放行權掌握在排程中心,而不是模型手中。這就是「硬驅動」:流程由系統硬性推進,而不是只透過提示詞提出建議。


門控 Gate:管理階段之間的放行


門控是階段之間的關卡,分為三種模式。


第一種是自動放行。階段完成後,立即進入下一站,不等待人工確認,適合不需要人員拍板的執行環節,例如撰寫程式碼或執行測試。它就像高速公路的 ETC 通道,符合通行要求便可繼續前進。


第二種是人工放行。階段完成後必須停下來,等使用者確認繼續才往下走,適合梳理需求與制定規劃等需要人員決策的環節。


第三種是條件放行。完成後,系統會檢查是否符合通行條件;通過才放行,有問題就攔下。這適合審查、測試等需要判斷結果是否合格的環節。因此,即使同樣是測試階段,也可以依流程需要採用不同的門控模式。


此外,系統設有連續自動跳轉的上限,避免全自動流程持續空轉,始終不將控制權交還使用者。就像高速公路不能無限延伸,流程運作到一定程度,也需要保留出口。


執行者 Runner:決定這一站由誰完成


執行者回答的是「這個階段由誰來做」,分為兩種模式。


第一種是本機執行。在主迴圈中更換工作手冊,繼續由同一個 AI 執行,就像同一位員工轉換崗位,人沒有更換,但任務與工作要求改變了。


第二種是委託執行。將整個階段打包,交給獨立的專家處理,就像聘請一位外部顧問,由他帶著自己的工具箱來完成該階段的工作。

[AI 分享] AI Coding 時代的程式碼審查:從逐行檢查轉向分級把關

 [AI 分享] AI Coding 時代的程式碼審查:從逐行檢查轉向分級把關

摘要 : AI 提效不靠逐行審查,而是把關需求品質、完善自動化流程,並針對核心高風險模組進行人工審查。



內容:

AI Coding 這麼強,到底還需不需要人工做程式碼 Review?以我們十幾個專案組的實際情況來說,全端工程師使用 AI Coding,一個小時的程式碼產出量,就可能抵得上過去幾天的工作量。面對這麼大量的程式碼,還要不要逐行審查?我們實戰後的結論是:擺正 AI Coding 的使用方式,放棄全量審查的無用功,改做分級 Review。


可以把 AI 想像成團隊裡不同資歷的工程師。當一位工程師剛到職、第一次提交程式碼時,技術負責人通常會確認:程式碼是否符合專案規範、業務理解與邏輯是否正確、邊界條件是否完整,以及空值判斷、異常處理、SQL 效能、資料表索引、交易、權限、鎖與服務可用性等是否存在問題。


如果這位工程師多次表現良好,團隊就會逐步建立信任,後續審查也會轉為抓大放小,依模組風險決定投入程度。一般後台 CRUD 功能,功能跑通就放行;但支付、訂閱等核心資金流程,仍必須重點審查交易、鎖與高可用性等風險。


那麼,你手上的 AI 相當於哪個級別的工程師?在我們的實務中,AI 被視為中級以上的開發者。因此,我們更重視前期對業務理解與架構設計的評審,相對淡化後期逐行程式碼 Review。


這套 AI Coding 流程,首先必須嚴格把關上游需求品質。產品經理要產出對 AI 友善的 PRD,並透過需求壓測 Skill 檢查需求完整性。接著,全端工程師使用 Super Power 等工具,嚴格執行需求澄清與 Spec 規範,將業務邏輯、架構設計、需求邊界和業務約束,完整沉澱到 Spec 檔案中。


在開發環境裡,我們使用統一的 AI 腳手架,提前透過 agents.md 定義專案目錄與架構,規定各資料夾的職責,例如 util、DAO 應放哪些內容,再透過 rules 檔案固定程式碼規範與安全規範。有了這些前置準備,AI 產出的程式碼通常比較規範,幾乎不會出現低階語法錯誤;它容易踩坑的地方,反而多半是需求邊界描述不清。


後置流程則搭配三類工具:模型交叉 Code Review Skill、效能評審 Skill,以及能自動完成測試案例設計、測試腳本生成、執行與迴歸測試的 QA Agent。最後再結合開發者自測兜底,讓整體流程兼顧速度與穩定性。


這套流程的核心始終是需求。如果需求沒有講清楚,後面再怎麼 Review 也很難補救。因此,我們把更多時間投入需求品質把控與需求澄清,而不是把所有精力放在程式碼產出後的人工檢查。


至於什麼時候需要人工 Review,我們採取分級處理:非核心模組完成整套流程與功能自測後,直接交付;核心、高風險流程,才進行針對性的重點審查。這種做法特別適合敏捷開發、小步快跑的團隊。


也提醒團隊負責人:想透過 AI 取得數倍的效率提升,就要接受分級容錯。非核心場景允許小瑕疵,核心場景則必須零容忍。


AI Coding 下的人工 Review,不再是所有程式碼都必須經過的固定關卡,而是從逐行逐句通讀,轉變為在關鍵節點做判斷與把關。AI 負責產出吞吐,人負責核心品質與流程調整。


關注明隊,後續將繼續分享企業產品與研發提效的實踐和方法。有想法也歡迎在評論區交流。

[AI 反思] AI技術與未來敘事:從自動駕駛到2030年滅絕風險

 [AI 反思] AI技術與未來敘事:從自動駕駛到2030年滅絕風險

摘要 : AI進步不等於全面可靠,從自動駕駛到滅絕警告,應檢視技術與敘事之間被跳過的步驟。



內容:

四年以後,AI可能毀滅人類?以Anthropic近期公開的風險警告,以及其報告中涉及中國相關行為者使用Claude進行軍事研發、電子戰與反魚雷系統研究的案例,提出一個問題:我們是否已經從討論AI取代程式設計師,迅速跳到了討論2030年人類是否還存在?


但比起直接判斷AI有多強,更值得回頭檢視的是:過去十年,技術實際走到了哪裡,而我們對未來的故事又跑到了哪裡?AI現在真正失控的,可能不只是技術,也包括不斷加速的敘事。


自動駕駛的教訓:技術方向可能正確,時間表卻可能錯十年


2016年,馬斯克曾公開提出,希望在2017年底,讓一輛特斯拉從洛杉磯一路自主開到紐約,全程不需要人碰方向盤。然而,十年後特斯拉官網仍將相關功能稱為「Full Self-Driving(Supervised)」,也就是需要駕駛監督的全自動輔助駕駛;駕駛必須保持注意力,隨時準備接管,車輛並非完全自動駕駛車輛。


這不代表自動駕駛失敗。Waymo已經證明,在限定城市與區域,經過大量地圖建置、測試及營運準備後,沒有安全員的Robotaxi可以運作。過去十年的進步確實巨大,問題在於,我們嚴重低估了全面可靠所需的時間。


讓汽車「會開」,與讓汽車「在幾乎所有情況下都能可靠地自己開」,是兩個不同問題。從零做到九十分可能很快,但從九十分走向99%、99.9%,甚至更高可靠度,直到人們願意放心把家人交給車輛,最後這段路可能比前面更加困難。


人形機器人:上一層尚未全面解決,下一層的時間表卻更快


自動駕駛尚未全面落地,人形機器人的故事已經接棒。工廠機器人、家庭機器人與Optimus,都指向一個充滿吸引力的未來:機器人可以承擔大量人類工作。


這些願景並非不可能,但關鍵仍是何時能夠實現。長期看好Tesla與機器人產業的ARK研究,指出其模型估算,真正通用的人形機器人所面對的綜合複雜度,可能是Robotaxi的二十萬倍。這不是物理定律,而是模型估算,但它提醒我們,兩者面對的問題規模並不相同。


汽車主要控制方向、油門與煞車,運作於複雜但規則相對明確的道路系統。通用機器人則必須處理多個關節、平衡、抓取、力量控制、物體辨識與人類互動,並適應樓梯、廚房、玻璃杯、寵物、小孩、工廠及醫院等高度非結構化環境。


Robotaxi發展十多年,真正無人運行至今仍受區域與場景限制;與此同時,產業卻已開始討論十億台機器人進入現實世界。值得追問的是:上一層問題真的解決了嗎?如果沒有,為什麼下一層的時間表反而如此樂觀?


太空資料中心:未來故事持續跑在現實兌現之前


機器人還沒有普遍進入家庭,下一個宏大願景又出現了:把AI資料中心搬到太空。


SpaceX相關材料已納入軌道AI運算構想,規劃最快從2028年開始部署軌道AI運算衛星,長期甚至希望每年將100GW級別的AI運算能力送入軌道;相關長期股權獎勵目標,也涉及建立大規模非地球資料中心。


如果Starship確實能大幅降低發射成本,軌道運算未來可能具備自身的經濟邏輯。因此,問題不是武斷認定這些構想做不到,而是:為什麼從汽車自主駕駛、機器人替人工作、Agent管理工作,到資料中心離開地球,故事總是不斷向前推進,卻很少等待上一個承諾充分兌現?


Agent的現實考驗:能做很多事,不等於每天都能放心交付


相較於宏大的太空願景,OpenClaw熱潮提供了一個更貼近日常的觀察案例。中國網路一度流行「養龍蝦」,學生、程式設計師、上班族,甚至退休人士,都開始研究如何使用Agent。


它背後的想像非常誘人:每個人都能擁有數個AI助手,分別處理郵件、查資料、訂機票、寫程式與管理行程,甚至由一個人加上一群Agent經營公司。


Agent的能力確實持續增強,OpenClaw也沒有消失。幾個月後,媒體開始討論熱度消退,原因包括Token成本、使用門檻、安全問題與配置複雜。更重要的是,普通使用者逐漸發現:「知道它可以做很多事」,與「每天都能穩定把工作交給它」,完全不是同一回事。


AI討論最容易混淆的,正是「能做到」與「能長期、穩定、低成本地做到」。


程式設計師的工作:完成任務,不等於承擔職業


AI如今已能快速寫頁面、修復錯誤與搭建程式,但程式設計師的工作並不只是產出第一版程式碼。


真實軟體系統需要持續升級與維護,還必須面對需求變更、API調整、監管要求及安全漏洞。真正重要的,往往不是誰最快寫出第一版,而是系統出問題之後,誰能理解原因並持續維護。


這就是Task與Job的差別。AI可以完成許多個別任務,但一份職業還包含長期上下文、判斷、維護,以及責任。


因此,宣稱AI能完成相當於人類數小時、甚至數天工作量的測試,不能直接解讀為AI已能獨立擔任數天的程式設計師。在基準測試中,50%的成功率可能代表突破;在生產環境中,同樣的成功率卻可能意味著事故。


真正的問題不是AI會不會寫程式碼,而是我們是否敢把真實系統長期交給它負責。


軍事應用報告:使用AI,不等於AI已掌握核心系統


回到Anthropic的報告,其中確實描述了中國相關行為者使用Claude參與反魚雷系統方案、電子戰軟體開發,以及多輪模擬與程式碼迭代的案例。AI被用於軍事研發、情報分析及軟體開發,值得認真關注。


然而,這些案例究竟能證明到什麼程度,仍須區分。Anthropic也承認,部分案例無法確認具體身分,一些分析使用的是公開資訊;電子戰案例中的使用者,也擁有部署在內部網路的模型。


因此,「軍工相關人員正在使用Claude」,與「Claude已進入中國最核心的軍事系統」,不是同一件事。媒體標題若抹去這些差異,就容易讓讀者形成「連軍方都已離不開AI」的印象,再進一步接受「既然今天已經如此強大,四年後就可能毀滅人類」的推論。


真正值得質疑的,是這些推論之間被跳過的步驟。


面對2030年風險,應追問中間條件,而非只接受結局


這並不是否認超級智慧可能帶來重大風險。它最終會造成什麼影響,今天沒有人能完全確定。但嚴謹的討論應該追問:從今天的AI能力走到毀滅性結果,中間究竟還需要跨越哪些門檻?


首先,AI必須從能完成許多複雜任務,進一步變成能長期、穩定地完成這些任務。其次,它必須從依賴人類提供目標、資料與回饋,走向長期自主行動。接著,還要具備自主規劃與獲取資源的能力。


討論AI未來,不應只在「全部都是騙局」與「即將毀滅人類」之間選邊站。更重要的是區分已被證明的能力、尚未解決的可靠性問題,以及仍屬推測的未來情境,避免讓敘事的速度取代對技術現實的判斷。

2026年10月3日 星期六

[AI 分享] 關掉電腦後,AI 能否持續工作?OpenAI 新功能與交付考驗

 [AI 分享] 關掉電腦後,AI 能否持續工作?OpenAI 新功能與交付考驗

摘要 : OpenAI 推出持續執行任務與團隊協作新功能,能否真正省心,仍取決於授權管理與穩定交付。



內容:

關掉電腦後,人工智慧還能繼續把工作做完嗎?根據分享內容,OpenAI 在 9 月 29 日於舊金山舉行的開發者大會上,提出名為 Dots 的新方案,定位為能長期跟進工作的助手。


Dots 擁有自己的雲端電腦和瀏覽器,可以連接使用者授權的應用程式,並根據回饋記住偏好。即使使用者離開聊天視窗,它仍能繼續推進已交代的任務。官方提到的一個早期案例是:使用者忘記向出版機構開立發票,助手自行發現這項待辦事項,準備好發票後,等待使用者批准再寄出。值得注意的是,它不只是執行指令,也能發現尚未完成的工作,但這仍只是官方披露的早期使用案例。


團隊協作方面,分享內容提到 ChatGPT Space,讓同事與人工智慧可以圍繞同一份頁面修改內容、留下評論及補充資料。專案有新進展時,也能讓 AI 持續更新。不過,協作幻燈片與表格功能尚未推出,官方標示為「即將推出」。


模型方面,分享內容提到新版本 GPT-6.1 So。OpenAI 表示,它在程式設計、操作電腦及專業工作上的表現接近 Extra,而標準介面的輸入、輸出單價為 Extra 的五分之一。不過,單價較低不代表完成任務的總成本一定更低,實際費用仍取決於使用量,以及是否需要返工。


另一個重要細節是,常駐後臺並不代表 AI 可以任意替使用者做決定。官方表示,主動蒐集資訊的工具只能讀取資料;發送訊息或修改內容,則必須遵守使用者設定的授權與稽核規則。涉及重要結果時,使用者仍應親自確認。


目前並非所有帳號都能使用 Dots。依分享內容所述,它正向符合地區條件的 Pro 和 Business Premium 使用者開放,企業使用者則需要管理員啟用,因此應先確認自己的帳號是否已有使用入口。


這場發布會真正值得持續觀察的,是把工作交給 AI 之後,使用者究竟能少操多少心。如果仍需要逐步監督、反覆糾錯,節省的時間就很有限。能否穩定交付,才是這些新功能接下來必須回答的問題。