2026年10月4日 星期日

[AI 分享] 讓引擎管流程、讓模型管執行:AI 程式開發的 Harness 設計

 [AI 分享] 讓引擎管流程、讓模型管執行:AI 程式開發的 Harness 設計

摘要 : 透過確定性的流程引擎,管理 AI 開發階段、工具與門控,避免跳步並提升一致性與複用性。



內容:

當我們讓 AI 撰寫程式碼時,整個工作流程應該由誰主導?這看似是技術問題,實際上也關乎產品哲學。主流做法是將流程寫進提示詞,建議 AI 按照步驟完成任務;但建議不等於約束,AI 仍可能省略規劃、跳過測試或略過審查。


我們的產品選擇另一條路:以確定性的引擎硬性驅動流程,AI 只負責完成各個步驟中的工作。一句話概括,就是「讓引擎管流程,讓模型管執行」。


智慧體迴圈:有執行能力,卻不負責全局流程


理解這套設計,首先要認識智慧體迴圈,也就是 Agent Loop。它是 AI 程式開發助手的執行核心,運作方式是不斷循環:思考該使用什麼工具、呼叫工具,例如讀取檔案或執行命令,再觀察結果是否足夠;如果不足,就繼續下一輪。


這就像派一位員工處理複雜任務,他不是一次完成所有事情,而是逐步探索、採取行動,再根據結果調整。這個迴圈讓 AI 具備實際動手的能力,但它的主要職責是完成眼前任務,而不是管理整體流程。


我們將它稱為「執行核心」。給它任務、工具與工作說明,它就持續運作,直到任務完成。然而,它不負責判斷整個流程進行到哪一步、目前是否應該執行這件事,也不負責決定完成後要前往哪個階段。


它像是一位能力很強、卻不負責全局安排的工匠。你讓他砌牆,他可以把牆砌好,但不會主動決定現在是否應該砌牆,或砌完之後是否需要驗收。


裸迴圈的三個缺口


當一個 AI 程式開發產品只有執行核心,上層沒有流程管控時,我們稱之為「裸迴圈」。這種設計有三個主要缺口。


第一,缺乏品質門控。AI 認為工作差不多完成,就可能停止,甚至跳過測試與程式碼審查,因為系統沒有設置必須通過的關卡。


第二,缺乏流程一致性。同一個任務,AI 這次可能執行五個步驟,下次只執行三個,導致流程與結果難以預測,也難以重現。


第三,缺乏複用性。好不容易摸索出一套有效的工作方法,卻只存在於某次對話的上下文中。換個專案或會話,就難以延續,無法有效沉澱與分享。


這三個問題,都指向同一個根源:執行核心之上,缺少一個統一管理節奏與流程的角色。


提示詞是建議,不是流程約束


常見的解法,是把工作流程寫進系統提示詞,例如要求 AI 先分析需求、再規劃、接著實作,最後執行測試。


這樣做看似合理,卻仍然只是建議。AI 可能認為任務很簡單,不需要規劃就直接寫程式碼;也可能在完成程式碼後宣告任務結束,卻沒有真正執行測試。單靠提示詞,無法硬性保證它遵守每個步驟。


這就像把交通規則寫在紙條上交給司機,與在道路上設置紅綠燈和檢查站,是兩種不同的管理方式。前者依靠遵守,後者則建立實際的流程約束。我們的產品要做的,就是為 AI 工作流程裝上這些「紅綠燈」。


Harness:可插拔的工作流程引擎


Harness 可以用線束的概念理解:將原本散亂的部分,組織成有序、可控的整體。在我們的產品中,它是一套可插拔的工作流程引擎,主要負責三件事:規定任務分成哪些步驟、每一步由誰執行,以及完成後前往哪一步。


它相當於 AI 的排程中心。執行核心不再自行決定整體節奏,而是接受排程:先完成第一步,完成後回報,取得放行才能進入第二步。


這套規則可以替換。換一套 Harness,就等於換一套工作方式,像是為同一臺機器換上不同的作業指導書。


雙層架構:排程與執行各司其職


整體架構分成兩層。上層是排程中心,也就是階段狀態機,負責讀取目前階段的作業指導書、配置工具與工作手冊,以及決定完成後的去向,但不親自執行任務。


下層是執行核心,接收派發的工作,透過智慧體迴圈逐步完成,但不管理全局流程。兩層各司其職,形成清楚的分工:排程歸排程,執行歸執行。


階段 Stage:流程中的任務卡


階段是工作流程中的一站,也是整套系統的基本組成單元。每個階段都像一張任務卡,包含四項資訊。


第一是工作手冊,說明這一步的目標與做法。第二是工具箱,規定此階段允許使用哪些工具,也可以限制為只開放必要工具。第三是門控,決定完成後自動放行、等待人工確認,或依條件判斷。第四是下一站,指定完成後要前往哪個階段。


例如,產品內建的 Dev Flow 開發流程包含八個階段:梳理需求、制定規劃、撰寫程式碼、審查是否符合需求、審查程式碼品質、執行測試、沉澱知識,以及提交程式碼。每個階段都有各自的任務卡。


階段狀態機 Stage Machine:以程式邏輯決定流程


階段狀態機是整套系統的排程中心,只回答三個問題:現在執行哪個階段、完成後前往哪裡,以及是否需要停下來等待使用者。


最關鍵的設計是:排程中心具有確定性,所有流程決策由程式碼邏輯做出,而不是由 AI 決定。


即使 AI 在畫面上輸出「梳理階段完畢」,那也只是一段顯示文字,不是排程中心放行的依據。排程中心依照自身維護的狀態與規則運作,因此 AI 不能僅憑自己的判斷跳過某個階段。


即使 AI 認為審查沒有必要,也無法自行繞過關卡,因為放行權掌握在排程中心,而不是模型手中。這就是「硬驅動」:流程由系統硬性推進,而不是只透過提示詞提出建議。


門控 Gate:管理階段之間的放行


門控是階段之間的關卡,分為三種模式。


第一種是自動放行。階段完成後,立即進入下一站,不等待人工確認,適合不需要人員拍板的執行環節,例如撰寫程式碼或執行測試。它就像高速公路的 ETC 通道,符合通行要求便可繼續前進。


第二種是人工放行。階段完成後必須停下來,等使用者確認繼續才往下走,適合梳理需求與制定規劃等需要人員決策的環節。


第三種是條件放行。完成後,系統會檢查是否符合通行條件;通過才放行,有問題就攔下。這適合審查、測試等需要判斷結果是否合格的環節。因此,即使同樣是測試階段,也可以依流程需要採用不同的門控模式。


此外,系統設有連續自動跳轉的上限,避免全自動流程持續空轉,始終不將控制權交還使用者。就像高速公路不能無限延伸,流程運作到一定程度,也需要保留出口。


執行者 Runner:決定這一站由誰完成


執行者回答的是「這個階段由誰來做」,分為兩種模式。


第一種是本機執行。在主迴圈中更換工作手冊,繼續由同一個 AI 執行,就像同一位員工轉換崗位,人沒有更換,但任務與工作要求改變了。


第二種是委託執行。將整個階段打包,交給獨立的專家處理,就像聘請一位外部顧問,由他帶著自己的工具箱來完成該階段的工作。

[AI 分享] AI Coding 時代的程式碼審查:從逐行檢查轉向分級把關

 [AI 分享] AI Coding 時代的程式碼審查:從逐行檢查轉向分級把關

摘要 : AI 提效不靠逐行審查,而是把關需求品質、完善自動化流程,並針對核心高風險模組進行人工審查。



內容:

AI Coding 這麼強,到底還需不需要人工做程式碼 Review?以我們十幾個專案組的實際情況來說,全端工程師使用 AI Coding,一個小時的程式碼產出量,就可能抵得上過去幾天的工作量。面對這麼大量的程式碼,還要不要逐行審查?我們實戰後的結論是:擺正 AI Coding 的使用方式,放棄全量審查的無用功,改做分級 Review。


可以把 AI 想像成團隊裡不同資歷的工程師。當一位工程師剛到職、第一次提交程式碼時,技術負責人通常會確認:程式碼是否符合專案規範、業務理解與邏輯是否正確、邊界條件是否完整,以及空值判斷、異常處理、SQL 效能、資料表索引、交易、權限、鎖與服務可用性等是否存在問題。


如果這位工程師多次表現良好,團隊就會逐步建立信任,後續審查也會轉為抓大放小,依模組風險決定投入程度。一般後台 CRUD 功能,功能跑通就放行;但支付、訂閱等核心資金流程,仍必須重點審查交易、鎖與高可用性等風險。


那麼,你手上的 AI 相當於哪個級別的工程師?在我們的實務中,AI 被視為中級以上的開發者。因此,我們更重視前期對業務理解與架構設計的評審,相對淡化後期逐行程式碼 Review。


這套 AI Coding 流程,首先必須嚴格把關上游需求品質。產品經理要產出對 AI 友善的 PRD,並透過需求壓測 Skill 檢查需求完整性。接著,全端工程師使用 Super Power 等工具,嚴格執行需求澄清與 Spec 規範,將業務邏輯、架構設計、需求邊界和業務約束,完整沉澱到 Spec 檔案中。


在開發環境裡,我們使用統一的 AI 腳手架,提前透過 agents.md 定義專案目錄與架構,規定各資料夾的職責,例如 util、DAO 應放哪些內容,再透過 rules 檔案固定程式碼規範與安全規範。有了這些前置準備,AI 產出的程式碼通常比較規範,幾乎不會出現低階語法錯誤;它容易踩坑的地方,反而多半是需求邊界描述不清。


後置流程則搭配三類工具:模型交叉 Code Review Skill、效能評審 Skill,以及能自動完成測試案例設計、測試腳本生成、執行與迴歸測試的 QA Agent。最後再結合開發者自測兜底,讓整體流程兼顧速度與穩定性。


這套流程的核心始終是需求。如果需求沒有講清楚,後面再怎麼 Review 也很難補救。因此,我們把更多時間投入需求品質把控與需求澄清,而不是把所有精力放在程式碼產出後的人工檢查。


至於什麼時候需要人工 Review,我們採取分級處理:非核心模組完成整套流程與功能自測後,直接交付;核心、高風險流程,才進行針對性的重點審查。這種做法特別適合敏捷開發、小步快跑的團隊。


也提醒團隊負責人:想透過 AI 取得數倍的效率提升,就要接受分級容錯。非核心場景允許小瑕疵,核心場景則必須零容忍。


AI Coding 下的人工 Review,不再是所有程式碼都必須經過的固定關卡,而是從逐行逐句通讀,轉變為在關鍵節點做判斷與把關。AI 負責產出吞吐,人負責核心品質與流程調整。


關注明隊,後續將繼續分享企業產品與研發提效的實踐和方法。有想法也歡迎在評論區交流。

[AI 反思] AI技術與未來敘事:從自動駕駛到2030年滅絕風險

 [AI 反思] AI技術與未來敘事:從自動駕駛到2030年滅絕風險

摘要 : AI進步不等於全面可靠,從自動駕駛到滅絕警告,應檢視技術與敘事之間被跳過的步驟。



內容:

四年以後,AI可能毀滅人類?以Anthropic近期公開的風險警告,以及其報告中涉及中國相關行為者使用Claude進行軍事研發、電子戰與反魚雷系統研究的案例,提出一個問題:我們是否已經從討論AI取代程式設計師,迅速跳到了討論2030年人類是否還存在?


但比起直接判斷AI有多強,更值得回頭檢視的是:過去十年,技術實際走到了哪裡,而我們對未來的故事又跑到了哪裡?AI現在真正失控的,可能不只是技術,也包括不斷加速的敘事。


自動駕駛的教訓:技術方向可能正確,時間表卻可能錯十年


2016年,馬斯克曾公開提出,希望在2017年底,讓一輛特斯拉從洛杉磯一路自主開到紐約,全程不需要人碰方向盤。然而,十年後特斯拉官網仍將相關功能稱為「Full Self-Driving(Supervised)」,也就是需要駕駛監督的全自動輔助駕駛;駕駛必須保持注意力,隨時準備接管,車輛並非完全自動駕駛車輛。


這不代表自動駕駛失敗。Waymo已經證明,在限定城市與區域,經過大量地圖建置、測試及營運準備後,沒有安全員的Robotaxi可以運作。過去十年的進步確實巨大,問題在於,我們嚴重低估了全面可靠所需的時間。


讓汽車「會開」,與讓汽車「在幾乎所有情況下都能可靠地自己開」,是兩個不同問題。從零做到九十分可能很快,但從九十分走向99%、99.9%,甚至更高可靠度,直到人們願意放心把家人交給車輛,最後這段路可能比前面更加困難。


人形機器人:上一層尚未全面解決,下一層的時間表卻更快


自動駕駛尚未全面落地,人形機器人的故事已經接棒。工廠機器人、家庭機器人與Optimus,都指向一個充滿吸引力的未來:機器人可以承擔大量人類工作。


這些願景並非不可能,但關鍵仍是何時能夠實現。長期看好Tesla與機器人產業的ARK研究,指出其模型估算,真正通用的人形機器人所面對的綜合複雜度,可能是Robotaxi的二十萬倍。這不是物理定律,而是模型估算,但它提醒我們,兩者面對的問題規模並不相同。


汽車主要控制方向、油門與煞車,運作於複雜但規則相對明確的道路系統。通用機器人則必須處理多個關節、平衡、抓取、力量控制、物體辨識與人類互動,並適應樓梯、廚房、玻璃杯、寵物、小孩、工廠及醫院等高度非結構化環境。


Robotaxi發展十多年,真正無人運行至今仍受區域與場景限制;與此同時,產業卻已開始討論十億台機器人進入現實世界。值得追問的是:上一層問題真的解決了嗎?如果沒有,為什麼下一層的時間表反而如此樂觀?


太空資料中心:未來故事持續跑在現實兌現之前


機器人還沒有普遍進入家庭,下一個宏大願景又出現了:把AI資料中心搬到太空。


SpaceX相關材料已納入軌道AI運算構想,規劃最快從2028年開始部署軌道AI運算衛星,長期甚至希望每年將100GW級別的AI運算能力送入軌道;相關長期股權獎勵目標,也涉及建立大規模非地球資料中心。


如果Starship確實能大幅降低發射成本,軌道運算未來可能具備自身的經濟邏輯。因此,問題不是武斷認定這些構想做不到,而是:為什麼從汽車自主駕駛、機器人替人工作、Agent管理工作,到資料中心離開地球,故事總是不斷向前推進,卻很少等待上一個承諾充分兌現?


Agent的現實考驗:能做很多事,不等於每天都能放心交付


相較於宏大的太空願景,OpenClaw熱潮提供了一個更貼近日常的觀察案例。中國網路一度流行「養龍蝦」,學生、程式設計師、上班族,甚至退休人士,都開始研究如何使用Agent。


它背後的想像非常誘人:每個人都能擁有數個AI助手,分別處理郵件、查資料、訂機票、寫程式與管理行程,甚至由一個人加上一群Agent經營公司。


Agent的能力確實持續增強,OpenClaw也沒有消失。幾個月後,媒體開始討論熱度消退,原因包括Token成本、使用門檻、安全問題與配置複雜。更重要的是,普通使用者逐漸發現:「知道它可以做很多事」,與「每天都能穩定把工作交給它」,完全不是同一回事。


AI討論最容易混淆的,正是「能做到」與「能長期、穩定、低成本地做到」。


程式設計師的工作:完成任務,不等於承擔職業


AI如今已能快速寫頁面、修復錯誤與搭建程式,但程式設計師的工作並不只是產出第一版程式碼。


真實軟體系統需要持續升級與維護,還必須面對需求變更、API調整、監管要求及安全漏洞。真正重要的,往往不是誰最快寫出第一版,而是系統出問題之後,誰能理解原因並持續維護。


這就是Task與Job的差別。AI可以完成許多個別任務,但一份職業還包含長期上下文、判斷、維護,以及責任。


因此,宣稱AI能完成相當於人類數小時、甚至數天工作量的測試,不能直接解讀為AI已能獨立擔任數天的程式設計師。在基準測試中,50%的成功率可能代表突破;在生產環境中,同樣的成功率卻可能意味著事故。


真正的問題不是AI會不會寫程式碼,而是我們是否敢把真實系統長期交給它負責。


軍事應用報告:使用AI,不等於AI已掌握核心系統


回到Anthropic的報告,其中確實描述了中國相關行為者使用Claude參與反魚雷系統方案、電子戰軟體開發,以及多輪模擬與程式碼迭代的案例。AI被用於軍事研發、情報分析及軟體開發,值得認真關注。


然而,這些案例究竟能證明到什麼程度,仍須區分。Anthropic也承認,部分案例無法確認具體身分,一些分析使用的是公開資訊;電子戰案例中的使用者,也擁有部署在內部網路的模型。


因此,「軍工相關人員正在使用Claude」,與「Claude已進入中國最核心的軍事系統」,不是同一件事。媒體標題若抹去這些差異,就容易讓讀者形成「連軍方都已離不開AI」的印象,再進一步接受「既然今天已經如此強大,四年後就可能毀滅人類」的推論。


真正值得質疑的,是這些推論之間被跳過的步驟。


面對2030年風險,應追問中間條件,而非只接受結局


這並不是否認超級智慧可能帶來重大風險。它最終會造成什麼影響,今天沒有人能完全確定。但嚴謹的討論應該追問:從今天的AI能力走到毀滅性結果,中間究竟還需要跨越哪些門檻?


首先,AI必須從能完成許多複雜任務,進一步變成能長期、穩定地完成這些任務。其次,它必須從依賴人類提供目標、資料與回饋,走向長期自主行動。接著,還要具備自主規劃與獲取資源的能力。


討論AI未來,不應只在「全部都是騙局」與「即將毀滅人類」之間選邊站。更重要的是區分已被證明的能力、尚未解決的可靠性問題,以及仍屬推測的未來情境,避免讓敘事的速度取代對技術現實的判斷。

2026年10月3日 星期六

[AI 分享] 關掉電腦後,AI 能否持續工作?OpenAI 新功能與交付考驗

 [AI 分享] 關掉電腦後,AI 能否持續工作?OpenAI 新功能與交付考驗

摘要 : OpenAI 推出持續執行任務與團隊協作新功能,能否真正省心,仍取決於授權管理與穩定交付。



內容:

關掉電腦後,人工智慧還能繼續把工作做完嗎?根據分享內容,OpenAI 在 9 月 29 日於舊金山舉行的開發者大會上,提出名為 Dots 的新方案,定位為能長期跟進工作的助手。


Dots 擁有自己的雲端電腦和瀏覽器,可以連接使用者授權的應用程式,並根據回饋記住偏好。即使使用者離開聊天視窗,它仍能繼續推進已交代的任務。官方提到的一個早期案例是:使用者忘記向出版機構開立發票,助手自行發現這項待辦事項,準備好發票後,等待使用者批准再寄出。值得注意的是,它不只是執行指令,也能發現尚未完成的工作,但這仍只是官方披露的早期使用案例。


團隊協作方面,分享內容提到 ChatGPT Space,讓同事與人工智慧可以圍繞同一份頁面修改內容、留下評論及補充資料。專案有新進展時,也能讓 AI 持續更新。不過,協作幻燈片與表格功能尚未推出,官方標示為「即將推出」。


模型方面,分享內容提到新版本 GPT-6.1 So。OpenAI 表示,它在程式設計、操作電腦及專業工作上的表現接近 Extra,而標準介面的輸入、輸出單價為 Extra 的五分之一。不過,單價較低不代表完成任務的總成本一定更低,實際費用仍取決於使用量,以及是否需要返工。


另一個重要細節是,常駐後臺並不代表 AI 可以任意替使用者做決定。官方表示,主動蒐集資訊的工具只能讀取資料;發送訊息或修改內容,則必須遵守使用者設定的授權與稽核規則。涉及重要結果時,使用者仍應親自確認。


目前並非所有帳號都能使用 Dots。依分享內容所述,它正向符合地區條件的 Pro 和 Business Premium 使用者開放,企業使用者則需要管理員啟用,因此應先確認自己的帳號是否已有使用入口。


這場發布會真正值得持續觀察的,是把工作交給 AI 之後,使用者究竟能少操多少心。如果仍需要逐步監督、反覆糾錯,節省的時間就很有限。能否穩定交付,才是這些新功能接下來必須回答的問題。

[AI 衝擊] Muse 從回答到行動:AI Agent如何改變網際網路入口與消費模式

 [AI 衝擊] Muse 從回答到行動:AI Agent如何改變網際網路入口與消費模式

摘要 : AI智慧體可能接管需求入口、降低行動成本,並改變平臺流量、企業定價與消費習慣。



內容:

一個AI助手,為什麼可能牽動大型科技公司的市值,甚至衝擊旅遊訂票平臺的股價?原文以Meta的Muse為例,認為市場關注的並不只是它比ChatGPT多了哪些功能,而是網際網路的入口可能再次改變。文中提到的產品發布時間、下載量、股價變動及企業相關行動,未附資料來源,仍需進一步查證;以下整理其主要論點。


下一代網際網路入口,可能從App轉向Agent


PC網際網路時代,使用者主要透過瀏覽器與搜尋引擎取得資訊;到了行動網際網路時代,入口變成各種App:打車開啟Uber、購物開啟Amazon、訂飯店開啟Booking。


但如果未來不必自己尋找、切換與操作這些App,而是直接告訴AI:「幫我訂下週去紐約的機票和飯店」、「幫我換一份更便宜的汽車保險」、「幫我取消沒用的訂閱」,再由AI完成搜尋、比較、填表、寄信與付款,下一代入口就可能變成Agent,也就是能代替使用者執行任務的AI智慧體。


原文將Muse定位為個人AI智慧體,而不是單純的聊天機器人。它所描繪的功能包括瀏覽網頁、寄送郵件、安排旅行與購物,以及在使用者關閉應用程式後繼續執行任務。


關鍵不只是技術,而是能否成為日常入口


Muse並不是第一個嘗試自主規劃、呼叫工具與連續執行任務的Agent。原文以Manus為例,指出這類能力早已出現。


兩者的差異,更多在於產品定位:Manus比較像是使用者遇到複雜任務時交付工作的工具;Muse則試圖讓使用者把日常生活中的各種需求,都先交給AI處理。


Meta的潛在優勢,是Facebook、Instagram與WhatsApp既有的龐大使用者基礎。如果Agent能融入這些場景,就不必完全從零建立使用習慣。若再結合AI眼鏡,AI助手也可能不只是手機裡的一個App,而是更持續地陪伴使用者。


因此,Meta爭取的未必只是模型能力排名,而是成為使用者提出需求後,第一個接住需求的服務。


誰先接住需求,誰就可能掌握流量分配


當使用者想買一副適合跑步的耳機,過去可能會直接進入Amazon搜尋、比較與下單;未來則可能先交給Agent,再由Agent決定到哪個平臺購買。


在這種模式下,App不一定消失。Amazon仍提供商品,Uber仍提供交通服務,Booking仍提供住宿,但它們可能從使用者直接開啟的入口,變成Agent在後臺呼叫的服務。


這會觸及平臺的核心利益。原文稱Amazon已阻止Muse代替使用者在其網站購物,並以帳號安全、支付、隱私及授權為理由。文章進一步解讀,平臺也可能不願意讓其他公司的AI站在自己與消費者之間,削弱其對搜尋、推薦、廣告與購買流程的控制。


不過,安全與商業利益可能同時存在,不能僅憑這種解讀,就認定平臺的實際動機。


Agent真正可能降低的,是「行動成本」


如果Agent只是讓使用者少開幾個App,影響仍然有限。更大的變化,是它可能替人處理那些因為麻煩而長期擱置的事情。


換工作需要尋找機會與準備資料;開店需要聯絡供應商、尋找資金與安排時程;換保險需要比價、填資料與打電話;取消訂閱可能還得聯絡客服。很多事情不是做不到,而是執行成本太高,最後選擇放棄。


原文引述Alexander Wang的觀點,將Agent的價值放在消除這些執行障礙。以開麵包店為例,聊天機器人可以告訴使用者需要準備什麼;Agent則可能進一步尋找供應商、寄送郵件、查詢融資與安排時間,遇到需要人類判斷的關鍵決策時,再交回使用者確認。


兩者的差別可以概括為:過去AI主要提供答案,Agent則進一步替人行動。


網際網路降低了取得資訊的成本,行動網際網路降低了連接服務的成本,而Agent下一步可能降低的,就是把想法真正付諸執行的成本。


消費者慣性,可能成為最先受到衝擊的企業利潤來源


知道有更便宜的保險,與實際花時間更換保險,是兩回事;知道某個訂閱已經不需要,與真的聯絡客服取消,也不是同一件事。


部分企業能維持較高價格,不完全是因為產品難以替代,也可能因為消費者嫌麻煩、不願切換。保險漲價、電信方案偏貴、飯店訂貴了,或訂閱持續扣款,這些未被處理的小問題,可能支撐了一部分企業利潤。


Agent若能持續比價、尋找退款、取消訂閱與協助協商帳單,就可能壓縮這類建立在消費者慣性上的收益。


原文也提到Muse省錢挑戰,以及使用者透過重新比較汽車保險而降低支出的案例,並稱高盛已開始討論相關影響。這些案例與機構說法仍需查證,但其背後提出的問題值得關注:當大量消費者都有一個願意持續比價、切換服務與談價格的代理人,企業會面臨什麼變化?


保險、電信、線上旅遊與訂閱服務等產業,可能承受更大的價格競爭壓力。AI不必親自生產保險或經營飯店,也可能藉由降低消費者比較與切換的成本,讓商品和服務更難維持高價。


不過,這不代表Agent完全沒有成本;其實際效益仍取決於服務費用、執行效率、可靠性與平臺合作程度。


AI市場的焦點,可能從建設轉向實際應用


過去幾年,AI投資焦點多集中在GPU、記憶體、資料中心、網路與電力等基礎設施。Agent所代表的下一階段,則開始追問:AI進入日常消費後,究竟能節省多少時間、成本與中間環節?


因此,Agent的影響可能不只在於爭取使用者,也包括改變企業定價方式、消費者購買流程,以及平臺取得流量的模式。


可靠性、授權與平臺開放,仍是主要門檻


現在就認定Muse或任何Agent已經勝出,仍然太早。


首先,Agent必須足夠可靠。回答錯一個問題,通常可以重新詢問;但訂錯機票、買錯商品或寄錯郵件,可能造成實際損失。


其次,使用者是否願意交出郵箱、日曆、帳號與支付權限,是重要的信任門檻。Agent需要清楚的授權範圍、確認機制與責任界線。


再者,平臺是否願意開放也會影響其能力。如果大型服務商限制Agent操作,統一入口就很難真正成立。


競爭同樣不會只發生在Meta身上。OpenAI、Google、蘋果、Amazon與xAI都可能參與。各家公司掌握的優勢不同,包括聊天服務、搜尋、手機系統、郵件、地圖、瀏覽器、購物平臺與硬體裝置。


真正值得觀察的,或許不只是誰的模型多拿幾個測試第一,而是誰能成為最了解使用者、最值得信任,並且能安全、可靠地調用各種服務的AI助手。Agent能否從工具走向入口,最終仍要看它是否能把「替人行動」做成日常可用的服務。

2026年10月2日 星期五

[AI 影響] 自駕駛公司:AI 如何重塑管理與組織協作

 [AI 影響] 自駕駛公司:AI 如何重塑管理與組織協作

摘要 : AI Agent 可能先接管管理中的官僚動作,降低協調成本,讓員工更自主,並重新定義管理者的價值。



內容:

未來,公司最先被 AI 消滅的,可能不是員工,而是管理裡大量的官僚動作。Replit 創始人兼 CEO Amjad Masad 最近在 A16Z 的訪談中,提出了一個大膽的判斷:過去矽谷曾嘗試重新發明公司,透過移除中層管理、組織扁平化與員工自組織來改變工作方式,但許多實驗最後都失敗了。問題可能不只是文化,而是當時缺少一層關鍵技術——管理層級可以被拿掉,協調成本卻不會憑空消失。


沒有中層,不等於沒有管理。如果協調工作沒有被系統承接,管理只是從管理者身上,重新轉嫁給每一位員工。如今,AI Agent 開始有機會補上這一層,成為組織裡的膠水,讓大量協調、流程推進、跟進與檢查,逐漸轉為後臺自動執行的工作。Amjad 也正在實驗一種新的工作方式,稱為「Self-Driving Company」,也就是自駕駛公司。


這不是說公司以後不需要人,也不是說管理者都會消失。真正的變化是,過去許多必須靠人完成的管理動作,開始有機會被系統接管。


**第一個變化:AI 先接管管理裡最像機器的部分。**


一家公司為什麼需要這麼多管理動作?因為任務需要分派、資訊需要傳遞、進度需要追蹤、結果需要檢查、異常需要上報,經驗也需要反覆傳授。公司真正昂貴的,有時候不是把事情做完,而是讓一件事情在幾十個人之間正確地流動。


因此,許多管理層級,本質上都在解決兩個問題:資訊怎麼流動,協作怎麼發生。過去這些事情主要依靠人,所以公司越大,會議、彙報與流程越多,中間層也越厚。管理很多時候不只是管人,而是在替組織支付資訊差與協調成本。


Agent 出現後,一種新的可能性開始浮現:任務進來後,系統可以自動分派、補齊相關資訊、跟進進度、驗收結果,再將異常交給人處理。過去靠人記住的狀態,開始由系統記住;過去靠人推動的流程,開始由系統推動。


自動化真正進階的地方,不只是少開幾次會,而是讓許多會議從一開始就沒有必要發生。AI 不一定會先消滅管理,而是先把管理裡最像機器的部分,變成由機器執行。


**第二個變化:組織越自動,人反而可能越自由。**


Amjad 在訪談中提到,很多人並不喜歡被管理。他們真正想要的是:知道最終要完成什麼,然後自己把它完成。


但過去公司很難完全這樣運作。若沒有人追蹤進度、同步資訊,或發現任務卡住,組織就容易失控。因此,許多無管理、自組織的實驗,只是把老闆拿走,卻沒有把管理工作拿走。員工沒有了老闆,卻可能需要參加更多會議、同步更多資訊、維護更多流程,並自行承擔更多協調成本。層級少了,官僚動作反而可能更多。


Agent 的不同之處,在於它有機會把協調成本承接到系統裡。系統知道誰正在做什麼、任務卡在哪裡、什麼時候該提醒,以及哪些情況必須讓人介入。


未來公司可能朝向「可見的管理變少,不可見的系統變多」發展。組織越先進,可能越少依賴「誰記得這件事」,而越多依賴「系統本來就知道這件事」。當協調工作被系統接住,人的自治程度反而可能提高。


**第三個變化:管理者的價值將被重新定義。**


過去,許多管理者把大量時間花在收集與傳遞資訊、分配任務、追蹤進度、開會同步,以及製作狀態彙報。這些工作只要規則足夠清楚,就很適合交給 Agent。


那麼,人應該留下來做什麼?定義目標、設計邊界、判斷例外、處理衝突,決定哪些事情值得做,並在系統失效時承擔責任。當系統開始負責確定性的事情,人就應該把時間留給不確定性的事情。


未來管理者的價值,可能不再主要取決於誰最會催進度,而是誰最會定目標、做判斷與處理例外。


真正的 AI 原生公司,不只是讓員工多用幾個 AI 工具,而是重新設計整套工作流:哪些事情自動發生、哪些資訊自動流動、哪些結果自動檢查、哪些異常必須交給人,以及哪些判斷不能被外包。


以前,公司主要靠崗位連接崗位;未來,公司可能越來越多地靠系統連接任務、資訊與決策。到了這一步,AI 才不再只是提高個人效率,而是開始改寫公司的作業系統。


Self-Driving Company 最值得關注的,不是公司會不會自己運轉,而是它迫使我們重新思考:一家公司的多少執行成本,其實只是因為過去只有人能負責記、傳、催、查?如果這些動作開始被系統接管,公司的組織邊界也會隨之改變。


未來判斷一家企業是否為 AI 原生,可能不能只看它用了多少 Agent,而應該看有多少組織動作,已經從「靠人記、靠人傳、靠人催」,轉變為「系統知道、系統推進、系統反饋」。


AI 原生的真正分水嶺,不是有沒有 AI,而是組織裡還有多少事情,必須靠某個人記得、盯著、催著,才能繼續往前走。管理的最高形態,可能會從盯住每一個人,轉變為設計一個不必一直盯著,也能持續運轉的系統。


AI 真正重寫的,可能不只是工作,而是公司為什麼需要被這樣管理。


——Chuck,講看懂 AI。

[AI 衝擊] 理髮師也能用 AI 做系統:程式設計的門檻降低,專業價值如何改變?

 [AI 衝擊] 理髮師也能用 AI 做系統:程式設計的門檻降低,專業價值如何改變?

摘要 : AI 讓人人都能開發軟體,但穩定、安全與事故成本,仍是專業價值的關鍵。



內容:

一位在可口可樂工作的員工感嘆:「我的理髮師都在朋友圈裡手搓系統了,程式設計師這一行是不是要完蛋了?」評論區有人開玩笑,說後端工程師正在建議朋友去學理髮,乾脆來個「換家戰術」:理髮師轉行寫程式,程式設計師轉行剪頭髮,互相搶飯碗。


這個笑話背後,確實有正在發生的變化。AI 工具普及之後,原本需要專業技能才能完成的工作,門檻正快速降低。理髮師自己做出預約、會員卡或庫存管理系統,已經不再只是段子。不過,「做得出來」與「能安全、穩定地運作」,仍然是兩回事。


從氛圍程式設計,到人人都能做軟體


2025 年 2 月,AI 研究者 Andrej Karpathy 提出了「氛圍程式設計」(Vibe Coding)這個詞。這種開發方式大致是:不仔細閱讀程式碼,而是告訴 AI 想做什麼,讓它生成程式,自己測試結果;不滿意就繼續描述問題,再讓 AI 修改。


他當時描述的是週末製作小玩意的方式,但這個概念很快被理解成:「不會寫程式的人,也能做出軟體。」


一些面向非程式設計師的 AI 建站平台,使用者已達數百萬,其中一家成立不到一年,年化收入便超過一億美元。這些使用者不只是工程師,也包括小老闆、創業者,以及想解決店務問題的理髮師。


即使已有十幾、二十年的程式開發資歷,現在利用業餘時間做個人產品,也經常直接讓 AI 開發,再手動驗證成果,不逐行閱讀程式碼。過去受限於時間、可能一直做不出來的東西,如今透過與 AI 對話,就能快速完成,而且實用性與可靠性正在提升。


但副業變容易,不代表副業更容易成功。當更多人都能做產品,市場上的產品就會變多,競爭也會更激烈。開發成本下降,並不等於獲利機率上升。


最先受到衝擊的,是簡單系統與小型外包


理髮師需要的系統,多半是預約、會員與庫存管理。以前這些需求可能得找外包,花幾千到幾萬元完成,現在店主可以自己借助 AI 製作。


因此,最先受到衝擊的,未必是大型科技公司的工程師,而是小型外包公司、接零散案件的開發者,以及週末接私活的程式設計師。他們原本的客戶,開始自己動手做產品。


這類門檻降低的衝擊,往往先從最簡單、最便宜的工作開始,再逐步往上延伸:從小型工具,到更複雜的軟體,甚至企業級系統。最後會停在哪裡,取決於 AI 的能力,以及企業如何調整組織與流程,目前還不能下定論。


能上線,不代表沒有風險


幾個 AI 開發與操作事故,但相關名稱、數字及事故歸因仍需另行查證。


其中一個案例,是創辦人宣稱完全由 AI 生成、沒有人工撰寫或審查程式碼的 AI 社交平台。據原文描述,上線三天後,安全公司便發現其生產資料庫暴露在網際網路上,涉及約 150 萬組 API 金鑰、3.5 萬個電子郵件地址與平台私訊。取得金鑰的人,還可能冒充平台帳號。


另一個案例是一家線上學習平台。創辦人使用 AI 工具管理伺服器與基礎設施,卻沒有依建議將兩個專案分開部署。後來更換電腦時,又缺少記錄基礎設施狀態的檔案,導致 AI 在不完整的資訊下執行銷毀操作,刪除了生產資料庫、相關網路資源與自動備份,讓兩年半累積的學生作業、專案與排行榜資料消失。


亞馬遜 AI 工具操作造成服務中斷的報導。這些案例想說明的是:即使產品很快就能運作,若缺少權限管理、環境隔離、備份與操作確認,事故仍可能造成巨大損失。


沒有技術背景的人,可能不知道為什麼要區分測試與正式環境,也不知道該檢查哪些漏洞。AI 可以協助檢查與修正,但前提是使用者知道要問什麼,而且不能把「問過 AI」視為安全保證。


產生程式碼的速度,可能超過審查速度


對大型企業產品而言,目前仍需要人工審查。系統越複雜,越可能因為一個細節,造成完全不同的結果。AI 能加快開發與理解程式的速度,但不代表每一項輸出都能直接投入生產環境。


一項漏洞追蹤資料,指出被歸因於 AI 生成程式碼的正式漏洞,從某年一月的 6 個,增加到三月的 35 個;另引用一份產業報告,稱 93% 的受訪公司在使用 AI 撰寫基礎設施程式碼時曾出現事故,約三分之一直接使用未經人工審查的 AI 程式碼,43% 只做最低限度審查。這些統計仍須確認來源、樣本與定義,但反映出值得注意的問題:工具產出越快,審查與風險管理越不能落後。


作為資深工程師也感受到技能差距正在被壓縮。以前需要多年經驗才能解決的問題,如今新人向 AI 提問,也可能很快找到答案。這讓我開始思考:當解題與實作能力越來越容易取得,資深工作者的價值究竟還剩在哪裡?


工作被改變,不必然等於立即失業


AI 持續接手既有工作內容的趨勢很明確,但這是否必然造成大規模職業危機,還不能直接畫上等號。某些職業可能轉換成新的形式,只是目前還不知道新角色會是什麼。


企業是否裁員,也不只取決於效率提升。公司能不能賺錢、是否具有市場優勢,以及管理者如何分配利潤,都會影響用人決策。有些公司即使員工工作節奏較慢,仍然能維持獲利與職缺;有些公司即使員工非常忙碌,依然低薪或裁員。


因此,不能只憑「AI 能做某件事」,就斷言所有從事這項工作的人都會立刻失業;但也不能忽視工作內容與技能價值已經受到衝擊。


開發變便宜,事故並沒有變便宜


理髮師做出系統後,可能一直正常運作,直到某一天客戶電話與消費紀錄外洩,或一次更新清空所有預約資料。這時才第一次接觸權限、備份與回滾,往往已經付出代價。


企業通常有法務、保險、事故處理流程與資源,可以承擔一定程度的損失。小店主則可能直接面對客戶流失、賠償與信任受損,未必有能力承受。


門檻降低,讓「做出東西」變便宜了,卻沒有讓「出事故」變便宜。


資深工程師仍有價值的重要原因。他們不只是把功能寫出來,更能提前辨識風險,避免事故。大型產品可能服務數千萬甚至上億人,一個小錯誤就可能造成大規模影響,因此企業願意花更多成本,換取經驗、穩定性與風險控制。


不過,這項優勢也不是永遠不變。隨著 AI 進步,部分風險辨識與預防工作也會被自動化,專業角色仍須持續調整。


「換家戰術」背後,是不同的競爭條件


理髮師轉向軟體開發,走進的是一個門檻正在降低的市場。他今天一個下午做出的產品,隔壁店明天也可能做出來。人人都能進場,產品自然更難賣出高價。


程式設計師轉向理髮,則走向需要實體在場、動手操作、直接服務人的工作。AI 可以設計髮型,但要安全地替真人剪髮,仍涉及機械操作、現場判斷與信任,因此短期內面臨的替代條件不同。


當然,這也不是永久保障。自動理髮設備與機器人仍可能繼續發展,只是涉及人體安全與實際服務,不能單憑展示影片就認定已能成熟取代理髮師。


程式設計師接下來可以往哪裡走?


這個問題沒有終極答案。相對而言,大型企業裡對安全、穩定與可靠性要求高的產品,可能較晚才能完全交由 AI 自動處理。但「較晚被取代」,不代表永遠不會改變。


另一條方向,是加入 AI 的應用與普及工作,協助企業導入工具、整合流程、管理風險。不過,這些工作同樣可能逐步被自動化。至於大模型研究與開發,則需要不同於一般軟體工程的研究能力,不能視為所有工程師都能直接轉入的選項。


真正值得思考的是:當實作不再稀缺,自己還能提供什麼價值?是理解需求、做出產品判斷、保障系統穩定,還是找到使用者並建立信任?


從「會做」,走向「做得有用、做得可靠」


三十年前,打字員是一份工作;現在人人都會打字,單純打字不再是稀缺技能,但創作與寫作並沒有因此消失。


軟體開發可能正在經歷類似變化。會做軟體的人越來越多,單靠「我能把功能做出來」維生的空間,可能受到壓縮。但能做出真正有用、有人使用、能穩定運作的產品,仍然具有價值。


就像會打字不代表能寫出受歡迎的小說,能用 AI 做出軟體,也不代表產品有需求、有人願意付錢。


理髮師也能做系統,並不等於所有程式設計師明天就會失業;它更直接地提醒我們:單純實作的門檻正在降低,而需求判斷、安全、穩定、使用者信任與商業成果,正變得更加重要。


人人都能參與,只會讓競爭更加激烈。能做出來,不代表能賺到錢;真正的挑戰,是讓做出來的東西有用、可靠,並且值得被使用。

2026年10月1日 星期四

[AI 分享] OpenAI Dev Day 2026:從聊天產品走向智慧體工作與分發平臺

 [AI 分享] OpenAI Dev Day 2026:從聊天產品走向智慧體工作與分發平臺

摘要 : 從常駐智慧體到雲端開發工具,整理OpenAI新布局、開放狀態與工程師的實作重點。



內容:


一、這場發表會的主角,不再只是模型


OpenAI於2026年9月29日在舊金山Fort Mason舉辦Dev Day,由Sam Altman主講。53分鐘的主題演講公布超過20項更新,涵蓋ChatGPT、模型、Codex、協作工具與開發者平臺,官方將其定位為迄今規模最大的一屆。


最值得注意的是,最前面的介紹與最長的演示時間,並未留給新模型,而是交給名為DOTS的常駐智慧體。這透露出一個方向:OpenAI正在把ChatGPT從聊天產品,推向能持續執行任務、支援團隊協作的工作平臺。


會上另公布ChatGPT每週活躍使用者達12億。這個規模,也是後續第三方登入、外掛與應用分發布局的重要基礎。


二、DOTS:全天候工作的數位員工


DOTS可以理解為一名常駐的數位員工。原文指出,它由GPT-6 Astra驅動,擁有雲端電腦與瀏覽器,並透過外掛生態連接四千多個應用。


使用者可以交付一個目標,例如追蹤新進來的錯誤報告、重現問題、修復程式、執行測試並提交PR。即使使用者關上電腦,任務仍會在背景持續推進。


溝通入口不只在ChatGPT,也包含Slack與Teams,後續還規劃支援簡訊及電話。權限方面,原文描述其預設採取唯讀操作,敏感操作需經人工審批。


目前開放對象包括Pro與Business Premium,企業使用則需由管理員啟用。原文亦以DOTT稱呼個別智慧體,並指出第一個DOTT包含於方案中,對話不占用量。


對工程師而言,真正的問題不是它能否回答程式問題,而是能否放心把完整修復流程交給它持續執行。


三、Space:讓人與智慧體共享工作脈絡


如果DOTS負責工作,Space就是工作的場所。這個共享工作區讓同事及各自的智慧體,圍繞共同目標與歷史紀錄協作。


其中的Pages支援人與智慧體共同編輯,也能把對話整理成頁面。協作式幻燈片則預計在數週內推出。Slack與Teams中的多人對話,不要求所有參與者都具備訂閱。


Mac端另新增會議外掛,可將會議紀要與待辦事項存入Space。原文指出,官方說明原始音訊使用後即刪除,無法回放。


這些功能對程式設計師未必都是最直接的需求,卻反映出OpenAI的產品判斷:AI產出不應停留在對話框,而應進入可維護、可重用的文件與工作成果。


四、模型更新:智慧、成本與速度分開選擇


GPT-6.1 SOL 定位為「接近Astra的智慧,約五分之一的價格」。API價格為每百萬token輸入2美元、輸出10美元,與上一代持平;快取輸入價格則由0.2美元降至0.1美元。


對智慧體應用而言,系統提示詞、程式碼倉庫上下文與工具定義,往往包含大量重複前綴。如果能穩定命中快取,就有機會明顯降低成本。


其上下文視窗為約105萬token,最大輸出128K。原文指出,發布當天已進入API、ChatGPT Work與Codex,但一般聊天尚未提供。


官方評測,SOL在OSWorld 2.0最高推理設定下,與Astra僅差約兩個百分點,成本約為七分之一;但最困難的科學任務仍由Astra領先。這些比較涉及不同口徑,不宜視為所有任務都具備相同差距。


UltraFast則是另一個付費維度。Astra開啟後,在Codex中的輸出速度最高可達八倍、每秒約300個token;API中最高約六倍,價格也提高至六倍,每百萬token輸入60美元、輸出300美元。


需要注意,輸出速度提高八倍,不代表整個任務會快八倍。工具執行、網路等待與其他流程耗時,並不會同步縮短。


訂閱方案也有所調整,包括新增500美元Pro方案、重新開放200美元Pro方案,以及新舊使用者額度與額外credits安排。


整體定價方向很明確:低成本與高速度,開始被分開販售。


五、Decisions API:把判斷獨立成API能力


Decisions API是工程價值容易被低估的一項更新。它基於小模型LUNA,接收上下文與一組預定義選項,直接返回選擇,適合分類、路由及決定智慧體下一步行動。


原文引用的官方比較為約150毫秒,相較一般LUNA呼叫的1.6秒,速度約快十倍。


過去常見做法,是讓大模型生成JSON,再由程式解析結果。對一個簡單判斷而言,這可能付出不必要的生成延遲與成本。Decisions API則把「做選擇」獨立成可直接使用的API原語。


客服分流、審批路由及智慧體狀態機,是值得優先測試的場景。目前仍屬限量預覽,原文指出官方預計在數日內擴大開放。


六、Codex:競爭從程式生成走向工程基礎設施


Codex是此次更新最密集的產品線,其中最重要的是Codex Cloud。開發環境設定一次後,即可保存為雲端環境,讓任務在託管電腦中持續執行,不受本機關閉影響。


現場示範以一句指令要求將整個後端改寫為Rust,再把任務交給雲端執行。重點不只是生成程式碼,而是讓開發工作能在獨立環境中持續推進。


其他更新包括雙向語音、智慧體檢視,以及桌面端程式碼審查。相關審查可在雲端自動執行,並與GitHub PR、GitLab MR結合。


Codex Security Cloud則持續掃描程式碼倉庫、尋找漏洞,並準備修復方案。此外,原文也提到Linux版、單專案跨多檔案操作與手機端支援。


這些更新支持一個判斷:AI程式設計工具的競爭,正從「誰更會寫程式」延伸到「誰能提供完整的工程執行與維護環境」。


七、Agent API與開源框架:把執行能力交給開發者


Agent API進入公測,將驅動Codex的執行框架以託管方式提供。開發者主要負責定義任務、串接工具與資料,底層環境則由OpenAI管理。


多智慧體協作、工具搜尋與上下文壓縮等能力內建其中,並加入電腦操作,讓智慧體直接開啟瀏覽器、操作軟體介面、執行流程與測試。


與AWS合作的Bedrock Managed Agents,以及企業端的Private Intelligence,涉及零資料保留與隱私、安全處理,相關隱私推理能力預計於秋季提供預覽。


對工程師而言,Codex Harness開源尤其值得注意。原文指出,Codex、ChatGPT Work與DOTS共用同一套智慧體框架,開發者可直接閱讀實作,理解其執行機制。


八、真正的主線:ChatGPT成為工作與分發平臺


把各項更新放在一起看,主線並非單純增加功能,而是讓ChatGPT成為第三方產品入口與工作執行層。


Sign in with ChatGPT讓使用者帶著訂閱額度登入第三方產品。原文提到首批16家,包括Notion、VS Code與Devin,且聊天紀錄與記憶不共享。


外掛擴充讓開發者能在ChatGPT內建立側邊欄、互動面板與檔案檢視器,相當於把應用嵌入對話介面。MCP Events則讓外部事件觸發ChatGPT中的自動化,不必等待使用者主動開啟對話。


企業Marketplace首批合作對象據稱有32家,包括Figma、Adobe與Salesforce。若以原文所述12億週活躍使用者為基礎,這套生態的核心價值就在於分發規模。


九、需要保留的判斷:官方宣告不等於外部驗證


首先,效能數據主要來自官方評測。「SOL接近Astra」不代表第三方榜單或所有任務都得出相同結論。


Artificial Analysis智慧指數,稱SOL為52分、另一款名為「Cloud Opus 5.5」的模型為58分,並主張SOL的主要優勢在成本。相關名稱與數據仍需另行核對。


其次,官方所稱內部AI研究實習生已上崗、模型能獨立完成部分研究任務,原文指出尚缺論文及外部評測,因此應先視為公司宣告。


最後,宣布不等於立即可用。SOL的UltraFast版本、協作幻燈片與隱私推理仍在規劃或預覽階段,DOTS也有地區限制。


直播中的語音與3D演示曾出現問題,提醒讀者:流暢的產品願景與實際使用的可靠性,仍需要分開評估。


十、工程師接下來可以做的三件事


第一,將部分批次處理或智慧體任務切換至SOL,用真實任務比較總成本、品質與完成時間。同時整理穩定的長前綴,讓提示詞、工具定義與倉庫上下文更容易命中快取。


第二,如果系統包含分類或路由邏輯,待Decisions API開放後進行對照測試,評估是否能替換部分大模型呼叫,降低延遲與費用。


第三,閱讀Codex Harness原始碼,了解智慧體如何管理工具、上下文與執行環境。比起只看演示,這更有助於判斷哪些能力能真正融入現有工程流程。

2026年9月30日 星期三

[AI 觀點] 2026 年別只學 AI 工具,更要學會管理 AI

[AI 觀點] 2026 年別只學 AI 工具,更要學會管理 AI

摘要:與其追逐新工具,不如練習定義問題、拆解任務與給予回饋,讓 AI 改善真實工作流程。



內容:


2026 年,AI 工具愈來愈容易使用。與其不斷追逐新模型、Prompt 教程或 Agent 框架,擔心自己學得不夠快,不如把注意力放在如何讓 AI 幫你完成工作。這不是說不用學技術,而是不要把「學 AI」變成新的焦慮來源。


第一,學會定義問題。只說「幫我寫一份設計文件」,AI 很可能給出制式模板。如果能說清楚系統要服務多少使用者、支援哪些通知方式,以及需要考慮重試、限流、去重和監控,再請 AI 提出架構與潛在故障點,結果才更可能推進工作。


第二,學會拆解任務。不要把「完成一個功能」或「修好這個錯誤」整包丟給 AI。可以先請它理解現有程式碼、提出除錯計畫,再撰寫測試、檢查邊界情況。AI 的價值不在於一次給出完美答案,而在於能依照你的工作流程反覆迭代。


第三,學會給具體回饋。當 AI 的第一版不理想,指出問題比直接換工具更有用:例如沒有考慮併發、漏掉空值處理、測試覆蓋不足,或設計不利於日後擴充。這就像帶領團隊成員;你愈能說明判斷依據,AI 愈能照你的方向協助。


真正值得問的,不只是該用哪個工具,而是工作中哪些事可以交給 AI,哪些判斷必須由自己負責。若不知道從哪裡開始,就挑一件最重複、最耗時的事,例如除錯、製作檢查清單或整理會議紀錄:提供背景與目標,取得第一版,再持續回饋和檢查結果。重點不是看過多少 AI 內容,而是有沒有用 AI 改善一個真實流程,把時間留給更高價值的工作。

[AI 觀點] AI 時代,學生該如何選擇發展方向?

 [AI 觀點] AI 時代,學生該如何選擇發展方向?

摘要:大模型研究仍有空間;AI 基礎設施重視設計判斷,應用前景廣闊但難以預測。



內容:

對於覺得工作難找的本科生與研究生,該投入大模型研究、AI 基礎設施,還是應用開發?這三個方向各有機會,也面臨不同的不確定性。


大模型依然重要,發展空間也很大。AI 遠不是一個已經解決的問題;目前的大模型路線很有希望,但未來也可能出現新的路徑。對有志攻讀博士、從事研究的人來說,與其重複大家已經做了很多的模型,不如探索新的模型方向。


AI 基礎設施(Infra)方面,可以考慮進入工業界,但不能只把自己定位成寫程式的人,因為不少程式工作可能由 AI 完成。更重要的是具備設計品味與判斷力:能將 AI 產生的程式碼組織成良好的系統,理解什麼設計更持久、易維護且靈活。AI 能提供建議,但如果自己無法判斷好壞,就難以維護完全依賴 AI 設計的成果。


至於 AI 應用,前景廣闊,許多傳統商業模式都可能被改變;但它也最難預測。今天做出的應用,可能很快就被大型模型公司推出的新能力取代,甚至變成基礎平台本身就具備的功能。