2026年10月1日 星期四

[AI 分享] OpenAI Dev Day 2026:從聊天產品走向智慧體工作與分發平臺

 [AI 分享] OpenAI Dev Day 2026:從聊天產品走向智慧體工作與分發平臺

摘要 : 從常駐智慧體到雲端開發工具,整理OpenAI新布局、開放狀態與工程師的實作重點。



內容:


一、這場發表會的主角,不再只是模型


OpenAI於2026年9月29日在舊金山Fort Mason舉辦Dev Day,由Sam Altman主講。53分鐘的主題演講公布超過20項更新,涵蓋ChatGPT、模型、Codex、協作工具與開發者平臺,官方將其定位為迄今規模最大的一屆。


最值得注意的是,最前面的介紹與最長的演示時間,並未留給新模型,而是交給名為DOTS的常駐智慧體。這透露出一個方向:OpenAI正在把ChatGPT從聊天產品,推向能持續執行任務、支援團隊協作的工作平臺。


會上另公布ChatGPT每週活躍使用者達12億。這個規模,也是後續第三方登入、外掛與應用分發布局的重要基礎。


二、DOTS:全天候工作的數位員工


DOTS可以理解為一名常駐的數位員工。原文指出,它由GPT-6 Astra驅動,擁有雲端電腦與瀏覽器,並透過外掛生態連接四千多個應用。


使用者可以交付一個目標,例如追蹤新進來的錯誤報告、重現問題、修復程式、執行測試並提交PR。即使使用者關上電腦,任務仍會在背景持續推進。


溝通入口不只在ChatGPT,也包含Slack與Teams,後續還規劃支援簡訊及電話。權限方面,原文描述其預設採取唯讀操作,敏感操作需經人工審批。


目前開放對象包括Pro與Business Premium,企業使用則需由管理員啟用。原文亦以DOTT稱呼個別智慧體,並指出第一個DOTT包含於方案中,對話不占用量。


對工程師而言,真正的問題不是它能否回答程式問題,而是能否放心把完整修復流程交給它持續執行。


三、Space:讓人與智慧體共享工作脈絡


如果DOTS負責工作,Space就是工作的場所。這個共享工作區讓同事及各自的智慧體,圍繞共同目標與歷史紀錄協作。


其中的Pages支援人與智慧體共同編輯,也能把對話整理成頁面。協作式幻燈片則預計在數週內推出。Slack與Teams中的多人對話,不要求所有參與者都具備訂閱。


Mac端另新增會議外掛,可將會議紀要與待辦事項存入Space。原文指出,官方說明原始音訊使用後即刪除,無法回放。


這些功能對程式設計師未必都是最直接的需求,卻反映出OpenAI的產品判斷:AI產出不應停留在對話框,而應進入可維護、可重用的文件與工作成果。


四、模型更新:智慧、成本與速度分開選擇


GPT-6.1 SOL 定位為「接近Astra的智慧,約五分之一的價格」。API價格為每百萬token輸入2美元、輸出10美元,與上一代持平;快取輸入價格則由0.2美元降至0.1美元。


對智慧體應用而言,系統提示詞、程式碼倉庫上下文與工具定義,往往包含大量重複前綴。如果能穩定命中快取,就有機會明顯降低成本。


其上下文視窗為約105萬token,最大輸出128K。原文指出,發布當天已進入API、ChatGPT Work與Codex,但一般聊天尚未提供。


官方評測,SOL在OSWorld 2.0最高推理設定下,與Astra僅差約兩個百分點,成本約為七分之一;但最困難的科學任務仍由Astra領先。這些比較涉及不同口徑,不宜視為所有任務都具備相同差距。


UltraFast則是另一個付費維度。Astra開啟後,在Codex中的輸出速度最高可達八倍、每秒約300個token;API中最高約六倍,價格也提高至六倍,每百萬token輸入60美元、輸出300美元。


需要注意,輸出速度提高八倍,不代表整個任務會快八倍。工具執行、網路等待與其他流程耗時,並不會同步縮短。


訂閱方案也有所調整,包括新增500美元Pro方案、重新開放200美元Pro方案,以及新舊使用者額度與額外credits安排。


整體定價方向很明確:低成本與高速度,開始被分開販售。


五、Decisions API:把判斷獨立成API能力


Decisions API是工程價值容易被低估的一項更新。它基於小模型LUNA,接收上下文與一組預定義選項,直接返回選擇,適合分類、路由及決定智慧體下一步行動。


原文引用的官方比較為約150毫秒,相較一般LUNA呼叫的1.6秒,速度約快十倍。


過去常見做法,是讓大模型生成JSON,再由程式解析結果。對一個簡單判斷而言,這可能付出不必要的生成延遲與成本。Decisions API則把「做選擇」獨立成可直接使用的API原語。


客服分流、審批路由及智慧體狀態機,是值得優先測試的場景。目前仍屬限量預覽,原文指出官方預計在數日內擴大開放。


六、Codex:競爭從程式生成走向工程基礎設施


Codex是此次更新最密集的產品線,其中最重要的是Codex Cloud。開發環境設定一次後,即可保存為雲端環境,讓任務在託管電腦中持續執行,不受本機關閉影響。


現場示範以一句指令要求將整個後端改寫為Rust,再把任務交給雲端執行。重點不只是生成程式碼,而是讓開發工作能在獨立環境中持續推進。


其他更新包括雙向語音、智慧體檢視,以及桌面端程式碼審查。相關審查可在雲端自動執行,並與GitHub PR、GitLab MR結合。


Codex Security Cloud則持續掃描程式碼倉庫、尋找漏洞,並準備修復方案。此外,原文也提到Linux版、單專案跨多檔案操作與手機端支援。


這些更新支持一個判斷:AI程式設計工具的競爭,正從「誰更會寫程式」延伸到「誰能提供完整的工程執行與維護環境」。


七、Agent API與開源框架:把執行能力交給開發者


Agent API進入公測,將驅動Codex的執行框架以託管方式提供。開發者主要負責定義任務、串接工具與資料,底層環境則由OpenAI管理。


多智慧體協作、工具搜尋與上下文壓縮等能力內建其中,並加入電腦操作,讓智慧體直接開啟瀏覽器、操作軟體介面、執行流程與測試。


與AWS合作的Bedrock Managed Agents,以及企業端的Private Intelligence,涉及零資料保留與隱私、安全處理,相關隱私推理能力預計於秋季提供預覽。


對工程師而言,Codex Harness開源尤其值得注意。原文指出,Codex、ChatGPT Work與DOTS共用同一套智慧體框架,開發者可直接閱讀實作,理解其執行機制。


八、真正的主線:ChatGPT成為工作與分發平臺


把各項更新放在一起看,主線並非單純增加功能,而是讓ChatGPT成為第三方產品入口與工作執行層。


Sign in with ChatGPT讓使用者帶著訂閱額度登入第三方產品。原文提到首批16家,包括Notion、VS Code與Devin,且聊天紀錄與記憶不共享。


外掛擴充讓開發者能在ChatGPT內建立側邊欄、互動面板與檔案檢視器,相當於把應用嵌入對話介面。MCP Events則讓外部事件觸發ChatGPT中的自動化,不必等待使用者主動開啟對話。


企業Marketplace首批合作對象據稱有32家,包括Figma、Adobe與Salesforce。若以原文所述12億週活躍使用者為基礎,這套生態的核心價值就在於分發規模。


九、需要保留的判斷:官方宣告不等於外部驗證


首先,效能數據主要來自官方評測。「SOL接近Astra」不代表第三方榜單或所有任務都得出相同結論。


Artificial Analysis智慧指數,稱SOL為52分、另一款名為「Cloud Opus 5.5」的模型為58分,並主張SOL的主要優勢在成本。相關名稱與數據仍需另行核對。


其次,官方所稱內部AI研究實習生已上崗、模型能獨立完成部分研究任務,原文指出尚缺論文及外部評測,因此應先視為公司宣告。


最後,宣布不等於立即可用。SOL的UltraFast版本、協作幻燈片與隱私推理仍在規劃或預覽階段,DOTS也有地區限制。


直播中的語音與3D演示曾出現問題,提醒讀者:流暢的產品願景與實際使用的可靠性,仍需要分開評估。


十、工程師接下來可以做的三件事


第一,將部分批次處理或智慧體任務切換至SOL,用真實任務比較總成本、品質與完成時間。同時整理穩定的長前綴,讓提示詞、工具定義與倉庫上下文更容易命中快取。


第二,如果系統包含分類或路由邏輯,待Decisions API開放後進行對照測試,評估是否能替換部分大模型呼叫,降低延遲與費用。


第三,閱讀Codex Harness原始碼,了解智慧體如何管理工具、上下文與執行環境。比起只看演示,這更有助於判斷哪些能力能真正融入現有工程流程。

2026年9月30日 星期三

[AI 觀點] 2026 年別只學 AI 工具,更要學會管理 AI

[AI 觀點] 2026 年別只學 AI 工具,更要學會管理 AI

摘要:與其追逐新工具,不如練習定義問題、拆解任務與給予回饋,讓 AI 改善真實工作流程。



內容:


2026 年,AI 工具愈來愈容易使用。與其不斷追逐新模型、Prompt 教程或 Agent 框架,擔心自己學得不夠快,不如把注意力放在如何讓 AI 幫你完成工作。這不是說不用學技術,而是不要把「學 AI」變成新的焦慮來源。


第一,學會定義問題。只說「幫我寫一份設計文件」,AI 很可能給出制式模板。如果能說清楚系統要服務多少使用者、支援哪些通知方式,以及需要考慮重試、限流、去重和監控,再請 AI 提出架構與潛在故障點,結果才更可能推進工作。


第二,學會拆解任務。不要把「完成一個功能」或「修好這個錯誤」整包丟給 AI。可以先請它理解現有程式碼、提出除錯計畫,再撰寫測試、檢查邊界情況。AI 的價值不在於一次給出完美答案,而在於能依照你的工作流程反覆迭代。


第三,學會給具體回饋。當 AI 的第一版不理想,指出問題比直接換工具更有用:例如沒有考慮併發、漏掉空值處理、測試覆蓋不足,或設計不利於日後擴充。這就像帶領團隊成員;你愈能說明判斷依據,AI 愈能照你的方向協助。


真正值得問的,不只是該用哪個工具,而是工作中哪些事可以交給 AI,哪些判斷必須由自己負責。若不知道從哪裡開始,就挑一件最重複、最耗時的事,例如除錯、製作檢查清單或整理會議紀錄:提供背景與目標,取得第一版,再持續回饋和檢查結果。重點不是看過多少 AI 內容,而是有沒有用 AI 改善一個真實流程,把時間留給更高價值的工作。

[AI 觀點] AI 時代,學生該如何選擇發展方向?

 [AI 觀點] AI 時代,學生該如何選擇發展方向?

摘要:大模型研究仍有空間;AI 基礎設施重視設計判斷,應用前景廣闊但難以預測。



內容:

對於覺得工作難找的本科生與研究生,該投入大模型研究、AI 基礎設施,還是應用開發?這三個方向各有機會,也面臨不同的不確定性。


大模型依然重要,發展空間也很大。AI 遠不是一個已經解決的問題;目前的大模型路線很有希望,但未來也可能出現新的路徑。對有志攻讀博士、從事研究的人來說,與其重複大家已經做了很多的模型,不如探索新的模型方向。


AI 基礎設施(Infra)方面,可以考慮進入工業界,但不能只把自己定位成寫程式的人,因為不少程式工作可能由 AI 完成。更重要的是具備設計品味與判斷力:能將 AI 產生的程式碼組織成良好的系統,理解什麼設計更持久、易維護且靈活。AI 能提供建議,但如果自己無法判斷好壞,就難以維護完全依賴 AI 設計的成果。


至於 AI 應用,前景廣闊,許多傳統商業模式都可能被改變;但它也最難預測。今天做出的應用,可能很快就被大型模型公司推出的新能力取代,甚至變成基礎平台本身就具備的功能。

2026年9月28日 星期一

[AI 爆料] OpenAI正開發新模型Bell

 [AI 爆料] OpenAI正開發新模型Bell

摘要:傳聞稱OpenAI正開發新模型Bell,並以AI破解數學難題;模型能力、證明與研究歸屬仍待查證。



內容:


近期爆料稱,OpenAI正在開發代號「Bell」的新一代基礎模型,可能成為Astral之後產品的基礎,甚至被部分媒體稱為「ChatGPT-7」。最早的說法之一來自8月25日的網路帳號NFTChain,聲稱Bell已完成一輪預訓練,參數量超過10兆。這些規格與產品定位目前仍屬傳聞,不能視為OpenAI已確認的資訊。


依照爆料,Bell承接代號「DOG」的基座模型,並採用「雙速學習」架構:一方面從程式測試、數學證明及工具使用中即時取得經驗,另一方面將經過驗證的成果納入後續訓練。爆料者據此推測,它可能持續改善自身的學習方式,並將能力轉移到較輕量的模型。另有說法稱,Bell在程式撰寫、推理與長時間自主執行任務方面超越Astral,還能協調大量並行運作的AI代理;這些能力尚缺乏可獨立核實的證據。


相關傳聞也把Bell與OpenAI的算力、自研晶片「Jalapeno」,以及所謂AI自主改進的內部實驗連在一起,並推測其將成為OpenAI與Anthropic競爭的關鍵。不過,原文列舉的模型成績、效率提升幅度、產品時程及內部動向,多來自爆料或轉述,仍需審慎看待。


另一項爭議圍繞納維-斯托克斯方程。原文稱,OpenAI宣布由內部模型驅動的大量協同AI代理,在約88小時內找到這項千禧年難題的求解方案;部分報導進一步將成果歸於Bell。即使確有方案,其證明是否成立、是否構成該難題的完整解答,仍須經過學術界審查,不能逕稱難題已被破解。


原文並引述紐約大學數學教授特里斯坦·巴克馬斯特的疑慮:他與研究搭檔曾私下研究相關問題,認為OpenAI所述的求解路徑與兩人的工作相近,因而質疑研究資料是否曾被模型使用。他同時表示,尚未看到完整證明,也無法證實資料遭挪用。原始內容在提及OpenAI回應、稱專案於9月1日開始之處中斷,因此無法確認後續說明。

[AI 解析] 微軟新版 Copilot:模型之外,誰掌握企業 AI 入口?

 [AI 解析] 微軟新版 Copilot:模型之外,誰掌握企業 AI 入口?

摘要:微軟讓 Copilot 自動選擇模型,並以代理、權限與成本治理爭奪企業 AI 工作入口。



內容:


2026 年 9 月 25 日,微軟推出新版 Copilot,加入 Home、Code 和 AutoPilot 三個入口。Home 整合聊天、程式工作與 Office 應用;Code 讓一般員工也能建立工具;AutoPilot 則是可在雲端持續執行任務的代理,即使使用者關閉電腦,工作仍能繼續。


這次更新的核心,不只是增加功能,而是改變模型在產品中的位置。Copilot 的 Auto 路由系統會依任務的準確率需求、速度與成本,自動選擇合適模型;簡單摘要不必動用昂貴的前沿模型,複雜任務則可升級,或交由不同模型與子代理分工。使用者面對的是完成工作的 Copilot,不一定需要親自挑選模型。


對模型公司而言,這代表競爭可能從吸引使用者選擇品牌,轉向爭取路由系統分配的任務。OpenAI、Anthropic、微軟自研模型及開放權重模型都可能進入候選範圍。若多款模型在常見任務上的表現接近,價格、延遲與安全性就會更直接地影響呼叫量。企業也能藉由切換供應商取得更大的議價空間。


但路由權集中在微軟手中,也帶來透明度問題。當微軟自研模型與外部模型同場競爭,企業需要知道系統為何選擇某個模型、花了多少錢,以及任務失敗時發生了什麼事,才能判斷選擇是否真正符合自身利益。開放權重模型則提供另一種選項:企業可依內部資料微調,或部署在可控環境中;不過,進入核心工作流程仍須符合安全與合規要求。


比模型路由更深的一層,是代理對企業系統的操作能力。AutoPilot 若能讀取檔案、開啟應用並更新紀錄,就必須清楚界定它能看什麼、做什麼,以及哪些動作需要人類批准。聊天回答出錯可以重問,代理若改錯訂單或財務資料,後果則可能直接進入業務流程。微軟以 Agent 365 管理代理身分、權限、安全政策及審計紀錄,試圖建立企業採用長期代理所需的控制層。


計費方式也跟著改變。日常問答與初稿適合固定訂閱;需要持續呼叫模型和工具的 Code、AutoPilot,則採按量計費。企業最終要衡量的,不只是每百萬 token 的價格,而是一項任務通過驗收的總成本,包括重試、工具呼叫與人工檢查。微軟因此加入 AI 成本治理,讓管理員追蹤用量並設定預算。


微軟的優勢在於,Copilot 可連接既有的 Office、Teams、GitHub、企業身分與資料系統。當員工逐漸從「逐一操作軟體」轉為「交代目標並監督代理」,任務入口、資料權限和操作紀錄的價值可能上升,傳統軟體介面的價值則可能改變。OpenAI、Anthropic 正向企業產品推進;擁有 Workspace、Cloud 與裝置入口的 Google,也可能在同一領域競爭。


模型戰爭不會因此結束。頂尖模型仍決定能力上限,但企業未必每次都需要最強、最貴的模型。微軟押注的是:讓可替換的模型在 Copilot 裡工作,同時把任務、權限、路由與成本治理留在自己的平台。這套策略能否成立,仍取決於 AutoPilot 能否可靠完成長任務、Auto 能否公平選擇模型,以及 Agent 365 能否守住安全邊界。

2026年9月24日 星期四

[AI 解析] Claude Ops 5.5:降價、效能與遷移風險

 [AI 解析] Claude Ops 5.5:降價、效能與遷移風險

摘要:解析 Claude Ops 5.5 的價格、效能、架構變更與遷移風險。



內容:


Anthropic 最新發布大模型 Claude Ops 5.5,能力、速度與價格均有所調整。社群也開始用它製作各類 3D 遊戲 Demo,包括類似《QQ 飛車》的競速與道具模式、《穿越火線》風格的戰鬥場景,以及常被各大模型拿來比較的 3D 單車遊戲。


然而,這次更新的重點並非單純的能力躍升,而是「單位經濟學」的重新設計:輸入與輸出價格各降低約 20%,快取讀取價格降低 60%;但在獨立測試的最高檔位中,單次任務輸出約 11.9 萬個 token,是上一代的 1.6 倍。換句話說,單價雖然下降,總成本卻未必同步降低。


更值得注意的是,預設 effort 檔位從 High 悄悄下調至 Medium。若團隊沒有修改程式碼,可能在監控數據看似改善的情況下,實際遭遇一次「靜默降級」。因此,真正的問題不是模型是否變便宜,而是使用量增加後,帳單是否反而更高。


一、核心數字與定位


Claude Ops 5.5 於 9 月 22 日發布,用來取代 Ops 5,並成為預設推薦模型。這次更新的主要變化包括:


輸入與輸出單價降低約 20%

快取讀取價格降低 60%

預設 effort 從 High 調整為 Medium

最高檔獨立測試得到 58 分,領先並列第二名約 5 分

最高檔每項任務輸出約 11.9 萬個 token,為上一代的 1.6 倍


因此,它更像是一次成本與效能配置的釋出,而非全面性的能力突破。


模型最大的壁壘在於既有治理資產,但最大的摩擦也出現在同一領域。根據相關評估,它在未經驗證的前沿安全與生物研究任務上,相較上一代有所退步。較適合的定位是:「把它當執行者,而不是顧問。」


二、發布時間線與安全爭議


約在 9 月 12 日,執行長發表應為前沿 AI 發展減速的主張;9 月 15 日前後,相關意見陸續出現;到了 9 月 22 日,新模型正式發布,前後相隔僅約十天。


官方解釋是,減速呼籲所針對的是能夠完全自動化 AI 研究的系統,而 Claude Ops 5.5 只是用更低成本、更快速度,完成上一代已經具備的工作。


另一項值得關注的措施,是讓常駐審計與外部評估人員取得接近員工層級的權限,並可公開揭露風險發現。不過,官方仍保留範圍有限的內容刪改權。判斷其安全承諾時,不能只看對外聲量,也應觀察實際資源與資金流向。


三、價格與 effort 檔位


模型的上下文長度為 100 萬個 token,最大輸出為 12.8 萬個 token,與上一代一致。真正的行為變更主要有兩項:


自適應思考功能預設常開,且無法關閉。

effort 預設值從上一代的 High 改為 Medium。


快取讀取價格則從 0.50 美元降至 0.20 美元,降幅達 60%;相較普通輸入價格,快取讀取約有 95% 的折扣。


不同版本並非完全不同的模型,而較像是共享核心能力、提供不同的存取與運算等級。


各 effort 檔位的測試結果與成本如下:


Max:58 分,5.98 美元

S High:56 分,3.46 美元

High:54 分,1.82 美元

Medium:51 分,1.30 美元

Low:12 分,0.55 美元


預設的 Medium 檔取得 58 分中的 51 分,但成本只有 Max 的約五分之一。這說明所謂的提效降價,部分來自預設檔位下移,而非模型本身在相同運算條件下大幅變便宜。


其中,High 可能是整體性價比較佳的選擇:得分高於另一款旗艦模型的最高檔,成本卻僅約為其 56%。


四、思考機制與 API 變更


這次更新移除了兩條舊有操作路徑:


傳送關閉思考功能的設定

手動指定思考預算參數


目前無論在哪一個 effort 檔位使用這些設定,都可能收到 HTTP 400 錯誤。


官方理由是,模型已在訓練階段內建思考機制。若允許關閉思考,模型就會進入未受完整訓練的運作模式,也可能破壞模型先規劃、再執行的能力。


另一項遷移摩擦是,思考區塊會與產生它的模型及上下文綁定。若修改先前訊息或系統提示,後續思考內容可能失效,並返回 HTTP 400。這會影響既有的對話重播、提示詞編輯及工作流設計。


五、執行腳手架與真實任務


模型若沒有執行腳手架,就只是一個聊天介面。要讓它連接真實任務,系統至少需要處理三個層面:


連線管理與憑據邊界

任務迴圈、狀態管理與工具路由

檔案系統及執行環境隔離


分層設計會直接決定哪些部分需要隨模型遷移。通常會隨模型變動的是思考機制與 effort 設定;不必隨模型更換的部分,則包括動作前分類器、快取、記憶、沙箱與透明回退機制。


評估自動化任務時,不能只看模型執行速度。實際淨收益應將人工完成時間,扣除 AI 執行、人工複核及後續整合處理所需時間;採購端真正支付的,也是整套流程成本,而非只有 token 費用。


六、遷移與成本風險


不同變更的回滾難度並不相同:


更換模型名稱:通常可在數分鐘內回滾

調整 effort 檔位:可能需要數小時重新測試

思考功能常開:涉及 API 與工作流設計,遷移成本較高

修改早期訊息造成思考區塊失效:可能破壞既有對話與代理流程


因此,團隊不應只因單價下降就直接全面切換。較穩妥的做法,是先固定 effort 檔位,以相同任務比較成功率、輸出 token、執行時間、快取命中率及人工複核成本。


Claude Ops 5.5 的核心價值,在於以較低檔位保留大部分能力,但低單價不代表低總成本。若任務輸出量、重試次數或人工複核時間上升,最終帳單仍可能高於上一代。

2026年9月22日 星期二

[AI 衝擊] Jev:專為自動化決策而生的高速 AI 模型

 [AI 衝擊] Jev:專為自動化決策而生的高速 AI 模型

摘要 : Jev 以高速、低成本與低幻覺,重新定義 AI 自動化流程中的決策節點。



內容:


Jev 是近期 AI 圈備受關注的新模型。它不聊天、不寫文章,也不協助撰寫程式,而是專注於一件事:做決定。使用者提供資料、問題與預設選項後,Jev 便會直接回傳各選項的機率。


Jev 於 9 月 15 日發布,由 Typesafe AI 開發。創辦人 Diego Omiada 曾參與打造 ChatGPT,也是 RLHF 訓練方法的共同發明人之一。他在完成 ChatGPT 後,花費兩年研究新的訓練方法,最終推出這款完全不以對話為核心的模型。


Jev 發布後迅速引發關注。創辦人的 X 貼文累積接近 3,000 萬次觀看,當天在工程師論壇 Hacker News 獲得 1,679 分與超過 400 則留言;隔天,Vercel 也將 Jev 上架至自家平台。


根據官方資料,Jev 的速度比主流大型語言模型快 20 至 200 倍,價格便宜 40 至 400 倍,而且輸出完全免費。無論輸出結果長短,都不收取輸出費用,只按照輸入的文字量計費,每 100 萬個 token 收取 0.042 美元。


Jev 的名稱取自經濟學中的「傑文斯悖論」(Jevons paradox),意指當一項資源變得更便宜、效率更高時,人們反而會使用得更多。


傳統大型語言模型如 ChatGPT、Claude,會逐字生成答案,思考與輸出越多,等待時間也越長。Jev 則不自行撰寫答案,只需要三項資訊:一份資料、一個問題,以及事先設定好的選項,便能直接計算每個選項的機率。


例如,將一張發票交給 Jeff,詢問是否有問題,並提供「正常、詐騙、需要人工檢查」三個選項,它可能在不到 0.3 秒內回覆:正常機率為 88%,其餘機率則分配給另外兩個選項。


如果把一般大型語言模型比喻為回答申論題,Jev 就是在作答選擇題。申論題需要逐句生成,速度較慢,也可能離題;選擇題只會從指定答案中選擇,因此速度更快,結果也不會超出預設範圍。這也是 Jev 能降低幻覺的原因,因為它沒有機會編造選項以外的答案。


目前 Jev 主要能處理三種問題:


第一種是是非題。使用者可以詢問某件事是否成立,Jev 會回傳一個介於 0 到 1 的機率,數值越接近 1,代表它越肯定。


例如,詢問某張發票是否為詐騙,Jev 可能回傳 90%。如果再加入常見詐騙特徵作為判斷條件,它便能依據更多資訊調整信心水準。企業也能設定自動化門檻,例如詐騙機率超過九成便自動拒絕退款,其餘案件再轉交真人客服處理,藉此節省大量人工審查時間。


第二種是單選題。使用者可以預先列出多個選項,Jev 會選出最合適的答案,同時提供每個選項的機率。選項最多可設定 255 個,每個選項也能附上簡短說明,協助模型理解其定義。


例如,可將 Jev 應用於電子郵件整理,讓它判斷每封信應被歸類到哪一個資料夾。


第三種是程度評分。部分問題並非非黑即白,而是需要判斷程度。使用者可以建立一套由低至高的評分標準,最多分成 11 個級距,再由 Jev 判斷目前狀況位於哪一個位置。


例如,企業可用它篩選潛在客戶:0 分代表沒有預算的學生、1 分代表小型團隊、2 分代表有明確需求與時程的公司、3 分則代表預算充足的大型企業。


若有大型企業透過網站表單詢問,Jev 可能給出 2.9 分。企業便可設定規則,當分數高於 2.5 時,立即通知業務主管,確保團隊能在當天快速回覆並爭取訂單。


整體而言,Jev 專門回答三類問題:「是不是」、「哪一個」以及「到什麼程度」。許多自動化工作流中的判斷邏輯,基本上都離不開這三種類型。


Jev 並非要取代功能全面的大型語言模型,也不適合直接用來開發完整產品。它更適合被放入自動化工作流中,擔任快速、便宜且低幻覺的決策節點。


例如,判斷一封信是否需要回覆、客服案件應轉交哪個部門,或留言是否為詐騙廣告。這類任務通常只需要一個選項作為答案,若使用昂貴且速度較慢的大型模型處理,容易造成時間與成本浪費。


Jev 的核心價值,就是把資料送進去後,不進行多餘對話,迅速提供可供後續規則使用的判斷結果,如同自動化流程中一個小而精準的智慧開關。

2026年9月17日 星期四

[AI 解讀] AI衝擊白領工作:程式設計師真的會在2030年前消失嗎?

[AI 解讀] AI衝擊白領工作:程式設計師真的會在2030年前消失嗎?

摘要 : 報告僅推演三種AI情境,程式設計師未必消失,轉型關鍵在善用AI與產業專業。



內容:


近期網路流傳一種說法,宣稱某 AI 公司預測:2030 年前,程式設計師與電話客服將會消失,並建議從業者轉行當電工或護士。然而,這並非報告原意,而是中文媒體轉述時加入了「消失」等較為聳動的措辭。


這份報告不是對未來的預言或判決,而是利用經濟模型,推演美國經濟在 2030 年前可能出現的三種情境。


第一種是溫和情境。AI 帶來的影響與當年網際網路相近,經濟略有成長、工資大致穩定,受 AI 影響的工作者占整體勞動力的比例,僅從 62.2% 降至 59.7%。雖然換算後仍涉及數百萬人,但若分散在數年間,勞動市場仍有機會逐步消化。


第二種是中等情境。經濟增速可能翻倍,但受 AI 影響的工作者薪資將陷入停滯。報告提到,在個人層面,程式設計師與電話客服人員可能不得不轉向電工、護士等較不容易受到 AI 影響的工作。


不過,原文緊接著也指出,整體職業轉換會非常困難,許多人可能需要很長時間才能找到新工作。失業率上升不只因為舊職位消失,也可能是白領工作者無法立即轉入新的產業,長時間卡在兩份工作之間。


第三種是極端情境。美國經濟產出每 4.5 年翻一倍,到 2030 年時,GDP 將比沒有 AI 的情況高出 33%。但受 AI 影響工作者的失業率可能升至 17.9%,勞動收入占經濟產出的比例也可能從 60% 降至 45%。


在此情境下,較不受 AI 影響的職位,薪資可能相對上漲 33.6%;受影響較大的工作者,薪資則可能相對下跌 11.5%。換言之,國家整體變得更加富裕,但程式設計師、會計師、律師與分析師等知識工作者,未必能分享到經濟成長的成果。相較之下,電工、水管工、建築工人及護士等需要實際動手的工作,反而可能更有價值。


因此,報告並沒有斷言程式設計師必然消失,而是說在部分情境下,他們可能被迫轉行。這只是數種可能性之一,沒有人能精確預測未來。


該公司執行長先前也曾警告,五年內可能有一半的入門級白領職位消失,失業率甚至可能達到 10% 至 20%。但新報告將這類結果放進三種情境中的極端版本,代表最壞情況並非必然發生。這可能是模型分析後的修正,也可能是一種預期管理。


此外,報告由 AI 公司發布,本身也可能存在利益衝突。AI 公司自然希望 AI 模型持續進步並廣泛普及,而這也可能放大 AI 對經濟與勞動市場的影響。


報告之所以特別提到電工與護士,並不是隨意挑選。根據美國勞工統計資料,2024 年至 2034 年間,電工與註冊護士屬於預計成長較多的職業。律師與會計原本也被看好,但這兩類白領工作同樣容易受到 AI 衝擊,因此需要實際操作與現場服務的工作,可能更具穩定性。


護士也不限定由女性擔任。在美國與加拿大,男性護士相當常見。由於薪資較高、就業機會多,護理工作本來就是不少人轉職時的選項。


另一份三月公布的研究顯示,程式設計師的日常任務中,已有約 75% 被觀察到有 AI 介入;客服與資料輸入工作則緊隨其後。最容易暴露在 AI 影響下的,不一定是低學歷、低收入族群,反而可能是高學歷、高收入的白領,因為 AI 目前最擅長接管的正是電腦上的知識型工作。


不過,「理論上能做」與「實際已經在做」之間,仍存在明顯差距。電腦相關職位的理論 AI 暴露度可高達 94%,但實際觀察到的 AI 覆蓋率約為 33%;辦公室文書工作的理論暴露度約為 90%,實際覆蓋率則約為 25%。


造成這條鴻溝的主要原因是可靠性。企業無法完全信任 AI 獨立完成所有工作,尤其大型企業軟體與複雜專案,仍需要領域專家審核。AI 即使可以產出程式碼,也可能犯錯,最終仍要由熟悉系統與業務的人員負責判斷。


因此,討論 AI 是否取代某個行業時,必須分清楚三種層次:理論上能否取代、未來情境是否可能取代,以及目前實際觀察到多少工作已被取代。


理論上,程式設計師的大部分任務都可能被 AI 接手;在部分未來情境中,程式設計師甚至可能被迫轉行。但依照目前觀察,約三分之一的工作正被 AI 接管,其餘工作仍掌握在人類手中。只要工作尚未完全自動化,人類審核、溝通與決策的瓶頸就仍然存在,程式設計師的工作也尚未真正消失。


至於轉行當電工,未必是最合理的選擇。程式設計師多年累積的判斷力、系統思維與技術協作能力,很難直接用在電工工作上。若完全更換專業,等於放棄過去數年甚至數十年的經驗,從頭學習新技能,是成本最高的轉型方式。


在徹底轉行以前,程式設計師至少還有三條成本較低的路。


第一是往上走,學習指揮、使用與檢查 AI,成為負責設計、整合與審核的人。


第二是往下扎根,把軟體技能深入醫療、能源、金融等具體產業。對業務流程、法規與產業知識的理解,能形成通用 AI 較難取代的門檻。


第三是更換產業,但不必更換手藝。即使電工、護士與建築等行業持續成長,這些領域仍需要醫療資訊系統、電網調度軟體、建築專案管理工具等技術。程式設計師可以把既有能力帶進其他產業,而不是直接放棄專業。


相較之下,電話客服面臨的風險可能更高。美國約有近三百萬人從事客服工作,加拿大的呼叫中心也是不少新移民的第一份工作。客服任務幾乎全部發生在電腦與電話上,正是 AI 最容易優先接管的領域。


程式設計師還可以藉由使用、管理與審核 AI 提升自身位置,但傳統客服較難透過「指揮 AI 接電話」建立新的職涯階梯。因此,客服人員若只從事電腦與電話工作,風險相對較大;若轉向面對面的服務、銷售、護理支援或社區服務,可能更有機會延長職業生命。


AI 的快速發展也讓家長重新思考孩子該學什麼。過去,程式設計可能是優先選項;現在,單純學習寫程式是否仍具長期價值,已變得不確定。除了技術能力,健康、運動、溝通、判斷力與適應變化的能力,可能更加重要。


若極端情境成真,2030 年前可能出現和平年代罕見的經濟成長,社會將創造大量產品與財富;但同一時間,知識工作者的失業率也可能升至 17.9%。真正的核心問題將不只是 AI 能創造多少財富,而是這些財富應如何分配,以及失去工作的人能否分享 AI 帶來的成果。

2026年9月16日 星期三

[AI 衝擊] 高度自動化Agent帶來的工程師職涯危機

 [AI 衝擊] 高度自動化Agent帶來的工程師職涯危機

摘要 : 工程師以MCP與Skill打造自動化Agent,也因此直面職涯價值與AI取代焦慮。



內容:


最近一篇帖子,發帖人表示,自己不斷見證AI變強,因而產生了強烈的無力感。


一年前,他還在嘲笑AI不會寫複雜專案的程式碼;如今,AI已經能完成程式開發、測試、問題排查及上線發布。他甚至常常只需要坐在辦公室與同事聊天,實際工作則由AI處理。


過去半年,他主要在為AI搭建MCP與Skill。MCP是由Anthropic率先提出、如今逐漸成為業界通用的標準介面,能讓AI直接呼叫公司的工具與系統;Skill則是將一套操作流程整理成AI可以重複使用的技能包。


完成這些建設後,AI已經能自行取得分配給它的需求。遇到不確定之處時,它會透過機器人帳號主動與工程師討論,接著自行開發、解決程式碼衝突、部署及測試。


AI也可以查看測試與正式環境的日誌,存取資料庫、訊息佇列及大數據平台,進一步排查與驗證問題,甚至直接完成線上發布。


更進一步,AI還會閱讀業務群組中的各種問題。多數情況下,它能自行排查、自行解決並直接回答。


發帖人曾親眼看到AI向業務人員索取具體資訊,再根據取得的資料,跨越五個服務檢查專案程式碼、日誌及資料庫,最後找出問題的根本原因並回覆業務方。整套流程完全由AI獨立完成,前後不到20分鐘。


當然,建成這套系統耗費了他大量時間與精力。目前多數人還達不到這樣的自動化程度,但這已經證明,AI能完成大部分人的工作,甚至可能做得更好。


未來如果有更多公共MCP與Skill開放,達到這種自動化程度的人將愈來愈多,使用AI的門檻也會持續下降。


這讓發帖人開始思考三個問題:


第一,一個每月只需200美元的AI,已能比他和同事做得更好;而他們的年薪接近80萬元,這樣的工作還能維持多久?


第二,他們所做的工作,真的值80萬元年薪嗎?


第三,也是最令人不安的一點:真正可怕的不是現在的AI有多強,而是AI進入Agent時代還不到一年,就已經發展到這種程度。明年、後年乃至更遠的未來,究竟會變成什麼樣子?


這套高度自動化系統,本質上是發帖人花半年時間建立的一條Pipeline,主要包括四件事。


第一是「文件化」。將原本只存在於員工腦中的業務規則、系統關係與問題排查經驗,整理成AI能夠理解的規格,把隱性知識轉化為顯性知識。


第二是「介面化」。將日誌、資料庫、訊息佇列及發布系統,逐一接入AI可以呼叫的MCP與工具,相當於為AI裝上雙手。甚至連聊天工具也能交由AI操作,讓它直接與業務人員溝通。


第三是建立「Skill」。將人類過往解決問題的方法文件化,整理成可以重複使用的操作步驟,相當於為AI裝上經驗。


第四是賦予AI一個可以在組織內活動的身分,例如機器人帳號。它可以加入群組、主動提問、回覆訊息,甚至直接解決問題,因為它已經接通其他工作流程與系統。


許多公司的聊天工具中已經存在AI機器人,只是自動化程度不同。發帖人打造的AI機器人顯然走得更遠:不只是擁抱AI、使用AI,而是進一步讓AI自動運作。


然而,愈是走在前面的人,危機感往往愈強。因為他們比其他人更清楚AI真正具備哪些能力,也更直接地看見自己的工作如何被取代。


以20分鐘內跨五個服務完成問題排查為例,在傳統公司中,五個服務可能分屬五個團隊。這通常需要召集多人開會,各自檢查日誌與系統,經歷跨部門溝通,甚至互相推卸責任,最後再由資深人員判斷。整個過程可能需要數天,甚至數十天。


AI卻能在不到20分鐘內完成。它取代的不只是技術工作,也一併消除了組織協調與跨部門溝通的成本。


不過,這種效率有一項重要前提:建立AI系統的人必須擁有足夠權限,讓AI能夠存取跨部門的程式碼、資料與系統介面。


目前許多大型企業仍受到組織架構與權限限制。一般團隊通常只能查看自己的程式碼,跨組織存取不僅涉及權限問題,也不符合既有工作習慣。但只要為AI提供相應權限及介面,它就可以跨越這些邊界。


這也是AI Agent與一般聊天機器人的本質差異。聊天機器人只能回答問題,Agent則能穿過組織與系統,實際執行任務並解決問題,甚至處理跨組織的問題。


當AI機器人建立起來後,業務人員遇到問題時,可能不再尋找原本的負責人,而是直接聯絡AI Agent。這會導致原有員工在組織中的可見度與重要性下降,而這些因素通常又是績效評估及職涯發展的重要依據。


即使工程師告訴所有人「這個Agent是我做的」,也未必能永久維持自身價值。當所有工作都被自動化後,組織最終仍會回到一個現實問題:這個人現在還能提供什麼價值?


即便如今價值下降,是因為他過去成功建立了自動化系統,管理者通常仍更在意員工當下能提供的價值,而不是過去的功勞。這正是發帖人感到無力的原因之一。


另一個原因,是他與AI發展的距離太近。普通人可能只是從新聞中得知AI正在變強;他卻每天親眼看著自己搭建的系統變得愈來愈能幹,因此感受更為強烈。


當AI接手大部分工作,他坐在辦公室聊天時也會感到心虛。過去,他認為產出必須依靠自己持續工作;如今,工作卻幾乎全部由AI完成。


歷史上也曾出現類似的技術升級。高階程式語言與編譯器出現時,原本手寫組合語言的工程師也曾懷疑,讓編譯器代替自己產生組合語言後,自己是否還算程式設計師。


後來,手寫組合語言的人雖然減少了,軟體開發者的數量卻大幅增加。因此,今天的AI管線會不會成為舊時代的「編譯器」,仍有待觀察。


問題在於,搭建這類管線的門檻可能並不高,因為工程師同樣可以要求AI協助建設。未來隨著公共MCP與Skill逐漸開放,發帖人花半年建立的系統,其他人可能只需要一天就能完成。


換句話說,先行者目前擁有的護城河,可能只是時間差,而不是永久優勢。


至於他是否真的值80萬元年薪,這筆帳並不容易計算。從公司的角度來看,他建立自動化管線後,個人產出可能提升數倍,甚至十倍。過去需要數名乃至十多名員工完成的工作,如今只需要一個人加上一套AI管線,因此公司支付80萬元,或許仍然相當划算。


但問題是,這套系統並非只有他能使用。換成一名初級工程師,也可能透過相同工具驅動整套流程。如果自動化程度與可靠性足夠高,甚至可以讓AI機器人直接與業務方溝通,完全不需要人類參與。


這也讓問題回到最核心之處:當AI不只提升人的效率,而是逐步接手整套工作流程時,人類在組織中的角色、價值與薪資,將如何被重新定義?

[AI 分享] Claude Code 零基礎入門:安裝、權限與常用命令

[AI 分享] Claude Code 零基礎入門:安裝、權限與常用命令

摘要:從安裝、權限模式到專案記憶與常用命令,帶新手安全上手 Claude Code。



內容:


Claude Code 是 Anthropic 官方推出的 AI 程式設計工具,主要透過終端操作。即使沒有程式基礎,也能用自然語言請它查看檔案、修改內容、修正問題、撰寫腳本、處理資料及生成文件。


終端可以簡單理解為一個輸入框,不必因為它看起來像程式設計工具而感到害怕。Claude Code 不只會回答問題,還能圍繞任務查看檔案、拆解步驟、執行命令,並在需要時等待使用者確認。


目前不少人開始改用 Codex,但 Claude Code 仍有其優勢。它的 Agent 架構相對成熟,能妥善處理上下文、權限與工具呼叫;Claude 模型面對複雜任務時,也較擅長先分析、再規劃,最後才執行。強模型搭配工程化完善的 Agent 工具,通常能帶來更穩定的結果。


安裝 Claude Code


Mac、Linux,以及透過 WSL 使用 Windows 的使用者,可以開啟終端,貼上官方提供的安裝命令並執行。若直接使用 Windows 終端,則要先確認目前使用的是 PowerShell 還是 CMD,因為兩者的安裝命令不同。


安裝完成後,在終端輸入:


claude



若能進入 Claude Code 的對話介面,代表安裝成功。也可以輸入:


claude --version



如果終端顯示版本號,同樣表示安裝完成。


若安裝時出現紅色錯誤訊息、找不到命令或其他問題,不必慌張。可以完整複製錯誤內容,交給其他可用的 AI 工具協助判斷。常見問題多半與網路、權限、終端環境或系統路徑尚未更新有關。


如果安裝後顯示找不到 claude,可以先關閉終端再重新開啟,然後再次執行命令。


用自然語言開始操作


安裝完成後,可以先進入任意資料夾,再啟動 Claude Code,直接用日常語言提問,例如:


這個資料夾是做什麼的?

幫我看看裡面有哪些檔案。

這個專案要怎麼啟動?

幫我整理這個專案目錄的內容。


Claude Code 在修改檔案、執行命令或存取外部資源前,通常會詢問是否批准。這並不是發生錯誤,而是它的安全機制,讓使用者知道它準備執行什麼操作。


選擇適合的工作模式


可以按下 Shift + Tab 切換工作模式。新手最常接觸的模式包括:


Default


預設的手動確認模式,設定較保守。Claude Code 可以直接讀取檔案,但修改檔案或執行命令時,通常會先徵求同意。


Accept Edits


適合已經大致信任執行方向的情況。它會自動批准專案目錄內的檔案編輯,以及建立資料夾、複製或移動檔案等常見操作。遇到複雜命令、敏感操作或專案範圍外的路徑,仍可能要求確認。


Plan


計畫模式非常適合新手。Claude Code 會先檢查專案、查閱檔案並提出方案,但不會立即修改內容。使用者看完計畫並確認後,再讓它繼續執行。


另外還有較積極或特殊的模式,例如 Auto 與 Bypass Permissions。Auto 會透過背景安全檢查減少頻繁確認,但不一定適用於所有帳號、模型及環境。


Bypass Permissions 則會大幅減少權限確認,只適合完全隔離的測試環境、容器或虛擬機器。新手不建議在日常電腦或正式專案中使用。


剛開始使用時,只要記住:不熟悉的任務使用 Default,重要或範圍較大的專案先使用 Plan。


新手安全操作四步驟


第一次使用 Claude Code,可以遵循以下流程:


先開啟 Plan 模式,讓它說明準備做什麼。

看懂並確認方案後,再允許它修改。

修改完成後,使用 /diff 查看實際變更。

如果結果不滿意,使用 /revert 或 /undo 回退。


重要檔案最好事先備份,或納入 Git 版本控制。如此一來,即使結果不理想,也能放心還原與反覆嘗試。


使用 CLAUDE.md 建立專案說明


在專案資料夾中輸入:


/init



Claude Code 會掃描專案並生成 CLAUDE.md。這份檔案就像提供給新同事的入職說明,可以記錄:


專案使用的技術與工具。

專案如何安裝及啟動。

應遵守的開發規範。

哪些檔案或區域不能任意修改。

修改後必須執行哪些測試。

文案應採用何種風格。

腳本應放在哪個目錄。


之後每次在該專案中啟動 Claude Code,它都會先讀取這份說明,省去重複交代背景與規則的時間。


不過,CLAUDE.md 比較像專案囑咐,而不是百分之百強制執行的規則。Claude Code 會參考內容,但不保證絕對服從。相較之下,Hook 更接近強制檢查機制。


若想查看或修改專案記憶,可以使用:


/memory


新手必備命令


在 Claude Code 中輸入 /,就能查看目前可用的命令。新手不需要一次記住所有命令,可以依照使用階段逐步學習。


第一階段建議掌握:


/plan:進入計畫模式,大幅修改前先產生方案。

/diff:查看這次修改了哪些檔案與內容。

/revert 或 /undo:回退至先前的檢查點。

/help:查看命令說明及使用方式。


Claude Code 做錯時不必慌張,確認差異後回退即可。


使用一段時間後再學的命令

/context:查看目前對話使用了多少上下文空間。

/compact:壓縮過長的對話歷史,讓任務繼續進行。

/clear:清空目前會話,適合切換至新任務;專案中的 CLAUDE.md 不會因此消失。

/resume:找回並繼續之前的會話。

/rename:替目前會話命名,方便日後尋找。

/btw:詢問不納入主要對話歷史的題外問題。

進入真實專案後可使用的命令

/model:切換模型。簡單任務可選擇更快或成本較低的模型,複雜任務再使用能力較強的模型。

/code-review:檢查此次變更是否存在明顯錯誤。

/doctor:診斷安裝、登入或設定問題。

/mcp:查看及管理 MCP 連線。

/hooks:查看目前設定的 Hook。

/tasks:查看背景任務的執行進度。


新手不必一次記住所有功能。先掌握安全模式、計畫、差異檢查與回退,再逐步加入專案記憶、模型切換、MCP、Hook 與背景任務,就能把 Claude Code 實際運用在日常工作與真實專案中。