你現在站在哪一層?
The AI-Era Hierarchy of Career Needs — Where Does Your Work Stand?
這張圖描述的是工具使用深度,不是今天的五層能力。
每個點約代表 9,200 人;全圖 2,500 點,總計約 2,300 萬人,色彩為截至 2026 年 2 月的推估分佈。資料為文章作者依全球使用分布與台灣產業結構所作推估,非台灣官方統計或代表性抽樣調查。
出處:Paul Kuo 郭曜郎,「AI 時代的能力落差:從一張爆紅圖表談起」,2026 年 3 月・paulkuo.tw/articles/ai-capability-gap-2026
開始使用只是起點;真正的差距,出現在 AI 如何進入工作。
你拿什麼指導他?
你的熟練,能不能變成團隊做得到的工作方式?
兩種都沒有關係。今天要談的,不是誰比較會用 AI。
喬泰科技|AI 解決方案
AI 實作與知識工作筆記|substack.com/@hengshiou
演算法 × 晶片 × 系統平台;應用涵蓋智慧醫療、工安預警與無人巡檢。
持續使用 AI Agent 做產品、研究與軟體開發;每週整理實作與系統設計經驗。
我關心的不是 AI 能不能生成,
而是它進入真實工作以後——
怎麼驗證、怎麼交接、怎麼管理,最後誰要負責。
AI 一旦進入真實工作,最後都會變成主管要回答的問題。
剛才的點陣圖,描述的是你使用 AI 用到多深。這張金字塔,描述的是當 AI 進入一項工作,你承擔到哪一層能力與責任。五層不是職級、薪資、高低或成熟度排名;同一個人在不同工作裡,可以站在不同層。
不用 → 免費聊天 → 付費工具 → 開發工具與 Agent
第一版 → Context → 工作流 → 協調 → 判斷
它反覆發生,不是一年一次的特例。
過程中確實有一段很花時間。
第一版常常要改,甚至重做。
要交給別人接手,或跟別人一起完成。
接下來五個故事,不是要你記住我的故事——是要你拿這項工作,一路對照。
它交出一份看起來很完整的報告——作者、年份、reference 都有。直到我想多看其中一篇,一查:根本不存在。
AI 壓低的是第一版的成本,不是最後結果的責任。你更快得到一版,但沒有更快獲得真相。
資料來源:Anthropic,「AI 輔助與編碼技能形成實驗」,2026-01-29,隨機控制實驗(n = 52)・anthropic.com/research/AI-assistance-coding-skills
依 Anthropic 研究重製,非官方原圖。任務完成速度兩組相近;分數差異反映的是理解與技能形成,不同 AI 使用方式結果不同,不宜當成因果定論。
六種使用方式,完成時間都差不多;事後理解分數,卻從 86% 一路掉到 24%。
資料來源:同前頁,Anthropic,「AI 輔助與編碼技能形成實驗」,2026-01-29・anthropic.com/research/AI-assistance-coding-skills
依 Anthropic 研究重製,非官方原圖。六種互動模式屬質化分群與關聯描述,不可當成因果結論。
把 AI 交回的叫「底稿」,不叫「報告」。名字決定它會不會被直接採用。
來源、事實、返工時間,一項一項驗回來。驗收花的時間也要記下來。
把淨省下的時間,移去比較、追問、接近真實結果——不是拿去生成更多。
回到你選的那項工作——第一版怎麼驗?由誰驗、驗什麼、花多久?
判斷的是這項工作目前在哪一層,不是在替你這個人打分數。
實際約 173 × 200 cm——高估約 1.5 倍。
技術鏈全部跑通了,模型也「成功執行」。但這個尺寸,不是窗戶,是一扇門吧。
清掉過期的工具結果(Context Editing),多步驟 Agent 搜尋任務相對改善
再把關鍵發現存到 Context 之外(Memory),相對改善再提高
100 回合網路搜尋評測的 Token 消耗;原本會因 Context 耗盡而失敗的流程得以跑完
Anthropic 自家評測;29%/39% 為相對改善,不是成功率增加 29 個百分點;84% 僅代表該項評測。
資料來源:Anthropic「Context Management」說明,2025・claude.com/blog/context-management
交付目標、使用者、可用資料與案例——真正影響品質的,先寫出來。
不可跨越的限制、正例與反例——說清楚什麼不能做。
由誰、用什麼證據驗收——「做完了」要有標準,不靠感覺。
不是資料丟進去就能放款——能不能貸、哪裡要擋,都在老手的腦袋裡。
不是條文貼上去就能審——哪一條會出事,靠的是看過的案子。
不是產品資料給了就能寫對——品牌的分寸、踩不得的線,從來沒人寫下來。
回到你選的那項工作——最常被新人問的三件事是什麼?那就是還留在你腦中的條件。
判斷的是這項工作目前在哪一層,不是在替你這個人打分數。
下半場不談更多提示詞。談的是:為什麼明明寫了條件,組織還是沒有變強。
重新理解專案+收拾結果:約 1 小時。
「靠邀,有討論、有寫文件,最後還是我要接手——那我分工的意義在哪?」
文件是某個時間點的快照;專案已經前進,它停在上個版本
它沒有偷懶,它認真讀了——舊的那份
文件不會自己退役,也不會說哪一份代表現在
第二層解決的是「這一次,少猜」;第三層要保證的是「下一次、換個人、隔一個月,還做得成」。
88% 的組織已規律使用 AI;回報企業層級財務影響的只有 39%。少數 high performers 更常做的,是根本重設工作流——機率接近其他受訪者的 3 倍。
資料來源:McKinsey「The State of AI」,105 國、1,993 名受訪者,2025-11・mckinsey.com/…/the-state-of-ai
依 McKinsey 2025 全球 AI 調查重製。約 6% 受訪者被列為 AI high performers;「根本重設個別工作流」為其相對其他受訪者更常回報的做法(約 3 倍),屬調查自陳結果,非因果推論。
把任務整包「委派」出去的使用者,事後理解分數最低。工作完成了,理解沒有留下——個人如此,組織的工作流也是。
資料來源:同第 9、10 頁,Anthropic,「AI 輔助與編碼技能形成實驗」,2026-01-29・anthropic.com/research/AI-assistance-coding-skills
依 Anthropic 研究重製,非官方原圖。原研究為個人學習實驗;此處作為組織層級的類比證據,屬合理推論,非因果結論。
成熟組織不是直接發工具,而是先做跨團隊評估,看流程接不接得住,再決定擴大。
資料來源:OpenAI 與 AutoScout24 客戶案例,2026-05-12(長條以區間上限 21 天、3 天繪製)・openai.com/index/autoscout24
僅部分專案,無對照組。擴大前先做跨團隊三個月評估:可用性、工作流相容性、生產力、程式碼品質——約 2,000 名員工取得工具、約 1,000 個 builder 角色使用 Codex。
工作流不是輸出結果,而是保存一條可重複完成的路徑——有驗收、有例外、有 Owner、會更新。
上一頁是一整條 工作流;這一頁只回答其中一個關鍵問題——下一個人、下一個 Agent,第一個該看哪裡?
下一個人先看哪裡,不用猜。
怎麼知道真的做對,不是只做到。
誰負責讓這條路持續有效,而不是慢慢過期。
成功一次,不等於公司具備能力——能力是那條路留下來了。
回到你選的那項工作——明天交給別人,他第一個打開的是什麼?如果答不出來,入口還不存在。
判斷的是這項工作目前在哪一層,不是在替你這個人打分數。
每個 Agent 都完成了自己的任務,沒有人完成我們正在做的目標。
Agent 不會因為數量增加,就自然形成團隊。
核心問題:換人、隔一段時間,還走得完嗎?
核心問題:多個 Agent 同時跑,還能不能回到同一個目標?
工作流解決「怎麼走」;協調者解決「大家怎麼一起走」。
一個帶頭的 Agent 負責分派,幾個 subagent 同時往不同方向查。任務彼此獨立時,內部評測比單一 Agent 高 90.2%。
限制:Anthropic 自家研究評測,特別適合多條獨立搜尋路徑,不能直接換算企業投資報酬。
資料來源:Anthropic 多 Agent Research 工程資料,2025-06-13・anthropic.com/engineering/multi-agent-research-system
多 Agent 系統用掉的 Token,約為一般聊天的 15 倍(單一 Agent 約 4 倍)。右邊這張官方流程圖裡的每一個來回,都是協調成本。
限制:Token 不是全部的管理成本,返工與協調時間另計——它提醒我們:能力與成本會一起增加。
資料來源:同前頁,Anthropic,2025-06-13・anthropic.com/engineering/multi-agent-research-system
多 Agent 的價值不在數量,在協調者能否安排好拆分、依賴與整合。
資料來源:同前兩頁,Anthropic 多 Agent Research 工程資料,2025-06-13・anthropic.com/engineering/multi-agent-research-system
協調者是一個「位置」,不一定永遠由人親自坐。低風險的派工與進度追蹤,可以交給一個帶頭的 Agent;整合放行與不可逆的批准,依既定規則回到人。
產業類比 30 秒:退款不是流程不存在——客服、財務、法務、系統各自持有局部狀態,沒有一個協調者同時看見「已送出、銀行逾時、尚未入帳、通知不應寄出」。
先看依賴,再決定誰做、先後順序與能否平行。
指定角色與任務・指定可讀/可改範圍・共用資產高、依賴高時,改成依序。
讓所有執行者知道整體現在在哪裡。
收交接・追蹤進度與卡住的地方・看共用的東西有沒有衝突・必要時重新排程或派工。
把多份成果合成一個版本,再做整體驗收。
局部完成不能自行發布・不一致就退回・整體版本只放行一次。
回到你選的那項工作——有沒有一個位置,看得見全局?
如果每個人只能說「我那塊做完了」——這個位置,就還空著。
判斷的是這項工作需要的協調能力,不是在替你這個人打分數。
協調的人能安排誰做、怎麼合;但哪個代價值得扛,他替公司決定不了。
示例已經顯示可省 TWD 4,237。下一步看起來很自然:直接幫人購票、出票,不是更完整嗎?
但我的決定是:先不要。
飛省 Fare・fare.hengshiou.com
以飛省為例:站內購票要碰的是——航班票務 API・商務條件・付款・出票・交易失敗・售後責任。這不是多一顆按鈕,是產品責任邊界改變了。
第四層安排誰有權按;第五層要求那個人說清楚為什麼按。
「機票已經訂好了 ✓」
對話裡看起來一切順利,任務標記完成。
資料庫裡,有沒有那筆訂位紀錄?
完成回報只能證明它說自己做了;結果要看世界有沒有真的改變。
執行紀錄與真實結果,分開驗證。
這組證據不是「AI 不可信」——是兩件事要分開查。資料來源:Anthropic「Demystifying evals for AI agents」,2026-01-09・anthropic.com/engineering/demystifying-evals-for-ai-agents
哪些事人做、哪些事 AI 做,開工前先講清楚。
誰負責看系統的表現,偏離時誰先知道。
AI 系統的風險決定,要放在具名的人身上——不能事後才找。
NIST AI 風險管理框架為自願性指引,不代表照做就會提高績效。來源:NIST AI RMF Core・airc.nist.gov/airmf-resources/airmf/5-sec-core
補充:PwC 2026 全球 AI 職缺研究(27 國、逾 10 億筆;240 萬筆美國初階職缺分析)——AI 暴露最高的初階職位,要求領導、創造力或面對面互動等資深能力的可能性,是暴露最低者的 7 倍。判斷力,正在被更早要求。(2026-06-15)・pwc.com/…/pwc-2026-ai-jobs-barometer
AI 可以交出答案;組織仍需要有人決定,這個答案能不能進入真實世界。
誰願意具名放行?
誰核准這份產出對外使用?我願不願意用自己的名字說:目前的證據,足以支持承諾到這裡。
第四層問誰「可以」批准;落款問願不願意「具名」。
什麼情況必須停?
哪個訊號出現,就暫停、收回或重新評估?
採用以前先寫好,不是出事才想。
這個 Yes,換掉哪個 No?
採用這個方案,我同時放棄什麼?
速度、收入、風險、體驗、責任——不可能全部拿。
拿掉 AI,我還能說明理由嗎?
關掉 AI 報告,還說得出:為什麼選它、證據到哪裡、哪裡沒驗證、誰承擔代價?
只能把模型結論再念一次,這份簽名還沒有內容。
AI 可以列出選項;結果所有者要能說明選擇。
貸款:模型能整理風險,核不核准改變的是申請人的結果——誰有停止權?偏離後誰重新檢查?
工地:進度模型說趕得上,現場安全條件卻變了。資料沒有錯——真正的決定是:現在要不要停工?
結果所有者不必重做 AI 的工作,但不能把偏離的結果推回 AI。
回到你選的那項工作——最後哪個決定不能委派?
把 AI 報告關掉,你還能自己說明為什麼按下去嗎?
如果答案只剩「因為 AI 建議這樣做」——就還沒真正站到第五層。
判斷的是這項工作目前需要的能力,不是替你這個人打分數。
判斷的是這項工作,不是你這個人——同一個人在不同任務上,可能同時使用不同層級的能力。
不要同時改十件事。30 天後,你要有證據,不是有感覺。
現在你有答案了——
第一版怎麼驗 → 條件怎麼寫 → 流程怎麼接 → 多人怎麼管 → 哪些決定不能委派
五層自我診斷表+30 天 AI 工作流行動卡
把今天選的那項工作,帶回公司繼續做。