最近大家常講「AI Agent 快要能接手真的工作了」,但這個說法到底怎麼驗證?UC Berkeley 的 Dawn Song 團隊發布了 Agents’ Last Exam (ALE),直接測 agent 能不能完成「有經濟價值的真實工作」。這個團隊過去做出了 MMLUMATH 這些經典 benchmark,這次在發表的推文裡給了一個蠻清醒的結論,翻譯過來是:

agent 有用的時代已經到來,但真正能勝任工作 (job-ready) 的時代還沒到。

ALE 在測什麼

先講一下這個團隊的來歷。帶頭的 Dawn Song 是 UC Berkeley EECS 教授、MacArthur Fellow,資安研究出身,同時是 Berkeley RDI 研究中心的共同創辦人,ALE 就是這個中心主導的計畫。這個研究群做評測的資歷很深: 從早期量測知識廣度的 MMLU、數學推理的 MATH,到近年 agent 方向的 CyberGym(測 AI agent 能不能在真實開源專案裡找出漏洞)和 ExploitGym(測能不能把已知漏洞做成實際可用的攻擊),這次的 ALE 再把範圍拉到「所有在電腦上進行的專業工作」。考的東西從知識、資安攻防一路走到實際工作,一直跟著模型能力的邊界在移動。

ALE 由 Berkeley RDI 主導,號稱是目前規模最大、涵蓋最廣的 agent 評估 benchmark: 300 多位產業專家出題,涵蓋 55 個子產業,目前收了 1,500 多個任務(目標 5,000 題),而且是「持續更新式 (rolling) 的 benchmark」,會不斷加入新題目來對抗飽和。

它跟一般 LLM benchmark 最大的差別是: 任務不是問答題,而是在真實專業軟體裡完成實際工作,例如:

  • 在 Adobe After Effects 做動畫與視覺特效
  • 在 Siemens NX 做 3D 建模
  • 在 Unreal Engine 做遊戲場景設置與渲染
  • 在 Moldex3D 做模流分析(對,台灣廠商的模流分析軟體也在題庫裡)
  • 在 Rhino 3D 做建築建模與能源分析
  • 在 FSLeyes 做腦神經影像分析

每個任務都有可驗證的結果 (verifiable outcomes),不是靠 LLM 當裁判給印象分。網站上還有 agent traces 可以直接看 agent 的完整執行過程,想研究 agent 在專業軟體裡怎麼卡關的,這是很好的素材。

名字裡的「Last」有兩層含義,Dawn Song 在 LinkedIn 發文裡解釋: 一是「最後要跨過的門檻」,通過這些考題,代表 agent 真的能做這份工作、持續交付有經濟價值的產出;二是「難度的最前沿」,任務就落在現今 agent 能力的邊界上。

編按: 這個命名很難不讓人想到 CAIS 和 Scale AI 的 Humanity’s Last Exam (HLE): 由專家出題、測學術知識推理極限的問答評測,發布時前沿模型的正確率不到 10%。兩者其實有師承關係: HLE 的主導者 Dan Hendrycks 當年在 UC Berkeley 讀博士,指導教授就是 Dawn Song,MMLU、MATH 正是他們師生當時的合作成果。不過兩個評測的方向不同: HLE 考的是知識問答的極限,ALE 考的是實際工作的完成度。

難度分層的設計

ALE 的 leaderboard 把任務分成幾個子集,這個設計蠻值得學:

  • Near-term: 現在的前沿 agent「部分做得到」的工作流,適合短期競爭和快速迭代
  • Full-Spectrum: 50 多個產業每個至少一題,測廣度
  • Last-Exam: 前沿難度,用來衡量距離「真正能上工」還有多遠
  • ALE-CLI: 只需要 Linux 命令列就能完成的子集,方便低成本評估

計分也有兩套: 「pass rate」是拿到滿分的比率,「score」是部分給分 (partial credit) 的平均。這對長時程任務很重要,因為在最難的題目上大家 pass rate 都趨近零,沒有部分給分的話,榜單就完全失去鑑別度了。

目前的成績: 最難那層幾乎沒人及格

看 2026 年 7 月的 leaderboard,Overall 排名前段是:

模型 (harness) Score Pass Rate 總成本
GPT-5.6-Sol (Codex, xhigh) 53.6% 30.6% $762
GPT-5.6-Terra (Codex, max) 50.5% 28.0% $545
GPT-5.6-Luna (Codex, max) 49.2% 28.3% $391
Claude Fable 5 (Claude Code, xhigh) 48.7% 25.7% $4,340
GPT-5.5 (Codex, xhigh) 47.9% 26.6% $602
Claude Opus 4.8 (Claude Code, max) 45.1% 27.0% $3,985

最好的模型也只拿到一半左右的分數,完整做對的比率只有三成。拆開各子集看更有意思(各取該子集分數最高的模型):

子集 題數 最佳模型 Score Pass Rate
Near-term(現在部分做得到) 67 GPT-5.6-Sol 78.8% 47.8%
Full-Spectrum(每個產業至少一題) 55 GPT-5.6-Sol 46.6% 30.0%
Last-Exam(前沿難度) 38 GPT-5.6-Sol 19.4% 3.9%

從這份數據還可以看出幾件事:

  • 就算是 Near-term 這種「設計上就是現在的 agent 部分做得到」的題目,最好的模型也只完整做對不到一半。
  • Last-Exam 子集在 6 月發表當時,所有前沿模型的 pass rate 都是 0%;一個多月後的現在,pass rate 最高的是 Fable 5 的 7.9% (score 16.5%),大多數模型還是 0%。
  • 需要商業軟體授權的 11 題(After Effects、Siemens NX 這類)單獨看分數最低: 最好的 Fable 5 score 也只有 29.4%、pass rate 9.1%,等於 11 題最多完整做對 1 題。agent 在專業 GUI 軟體裡的操作能力,明顯比在命令列環境弱。
  • 加大推理算力的回報有限: GPT-5.6-Sol 從 medium 檔開到 xhigh,score 只從 51.9% 進步到 53.6%;在 Last-Exam 子集,medium 和 xhigh 根本同分。
  • harness 的影響跟模型本身一樣大: 同一個 Claude Opus 4.7,配 Cursor CLI 拿 41.8%,配自家的 Claude Code 只有 35.1%。這個榜測的其實是「模型 + harness」的組合,不是模型單獨的能力。
  • 中國模型最高的是 GLM-5.2 的 40.6%,已經超過 Gemini 3.1 Pro 的 32.0%。

另外小編提醒一個容易忽略的欄位: 成本。Fable 5 跑完整套要 $4,340,GPT-5.6-Sol 只要 $762,成本差了近 6 倍,分數還比較高。ALE 把成本直接放上榜單,agent 評估已經不只看做不做得到,還要看划不划算。

其他還沒飽和的知名 Agent benchmark

ALE 不是唯一在做「真實工作」評估的 benchmark,小編整理幾個目前公認難度高、還沒飽和的對照:

GDPval (OpenAI): 44 個職業、1,320 個任務,同樣主打「有經濟價值的工作」,但評的是產出物: 文件、簡報、試算表這類交付成果。OpenAI 論文當時的做法是找真人產業專家盲測,比較模型和人類專家的成品,不過那是一次性結果,沒有持續維護排行榜,對外也只公開了 220 題的 gold subset。目前持續更新的榜單是第三方 Artificial Analysis 的 GDPval-AA v2: 拿這 220 題,用三個前沿 LLM 裁判做盲測配對比較算 Elo,以人類專家 = 1000 為基準,目前 Fable 5 排第一 (1760)。跟 ALE 的差異在驗證方式: GDPval 是比較誰的成品好,沒有絕對的通過標準;ALE 是在真實軟體環境裡操作,結果可以程式化驗證。兩者互補。

Remote Labor Index (RLI) (CAIS + Scale AI): 直接拿真實的接案市場專案來測: 3D 建模、平面設計、影音製作、資料分析、網頁開發等,每個專案都有付費請專業人士做出的標準交付成果,由人類評審盲測判斷 AI 的產出「客戶會不會買單」,指標就叫「自動化率 (automation rate)」。2025 年底發布時最好的 agent 只有 2.5%,2026 年 7 月的更新中 Fable 5 到了 15.8%,是 Opus 4.8 (8.3%) 的近兩倍。八個月內前沿成績翻了好幾倍,但離「大部分外包工作可以自動化」還很遠。這份更新還有一個做 eval 的人會有感的發現: 他們試著用 LLM 裁判取代人類評審,結果在最新模型上高估了 2 到 3 倍,排名雖然還算對,絕對數字完全不能信。

OSWorld 2.0: computer use 方向的代表。2.0 版把任務換成長時程的桌面工作流,人類專家也要花一小時以上才能完成。在 500 步的預算下,沒有任何系統的端到端完成率超過 21%,最高的 Claude Opus 4.8 也只有 20.6%。報告特別點出 agent 的弱點是「維護與恢復隱藏狀態」: 漏更新、用過期的資訊繼續執行。

DeepSWE (Datacurve): 最近社群討論度很高的 coding agent benchmark,X 上比較 GPT-5.6、Fable 5、Kimi K3 的貼文常常引用它。113 個在大型程式碼庫裡的長時程工程任務,評分方式是把 agent 提交的程式碼放到乾淨的隔離環境重新驗證,7 月中剛更新 v1.1 加強可重現性。目前最高分是 GPT-5.6-Sol 的 72.7%,Fable 5 69.7%,榜單同時畫出「分數 vs 每題成本」,跟 ALE 一樣把成本當成一級指標。在 SWE-Bench 系列失去鑑別度之後,它某種程度上接手了「coding agent 進展指標」的位置,不過頂尖分數已經到七成,飽和速度值得觀察。

Long-Horizon Terminal-Bench (LHTB): 這個月剛出的,46 個需要數百個相依步驟的 terminal 長任務,配隱藏驗證器防作弊。18 個前沿模型裡最好的平均分數只有 0.51,有 29 題至今沒有任何模型解出來過。

METR Time Horizon: 嚴格說不是排行榜,而是量測「agent 有 50% 成功率完成的任務時長」。有意思的是 2026 年 5 月的更新加了一條註記: 16 小時以上的量測結果已經不可靠,因為現有任務集的長度上限快被模型追上了,連測量用的任務集本身都得再加長。

ARC-AGI-3: 走另一個極端的路線: 不測專業工作,測「面對全新環境的適應能力」。agent 被丟進沒有任何說明的互動式環境,要自己摸索規則、推斷目標、規劃行動。人類測試者可以解開 100% 的環境,而截至 2026 年 3 月,前沿 AI 的分數不到 1%,是目前差距最懸殊的知名 benchmark。

對照組是已經接近飽和的榜單: Terminal-Bench 2.1 的第一名(Claude Code + Fable 5)已經到 83.8%,SWE-Bench Verified 更早就失去鑑別度。短任務、單一領域的 benchmark,參考價值正在一個一個消失。

小編觀察

把這些放在一起看,2026 年 agent benchmark 的設計有明顯的共同走向: 從「幾分鐘的封閉任務 + pass/fail」轉向「數小時起跳的真實工作流 + partial credit + 直接標成本」。因為前沿模型在短任務上已經拉不開差距,鑑別度只剩下長時程和專業深度這兩個方向。

而 ALE 用 Near-term / Full-Spectrum / Last-Exam 的分層,加上持續收新題,等於把「對抗飽和」直接設計進 benchmark 的結構裡。Dawn Song 團隊的定位很明確: 這不是拿來衝分數的榜,是拿來當長期路標的。現在 Last-Exam 那層的個位數 pass rate,就是「agent 取代專業工作」這個說法目前的真實差距。