AI Articles

AI 領域精選文章翻譯

View the Project on GitHub Kumazan/ai-articles

18 April 2026

AI 代理的每小時成本也在指數上升嗎?

by Toby Ord

AI News · 2026-04-18

原文連結: Are the Costs of AI Agents Also Rising Exponentially? — Toby Ord

摘要

· · ·

這篇文章想回答的問題很直接:AI 系統在能處理越來越長的任務時,執行那些任務的「每小時成本」是不是也在一起指數上升?

過去幾年,AI 的能力曲線一路往上。很多人因此自然會把這條趨勢外推,預測它什麼時候能做一個工程師做一天、做一週、甚至做一年的工作。

但作者認為,這裡少了一個關鍵變數:成本。

在這 7 年裡,AI 系統的成長是指數式的。模型大小大約成長了 4,000 倍,每個任務中被生成的 token 數量大約成長了 100,000 倍。研究者也確實找出了很多效率改善,但最前沿的 AI 代理成本,很有可能也在跟著指數成長。

這不一定是壞事。假設最強 AI 代理能處理的任務長度每年成長 3 倍,而成本也每年成長 3 倍,那麼它做一件事的花費,對應到人類工時的相對價格其實不變。或者,如果成本的翻倍時間比任務長度更長,那麼 AI 相對於人類反而會變便宜。

但如果成本增長比任務長度更快呢?那麼這些前沿系統就會變得越來越不具經濟競爭力。這時,METR 的時間長度趨勢就可能會誤導人,因為那條曲線反映的是能力上限怎麼變高,但其中一部分進步,可能只是因為投入了越來越多算力與金錢。它會越來越像 AI 版的 Formula 1,展示「做得到什麼」,卻不代表「划算地做得到什麼」。

所以作者提出了一個核心問題:

AI 代理的「每小時」成本,究竟是怎麼變化的?

這裡的「每小時成本」,是指用 LLM 完成一個任務的財務成本,再除以那個任務對應的 human time horizon。也就是說,像 METR 的時間長度一樣,時間不是以模型自己花了多久算,而是以人類平均要花多久完成同樣工作來衡量。例如 Claude 4.1 Opus 的 50% time horizon 是 2 小時,意思是它能在 50% 的情況下完成那些人類軟體工程師平均要花 2 小時的任務。那就可以把完成這件事的成本除以 2,得到它的 hourly rate。

作者說,很少人真的在問這個問題。當他問別人怎麼看這些成本的變化時,答案差異非常大。有些人以為總成本不變,只是任務變長,這會代表每小時成本下降得很快。有些人則覺得總成本也會一起快速上升,畢竟前沿模型的存取價格確實很高。而多數人,包括作者自己,對於目前 AI 代理做一小時軟體工程到底要多少錢,其實都沒什麼概念。是一毛錢?幾塊錢?幾百塊錢?AI 代理總不會比人類還貴吧?真的嗎?

幾個月前,作者曾向 METR 要他們的 benchmark 成本資料。他原本以為這很簡單,只要把每個模型的成本對上發佈日期,畫出來就好。或者把每個模型的成本對上它的 time horizon,也能看出關係。

但 METR 很貼心地指出,事情沒那麼簡單。

他們 headline 的 time-horizon 數字,目的是顯示模型在不考慮成本的情況下,所能達到的最佳表現。所以他們會把模型放進 agent scaffold,不斷跑到性能趨於平臺為止。既然目標是確認有沒有真正到達 plateau,就會投入很多算力,成本不是最先考慮的事。畢竟如果只是要找出一個平台的高度,沒必要怕自己跑進太平的那一段。

但如果你想知道平台是從哪裡開始,就不能照這個做法。

因此,作者改用 METR 公開的圖表,從另一個角度看 hourly cost。

他先在圖上加上「固定每小時成本」的斜線。在對數圖上,每一條固定 hourly cost 的線都是斜率 1 的直線;越往左,代表每小時成本越低。

他替每條曲線都找出一條剛好擦邊的線,那就是那個模型的 cheapest hourly cost。這個碰到曲線的點,就是該模型的 sweet spot。更早之前,模型在這個點之前,時間長度隨成本增加得比線性還快,代表邊際效益在上升。sweet spot 剛好是邊際報酬開始遞減的位置,也就是如果把圖改成線性座標,會接近拐點的地方。這是任何模型性能曲線的關鍵位置。

作者發現,人類軟體工程師的最佳 hourly cost 最高大約是每小時 120 美元,而 AI 代理的 sweet spot 從每小時 40 美元一路到 40 美分都有。這個範圍非常大。雖然不同模型的 time horizon 大約差了 15 倍,不管是看端點還是 sweet spot,它們的 hourly cost 卻差了 100 倍。

而且這些還是「最划算」的 hourly rate。對很多任務長度來說,尤其是接近 plateau 的那一段,成本會高出 10 到 100 倍。比如 Grok 4 在 sweet spot 時每小時 0.40 美元,但到了最後平台開始的地方,會變成每小時 13 美元。GPT-5 對於大約 45 分鐘的任務,成本大概是每小時 13 美元,但如果是 2 小時的任務,會飆到每小時 120 美元。o3 甚至要花每小時 350 美元,才能達到它完整 1.5 小時的 time horizon,還比人類價格更高。這麼多錢,換來的還是一個對你剛剛付費、但成功率只有 50% 的代理,尤其當失敗比不做還糟時,這就更刺眼了。

不過作者也提醒,這裡有個值得保留的疑問:OpenAI 的 reasoning 模型在圖中的成本比 Anthropic 和 xAI 高得多,他自己也有點困惑。METR 頁面表示,那些模型的價格資料當時還是估算值,基於 o1 成本,所以他不會太執著於 OpenAI 曲線真的那麼貴這件事。幾條曲線可能還會往左移,也就是便宜一些。

即便如此,圖表仍然提供了一個清楚訊號:time horizon 越長,成本通常也越高,而且 hourly cost 也在跟著上升。這表示我們可能正接近一個狀況,模型的峰值能力其實是用不太划算的方式換來的。若這個關係持續下去,那麼只看 METR 的能力趨勢來預測何時能做到某些任務,就會誤判。因為模型剛達到那些能力時,可能還太貴,得再等一段時間,等成本真正降下來,才算實用。

也就是說,能力到達,不等於經濟上可用。

這篇文章最後列出幾個限制與後續研究方向:

作者認為這類分析其實很適合 METR 直接延伸做下去。

結論

附錄

METR 在它們的 GPT-5.1 codex 頁面上也有類似圖表

那張圖包含更多模型,並且改用 token 數而不是美元成本做比較:

固定每小時成本的線與 sweet spot

在對數圖上,每一條固定 hourly cost 的線都會是斜率 1 的直線。較低的 hourly cost 會出現在更左邊。

人類與 AI 模型的 sweet spot

作者估算,人類軟體工程師最划算的 hourly cost 大約是每小時 120 美元;AI 代理則從 o3 的 40 美元一路到 Grok 4 與 Sonnet 3.5 的 40 美分。

saturation point 的定義

作者用「斜率下降到 sweet spot 的 1/10」當作 saturation point,也就是每增加 10% 成本,只能換來 1% 的 time horizon 增長。

觀察

延伸評論:能力曲線正在被成本曲線追上

這篇最值得警惕的地方,不是「AI 代理貴」,而是「AI 代理變強的方式,可能正在把成本一起推高」。如果一個模型的 time horizon 持續延長,但每次到達那個能力點都要付出更高的 hourly cost,那麼產業常用的進步敘事就會開始失真:看起來像能力在穩步解鎖,實際上只是燒得更兇。

對做 agent 的人來說,這篇最實用的提醒是,benchmark 不是產品性價比。真正要問的是:同樣一個任務,模型是用更少步驟完成,還是只是用更多算力把成功率堆上去?如果只看最頂端的能力,不看單位時間成本,很容易把 demo 當成可部署的商業實力。

也因此,接下來真正重要的,不只是更大的模型,還有更便宜的推論、更好的 scaffold、更精準的任務切分,以及能把高能力落到合理價格區間的系統設計。