AI 領域精選文章翻譯
by Matthew S. Smith

原文連結: Stanford’s AI Index for 2026 Shows the State of AI
《2026 年 AI Index》又是一本超過 400 頁的大部頭,Stanford HAI 把模型 benchmark、投資、醫療研究、就業與民意資料全塞進同一份報告裡,讓外界比較不容易只盯著單一指標喊「進步」或「泡沫」。這篇 IEEE Spectrum 的整理,延續 2021、2022、2023、2024、2025 年的觀察,挑出最能代表 2026 年 AI 現況的幾條趨勢。
根據 Epoch AI 的統計,2025 年由美國機構發佈的 notable 模型有 50 個。中國的產出正在追趕,但美國仍領先。
更驚人的是,幾乎所有 notable 模型都來自產業界,而不是學界或政府機構。Epoch AI 追蹤到 2025 年共有 87 個 notable 模型出自產業界,其他來源只有 7 個。這是長期趨勢的延伸。2015 年時,產業界只佔不到一半;2003 年甚至是 0%。如今,產業界已經佔了超過 90%。
如果說美國在模型數量上領跑,中國在機器人部署上則有明確優勢。依據 International Federation of Robotics 的數據,中國在 2024 年安裝了 295,000 台工業機器人。日本約 44,500 台,美國則是 34,200 台。
這張圖裡最搶眼的不是單一模型,而是整體算力的爆炸。
以 Nvidia 的 H100e 算力作為尺規,EpochAI 的估算顯示,全球 AI 算力自 2022 年起每年都增加超過 3 倍。和 2021 年相比,總 AI 算力已經成長了 30 倍。
Nvidia 吃到的紅利最大,因為它的 GPU 目前佔全球 AI 算力超過 60%。Amazon 和 Google 則分居第二、第三,兩者都投入自家硬體來支撐 AI 工作負載。
Stanford AI Index 近年一直在提醒 AI 訓練的碳排問題,而這次的數字依然不樂觀。
報告估計,訓練最新的 frontier LLM,像 xAI 的 Grok 4,可能產生超過 72,000 噸的碳當量排放。這比過去對 GPT-4 的 5,184 噸、以及 Meta Llama 3.1 405B 的 8,930 噸估計都高出一大截。
Ray Perrault 提醒,這些數字都只是估算。Grok 的數據大量依賴公開報導、xAI 說法與其他不可驗證來源,誤差本來就不小。另一方面,Epoch AI 甚至估計 Grok 4 的排放可能高到約 140,000 噸 CO₂。
推論階段的排放也在增加,而且模型之間差距很大。報告估計,效率最差的推論模型,其碳排超過效率最佳模型的 10 倍。以中等長度 prompt 來看,DeepSeek V3 約消耗 23 瓦,Claude 4 Opus 約 5 瓦。
過去十年,AI 模型能力的提升速度已經很誇張,而這份報告看起來只是在說,速度還在加快。多模態 LLM 尤其如此,新的 benchmark 幾乎一出來就被攻破。
agentic AI 的進展最明顯。圖上右側那兩條陡線,代表的是 OSWorld 和 SWE-Bench Verified。前者測試自動化電腦操作,後者測試自主寫程式能力。
Humanity’s Last Exam 也在快速進步。這個 benchmark 由各領域專家出題,試圖模擬最難的學科問題。2025 年版 AI Index 報告時,排名第一的 OpenAI o1 只答對 8.8%。現在已經升到 38.3%。而且這數字還有點過時,因為到 2026 年 4 月時,最高分模型像 Anthropic 的 Claude Opus 4.6 和 Google 的 Gemini 3.1 Pro 已經超過 50%。
但 Perrault 也提醒,benchmark 不一定能直接對應現實世界表現。對很多實際場景來說,真正缺少的其實是系統在特定環境裡到底要做到什麼程度的量化方式。像法律推理若有 75% 正確率,也不代表它就真的足以進入律所工作流。
AI benchmark 的進展,也能在醫療研究看見回聲。AI 在藥物發現上的論文數量,過去兩年已經翻了一倍多;多模態生醫 AI 的論文數量,則是兩年前的 2.7 倍。
這代表 AI 在醫學裡不再只是概念展示,而是真的進入研究管線。
另一邊,AI 也還是會在一些很日常的任務上翻車,像是讀時鐘、理解行事曆。
ClockBench 測試多模態 LLM 讀類比時鐘的能力。表現最好的模型 OpenAI GPT-5.4,也只有 50-50 的正確率。多數模型更差。Anthropic Claude Opus 4.6 的正確率只有 8.9%。
這聽起來有點反直覺,因為同一個模型在其他 benchmark 往往表現很好。但這也提醒了一件事,模型可能在紙上答題很強,遇到圖片與語言混合的真實任務時,仍可能把非文字資訊忽略掉。
模型能力提升,和 AI 公司募資、投資熱潮是綁在一起的。根據 AI 分析公司 Quid 的數據,2025 年 AI 投資創下新紀錄,總額超過 5,810 億美元。
這比 2024 年的 2,530 億美元(253 billion)多了一倍以上,也超過 2021 年的 3,600 億美元(360 billion)舊紀錄。和 2021 年不同的是,當年的高峰主要靠併購;2025 年則是由私人投資推上去。
其中大部分資金都流向美國,去年光是美國就吸走了超過 3,440 億美元(344 billion)的 AI 投資。
AI 熱潮不只來自資本,也來自開發者社群。
GitHub 上的 AI 相關專案在 2025 年已經衝到 5.58 million 個,也就是 558 萬個,和 2020 年相比約成長 5 倍,比 2024 年還多 23.7%。這看起來不像只是 AI 生成垃圾專案暴增而已,因為至少 10 顆星的專案數量與整體星數成長也差不多,代表人類參與度仍然很高。像 OpenClaw 這類熱門開源 agentic AI 軟體,甚至已經拿到 352,000 顆星。
AI 在學術界也很熱。過去十年,AI 相關的電腦科學論文從 102,000 篇增加到 258,000 篇;其中 2024 年仍有超過 68% 來自學界,政府與產業界分別約佔 11.5% 和 12.5%。
生成式 AI 的崛起,當然也伴隨著對工作流失的焦慮。不過目前資料還看不出單一方向。
報告拿 software developers 和 customer support agents 這兩個常被視為高風險職業來看,結果顯示入門職位確實減少了,但中階與資深職位大致持平,甚至有些還上升。
但這些變化仍很難從更大的經濟背景切開。報告同時指出,許多職業的失業率都在上升,而且出乎意料的是,最不受 AI 影響的職業,失業率上升得甚至比最受 AI 影響的職業還多。
這份報告最令人意外的,也許是民意端出現了小幅但明顯的樂觀回升。Ipsos 調查顯示,59% 受訪者認為「AI 的好處大於壞處」,高於 2024 年的 55%。另外有 68% 的受訪者表示自己對 AI 有「良好理解」,也比去年的 67% 稍高。
不過,負面感受也沒有消失。52% 的受訪者表示,使用 AI 的產品與服務會讓他們感到不安。
不同國家差異很大。東南亞國家,包括中國、馬來西亞、泰國、印尼與新加坡,整體對 AI 的態度都在變得更正面。年增幅最大的是德國 12%、法國 10%、荷蘭 10%。哥倫比亞則出現最明顯的負向變化,下降 6%。
雖然越來越多人覺得 AI 會帶來正面影響,但這種態度並不代表大家就信任政府能把它管好,尤其在監管這件事上,懷疑仍然很深。
美國尤其明顯。它雖然在 AI 投資上領先,但只有 31% 的 Ipsos 受訪者信任政府能有效監管 AI。許多歐洲國家與日本的信任度也偏低;相對地,亞洲與南美洲國家對政府監管 AI 的能力更有信心。
美國和哥倫比亞的結果很有意思。美國對 AI 監管高度不信任,但多數受訪者仍認為 AI 的好處會超過壞處。哥倫比亞則相反,對 AI 監管有很高信任,卻對 AI 整體前景越來越悲觀。
這很像 2025 年 AI 敘事的縮影。模型結果的品質,以及社會對 AI 影響的看法,都還在不同任務、不同國家與不同情境下大幅分歧。
2026 年的 AI 競賽,已經不只是「誰把模型做得更強」而已。算力、電力、碳排、監管信任、就業結構,全部都一起被拉進戰場。模型 benchmark 可以一路刷新,但如果部署成本、能源代價和社會接受度跟不上,成長曲線就會開始長出摩擦。
更值得注意的是,AI 的進步不再平均地落在所有任務上。某些基準早就被攻破,某些日常任務卻還很脆弱。這代表真正的競爭,可能已經從「能不能答對」轉向「能不能穩定進入現場流程」,包括可監管、可解釋、可持續,還有可負擔。
換句話說,下一輪贏家不一定是最會衝 benchmark 的團隊,而是最能把能力、成本與信任一起打包的人。