AI Articles

AI 領域精選文章翻譯

View the Project on GitHub Kumazan/ai-articles

6 May 2026

美國把 Google、Microsoft、xAI 的前沿模型納入國安測試

by Jennifer Huergo

NIST · 2026-05-05

原文連結: CAISI Signs Agreements Regarding Frontier AI National Security Testing With Google DeepMind, Microsoft and xAI

摘要

· · ·

美國商務部 National Institute of Standards and Technology 轄下的 Center for AI Standards and Innovation(CAISI)今天宣布,已與 Google DeepMind、Microsoft、xAI 簽署新協議。

透過這些擴大的產業合作,CAISI 將執行模型公開前評估(pre-deployment evaluations)與針對性研究,以更好地評估前沿 AI 能力,並推進 AI security 的實務水準。

這些協議建立在先前已宣布的合作基礎上。先前的合作對象包括 OpenAI 與 Anthropic;相關協議已重新協商,以反映商務部長指示與 America’s AI Action Plan 對 CAISI 的要求。

在商務部長 Howard Lutnick 指示下,CAISI 被指定為美國政府內部與產業互動的主要窗口,負責推動與商業 AI 系統相關的測試、共同研究,以及最佳實務發展。

CAISI 與前沿 AI 開發者的協議,讓政府能在模型公開前進行評估,也能在模型部署後繼續做評估與其他研究。到目前為止,CAISI 已完成超過 40 次這類評估,其中包含仍未公開的 state-of-the-art models。

CAISI 主任 Chris Fall 表示,獨立且嚴謹的 measurement science,對理解前沿 AI 及其國安意涵至關重要。他也指出,這些擴大的產業合作,能在關鍵時刻協助 CAISI 擴大服務公共利益的工作。

這些協議支援資訊共享,推動自願性的產品改進,也確保政府能清楚理解 AI 能力與國際 AI 競爭的現況。

為了完整評估與國安相關的能力與風險,開發者經常會提供 safeguards 被降低或移除的模型給 CAISI。來自美國政府各單位的評估者可能參與評測,並透過 CAISI 召集的 TRAINS Taskforce 定期提供回饋。TRAINS Taskforce 是一個跨部會專家小組,專注於 AI 國安議題。

這些協議也支援在 classified environments 中進行測試,並且在設計上保留足夠彈性,以便快速回應 AI 技術持續演進。

· · ·

前沿 AI 監管正在移到發布前

這則公告真正值得注意的地方,在於它把「模型發布後再處理風險」往「模型發布前就先測能力」推進了一步。過去 AI safety 常被討論成一組抽象原則,但 CAISI 這類協議把流程具體化:誰拿到模型、何時測、測哪些高風險能力、測完如何回饋開發者。

對模型公司來說,這也是一種雙面訊號。一方面,政府測試能增加前沿模型的可信度,尤其是 cyber、bio、chemical 等國安敏感能力;另一方面,若評測流程變成事實上的發布前關卡,模型開發節奏、保密策略與跨國競爭都會受到影響。

對真的在做 agent 的團隊來說,這篇也提醒了一件事:前沿能力不只會被 benchmark 衡量,也會被治理流程衡量。當模型能操作工具、理解環境、找漏洞、連接外部系統,評測就不能只問「答得準不準」,而要問「在 safeguards 放鬆、工具可用、環境真實時,它能做到什麼」。

接下來值得觀察的不是協議本身,而是 CAISI 這套測試制度會不會逐漸形成可重複、可稽核、各家模型都必須面對的前沿 AI 發布流程。若會,這可能會成為美國 AI 產業的新基礎設施之一。