AI Articles

AI 領域精選文章翻譯

View the Project on GitHub Kumazan/ai-articles

10 April 2026

ChatGPT 語音模式其實是較弱的模型

by Simon Willison

AI News · 2026-04-10

原文連結: ChatGPT voice mode is a weaker model

摘要

· · ·

2026 年 4 月 10 日

很多人直覺會以為,ChatGPT 的語音模式既然最像在跟 AI 對話,那背後應該就是最強的模型。Simon Willison 指出,事情其實不是這樣。OpenAI 的語音模式跑的,是一個更老、也更弱的模型;如果去問它知識截止日期,它會回答 2024 年 4 月,這代表它其實還停留在 GPT-4o 時代。

他也提到,這種落差很容易被使用者忽略,因為語音介面給人的感覺就是「最即時、最自然、最像智能本體」。但 OpenAI 的實際產品分層,卻可能是語音一套、編碼一套、推理一套。語音模式會在一些最簡單的問題上翻車;相對地,較高階的 Codex 模型卻能連續運作一個小時,重構整個 codebase,甚至找出並利用系統漏洞。

Simon 認為,這種進步之所以能發生,是因為這些任務有兩個條件:第一,回饋函數明確而可驗證,像是單元測試有沒有通過;第二,這些能力在企業市場裡非常值錢,因此團隊會投入大量資源去優化它們。相對來說,像寫作這種很難被自動判定好壞的領域,就沒那麼容易靠同一套方法快速推進。

介面看起來越聰明,不代表模型真的越聰明

這篇最有意思的地方,是它把一個很常見的錯覺說破了:人們會把「最順手的入口」誤認成「最強的能力」。語音模式因為更自然、更像人,所以更容易被當成主模型,但產品實際上常常是多個模型分工,能力也不是同一條線。

對做 AI 產品的人來說,這提醒很直接。不要只包裝一個漂亮入口,還要想清楚不同入口到底要接哪個模型、該承擔什麼錯誤成本,以及使用者會不會把弱模型的失誤誤判成整個產品的問題。這種分層如果沒講清楚,期待值很容易直接炸掉。