AI Articles

AI 領域精選文章翻譯

View the Project on GitHub Kumazan/ai-articles

21 April 2026

ChatGPT Images 2.0:找浣熊測試裡,OpenAI 這次贏了

by Simon Willison

AI News · 2026-04-21

原文連結: Where’s the raccoon with the ham radio? (ChatGPT Images 2.0)

摘要

· · ·

2026 年 4 月 21 日

OpenAI 今天推出了 ChatGPT Images 2.0,這是他們最新的圖像生成模型。Sam Altman 在 直播 上說,gpt-image-1 升級到 gpt-image-2 的飛躍,大概就像從 GPT-3 跳到 GPT-5 一樣。以下就是我實測的結果。

我的提示詞是:

做一張「找威利」風格的圖,不過要找的是拿著火腿電台的浣熊

gpt-image-1

先拿舊版 gpt-image-1 當基準,這是我直接在 ChatGPT 裡得到的結果:

我沒辦法把浣熊找出來,我很快就發現,拿「找威利」風格的圖來測試圖像生成模型,其實會讓人非常抓狂。

我試著請 Claude Opus 4.7 用它更新後的高解析度輸入來解題,但它反而堅持說圖裡一定有一隻浣熊,只是因為左上角那張說明卡片所以很難找:

沒錯,圖裡至少有一隻浣熊,但它藏得非常深。仔細掃過幾個放大的區域後,老實說,我沒辦法確定地找出一隻拿著火腿電台的浣熊。[…]

Nano Banana 2 和 Pro

接著我試了 Google 的 Nano Banana 2,經由 Gemini

這張就非常明顯了,浣熊就在圖片中央的「Amateur Radio Club」攤位裡!

Claude 說:

老實說,這張根本沒有在躲,牠就是攤位上的主角。這位插畫家大概是看上一張太難了,乾脆直接放水。攤位上那個「W6HAM」的呼號雙關也很有趣。

我也在 AI Studio 試了 Nano Banana Pro,結果得到的是這張,到目前為止,這是所有模型裡最糟的一次。我也不確定到底哪裡出了問題。

gpt-image-2

基準確立之後,來試試新模型。

我用的是更新版的 openai_image.py 腳本。它只是 OpenAI Python client library 的薄包裝;雖然官方 client library 還沒更新到支援 gpt-image-2,但好消息是它不會驗證 model ID,所以可以直接塞進去用。

我是這樣跑的:

OPENAI_API_KEY="$(llm keys get openai)" \
 uv run https://tools.simonwillison.net/python/openai_image.py \
 -m gpt-image-2 \
 "Do a where's Waldo style image but it's where is the raccoon holding a ham radio"

這是我拿到的結果。我覺得裡面看不到浣熊,我自己找不到,Claude 也找不到。

OpenAI 的 image generation cookbook 已經更新,加入 gpt-image-2 的說明,包括 outputQuality 設定和可用尺寸。

我把 outputQuality 設成 high,尺寸拉到 3840x2160,我相信這應該是上限,結果得到這張圖,輸出成了 17MB PNG,我再轉成 5MB 的 WEBP:

OPENAI_API_KEY="$(llm keys get openai)" \
 uv run 'https://raw.githubusercontent.com/simonw/tools/refs/heads/main/python/openai_image.py' \
 -m gpt-image-2 "Do a where's Waldo style image but it's where is the raccoon holding a ham radio" \
 --quality high --size 3840x2160

這張就相當不錯了!火腿電台浣熊確實在裡面,位置在左下角,而且很容易辨認。

這張圖用了 13,342 個 output tokens,按每百萬 30 美元計價,總成本大約是 40 美分

結論

我覺得這個新版 ChatGPT 圖像生成模型,至少目前已經把冠軍從 Gemini 手上拿走了。

拿「找威利」風格的圖來測試模型,其實有點惱人,也有點愚蠢,但它確實能很好地展示,這些模型在結合複雜插畫、文字與細節方面,已經進步到什麼程度。

更新:請模型自己解題其實很危險

rizaco 在 Hacker News 上 要 ChatGPT 在一張他沒找到浣熊的圖片上,把浣熊圈出來。下面這張是他得到的結果,和原圖混合後的動畫:

看起來我們真的不能相信這些模型能可靠地替自己解題!

Simon Willison

編輯:

Hacker News 討論:https://news.ycombinator.com/item?id=47852835

· · ·

延伸評論:圖像模型真的強了,但評測方式也更詭異了

這篇最有意思的地方,不只是 gpt-image-2 比前代更會畫,而是它把圖像模型評測的荒謬感一起放大了。找浣熊這種任務看起來像玩笑,卻剛好揭露一件事,模型不只在生成圖,也在重新定義「答對」到底長什麼樣子。

對做產品的人來說,真正值得注意的不是單次 demo 有多漂亮,而是高品質輸出下的穩定性、成本、以及模型是否真的能在複雜視覺線索裡維持一致性。這類能力一旦成熟,會直接影響設計工具、廣告素材、教育內容,還有一堆原本靠人工反覆修圖的工作流。