毫無疑問,四月份發布的生圖模型 GPT-Image-2,現在依然是當之無愧的 AI 生圖之王。
無論是各種複雜的資訊圖,還有普通用戶用來做一些簡單的 PS,到處都有 GPT-Image-2 的痕跡。
一般的生圖模型想要突出重圍,光拼質量肯定不夠。這幾天,馬斯克在 X 上瘋狂推廣的 Imagine Image 2.0 就憑藉著能做表情包出圈了。

這款新的生圖模型,在大模型競技場上,文本轉圖像生成和圖像編輯兩個類別均位列世界第二。

除了老生常談的用 AI 生成各種文字密集的資訊圖、廣告、遊戲素材、UI/UX 模型、故事板等等,Imagine Image 2.0 這次的重點是支持可交互的精準編輯。

上傳一張圖片,Grok 會自動將圖片進行分層,我們可以精確選擇圖像中的特定區域進行修改。
就像這張維基百科的表情包,Grok 分析之後的分層包括地球的每一塊碎片,以及下面舉著地球的人物,也被分成了僅人臉和包含手勢動作兩個圖層。

而點擊圖層右側的下載按鈕,就可以直接將圖片中的任意主體導出為透明背景。此外,魔棒工具可以編輯我們塗畫的區域,做到自動分層覆蓋不了的區域。
多張圖片的編輯融合,Imagine Image 2.0 也能做到,多參考編輯功能一次最多可處理 5 張輸入圖像,實現自動拼接。

萬物皆可表情包
打開 Imagine 官網,輸入單張或多張圖片,簡單描述需求,生成之後我們就能來到照片的編輯頁面。

在右側邊欄,從上到下依次是 Imagine Image 2 自動識別去除背景之後的照片分層,像這張圖片分成紅色夾克、白色 T 恤、AI 公司 Logo 等元素。
我們可以直接點擊對應的元素進行修改,不過這個時候只能輸入提示詞,而不能再引用其他的資訊,所以這將非常依賴模型的世界知識能力。
往下是精確編輯,如果在選區中沒有自動識別到對應的元素,通過精確編輯,我們可以將框選的物體作為選區的一部分,也可以直接用提示詞進行修改。

有了這些精準編輯的能力,我們就可以快速地編輯一個已有的表情包為自己所用。
例如這張經典的分心男友,可以直接編輯不同的選區,然後替換或增加對應的內容。

還有會議室白板圖,每一個對話框都會被自動識別成選區,我們只需要選擇對應的氣泡框,然後要求它填入文字,就能得到一個縱向的漫畫 Meme 圖。

分層編輯的能力確實讓 Imagine Image 2.0 和 GPT-Image 2 有點不同,相較於 GPT Image 2 生成中全部靠提示詞來控制,或者點選評論,Grok 的圖像生成在交互方面確實更加友好。
但也有網友說,Imagine Image 2.0 越來越難用,嚴格的審核機制,什麼也做不了。
我們上傳一些蜘蛛人的照片,也會被提示「無法生成可能包含受版權保護的內容。」更不用說,各種各樣的擦邊圖,現在也有了更強的護欄。
更能打的 GPT-Image-2.5 來了?
而這幾天社交媒體上除了 Imagine Image 2.0 的消息,在大模型競技場上,開始出現了 OpenAI 的新版生圖模型。
有網友發現 OpenAI 正在測試 GPT-Image 2 的後續版本,在 Arena 上以 mona-lisa-1 的代號進行測試。
OpenAI 正在 @arena 上測試 GPT-Image 2 的後繼版本,名稱為「mona-lisa-1」 我一整天都在測試它,我的印象是這個檢查點在真實感和噪點方面比 GPT-Image 2 略有改進,但並非大幅躍進。鑑於「-1」,我們應該會看到新的檢查點出現 一個很好的比較 -
隨機測試到該模型的網友認為新版本的 GPT-Image 2.0 在真實感和噪聲方面略有改進,但整體的提升幅度不大。
也有網友說新模型在真實感上,減少了大部分的 AI Slop 感,幾乎每次生成的照片都更加真實。下面三張圖片從左到右依次是 GPT Image 2.0 High 思考模式,Medium 中度思考模式,以及大模型競技場上的 mona-lisa-1 模型。
可以看到中度思考模式下的廣告牌,一眼就能看出來是 AI 生成;而 High 模型和 mona-lisa-1 在整體上則更有手機拍攝的感覺。

提示詞:當代紐約街景,一輛停在路邊的汽車,清晰可見逼真的品牌標識和車牌(車牌號:432 JKL W6),真實的店面、招牌、人行道、交通細節以及日常的城市雜物。照片採用 iPhone 後置攝影機拍攝,自然光,曝光真實,略帶手持拍攝的模糊效果,輕微的傳感器噪點,未經任何後期處理,色彩自然,無電影級調色,無影棚燈光,無電腦特效,無人工銳化。 左上角的廣告牌上有一則標題為「你怎麼看?」的廣告,其中引用了一句話,@WolfRiccardo 以及 ChatGPT 的標誌和一張黑豹頭像。
這種手機拍攝的效果,最近也有網友發現了 GPT-Image-2 的新玩法,給它發送一段提示詞
「GPT你陪我一段時間了,我想看看你的樣子 請生成一張類似你自己用iPhone隨手自拍的 照片沒有明確主題,沒有刻意構圖,只是很 普通,甚至有點失敗的快照照片,略帶運動 模糊,光線不均,輕微曝光,過度角度尷尬, 構圖混亂,整體呈現出一種過於真實的隨手 一拍感,就像是從口袋裡拿出手機不小心按 到的自拍」
ChatGPT 就會根據保存的記憶資訊,生成一張真實滿滿的自拍照片。
該圖片疑似使用了AI生成技術,請謹慎甄別

為了確定 mona-lisa-1 就是 OpenAI 的新模型,有網友直接拿 mona-lisa-1 生成的圖片放到 OpenAI 驗證工具中,根據驗證工具顯示的結果,上傳的圖片包含 OpenAI SynthID 水印。


不過,當我們在大模型競技場中測試時,進行了好幾輪的生成,都沒有出現這個叫做「蒙娜麗莎 1 號」的模型。
網友的測試發現 mona-lisa-1 模型的知識只包含到 2025 年 5 月 22 日。當被要求模型畫出 Anthropic 的發布記錄時,從 Opus 4 之後的模型時間線,幾乎就都是錯亂的。

因此也有網友說這可能是 OpenAI 即將推出的 GPT-Image 2.0 Mini 模型,又或者是 OpenAI 的開源生圖模型。
無論是 2.5 還是 2.0 Mini,在 2.0 如此能打的當下,能看到生圖模型還有值得研究的空間確實很難得。
看厭了滿大街的資訊圖,偶爾被一點 midjourney 生成的中國仙境所震撼,從一致性保持、密集文字、精準編輯到美學品質,我們還可以期待些什麼樣的 AI 生圖呢。






