
就在剛剛,OpenAI 發布新一代圖像生成模型 ChatGPT Images 2.5。
官方表示,新模型重點提升了圖片細節質量、生成速度、編輯精度以及多輪修改過程中的一致性,並新增 Sketch 手繪參考、創作模板、圖片評論編輯等功能,讓用戶能夠更接近專業設計流程完成 AI 創作。
ChatGPT Images 2.5—faster, sharper, smarter, with better tools for creating whatever you can dream of. - Faster image generation to keep your ideas flowing - Improved fidelity for more natural, recognizable images - Consistent details across multiple edits - Comment-based edits to change only what you want https://twitter.com/OpenAI/status/2097394956457623964
OpenAI 稱,目前用戶每周通過 ChatGPT Images 和 API 中的 GPT Image 系列模型生成超過 30 億張圖片。
Images 2.5 的推出,意味著 OpenAI 希望進一步擴大 AI 圖像工具在個人創作、營銷設計、產品視覺等場景中的使用範圍。
Images 2.5 is here. I don't think it can solve super difficult math problems, but it is really good and we hope you enjoy it. https://twitter.com/sama/status/2097410967978324010
相比上一代 Images 2.0,Images 2.5 最大變化在於對「修改」的理解能力提升。

過去,AI 繪圖通常更擅長從零生成一張圖片,但當用戶要求調整某個細節時,模型容易誤改其他部分。例如修改人物服裝時,可能改變臉部特徵;調整背景時,可能導致整體風格發生變化。
OpenAI 表示,Images 2.5 在精準編輯方面進行了優化,能夠更準確執行用戶指定的修改,同時保留原有主體、構圖和視覺風格。用戶可以針對產品、背景、文字等單個元素進行調整,而無需重新生成整張圖片。真就·指哪打哪。

OpenAI 展示的案例中,一張人物照片可以被轉換成不同場景和風格,例如將普通人物頭像改造成復古攝影棚寫真,或者將寵物照片轉換成新的視覺主題,同時保持原始人物和動物的關鍵特徵。
我也實際嘗試了 Images 2.5 多個不同類型的生成任務。
比如在人像生成測試中,我嘗試要求模型保持參考人物面部特徵,生成一張高清攝影創意作品。

實際效果顯示,Images 2.5 對參考人物特徵的保留能力有所提升。模型能夠在改變攝影風格、服裝和環境的同時,讓人物身份保持較高一致性。
而且現在,Images 2.5 也終於能夠通過數字直觀顯示圖片生成進度了。

根據網友的測試,甚至還能在生成圖像期間玩貪吃蛇。
類似能力也體現在影視角色合成場景中。例如,我測試了馬斯克「與教父在片場自拍」的場景,要求模型保留參考照片人物的臉部結構、表情、姿態,並生成一張 1:1 比例的電影幕後自拍。

這一類任務過去容易出現人物臉部變化、比例錯誤等問題,而 Images 2.5 對人物主體的保持更加穩定。
在街頭攝影風格下,馬斯克的「人生照片」也是有了。

除了人物,Images 2.5 對產品視覺設計的理解也有所增強。在一個商品設計測試中,我要求模型生成一隻完全由柔軟毛絨材質構成的可樂罐。

在複雜視覺邏輯測試中,我嘗試生成一個遞歸畫面。
提示詞要求「一隻橘貓坐在辦公室椅子上拿著 iPad,iPad 螢幕中又顯示同一隻貓拿著同一個 iPad,並不斷循環」。

這種遞歸結構需要模型同時理解主體、螢幕內容以及重複關係。生成結果能夠識別這種視覺嵌套關係,完成多層遞歸效果。
除了寫實圖片,Images 2.5 對複雜藝術風格的理解也有所提升。

在這幅黑神話風格的畫面中,Images 2.5 的整體風格更接近遊戲概念原畫,而不是簡單堆疊符號。

還有《三國演義》連環畫風格插畫。
生成結果能夠理解黑白線描、淡彩上色、老式紙張質感等傳統連環畫特徵,整體視覺更接近中國經典插畫風格,而不是簡單添加古裝元素。

和前代一樣,Images 2.5 在中文這塊表現亮眼。

整體來看,Images 2.5 的提升主要體現在三個方面。
一是對複雜提示詞的理解能力增強,能夠同時處理多個風格、主體和限制條件。二是參考圖保持能力提升,人物、產品等核心元素在多次修改過程中更加穩定。三是編輯流程更加接近真實設計工作,用戶可以圍繞同一張圖片持續調整,而不是反覆生成新的結果。
從網友 @aimlapi 的實測效果來看, 對 Nano Banana Pro 來說,Images 2.5 的效果明顯更有藝術風格。

不過 Images 2.5 也不是沒有缺點,比如噪點這一塊依舊可以說是災難級別的。
GPT-Image-2.5 has arrived in @ChatGPT 🔥 It features many improvements, but I couldn't help myself from doing the infamous "noise artifact" test. The results are mixed! Prompt: "Photo of a clearing in the woods with lots of green foliage, highly detailed" See for yourself: https://twitter.com/mark_k/status/2097411028510179759
再比如也有網友發現,OpenAI 官方展示案例中仍存在一些細節瑕疵。
Chatgpt images 2.5 released and on their official page they put one of the examples a 3 fingered man... https://openai.com/index/introducing-chatgpt-images-2-5/ Are we back in 2024? https://twitter.com/OriSilver/status/2097432538931175852
除了模型能力提升,OpenAI 也為 ChatGPT 增加了一系列圍繞創作流程的新功能。
其中,Sketch 功能允許用戶直接在 ChatGPT 中繪製草圖,並將其作為生成圖片的視覺參考。用戶可以簡單畫出房間布局、服裝輪廓或創意草稿,再讓 AI 根據描述生成完整圖片。
比如,我隨手一畫,就能生成筆記本和鋼筆。

Sketch 通過手繪直觀表達畫面布局和創作意圖,解決了用戶難以用文字準確描述空間關係、反覆調整提示詞的問題。
OpenAI is cooking right now with GPT 6 Astra and Image 2.5 in the same week One of the best-selling points that Codex has always had is how strong their built-in image generation is There are literally only three good models with built-in image generation, and that's Codex, MiniMax, and Grok 1. Grok images/videos are straight slop but have no rules and are super cheap 2. MiniMax's H3 video generation is amazing, but images are a bit behind 3. Codex has and always has had the strongest built-in image generation Anthropic doesn't even have built-in image generation, let alone a model worth using nowadays Sketch mode for image 2.5 is also super fun lol it turned this straight-up slop painting of mine into a Demon's Souls boss fight pretty easily lmaoo https://twitter.com/ashen_one/status/2097398184897077699
看來接下來網際網路將湧現出一大批「靈魂畫師」了。
該圖片疑似使用了AI生成技術,請謹慎甄別
ChatGPT Images 2.5 using Sketch tool. https://twitter.com/_simonsmith/status/2097422966027886821
除了靜態圖片,Sketch 也可以用於 GIF 等動態內容創作。
Using GPT-Image 2.5 to created animated GIFs from a sketch. It only took a few notes to get to this: https://twitter.com/AndrewMayne/status/2097425210735542335
OpenAI 還推出了模板功能,幫助用戶從常見設計場景開始創作,例如海報、商品圖片等。用戶無需從空白提示詞開始,可以選擇模板後進一步補充文字、風格和設計要求。

此外,用戶現在可以直接在圖片上添加評論,指定需要修改的位置,也可以分享生成圖片時使用的提示詞,讓其他用戶基於同一創意生成自己的版本。
面向開發者,OpenAI 同步推出兩個 API 圖像模型。
其中,GPT Image 2.5 Flare 是面向大多數應用場景的默認模型,在質量、編輯能力和速度方面進行了升級。
OpenAI 表示,相比 GPT Image 2,該模型能夠提供更高質量的圖片,同時將延遲降低 50%,適用於社交內容、電商視覺、視覺搜索和大規模圖片生成等場景。
GPT Images 2.5 est déjà sur @higgsfield , j'ai pu le comparer sur un prompt assez exigeant 👉 A gauche, GPT Image 2, en High & 4K 👉 A droite, GPT Image 2.5 Sunburst, en High & 4K https://twitter.com/leploutos/status/2097409785628950872
另一款 GPT Image 2.5 Sunburst 則面向更高要求的創意工作流程,強調更精細的控制能力,適用於廣告素材製作、高端產品圖片設計等場景。
目前,ChatGPT Images 2.5 已向 ChatGPT、ChatGPT Work 和 Codex 用戶開放,覆蓋桌面端、移動端和網頁端。API 用戶則可以調用 GPT Image 2.5 Flare 與 GPT Image 2.5 Sunburst。
ChatGPT Images 2.5 的意義,並不只是一次圖像模型升級。一個能夠理解視覺內容、保持上下文一致,並根據反饋持續調整的圖像模型,也將會成為 AI 理解世界的重要組成部分。
感興趣的朋友快去體驗一下吧。






