OpenAI 推出 ChatGPT Images 2.5 生成快 50% 兼改善精準修圖與角色一致性

Author:

Published:

- 廣告 -

OpenAI 正式推出新一代圖像生成模型 ChatGPT Images 2.5,針對生成速度、畫面細節、參考圖片保真度,以及多輪圖片修改能力作出改進。新版本已陸續向不同級別的 ChatGPT、ChatGPT Work 及 Codex 用戶開放,支援桌面、流動裝置及網頁版本。

OpenAI 表示,目前用戶每星期透過 ChatGPT Images 及 API 內的 GPT-Image 模型生成超過 30 億張圖片。Images 2.5 被定位為目前最新的圖像模型,主要改良包括更銳利的細節、更自然的光線和材質、更精準的圖片編輯,以及更快的生成速度。與 GPT-Image-2 相比,OpenAI 稱新模型最高可將圖像生成延遲降低 50%,讓用戶可以更快反覆生成及修改作品。

參考圖片保真度提高

其中一項重要改良,是模型處理參考照片的能力。過往利用人物或物件照片生成新場景時,經過風格轉換、姿勢改變或多次修改後,人物樣貌及原有特徵有機會逐漸偏離參考圖片。

- 廣告 -

Images 2.5 加強了對參考圖片主體的辨識及保留能力。OpenAI 指,新模型在把人物、地點或其他物件轉移至不同場景、構圖及視覺風格時,可以更有效保留原有辨識特徵,同時改善皮膚、材質及光線的自然程度。對需要製作同一人物或產品多款宣傳圖片的用戶而言,這亦有助維持視覺一致性。

舊模型在更換背景時,會出現移位甚至容貌、燈光有小許改變的情況,新模型就大幅改善這問題。
舊模型在更換背景時,會出現移位甚至容貌、燈光有小許改變的情況,新模型就大幅改善這問題。

修圖重點變成「只改你要求修改的地方」

另一項明顯改進是 Precision Editing 精準編輯

生成式 AI 修圖其中一個常見問題,是要求模型更改圖片某一個細節時,其他沒有要求修改的部分亦可能一併發生變化,例如人物面孔、服裝、背景、構圖甚至文字位置被重新生成。

Images 2.5 的設計重點之一,就是更準確理解「哪些地方需要修改、哪些地方不能改」。OpenAI 表示,即使畫面包含複雜人物及背景,新模型亦更能只改動指定物件,同時保留原有主體、構圖及其他細節。對產品照片及品牌素材而言,例如只更換商品、背景或一段文字,而不改變整體設計,實用性會較以往提高。

不單沒有錯字,修改時也不會隨便動到不需要修改的部分。
不單沒有錯字,修改時也不會隨便動到不需要修改的部分。

ChatGPT 同時加入圖片 Comment-based Editing 功能,用戶可以直接在圖片指定位置留下修改指示,進一步縮窄修改範圍。

多輪修改減少「愈改愈走樣」

Images 2.5 亦改善長對話中的 Multi-turn Editing Consistency

- 廣告 -

OpenAI 指,新模型在連續多次修改同一圖片時,會更可靠地保留之前已完成的改動,新指令會建立在上一版本之上,而非每次近乎重新生成整張圖片。圖片品質亦較不容易因多輪修改而逐步下降。

這種能力對實際設計流程尤其重要。例如先修改人物衣服、再移除背景物件、調整燈光,最後更改部分文字時,模型需要記住先前已確認的改動,而不是修改一處後令另一處回復原狀。

為狗狗換上不同服飾,真的能做到「絲毫不動」。
為狗狗換上不同服飾,真的能做到「絲毫不動」。

複雜構圖、透明背景及風格控制亦有改善

Images 2.5 同時提升對複雜視覺指令的理解能力。OpenAI 表示,模型在處理包含現實資訊的圖片時準確度有所提高,亦能處理更複雜的版面及透明背景。

在藝術風格方面,新模型亦更能維持用戶指定的視覺方向、構圖和個別元素,不容易隨著 prompt 愈來愈複雜而偏離原本要求。對需要製作一系列品牌風格一致的廣告圖片、UI 概念圖或簡報視覺素材的企業而言,這類穩定性尤其重要。

新增 Sketch 可以直接畫草圖給 ChatGPT

除了模型本身升級,OpenAI 亦加入新的 Sketch 功能。

有些構圖很難單靠文字描述,例如家具應放在哪個位置、衣服輪廓、人物站位或畫面中不同物件的比例。用戶現在可以直接在 ChatGPT 繪畫簡單草圖,再配合文字說明,由 Images 2.5 按照草圖生成完整圖片。

OpenAI 表示,用戶毋須具備繪畫技巧,草圖主要作用是向模型傳達構圖及形狀。在 ChatGPT 輸入「@Sketch」即可使用相關功能。

繪畫草圖,再加上簡單文字描述⋯⋯
繪畫草圖,再加上簡單文字描述⋯⋯
即能精準地生成照片。
即能精準地生成照片。

ChatGPT 亦新增 Poster、Merch 等常用圖像範本,讓用戶先選擇基本格式,再加入資訊、設計元素及指定風格。此外,用戶分享生成圖片時,亦可以選擇同時分享所使用的 prompt,讓其他人利用同一概念加入自己的照片或內容重新生成。

可以選擇同時分享所使用的 prompt,讓其他人利用同一概念加入自己的照片或內容重新生成。
可以選擇同時分享所使用的 prompt,讓其他人利用同一概念加入自己的照片或內容重新生成。

API 分為 Flare 與 Sunburst 兩款模型

開發者方面,OpenAI 同時推出兩個 GPT-Image-2.5 API 模型,分別是 GPT-Image-2.5 FlareGPT-Image-2.5 Sunburst

Flare 是大部分應用的預設選擇,主打生成速度及大量圖片工作。OpenAI 稱它在提供高於 GPT-Image-2 畫質的同時,可以降低約 50% 延遲,適合社交媒體內容、商品圖片、視覺搜尋、快速原型設計及大量圖片生成。

Sunburst 則集中於需要更高精準度的專業視覺工作,包括正式廣告素材及精修產品圖片。它提供更嚴格的修改控制,但相應需要較長生成時間。

API 規格亦進一步支援較高品質等級及更彈性的輸出尺寸,新模型加入 xhighmax 品質選項,並擴展可使用的圖片解像度及背景設定。

從「生成一張圖片」轉向完整創作流程

Images 2.5 的改良方向,已不再單純追求首次生成的圖片是否漂亮,而是進一步處理生成式 AI 在實際設計流程中的問題,包括人物是否走樣、修改局部時會否破壞其他內容,以及多次編輯後能否維持畫面一致性。

配合 Sketch、圖片註解修改及模板等工具,OpenAI 正逐步把 ChatGPT Images 從單純的文字生成圖片功能,發展成可以由構思、草圖、生成到反覆修圖的完整視覺創作工具。

- 廣告 -
Buy Me a CPM: PCM 讀者會員資助計劃
- 廣告 -

Related Articles

- 廣告 -

Recent Articles

- 廣告 -

最新影片

- 廣告 -