人工智慧

GPT Image 2 教學:用法與商用授權一次搞懂

眼前有一張海報,標題置中、內文分成三段排得整整齊齊,連價目表裡的數字都對齊到毫米不差。若被問這張圖是設計師花了半小時在排版軟體裡調出來的,還是有人打了一句話就讓 AI 生成的,多數人會直覺選前者。答案卻是後者——這是 OpenAI 最新一代圖片生成模型「GPT Image 2」單靠一句文字指令做出來的成品。

這個反差正好點出 GPT Image 2 這一代最大的突破:過去 AI 生成圖片最常出錯的地方,精準的文字、複雜的版面,這次終於準到能直接拿來用。但「準了」不代表「什麼都能做」,對經營者與設計工作者來說,真正該弄懂的其實是兩件事,這支工具怎麼開始用,以及生成出來的圖能不能商用、有沒有法律上的地雷。

先從它是什麼、跟前代機型差在哪裡講起,再一路拆到怎麼上手、文字渲染的真實表現,最後回到商用授權這個最多人在意的問題。

GPT Image 2 是什麼?跟 DALL-E 3、前代機型有什麼差異?

時間回到 2026 年 4 月 21 日,OpenAI 把圖片生成模型推上了新的世代,這天發布的產品名稱是「ChatGPT Images 2.0」,API 端的模型代號叫 gpt-image-2,同一天就一次內建進 ChatGPT、Codex 與 API 三個地方,不需要額外安裝任何外掛。

它不是外部掛在 ChatGPT 上的協力廠商工具,而是 OpenAI 自己家最新的旗艦圖片模型,取代的正是自己前一代的產品。這一代最關鍵的變化,OpenAI 稱之為「思考」(thinking)能力,模型在真正畫出畫面之前,會先在背後想過一輪版面怎麼安排、文字要放在哪裡、物件彼此的關係是什麼,再開始動筆生成。後面會反覆看到的文字渲染變準、複雜構圖更完整,根源都在這一步。

從 DALL-E 3 到 GPT Image 2,技術世代怎麼演進的?

把時間軸拉開來看,GPT Image 2 其實已經是第四個世代。最早的 DALL-E 3 屬於擴散模型(diffusion model)時代,靠逐步去除雜訊的方式畫出整張圖。2025 年 3 月,OpenAI 把原生圖片生成能力直接內建進 GPT-4o,當時對外稱為「4o image generation」,後來在 API 端定名為 GPT Image 1,這是技術路線第一次轉向。2025 年 12 月,OpenAI 再推出 GPT Image 1.5,持續優化細節與速度。到了 2026 年 4 月,才輪到加入推理能力的 GPT Image 2。

常被搞混的一點是,DALL-E 3 並不是被 GPT Image 2 直接取代,而是被整個 GPT Image 家族取代掉的舊世代,GPT Image 2 只是這個家族目前最新的一棒。

GPT Image 2 是 GPT Image 家族第四個世代,從 DALL-E 3 的擴散模型一路演進到 2026 年 4 月加入「思考」推理能力
從 DALL-E 3 到 GPT Image 2 共四個世代,最新這一代最大的轉折是在生成前先「思考」過版面(資料來源:OpenAI)。

自回歸架構跟過去的擴散模型,有什麼差異?

DALL-E 2、DALL-E 3 用的擴散模型,運作邏輯是從一片雜訊開始,一步一步把雜訊去除,直到浮現出完整畫面。這套做法擅長畫出漂亮的色調與光影,但要精準控制文字或版面位置時常常失手,因為整張圖是一起收斂出來的,沒有明確的「先寫字、再排版」這種順序概念。

GPT Image 家族走的是不同路線。OpenAI 的 API 文件說明,這個系列較早幾代的模型是先產生一連串專屬的「圖片 token」,再據以生成畫面,概念比較接近先理解語意、再逐步構築出圖像,而不是整張一起去噪。GPT Image 2 在這套基礎上,再往前加了一層「思考」,官方說法是它會先推理過版面結構才真正動筆生成。對一般使用者來說,感受得到的差別很直接,文字更準確,模型對指令的理解也更聽話。

擴散模型把整張圖一起去噪收斂,GPT Image 2 走自回歸路線、動筆前先「思考」推理版面,因此文字與版面位置更準
不是整張一起去噪,而是先理解語意、先「思考」版面再動筆,這正是 GPT Image 2 文字變準的根源(資料來源:OpenAI)。

怎麼開始使用 GPT Image 2?ChatGPT 與 API 是最實用的兩個管道

談完技術脈絡,接下來是更貼近你實際會做的事,這支工具要從哪裡開始用。最常見的入口是 ChatGPT 對話介面,直接打字描述想要的畫面就能生成,不用額外安裝任何東西;如果目標是整合進自己的網站、App,或是想做批次產圖的流程,就得走 API。OpenAI 的官方文件裡也提到,Codex(也就是 OpenAI 的程式開發代理)同樣內建這顆模型,寫程式、建網站時要順手產出一些素材,同一顆模型就能處理,不必切換工具。

在 ChatGPT 裡怎麼叫出 GPT Image 2?

在 ChatGPT 的對話框裡,不需要手動切換模型或啟用任何功能,只要用一般語句描述想要的畫面,系統就會自動判斷該用圖片生成能力來回應。生成完的圖片可以直接在對話串裡下載,也可以接著用文字要求局部修改,像是換掉背景顏色、放大某一段文字,這部分後面會有專門一節說明怎麼下指令才準。

OpenAI 官方公告清楚寫到,ChatGPT Images 2.0 的基本生成功能,從今天起開放給所有 ChatGPT 與 Codex 使用者,但要用到「思考」模式的進階輸出,包括讓模型先上網查資料、一次生成好幾張不同構圖、自己檢查產出結果這些能力,目前只開放給 Plus、Pro、Business 這幾個訂閱層。換句話說,免費帳號一樣能用 GPT Image 2 生成圖片,只是碰不到最吃資源的那一層進階功能。

想串接進自己的工具或網站,API 怎麼接?

API 這端提供兩種串接方式,選哪一種要看情境。單次生成或編輯一張圖,用 Image API 最直接;如果想做的是對話式、可以來回調整的產圖流程,像是先出一版草稿再一路修到滿意,交給 Responses API 處理會比較順手。實際打 API 時要決定的參數不複雜,主要是模型名稱、這次是要「生成」還是「編輯」既有的圖、輸出的尺寸與品質等級。

另外有一個容易被忽略的前置作業,第一次要用 GPT Image 系列模型之前,開發者主控台裡可能會要求先完成「API 組織驗證」(Organization Verification),這是 OpenAI 為了確保這類模型被負責任地使用而設的門檻,沒完成驗證會擋在呼叫這一步之前。

GPT Image 2 的文字渲染,準到可以直接拿來做設計稿嗎?

回到文章一開頭那張海報,它能通過那個「猜猜看」的關卡,靠的就是這節要講的重點,文字渲染。OpenAI 在發布時的說法是,這一代在細節指令的遵循度、物件彼此位置的精準關係,以及密集文字的呈現上,都是一次階段性的跨越,而且支援多種長寬比輸出。說得直接一點,海報標題、菜單價目、包裝上的文字這類過去 AI 生成圖片最常出錯的場景,這一代終於有機會直接拿來用,不用再回去手動修字。

不過坦白說,這不代表萬無一失。OpenAI 自己在技術文件裡也承認,文字渲染雖然有大幅改善,模型仍然可能在精準的文字位置與清晰度上出錯。實務上比較合理的用法,是把 GPT Image 2 生成的圖當成很接近成品的草稿,例如一家經營電商的中小企業想快速做出含正確價格標籤的商品示意圖,拿它先出一版再人工核對數字與位置,會比從零手工排版快很多,但上架前那道校對還是省不掉。

中文、日文等非拉丁文字,準確度到什麼程度?

這是台灣使用者最在意的問題,官方對這一點講得比想像中具體。發布公告裡點名,這一代在非拉丁文字的渲染上有顯著進步,特別是日文、韓文、中文、印地文與孟加拉文這幾種語言,不只是把文字排上去,產出的文字內容讀起來也更連貫,不會出現字型正確、但語句東拼西湊的狀況。這代表中文並不是被含糊帶過的「其他語言」,而是被具體點名有明顯改善的對象。

只是官方目前沒有針對中文另外公布一個具體的準確率數字,網路上流傳的某某百分比,大多查無官方一手出處,不建議直接引用。比較踏實的做法,是自己拿實際要用的文案去生成幾張含中文字的圖,親眼確認排版與文字是否符合需求,尤其是標題字數較多、或版面比較擁擠的情境,再判斷能不能直接沿用。

多元素構圖不用分開生成,GPT Image 2 一次排定版面

文字準了只是第一步,另一個常見的痛點是複雜版面。過去要生成一張含多個物件、多個主體的畫面,常常是元素跑位、比例對不起來,得靠人工把好幾張單獨生成的圖拼接起來。這一代因為有前面提到的「思考」能力,會先規劃過整體結構再動筆,完成度明顯提升,適合資訊圖表、產品陳列示意圖、分鏡式海報這類需要多個元素同時存在的畫面。

OpenAI 的 API 文件裡有一個實際範例,提供四張參考圖片,模型能把裡面各自的物件合成到同一個禮物籃畫面裡。轉譯到比較貼近台灣讀者的情境,像是一家品牌想把好幾張分開拍的商品照,合成一張放在同一個場景裡的情境圖,原本要靠美編一張一張手工拼接,現在可以先餵參考圖讓模型處理過一輪雛形。「思考」模式下也能一次產出多張構圖,官方公告提到最多能一次生成八張延續同一組角色與物件的圖,適合做成一系列的社群素材或分鏡草案。

當然,構圖控制依然不是零失誤。OpenAI 也承認,儘管指令遵循度變好了,模型在需要精確定位元素的結構化版面裡,還是可能出現放錯位置的狀況,越講究精準對齊的設計稿,越需要人工做最後一輪確認。

適合哪些構圖類型?資訊圖表、商品陳列、多張參考圖合成

把上面講的能力對應到實際會用到的場景,大概可以分三類。第一類是資訊圖表,文字跟圖示需要混排在同一個版面,正好吃到文字渲染與構圖規劃這兩項進步的紅利。第二類是商品陳列示意圖,把多個商品排在同一個畫面裡展示,過去最容易比例跑掉,現在能一次規劃好相對位置。第三類是用多張參考圖合成新圖,例如把好幾張分開拍的素材合成一張情境圖,不用再靠人工去背拼貼。三種情境的共通點,都是需要在同一張圖裡處理不只一個主體,這正是這一代模型被強化的重點。

GPT Image 2 適合資訊圖表、商品陳列與多張參考圖合成三類多元素構圖,一次最多能生成 8 張延續同角色的圖
資訊圖表、商品陳列、多張參考圖合成,是最吃 GPT Image 2 構圖紅利的三類場景,「思考」模式一次最多可產 8 張(資料來源:OpenAI)。

生成完的圖還能局部修改嗎?多輪編輯與跨圖一致性怎麼使用?

圖產出之後,如果只有一個小地方不滿意,不需要整張重新來過。GPT Image 2 支援用自然語言接著下修改指令,像是換背景、拿掉某個元素、把文字放大,模型會在原圖基礎上調整,而不是重新解讀一次完整的描述。除此之外,它也具備跨多次生成維持同一角色或風格的能力,對常常需要反覆修圖的設計工作來說,這比每次重寫一整套指令碰運氣要實際得多,更像是在跟一個懂你上一步在畫什麼的助手來回討論。

實作上有兩種做法,一種是透過 Responses API 的多輪對話,把上一次生成的結果編號帶進下一次請求,模型就知道要在哪張圖上繼續調整;另一種是直接上傳原圖加一張遮罩(mask),把要修改的範圍圈出來,模型會照著遮罩指定的區域動手,其餘部分保留不變。

只是跨圖一致性也不是完全穩定。OpenAI 自己的說法是,雖然模型有能力產出一致的畫面,但在多次生成之間,偶爾還是可能沒辦法完全維持住反覆出現的角色或品牌元素的樣貌,這點在需要嚴格對齊識別系統,像是固定角色、固定品牌配色的專案裡要特別留意。

怎麼下修改指令,AI 才會只改你要的地方?

下修改指令的原則其實很單純,明確講清楚要改哪一個部分,而不是把整張圖重新描述一遍。官方文件裡示範的做法,是先生成一張基礎圖,接著只用一句像「把它變得更寫實一點」這樣聚焦在單一調整方向的指令,而不是連同背景、角色、構圖全部重新交代一次。指令描述得越模糊、涉及的範圍越廣,模型越容易把不該動的地方也一起改掉。實務上可以把每一輪修改都當成一次小範圍的微調,而不是重新下一次完整的訂單,這樣跑出來的結果通常比較貼近預期。

AI 生成的圖怎麼被辨識出來?C2PA 與 SynthID 雙層標記機制

生成的圖能不能被看出來是 AI 做的,是另一個經營者常擔心的問題,不管是想避免被平台誤判成造假內容,還是反過來想確認一張看起來很專業的圖是不是 AI 生成。GPT Image 2 生成的每一張圖,同時帶有兩層來源標記,C2PA 內容憑證,以及 SynthID 浮水印。

C2PA 是一套開放的技術標準,讓出版商、企業等各方能把媒體的來源與相關資訊寫進中繼資料(metadata)裡,並不是專門為 AI 生成內容設計的,相機廠商、新聞機構也在採用同一套標準來認證內容的來源與歷程。SynthID 則是一種隱形浮水印技術,把訊號直接嵌進生成內容本身,跟中繼資料不同的是,這個訊號是圖片的一部分,就算經過某些編輯或轉檔,訊號也可能保留下來。

兩者剛好互補,C2PA 能承載比較完整的來源脈絡,SynthID 則在中繼資料撐不住的情況下,像是截圖、轉檔導致資訊被剝除,提供額外一層保險。ChatGPT、Codex 與 API 生成的圖片,兩層標記都會同時附上。

GPT Image 2 生成的每張圖都同時附上 C2PA 內容憑證與 SynthID 隱形浮水印兩層來源標記,彼此互補
C2PA 把來源寫進中繼資料、資訊量大但易被剝除,SynthID 把訊號嵌進像素、耐得住截圖轉檔,兩層互補(資料來源:OpenAI)。

C2PA metadata 記了哪些資訊?

C2PA 這套標準記錄的是內容的來源脈絡,像是這份內容是怎麼被創作出來的、經過哪些編輯步驟等背景資訊。它不是 OpenAI 自己發明的封閉系統,而是一套跨產業共同採用的開放標準,除了 AI 生成內容,相機廠商為照片附加拍攝資訊、新聞機構為報導附加來源證明,用的也是同一套規格。這樣的好處是,不管內容最後被轉貼到哪個平台,只要支援 C2PA 的工具都讀得懂這份憑證,不用各家平台各自定義一套規則。

SynthID 隱形浮水印,跟看得見的浮水印有什麼差異?

SynthID 原本是 Google DeepMind 開發的技術,OpenAI 透過合作把它導入自家的圖片生成產品。跟一般認知裡「浮水印」會在畫面上留下看得到的圖案或文字不同,SynthID 是把一段訊號嵌進圖片的像素本身,肉眼完全看不出來,卻能在後續的截圖、壓縮、轉存等操作之後,某種程度保留下來。這也是它跟 C2PA metadata 最大的差別,中繼資料能記的資訊量比較大,但只要檔案被處理過一輪就容易被整段剝除;浮水印能傳遞的資訊比較精簡,耐得住的操作卻更多。如果你在其他地方看過 AI 生成的影片帶著看得見的浮水印圖案,那是不同的做法,跟 SynthID 這種嵌入式的隱形訊號不要搞混。

自己想確認一張圖是不是 AI 生成,怎麼查?

OpenAI 提供一個公開的驗證工具,把想確認的圖片上傳上去,系統會檢查裡面有沒有支援的來源標記,包括源自 OpenAI 的 SynthID 浮水印,或是經過 OpenAI 認證的 C2PA 憑證,只要找到其中一種,就能判斷這張圖是用 OpenAI 的工具生成的。官方也提醒,這個工具只能確認「是不是用 OpenAI 工具生成」,不能確認圖片內容是否準確、有沒有被後製,或是用在什麼樣的情境底下。

比較容易被誤解的是「查不到訊號」這件事。查不到不代表這張圖一定不是 AI 生成,可能是中繼資料在轉存過程中被剝除、浮水印訊號因為壓縮或編輯而劣化、圖片來源本身不在支援範圍內,或者這張圖是在這套標記機制上線之前生成的。換句話說,這兩層標記能證明「有」,但沒辦法百分之百證明「沒有」。

GPT Image 2 生成的圖可以商用嗎?授權範圍與使用限制

回到最多人真正在意的問題,花時間搞懂怎麼用,這張圖能不能拿去做生意用。先講結論,OpenAI 的使用條款明確允許使用者把輸出內容用於商業用途,包括重製與銷售。但條款寫「可以商用」不等於「什麼都不用管」,底下還有幾個要分清楚的層次,分別是使用權本身、著作權登記,以及使用時要自己承擔的責任邊界。

GPT Image 2 生成的圖可以商用,但要分清使用權、著作權登記與使用責任三層,並避開肖像權與商標兩條紅線
OpenAI 允許把 GPT Image 2 的輸出商用,但「可商用」不等於「可登記著作權」,肖像與商標兩條紅線也不能踩(資料來源:OpenAI 使用條款、美國著作權局)。

生成的圖,所有權算誰的?

依 OpenAI 的使用條款,你對輸出內容擁有所有權,OpenAI 會把它在輸出內容上擁有的權利、所有權與利益都轉讓給使用者。白話說,這張圖生成出來之後,是使用者的東西,不是 OpenAI 的東西。

但有一個常被忽略的但書,條款裡的「相似內容」規定寫得很清楚,由於服務與人工智慧本身的性質,輸出內容不見得獨一無二,其他使用者也可能拿到類似的輸出結果,而前面那項權利轉讓,並不延伸到其他使用者的輸出內容,或是任何第三方輸出內容上。也就是說,如果你打的指令描述不夠獨特,別人用類似的描述可能也拿到很接近的圖,這不算侵權,也代表這張圖談不上真正的獨家。

商用授權跟著作權登記,是兩回事

「OpenAI 允許你把輸出拿去商用」跟「這張圖能不能在著作權法底下登記、受到排他保護」,是兩個完全不同層次的問題,很容易被混為一談。依美國著作權局在 2025 年 1 月發布的報告,其中針對生成式 AI 產出內容可著作權性的專門章節指出,純粹由 AI 生成、缺乏人類實質創作貢獻的產出,通常無法取得著作權登記;如果使用者對生成結果有實質的修改、編排或再創作,情況可能不同。

這裡要提醒的是,這份報告立場來自美國法制,其他法域的規定不一定一樣,個案認定本身也有灰色地帶。如果生成的圖要用在比較重要的商業場合,像是要申請商標或著作權保護,建議另外諮詢專業意見,不要單靠這篇文章的說明自行判斷。

哪些情況不能直接商用?肖像與商標是常見地雷

除了著作權登記這個層次,OpenAI 的使用政策裡還列了幾條跟商用最相關的紅線。第一條是肖像權,政策明確禁止未經當事人同意,生成足以混淆真偽的擬真肖像或聲音,不管是拿名人臉孔做行銷素材,還是模仿特定真實人物的樣貌,都不在允許範圍內。第二條是智慧財產權,政策同樣禁止用來侵犯他人的智慧財產權,像是生成明顯抄襲既有商標、角色設計的內容。

這兩條紅線最容易在行銷素材裡不小心踩到,尤其是想借用某個知名人物或品牌的形象增加吸睛度時。實務上比較安全的做法,是把生成內容當成全新的創作起點,避免直接指名要求模仿特定真人或既有商標,真的需要用到具體肖像或品牌素材,還是回到取得授權這條正規路徑比較穩妥。

免費版、Plus、Pro 額度怎麼算?API 計費是另外一套邏輯

最後回到很現實的問題,這支工具要花多少錢、額度夠不夠用。ChatGPT 裡的訂閱制,跟透過 API 串接的計費邏輯是完全不同的兩套系統,分開理解會清楚很多。

ChatGPT 內建方案,免費版、Plus、Pro 有什麼差異?

前面提過,ChatGPT Images 2.0 的基本生成功能開放給所有 ChatGPT 與 Codex 使用者,連免費帳號都能用;但需要動用「思考」能力的進階輸出,像是模型自己上網查資料、一次生成多張構圖、自動檢查產出結果,目前僅限 Plus、Pro、Business 這幾個訂閱層才能用到。至於各方案實際的每月費用與額度上限,這類頁面內容常常隨時間調整,想確認自己目前的方案夠不夠用,直接到 ChatGPT 官方的定價頁面查當下顯示的內容最準,不要沿用網路上可能已經過期的舊數字。

API 怎麼收費?以解析度和品質決定價格

透過 API 使用是另一套邏輯,不是「一張圖一個固定價格」,而是依 token 用量計費,加總起來包含輸入的文字 token、編輯既有圖片時的輸入圖片 token,以及輸出圖片的 token,輸出的 token 用量又受解析度與品質設定,低、中、高這三個等級影響。

以 OpenAI 官方定價頁公布的數字換算,生成一張 1024×1024 的圖,低品質約 0.006 美元,中品質約 0.053 美元,高品質約 0.211 美元,長方形尺寸的價格略低一些:

品質1024×10241024×1536/1536×1024
低(low)0.006 美元約 0.005 美元
中(medium)0.053 美元約 0.041 美元
高(high)0.211 美元約 0.165 美元

API 的呼叫頻率也依帳號等級分級,免費開發者帳號目前不支援 GPT Image 2,從 Tier 1 開始才能呼叫,額度隨帳號等級往上遞增:

帳號等級每分鐘可生成張數
Free不支援
Tier 15 張
Tier 220 張
Tier 350 張
Tier 4150 張
Tier 5250 張

另外有一個規格常被誤傳。輸出解析度超過 2560×1440,也就是俗稱的 2K 以上,OpenAI 官方文件把它標示為「實驗性」設定,不是正式支援的標準規格,坊間不少文章寫成「支援 4K」並不準確,實際使用前建議以官方文件當下的標示為準。

回到文章開頭那張海報,它能通過那個「猜猜看」的關卡,靠的正是 GPT Image 2 這一代在文字渲染與版面規劃上的真實進步,但這篇文章走到這裡也該坦白講,GPT Image 2 真正改變的不是「AI 能不能生成圖片」這個早就有答案的問題,而是「這些圖能不能直接拿來用」。這道分水嶺,才是它跟前幾代機型真正的差距所在。

只是技術進步不會讓使用權、著作權登記、肖像與商標這幾條規則跟著消失,它們原本該顧慮的事,一件也沒少。動手用之前先把這幾件事分開想清楚,才是真正把這個工具用對的起點。

資料來源
  1. Introducing ChatGPT Images 2.0 — OpenAI
  2. Usage Policies — OpenAI
  3. API Pricing — OpenAI
  4. Copyright and Artificial Intelligence, Part 2: Copyrightability — 美國著作權局