用文字或參考圖開始創作 GPT Image 2 圖片

GPT Image 2 是 OpenAI 的圖片生成模型,既可以依提示詞建立新圖片,也可以利用現有視覺素材繼續創作。在 aiimg.me 選擇適合的工作流程,確認長寬比、輸出等級、圖片數量與積分預估後,即可在瀏覽器中生成。

呈現文生圖與參考圖創作方式的裝飾拼貼圖

從方向最明確的輸入開始

既能建立新圖片,也能參考現有圖片繼續調整

OpenAI 將 GPT Image 2 說明為可接收文字與圖片輸入、輸出圖片,並支援圖片生成與編輯操作。aiimg.me 將這些能力整理成文生圖與圖生圖兩個工作區。本頁介紹的是 aiimg.me 目前提供的設定,並非官方 API 的所有選項。

當主體、場景、構圖、配色、材質或視覺處理還在確認階段時,這個模型更實用:你可以用文字描述,也可以透過參考圖提供資訊。如果成品除了某個精確修改外都必須維持不變,它就不能取代可精準控制的圖片編輯工具。

查看 GPT Image 2 官方模型文件

適合這些需求

  • 把產品、行銷活動、編輯內容或社群媒體需求轉成第一版視覺方向。
  • 在正式製作前嘗試不同場景、配色、材質、取景或光線。
  • 以產品照、草圖、上一次結果、姿勢或版面為依據建立新版本。
  • 依最終版位所需的長寬比,比較少量候選圖片。

這些需求應使用其他工具

  • 圖層、筆刷遮色片、鎖定區域或可重複的像素級修正。
  • 無損修復或保證不變形地放大現有檔案。
  • 精確的文字排版、Logo、尺寸或法規要求嚴格的幾何結構。
  • 讓同一角色、臉孔、品牌元素或原圖細節在每次輸出中完全一致。

文生圖還是圖生圖?

關鍵是判斷最可靠的資訊在哪裡。文字已經能說明方向,就用文生圖;如果主體、結構或視覺風格用圖片展示比憑記憶描述更清楚,就用圖生圖。

當需求文件最可靠時,使用文生圖

先寫主體與最終用途,再補充場景、構圖、光線、材質、顏色與氛圍。有效的提示詞應包含看得見的決定,例如:「霧面鈷藍色檯燈的編輯風產品攝影,放在淺色石灰岩上,柔和側光,4:5 構圖,檯燈上方留出充足的標題空間。」

當原圖包含關鍵資訊時,使用圖生圖

至少上傳一張圖片,說明每張參考圖的用途,再寫清楚需要改變什麼。例如:「參考圖 1 只用於瓶身輪廓和正面機位;參考圖 2 只用於砂岩配色。把瓶子放在淺色洞石上,使用溫暖的晨間側光。」參考圖會引導一次新的生成,並不會鎖定原圖的每個像素。

用最小的一次生成回答眼前的問題

按下「生成」前,工作區會依輸出等級與圖片數量計算總積分。先生成一張 1K 圖片,是檢查構圖和指令方向最省積分的方式。只有當更高等級或更多結果確實服務於下一步時,再增加投入。

圖片數1K2K4K
110 積分20 積分40 積分
220 積分40 積分80 積分
440 積分80 積分160 積分

1K:先驗證需求,再擴大生成

每張 10 積分,適合先檢查主體、取景、配色與提示詞邏輯。把 1K 當作決策工具,而不是一個尚未解決創意問題的低階版本。

2K:需要更大的工作檔案時再選

每張 20 積分。方向已經確定,而且更大的輸出有助於下一階段時,選擇 2K 更合理。它解決的是輸出尺寸需求,不能取代再修改一次提示詞。

4K:只有尺寸真的重要時才用最高等級

每張 40 積分,是 1K 成本的四倍。4K 改變的是輸出等級,不會修正含糊的指令、多餘物件、錯誤文字或薄弱構圖。

先生成一張驗證;需要比較時再選兩張或四張

還在排查提示詞問題時,只要求一張圖片。當多個方案同時出現能幫助判斷時,再選擇兩張或四張;總成本會按每張價格乘以圖片數量。按下「生成」後,伺服器會對每個任務扣費;記錄為失敗的任務會退還已消耗的積分。

根據最終版位設定長寬比

可選比例包括 Auto, 1:1, 5:4, 9:16, 21:9, 16:9, 4:3, 3:2, 4:5, 3:4, 2:3。版面尚未確定時可用 Auto;1:1 適合方形版位,4:5 或 3:4 適合直式版面,9:16 適合直向螢幕,16:9 或 21:9 適合寬幅畫面。盡量在生成前確定最終用途,後續裁切可能會刪掉構圖依賴的留白。

只在每張參考圖都有明確作用時使用它

圖生圖至少需要一張參考圖,最多支援 16 張。每個檔案最大 30 MB,支援 JPG, JPEG, PNG, WEBP。上限適合讓不同圖片分別提供不同資訊,不是每次都應達到的目標。

先使用足以說明任務的最少圖片。如果兩張參考圖在形狀、機位、配色或光線上互相矛盾,要明確由哪張圖決定哪一項。額外圖片可以補充資訊,也可能帶來互相競爭的方向。

只上傳你有權使用的素材;加入機密或敏感圖片前,請閱讀我們的 隱私權政策

從需求到可用結果,分四步完成

一次有效的生成,在按下「生成」前就已經開始:先判斷可靠資訊來自文字還是圖片,選擇對應工作流程,只花足夠回答目前問題的積分,再檢查結果後繼續。

  1. 01

    確定要以什麼為準

    需求本身足以定義畫面時,選擇文生圖;如果主體、結構、姿勢、構圖、配色或材質需要由現有圖片提供,就選擇圖生圖。

  2. 02

    寫清楚畫面中看得見的決定

    說明主體、位置、構圖、光線、材質與氛圍。使用圖生圖時,要為每張參考圖安排用途,並同時寫明保留什麼、改變什麼。

  3. 03

    依用途設定比例與預算

    先依最終使用位置選擇長寬比,再選擇 1K、2K 或 4K,以及生成一張、兩張或四張。送出前查看頁面顯示的積分總額。

  4. 04

    生成、檢查,然後只改一件事

    放大結果,與需求和參考圖逐項比對。如果還要再試,先修改造成最大問題的那條指令,不要一次重寫所有條件。

把結果用作正式素材前,先完整檢查

OpenAI 的圖片生成指南指出,精確的文字位置與清晰度仍可能出錯,連續生成中的角色或品牌元素也可能不一致。即使整張圖片看起來可信,這些問題仍然重要。請放大結果,並與需求和參考素材逐項比對。

  • 逐字檢查文字、Logo、標籤、數字與符號;需要準確排版時,最後在排版工具中加入正式文字。
  • 比對不同結果中的臉孔、角色、產品與品牌元素,不要預設身分或結構會保持不變。
  • 發布前檢查手部、圖案、反射、對稱、接縫、尺寸與細小結構。
  • 不要期待 4K、更多結果或更多參考圖能解決含糊或互相矛盾的指令。

遮色片、鎖定區域、精確排版、尺寸嚴格的幾何結構、無損修復以及最終的合規修正,應使用一般圖片編輯工具完成。

再次生成前,可以先試試這些方法

為什麼提示詞寫了很多,圖片還是漏掉一部分?

把必須出現的主體、動作和構圖放在最前面,再刪掉那些不會明顯改變畫面的修飾詞。如果一段提示詞同時塞進很多人物、道具、鏡頭和風格,拆成幾次嘗試會更容易控制。每輪只改一個條件,也更容易判斷是哪句話起了作用。

為什麼上傳的圖片被改動得比預期更多?

圖生圖會根據原圖重新生成一張圖片,並不是只修改幾個固定像素。先寫清楚哪些必須保留,再只說一個主要改動。例如「保留瓶身形狀和標籤位置,只替換背景」就比一長串風格詞更清楚。必須完全不變的部分,最後用圖片編輯器處理。

多加幾張參考圖,效果會更好嗎?

先放一張最有代表性的參考圖。只有在第二張能補充明確資訊時再添加,例如姿勢、配色、光線或材質,並在提示詞裡說明它負責什麼。工作區最多支援 16 張參考圖,但不代表應該全部用滿;圖片越多,方向反而越難控制。

文字或 Logo 總是出錯,該怎麼處理?

文字盡量短,把需要出現的內容放在引號裡,並刪掉會分散重點的要求。對於必須準確的 Logo、標籤、價格或標題,可以先用生成結果確定畫面方向,再在排版工具裡補上最終文字。提高解析度只會增加像素,並不會自動修正拼字。

什麼時候值得多花積分選擇 2K 或 4K?

還在調整主體、構圖或提示詞時,用每張 10 積分的 1K 即可。方向確定後,如果確實需要更大的檔案,再選每張 20 積分的 2K。每張 40 積分的 4K 更適合明確的印刷、裁切或大螢幕需求。如果創意方向還不對,先在 1K 下修改。

從提示詞開始,或帶上那張已經包含關鍵資訊的圖片

當文字需求已經包含清楚方向時,進入文生圖;當產品、主體、構圖、姿勢或視覺處理用圖片展示更清楚時,進入圖生圖。兩個入口都會選中 GPT Image 2,但不會自動開始生成。