適合這些需求
- 把產品、行銷活動、編輯內容或社群媒體需求轉成第一版視覺方向。
- 在正式製作前嘗試不同場景、配色、材質、取景或光線。
- 以產品照、草圖、上一次結果、姿勢或版面為依據建立新版本。
- 依最終版位所需的長寬比,比較少量候選圖片。
模型可以做什麼
OpenAI 將 GPT Image 2 說明為可接收文字與圖片輸入、輸出圖片,並支援圖片生成與編輯操作。aiimg.me 將這些能力整理成文生圖與圖生圖兩個工作區。本頁介紹的是 aiimg.me 目前提供的設定,並非官方 API 的所有選項。
當主體、場景、構圖、配色、材質或視覺處理還在確認階段時,這個模型更實用:你可以用文字描述,也可以透過參考圖提供資訊。如果成品除了某個精確修改外都必須維持不變,它就不能取代可精準控制的圖片編輯工具。
查看 GPT Image 2 官方模型文件選擇工作流程
關鍵是判斷最可靠的資訊在哪裡。文字已經能說明方向,就用文生圖;如果主體、結構或視覺風格用圖片展示比憑記憶描述更清楚,就用圖生圖。
文生圖
先寫主體與最終用途,再補充場景、構圖、光線、材質、顏色與氛圍。有效的提示詞應包含看得見的決定,例如:「霧面鈷藍色檯燈的編輯風產品攝影,放在淺色石灰岩上,柔和側光,4:5 構圖,檯燈上方留出充足的標題空間。」
圖生圖
至少上傳一張圖片,說明每張參考圖的用途,再寫清楚需要改變什麼。例如:「參考圖 1 只用於瓶身輪廓和正面機位;參考圖 2 只用於砂岩配色。把瓶子放在淺色洞石上,使用溫暖的晨間側光。」參考圖會引導一次新的生成,並不會鎖定原圖的每個像素。
aiimg.me 設定與積分
按下「生成」前,工作區會依輸出等級與圖片數量計算總積分。先生成一張 1K 圖片,是檢查構圖和指令方向最省積分的方式。只有當更高等級或更多結果確實服務於下一步時,再增加投入。
| 圖片數 | 1K | 2K | 4K |
|---|---|---|---|
| 1 | 10 積分 | 20 積分 | 40 積分 |
| 2 | 20 積分 | 40 積分 | 80 積分 |
| 4 | 40 積分 | 80 積分 | 160 積分 |
每張 10 積分,適合先檢查主體、取景、配色與提示詞邏輯。把 1K 當作決策工具,而不是一個尚未解決創意問題的低階版本。
每張 20 積分。方向已經確定,而且更大的輸出有助於下一階段時,選擇 2K 更合理。它解決的是輸出尺寸需求,不能取代再修改一次提示詞。
每張 40 積分,是 1K 成本的四倍。4K 改變的是輸出等級,不會修正含糊的指令、多餘物件、錯誤文字或薄弱構圖。
還在排查提示詞問題時,只要求一張圖片。當多個方案同時出現能幫助判斷時,再選擇兩張或四張;總成本會按每張價格乘以圖片數量。按下「生成」後,伺服器會對每個任務扣費;記錄為失敗的任務會退還已消耗的積分。
可選比例包括 Auto, 1:1, 5:4, 9:16, 21:9, 16:9, 4:3, 3:2, 4:5, 3:4, 2:3。版面尚未確定時可用 Auto;1:1 適合方形版位,4:5 或 3:4 適合直式版面,9:16 適合直向螢幕,16:9 或 21:9 適合寬幅畫面。盡量在生成前確定最終用途,後續裁切可能會刪掉構圖依賴的留白。
參考圖使用建議
圖生圖至少需要一張參考圖,最多支援 16 張。每個檔案最大 30 MB,支援 JPG, JPEG, PNG, WEBP。上限適合讓不同圖片分別提供不同資訊,不是每次都應達到的目標。
先使用足以說明任務的最少圖片。如果兩張參考圖在形狀、機位、配色或光線上互相矛盾,要明確由哪張圖決定哪一項。額外圖片可以補充資訊,也可能帶來互相競爭的方向。
只上傳你有權使用的素材;加入機密或敏感圖片前,請閱讀我們的 隱私權政策 。
GPT Image 2 使用方法
一次有效的生成,在按下「生成」前就已經開始:先判斷可靠資訊來自文字還是圖片,選擇對應工作流程,只花足夠回答目前問題的積分,再檢查結果後繼續。
需求本身足以定義畫面時,選擇文生圖;如果主體、結構、姿勢、構圖、配色或材質需要由現有圖片提供,就選擇圖生圖。
說明主體、位置、構圖、光線、材質與氛圍。使用圖生圖時,要為每張參考圖安排用途,並同時寫明保留什麼、改變什麼。
先依最終使用位置選擇長寬比,再選擇 1K、2K 或 4K,以及生成一張、兩張或四張。送出前查看頁面顯示的積分總額。
放大結果,與需求和參考圖逐項比對。如果還要再試,先修改造成最大問題的那條指令,不要一次重寫所有條件。
限制與檢查
OpenAI 的圖片生成指南指出,精確的文字位置與清晰度仍可能出錯,連續生成中的角色或品牌元素也可能不一致。即使整張圖片看起來可信,這些問題仍然重要。請放大結果,並與需求和參考素材逐項比對。
遮色片、鎖定區域、精確排版、尺寸嚴格的幾何結構、無損修復以及最終的合規修正,應使用一般圖片編輯工具完成。
第一張已經接近,但還差一點
把必須出現的主體、動作和構圖放在最前面,再刪掉那些不會明顯改變畫面的修飾詞。如果一段提示詞同時塞進很多人物、道具、鏡頭和風格,拆成幾次嘗試會更容易控制。每輪只改一個條件,也更容易判斷是哪句話起了作用。
圖生圖會根據原圖重新生成一張圖片,並不是只修改幾個固定像素。先寫清楚哪些必須保留,再只說一個主要改動。例如「保留瓶身形狀和標籤位置,只替換背景」就比一長串風格詞更清楚。必須完全不變的部分,最後用圖片編輯器處理。
先放一張最有代表性的參考圖。只有在第二張能補充明確資訊時再添加,例如姿勢、配色、光線或材質,並在提示詞裡說明它負責什麼。工作區最多支援 16 張參考圖,但不代表應該全部用滿;圖片越多,方向反而越難控制。
文字盡量短,把需要出現的內容放在引號裡,並刪掉會分散重點的要求。對於必須準確的 Logo、標籤、價格或標題,可以先用生成結果確定畫面方向,再在排版工具裡補上最終文字。提高解析度只會增加像素,並不會自動修正拼字。
還在調整主體、構圖或提示詞時,用每張 10 積分的 1K 即可。方向確定後,如果確實需要更大的檔案,再選每張 20 積分的 2K。每張 40 積分的 4K 更適合明確的印刷、裁切或大螢幕需求。如果創意方向還不對,先在 1K 下修改。