用文字或参考图开始创作 GPT Image 2 图片

GPT Image 2 是 OpenAI 的图片生成模型,既可以根据提示词创建新图片,也可以利用现有视觉素材继续创作。在 aiimg.me 选择适合的工作流,确认宽高比、输出档位、图片数量和积分预估后,即可在浏览器中生成。

展示文生图与参考图创作方式的装饰拼贴图

从方向最明确的输入开始

既能创建新图片,也能参考现有图片继续调整

OpenAI 将 GPT Image 2 说明为可接收文字和图片输入、输出图片,并支持图片生成与编辑操作。aiimg.me 将这些能力整理为文生图和图生图两个工作台。本页介绍的是 aiimg.me 当前提供的设置,并非官方 API 的全部选项。

当主体、场景、构图、配色、材质或视觉处理还在确定阶段时,这个模型更有用:你可以用文字描述,也可以通过参考图提供信息。如果成品除了某个精确修改外必须完全不变,它就不能代替确定性的图片编辑工具。

查看 GPT Image 2 官方模型文档

适合这些需求

  • 把产品、营销活动、编辑内容或社交媒体需求转成第一版视觉方向。
  • 在正式制作前尝试不同场景、配色、材质、取景或光线。
  • 以产品图、草图、上一次结果、姿势或版式为依据创建新版本。
  • 按最终投放位置所需的宽高比,比较少量候选图片。

这些需求应使用其他工具

  • 图层、笔刷蒙版、锁定区域或可重复的像素级修正。
  • 无损修复或保证不变形地放大现有文件。
  • 精确的文字排版、Logo、尺寸或合规要求严格的几何结构。
  • 让同一角色、面孔、品牌元素或原图细节在每次输出中完全一致。

文生图还是图生图?

关键是判断最可靠的信息在哪里。文字已经能说明方向,就用文生图;如果主体、结构或视觉风格用图片展示比凭记忆描述更清楚,就用图生图。

当需求文档最可靠时,使用文生图

先写主体和最终用途,再补充场景、构图、光线、材质、颜色与氛围。有效的提示词应包含看得见的决定,例如:“哑光钴蓝色台灯的编辑风产品摄影,放在浅色石灰岩上,柔和侧光,4:5 构图,台灯上方留出充足标题空间。”

当原图包含关键信息时,使用图生图

至少上传一张图片,说明每张参考图的用途,再写清楚需要改变什么。例如:“参考图 1 只用于瓶身轮廓和正面机位;参考图 2 只用于砂岩配色。把瓶子放在浅色洞石上,使用温暖的晨间侧光。”参考图会引导一次新的生成,并不会锁定原图的每个像素。

用最小的一次生成回答眼前的问题

点击“生成”前,工作台会根据输出档位和图片数量计算总积分。先生成一张 1K 图片,是检查构图和指令方向最省积分的方式。只有当更高档位或更多结果确实服务于下一步时,再增加投入。

图片数1K2K4K
110 积分20 积分40 积分
220 积分40 积分80 积分
440 积分80 积分160 积分

1K:先验证需求,再扩大生成

每张 10 积分,适合先检查主体、取景、配色和提示词逻辑。把 1K 当作决策工具,而不是一个尚未解决创意问题的低配版本。

2K:需要更大的工作文件时再选

每张 20 积分。方向已经确定,而且更大的输出有助于下一阶段时,选择 2K 更合理。它解决的是输出尺寸需求,不能代替再修改一次提示词。

4K:只有尺寸真正重要时才用最高档

每张 40 积分,是 1K 成本的四倍。4K 改变的是输出档位,不会修正含糊的指令、多余物体、错误文字或薄弱构图。

先生成一张验证;需要比较时再选两张或四张

还在排查提示词问题时,只请求一张图片。当多个方案同时出现能帮助判断时,再选择两张或四张;总成本会按每张价格乘以图片数量。点击“生成”后,服务器会对每个任务扣费;记录为失败的任务会退还已消耗的积分。

根据最终投放位置设置宽高比

可选比例包括 Auto, 1:1, 5:4, 9:16, 21:9, 16:9, 4:3, 3:2, 4:5, 3:4, 2:3。版式尚未确定时可用 Auto;1:1 适合方形位置,4:5 或 3:4 适合竖版,9:16 适合竖屏,16:9 或 21:9 适合宽幅画面。尽量在生成前确定最终用途,后期裁切可能会删掉构图依赖的留白。

只在每张参考图都有明确作用时使用它

图生图至少需要一张参考图,最多支持 16 张。每个文件最大 30 MB,支持 JPG, JPEG, PNG, WEBP。上限适合用于让不同图片分别提供不同信息,不是每次都应达到的目标。

先使用足以说明任务的最少图片。如果两张参考图在形状、机位、配色或光线上互相矛盾,要明确由哪张图决定哪一项。额外图片可以补充信息,也可能带来相互竞争的方向。

只上传你有权使用的素材;添加机密或敏感图片前,请阅读我们的 隐私政策

从需求到可用结果,分四步完成

一次有效的生成,在点击“生成”前就已经开始:先判断可靠信息来自文字还是图片,选择对应工作流,只花足够回答当前问题的积分,再检查结果后继续。

  1. 01

    确定以什么为准

    需求本身足以定义画面时,选择文生图;如果主体、结构、姿势、构图、配色或材质需要由现有图片提供,就选择图生图。

  2. 02

    写清楚画面里能看到的决定

    说明主体、位置、构图、光线、材质和氛围。使用图生图时,要给每张参考图安排用途,并同时写明保留什么、改变什么。

  3. 03

    根据用途设置比例和预算

    先按最终使用位置选择宽高比,再选择 1K、2K 或 4K,以及生成一张、两张或四张。提交前查看页面显示的积分总额。

  4. 04

    生成、检查,然后只改一件事

    放大结果,与需求和参考图逐项对照。如果还要再试,先修改造成最大问题的那条指令,不要一次重写所有条件。

把结果用作正式素材前,先完整检查

OpenAI 的图片生成指南指出,精确的文字位置与清晰度仍可能出错,连续生成中的角色或品牌元素也可能不一致。即使整张图片看起来可信,这些问题依然重要。请放大结果,并与需求和参考素材逐项对照。

  • 逐字检查文字、Logo、标签、数字和符号;需要准确排版时,最后在排版工具中加入正式文字。
  • 对比不同结果中的面孔、角色、产品和品牌元素,不要默认身份或结构保持不变。
  • 发布前检查手部、图案、反射、对称、接缝、尺寸和细小结构。
  • 不要期待 4K、更多结果或更多参考图能解决含糊或互相矛盾的指令。

蒙版、锁定区域、精确排版、尺寸严格的几何结构、无损修复以及最终的合规修正,应使用常规图片编辑工具完成。

再次生成前,可以先试试这些方法

为什么提示词写了很多,图片还是漏掉一部分?

把必须出现的主体、动作和构图放在最前面,再删掉那些不会明显改变画面的修饰词。如果一段提示词同时塞进很多人物、道具、镜头和风格,拆成几次尝试会更容易控制。每轮只改一个条件,也更容易判断是哪句话起了作用。

为什么上传的图片被改动得比预期更多?

图生图会根据原图重新生成一张图片,并不是只修改几个固定像素。先写清楚哪些必须保留,再只说一个主要改动。例如“保留瓶身形状和标签位置,只替换背景”就比一长串风格词更清楚。必须完全不变的部分,最后用图片编辑器处理。

多加几张参考图,效果会更好吗?

先放一张最有代表性的参考图。只有在第二张能补充明确的信息时再添加,比如姿势、配色、光线或材质,并在提示词里说明它负责什么。工作台最多支持 16 张参考图,但不代表应该全部用满;图片越多,方向反而越难控制。

文字或 Logo 总是出错,该怎么处理?

文字尽量短,把需要出现的内容放在引号里,并删掉会分散重点的要求。对于必须准确的 Logo、标签、价格或标题,可以先用生成结果确定画面方向,再在排版工具里补上最终文字。提高分辨率只会增加像素,并不会自动修正拼写。

什么时候值得多花积分选择 2K 或 4K?

还在调整主体、构图或提示词时,用每张 10 积分的 1K 即可。方向确定后,如果确实需要更大的文件,再选每张 20 积分的 2K。每张 40 积分的 4K 更适合明确的印刷、裁切或大屏需求。如果创意方向还不对,先在 1K 下修改。

从提示词开始,或带上那张已经包含关键信息的图片

当文字需求已经包含清晰方向时,进入文生图;当产品、主体、构图、姿势或视觉处理用图片展示更清楚时,进入图生图。两个入口都会选中 GPT Image 2,但不会自动开始生成。