GPT-Image-2真正厉害的是这套工作流
很多人用 AI 生图,都会经历一个很微妙的阶段。
刚开始很兴奋。
随便写几个词,图就出来了,质感还不错,甚至有时候比自己想象得还好。
但真到工作里,问题马上就来了。
要做一张广告图,文字多一个字。
要做一页融资 slide,数据层级乱了。
要给模特换衣服,衣服是换了,脸也顺手换了。
要抠一个产品,瓶身边缘糊了,标签还被重新设计了一遍。
这时候你会发现,AI 生图最大的问题,不是它不够会画,而是它太会发挥。
它很努力,也很热情,就是有时候热情过头了。
你想让它只改一把椅子,它顺手把厨房审美也升级了。
你想让它移除一朵花,它连人物气质都帮你重新规划了一下。
所以我看完 GPT-Image-2 这套官方案例后,最大的感受不是“模型又变强了”。
而是:AI 生图终于开始从抽卡,进入生产。

这套手册一共 34 页,里面有 28 个案例。
但如果只把它理解成“提示词案例合集”,就太可惜了。
它真正有价值的地方,是把 AI 生图拆成了三个层次:
第一层,生成。你要学会从零定义一个完整画面。
第二层,编辑。你要学会在已有图像上画清楚边界。
第三层,生产。你要学会把生成、编辑、质量档、尺寸、迁移策略串成工作流。

别一上来就追求 high
很多人看到新模型,第一反应是把参数开到最高。
这其实是典型的新手思路。
GPT-Image-2 里的 quality,不是审美开关,而是取舍旋钮。
low 适合批量探索、草图初筛、方向验证。
medium 适合多数工作流的默认起点。
high 适合小字密集、近景人像、身份相关编辑、最终交付图。
真正成熟的做法不是“永远 high”,而是先低后高。
先用更低成本跑通结构,再把值得投入的图推到高质量档。

尺寸也是一样。
很多人先写一大段美术词,最后随手选个尺寸。
这个顺序反了。
尺寸本身就是交付规格。
竖版适合海报、信息图、漫画、移动端 UI。
横版适合 slide、图表、产品首屏、广告横幅。
画布会决定模型如何组织信息。你让模型猜一次,就会多一轮返工。

生成是在建世界,编辑是在画边界
GPT-Image-2 最重要的分野,是生成和编辑。
生成任务,是从零开始建一个世界。
你要写清楚产物类型、受众、主体、构图、材质、文字、尺寸和质量档。
编辑任务,是在已有图像上动刀。
你不是让模型重新创作,而是告诉它:只改哪里,哪里绝对不能碰。
生成 prompt 的好坏,取决于世界定义是否完整。
编辑 prompt 的好坏,取决于边界是否清楚。

第一个案例是信息图。
信息图不是“画得好看”就行,它的核心是把结构化信息传达给特定受众。
学生、高管、客户、普通大众,看到同一张图需要的重点不一样。
所以提示词要像给设计师下 brief:讲什么内容,采用什么结构,哪些标签必须出现,给谁看。

信息图本地化也是一个很好的编辑案例。
你不是重新生成一张英文图,而是在原图上只替换文字。
排版风格、位置、间距、图标、层级,都不应该动。
这就是编辑任务的关键句式:
只改文字。
其他不变。

想要真实感,也不要只写“超逼真”。
真正有效的是摄影语言。
镜头、机位、光线、景深、胶片颗粒、真实皮肤纹理、织物磨损、自然色彩。
如果你不想要广告精修感,就要明确写“不要美化,不要重度修图”。
真实感不是更锐、更亮、更干净,而是更像现实世界。

GPT-Image-2 还可以调用语境知识。
当你给出足够精确的时间和地点,模型可能推断出背后的历史事件,并生成符合时代背景的画面。
这说明一件事:提示词不一定越长越好。
有时候,精确的上下文比堆形容词更重要。

好提示词不是愿望清单,而是约束系统
Logo 生成尤其能说明这个问题。
你不能只说“做一个温暖高级的面包店 Logo”。
你要说品牌名、行业、品牌个性、图形风格、负空间、可缩放、纯色背景、无水印。
这些都不是装饰词,而是约束。
约束越清晰,输出越可用。

广告生成也是一样。
广告不是技术规格堆叠,而是创意简报。
品牌是谁,面向谁,表达什么文化,画面里有哪些人,文案必须是什么,哪些东西不要出现。
你给出边界,模型在边界内发挥。
这比“帮我做一张潮流广告”稳定得多。

漫画案例告诉我们,叙事也要结构化。
不要写“宠物搞破坏”。
要写每一格发生什么动作,每一格状态如何变化。
主人出门,宠物占沙发,主人回来,宠物假装无事发生。
故事越落到动作,模型越容易生成可读的视觉节奏。

UI 生成也有一个常见坑。
很多人会写“做一个农贸市场 App 概念图”。
概念图听起来很合理,但模型很容易做成漂亮草图,而不是可用界面。
更好的写法是:像描述一个已经上线的真实产品。
标题、列表、分类标签、今日特价、地点、营业时间、手机边框、界面层级,都要写清楚。

教育图解的关键,是教学设计。
谁在学?
要学会什么?
必须出现哪些标签?
哪些科学关系不能错?
图解不是插画,它是知识结构的可视化。

生产力图片更是如此。
融资 slide、数据图、流程图,最怕的不是不好看,而是结构不可用。
标题、真实数字、图表类型、脚注、字体、颜色、布局层级,都应该直接写进 prompt。
不要写“做一页市场机会”。
要写“做一页能进 deck 的市场机会页”。

编辑任务最怕模型“顺手优化”
进入编辑案例后,逻辑就变了。
风格迁移里,你可以让模型沿用输入图像的视觉语言,但改变主体。
这里不需要解释太多风格细节,因为输入图已经提供了上下文。
你只需要说清:沿用什么风格,生成什么新内容。

虚拟试穿是最典型的身份保留任务。
衣服可以换。
脸不能换。
肤色不能换。
身形不能换。
姿态不能换。
表情和发型也不能换。
这类任务的写法就是先全部锁死,再只开放一个变量。
锁得越死,模型越不容易乱发挥。

草图转真实渲染,也不是让模型重新设计。
要保留布局、比例、透视,只补材质、光照和环境。
很多失败都发生在模型“觉得这样更好看”,于是添加了新元素。
所以“不要添加新元素或文字”这句话非常重要。

产品提取更像质检。
边缘干不干净?
标签是否可读?
几何形状有没有变?
背景是否纯白不透明?
有没有多余光晕?
这里不需要模型“升级设计”,只需要它准确执行。

图中文字是 GPT-Image-2 很重要的能力点。
但你不能含糊。
必须出现的文案,要放进引号里。
要求逐字呈现。
不要额外字符。
只出现一次。
字体、位置、对比度、字距也要写清楚。
这不是啰嗦,是验收标准。

天气和光照变换,看起来只是“改氛围”,但底层仍然是边界控制。
只改变光照、阴影、降雪、地面湿度和氛围。
不改变主体、几何形状、相机角度、物体位置。
这也是为什么分步编辑比一次生成更稳定。
每一步只动一个变量。

对象移除则更直接。
移除男人手里的花。
不要改变任何其他东西。
这句话简单到像废话,但在编辑任务里,它是核心指令。

人物插入场景更复杂。
你要同时锁定人物身份、动作状态、场景环境和摄影质感。
如果你想要真实照片,就要避免电影海报式灯光、戏剧性色彩和过度风格化构图。
真实感不是“更大片”,而是更像有人真的拍下了这一刻。

多图合成的规则也很清楚:
从哪张图取什么?
放到哪张图的哪里?
光照、构图、背景、比例和阴影如何匹配?
其他内容不许改。
只要这几件事没说清,模型就很容易把“合成”理解成“重新创作”。

真正的价值,是让失败变便宜
高价值案例里,室内替换特别适合商业场景。
客户想看一把椅子换成另一把椅子。
你要做的不是重新装修厨房,而是只替换那一件物体。
相机角度、室内光线、地板阴影、周围物体都要保留。
“只”这个字,在这里值钱。

立体贺卡案例适合季节营销。
它的关键不是梦幻,而是像真实产品摄影。
纸张层次、折叠、纤维、柔和灯光、浅景深、实体触感,都在让它从概念图变成可展示的商品视觉。

周边概念也是同理。
包装材质、印刷清晰度、零售摄影、原创设计、无商标、无水印,这些都决定它能不能进入商业讨论。
AI 很擅长出创意,但商业创意必须带着限制条件跑。

角色一致性是多页故事最容易翻车的地方。
第一步不是急着做故事,而是先建立角色锚点。
外观、比例、服装、气质、色彩、表情,都要先固定下来。
这就像给模型一张角色设定表。

后续故事延续时,核心句是“不要重新设计角色”。
场景可以变。
动作可以变。
情节可以推进。
但角色不能漂。
这句话比重复堆很多外貌描述更有效,因为它明确告诉模型:角色已经定稿了。

一套可以直接套用的生产模板
如果只能带走一个东西,我建议带走这套模板。
以后写 GPT-Image-2 提示词,先问八个问题:
交付物是什么?
给谁看?
画布是什么?
必须出现哪些文字?
版式层级是什么?
视觉语言是什么?
真实内容和数据是什么?
质量档怎么选?
这八个问题,比“高级感、电影感、8K”更有用。
因为它们不是在描述愿望,而是在定义规格。

编辑任务也可以浓缩成一句话:
可变项和不变量分离。
变量,是你允许模型改变的东西。
不变量,是它绝对不能碰的东西。
编辑 prompt 的质量,取决于 preserve list 的清晰度。

为什么这次说 GPT-Image-2 能进生产?
不是因为它更会画。
而是因为它在三个地方更接近真实工作流:
文字更可控。
身份更可守。
结构更可读。
真实生产里,效率提升不是第一张图更惊艳,而是首轮更接近规格,审核更少,重跑更少,局部返工更少。

如果你已经在用 gpt-image-1 或 1.5,也不要急着推倒重来。
迁移应该是增量式的。
新流程、客户资产、照片编辑、品牌敏感、图中文字,优先上 GPT-Image-2。
旧 prompt 先保留,拿真实样本比较质量、延迟和重试率。
哪里失败修哪里。
文字错,就补精确文案。
身份漂,就补保留项。
结构乱,就补层级。

最后总结成三句话。
产物先行。
边界显式。
指标闭环。
先定义广告、界面、信息图、幻灯片、照片,再写画面。
生成写完整规格,编辑写“只改什么 + 保留什么”。
用质量、延迟、吞吐、重试率决定 low、medium、high。
这不是提示词玄学。
这是把 AI 生图当成生产系统来用。

所以,真正会用 GPT-Image-2 的人,不会只问:
“这个模型能不能画得更好?”
他会问:
“我能不能把任务定义到它第一轮就更接近交付?”
能做到这一点,GPT-Image-2 就不只是一个玩图工具。
它会变成你的视觉生产系统。
