GPT Image 2.5 提示词与图像编辑完全指南及核心实战案例全景解析
把模糊的图片需求拆成可检查的主体、构图、风格与约束,再用单变量迭代和逐次验收减少漂移。

- Flare 为速度优化,Sunburst 为质量优化;选型要在自己的工作负载上同时比较质量、延迟、失败、重试和每张合格图成本。
- 有效提示词更像一份可维护的视觉规格:明确结果、可见细节、确切文字、参考图角色,以及编辑中哪些要改、哪些要保留。
- 提示词提高可控性但不保证确定结果;文字、科学关系、人物与产品保真、透明通道及连续编辑都必须逐次检查。
快速速览:GPT Image 2.5 带来的实质升级
- 双模型分工确立:
gpt-image-2.5-flare为速度优化的小模型(图像质量与 GPT Image 2 相当),gpt-image-2.5-sunburst为质量优化的基础模型(图像质量高于 GPT Image 2)。 - 自定义分辨率:支持符合约束的自定义尺寸:长宽均为 16 的倍数、最大边 3840px、长宽比不超过 3:1,像素总量在 65.5 万至 829.4 万之间。
- 原生透明背景通道:支持直接请求透明背景(
background="transparent"输出带 Alpha 通道的 PNG/WebP),但仍需检查 alpha、玻璃、毛发、阴影与边缘,必要时结合后处理或工程合成,避免依赖假棋盘格。 - 编辑模式结构化约束:支持多参考图角色分配(图 1 作主体、图 2 作服装、图 3 作背景),提示词可分别表达改动项与保留项,有助于减少画面漂移,结果仍需逐次检查。
- 文字与信息图工作流:可用于文字排版、多格叙事漫画、学术图表、商业幻灯片和局部文字翻译,生成结果仍需人工核对。
如果你想先了解模型本身,可以先读站内的 GPT Image 2.5 模型介绍;本文继续聚焦官方提示指南与落地工作流。
OpenAI 针对最新的 GPT Image 2.5 系列模型(包含为速度优化的小模型 Flare 与为质量优化的基础模型 Sunburst)发布了官方提示指南。
这份指南旨在让大家了解:AI 图像生成正在从单一的文生图提示词技巧,转向更清楚表达约束、提高可控性并逐次验收的“局部编辑、多图合成、角色一致性与工程交付”工作流。
无论你是使用 ChatGPT 制作海报、漫画、UI 原型与电商图的创作者,还是正在将 API 从旧版(GPT Image 1 / 1.5 / 2)迁移到 2.5 的开发者,本篇解读将为你拆透官方指南中的全部核心机制、参数底线、8 大编写心法与 22 个命名工作流(包含 9 个生成、8 个编辑、2 个跨轮次与 3 个更多工作流),并提供可直接参考的工程级提示词模板与落地工具包。
第一部分:模型选型与 API 核心参数底线
在写提示词之前,必须先厘清模型与接口参数。需要明确的是,通用提示方法虽可借鉴,但 Flare/Sunburst 模型选型以及 quality、size、background 均属于 API 调用语境,不能暗示 ChatGPT 界面必有这些控件。官方强调:接口参数应在 API 请求中显式指定,不要混在 Prompt 提示词中表述。
1. Flare 与 Sunburst:如何做选型与迁移?
| 模型代号 | 定位与特性 | 适用场景 | 质量基准 |
|---|---|---|---|
gpt-image-2.5-flare |
小型模型,为速度优化 | 高并发、实时交互、对时延敏感的原型与常规生成 | 图像质量与 GPT Image 2 相当 |
gpt-image-2.5-sunburst |
基础模型,为质量优化 | 商业广告、高精印刷、复杂信息图、高要求人像与光影 | 图像质量高于 GPT Image 2 |
迁移决策树
- 场景 A(现有 GPT Image 2 效果已满足要求):首先接入 Flare。在保持现有 Prompt、参考图和分辨率不变的情况下,验证是否能在画质相当的前提下缩短端到端响应时间。
- 场景 B(现有工作流效果存在痛点/复杂高难任务):首先接入 Sunburst,建立质量达标基线;一旦 Sunburst 验收通过,再反向用相同输入测试 Flare。如果 Flare 也能满足质量要求,再评估切至 Flare 的速度优势;需要明确的是,速度不能直接推断为更便宜,必须核对当前价格、失败率、重试次数与每张合格图的综合成本,若 Flare 无法达标则保留 Sunburst。
特别提醒:跨模型质量等级(Quality)不可直接画等号
两个模型即使选择相同的quality="medium",也不意味着实际出图细节和生成耗时相同。在做选型对比时,必须在同一组测试集上固定尺寸与格式进行实测。
2. 接口核心参数与分辨率数学约束
# API 典型请求结构
response = client.images.generate(
model="gpt-image-2.5-sunburst", # 或 gpt-image-2.5-flare
prompt=prompt_text,
quality="high", # auto (默认), low, medium, high, xhigh, max
size="1536x1024", # 支持预设或自定义
background="transparent", # auto, opaque, transparent
output_format="png", # png, jpeg, webp
)
关键参数限制与潜规则
size自定义分辨率必须满足 4 大硬性数学约束:- 单边最大长度不能超过 3,840 像素。
- 宽、高两边必须是 16 的整数倍(如 1024, 1536, 2048 等)。
- 长宽比(长边 : 短边)不得超过 3:1(禁止过于极端的超宽带状图)。
- 总像素数必须落在 655,360 至 8,294,400 像素 之间。
- 实验性区间警告:当总像素超过 3,686,400 像素(即
2560x1440)时,系统处于实验性支持阶段。
- 常见标准分辨率速查:
- 正方形(1:1):
1024x1024,2048x2048(2K) - 横屏风景(3:2 / 16:9):
1536x1024,2048x1152(2K),3840x2160(4K) - 竖屏人像(2:3 / 9:16):
1024x1536,2160x3840(4K)
- 正方形(1:1):
quality档位策略:- 档位提供
low、medium、high、xhigh、max以及默认的auto。 - 调优法则:永远先选定模型再调画质档位。遇到文字排版、小字号注释、密集多字体时,起步测试建议设为
medium或high。只有在时延预算充足且低档位确实无法满足锐度需求时,才考虑xhigh或max。
- 档位提供
background透明背景:- 透明输出可以直接在 API 请求(设置
background="transparent"),且output_format必须是png或webp。 - 禁止对 PNG 使用
output_compression(该参数仅适用于 JPEG 和 WebP)。 - 逐次验收与后处理:透明输出虽然可以直接请求,但仍需检查 alpha 通道、半透明玻璃、毛发细节、阴影过渡与边缘轮廓,并确认模型没有生成假棋盘格;必要时结合后处理或工程合成以达到交付标准。
- 透明输出可以直接在 API 请求(设置
3. 旧模型退役周期表(迁移预警)
如果你的生产环境仍在调用老版本模型,必须注意以下关停时限与迁移要点:
| 模型 | 当前状态 | 停机退役时间(Shutdown Date) | 迁移路线建议 |
|---|---|---|---|
gpt-image-1 |
已废弃(Deprecated) | 2026 年 10 月 23 日 | 先以 gpt-image-2 验证现有工作流,再评估 2.5;迁到 GPT Image 2 时省略 input_fidelity |
gpt-image-1.5 |
已废弃(Deprecated) | 2026 年 12 月 01 日 | 先以 gpt-image-2 验证现有工作流,再评估 2.5;迁到 GPT Image 2 时省略 input_fidelity |
gpt-image-2 |
稳定可用 | 现役基线模型 | 验证现有工作流的基准;其透明背景为 preview;基线稳定后再评估迁移 2.5 |
- 迁移验证路径:GPT Image 1 和 1.5 都应先以 GPT Image 2 验证现有工作流,确认达标后再评估 2.5。
- 尺寸参数官方值:GPT Image 1 和 1.5 的
size均为1024x1024、1024x1536、1536x1024或auto。 input_fidelity参数细节:两者input_fidelity均为low或high(其中 GPT Image 1 的high会增加图像输入 token);迁到 GPT Image 2 时省略input_fidelity,因为 GPT Image 2 始终高保真(不要写成“2.x 都不需要”)。- 透明背景状态:GPT Image 2 的透明背景为 preview,迁移评估时需注意其特性状态。
第二部分:编写高效 Prompt 的 8 大底层心法
官方总结了从基础生成到多轮编辑的 8 项编写准则。为便于实际改写与落地对照,以下将每项转化为紧凑的“Prompt 诊断卡”。提示词的细化旨在把意图表达清楚并提供检查依据,降低非预期结果出现的风险,但模型执行仍存在不确定性,生成结果仍需逐项对照验收。
1. 精准界定输出形态(Define the result)
- 核心作用:指明具体主体与交付媒介类型,为构图和光照设定清晰框架。
【模糊写法|中文】
一个白底上的陶瓷咖啡杯产品图。
【Vague|English】
A product photo of a ceramic coffee mug on a white background.
【可执行改写|中文】
电商白底产品图:一只纯白色哑光陶瓷咖啡杯,置于纯白无缝背景中央,从 45 度俯角拍摄,柔和漫射光,无干扰性阴影。
【Actionable|English】
E-commerce white-background product photography: a matte white ceramic coffee mug centered on a seamless pure white background, photographed from a 45-degree downward angle, with soft diffused lighting and no distracting shadows.
- 验收重点:核对画面是否符合电商交付规格,背景是否为纯白无缝、拍摄角度是否为 45 度俯角、阴影是否柔和且无干扰杂乱投影。
2. 采用易维护的格式(Choose a maintainable format)
- 核心作用:短句、规范段落、标签、指令或类 JSON 均可选用,关键是选择最易读、最易维护的格式;复杂任务可选用 Scene / Subject / Details / Constraints 分块作为可选组织示例,避免长句混杂。
【模糊写法|中文】
画一个在科技实验室做实验的女科学家,桌上有发光蓝色试管和全息投影,画面明亮整洁,不要杂物和文字。
【Vague|English】
Draw a female scientist doing an experiment in a tech lab, with glowing blue test tubes and holographic projections on the desk, bright and neat, no clutter and no text.
【可执行改写|中文】
[Scene] 明亮整洁的现代科技实验室,冷白室内环境光
[Subject] 一位身穿白色实验服的女科学家,正低头专注记录实验数据
[Details] 实验台上整齐摆放发光的蓝色试管与半透明全息分子模型
[Constraints] 画面无杂乱多余物品,背景与界面无额外文字
【Actionable|English】
[Scene] Bright and clean modern tech laboratory, cool white ambient indoor lighting
[Subject] A female scientist in a white lab coat, looking down and focusing on recording experiment data
[Details] Glowing blue test tubes and translucent holographic molecular models neatly arranged on the workbench
[Constraints] No messy redundant items in the scene, no extra text on the background or interfaces
- 验收重点:按分块逐项核对场景环境、人物姿态、实验道具细节,确认没有出现违背约束的多余杂物或无关文字。
3. 描述可肉眼感知的真实物理细节(Describe visible details)
- 核心作用:用可见的材质、纹理与环境光影表达真实感;相机焦段与光圈仅作为外观风格线索(Cues for appearance),并非真实的光学物理模拟。
【模糊写法|中文】
老木匠的高清真实肖像,质感超强,大师级光影,8k 电影感。
【Vague|English】
A high-definition realistic portrait of an old carpenter, incredible texture, master lighting, 8k cinematic feel.
【可执行改写|中文】
真实摄影:一位年长木匠的面部特写,皮肤带有深浅不一的干燥皱纹与微小毛孔,侧方柔和窗光勾勒轮廓,浅景深使工坊背景自然虚化(85mm 镜头外观线索)。
【Actionable|English】
Real photograph: a close-up portrait of an elderly carpenter, showing dry wrinkles of varying depth and visible pores, soft side window light outlining facial contours, shallow depth of field naturally blurring the workshop background (85mm lens appearance cue).
- 验收重点:检查面部皱纹、毛孔等肉眼可见细节是否自然,侧光与浅景深外观线索是否符合预期,不按真实光学物理指标衡量。
4. 具象化人物姿态与交互(Specify people and actions)
- 核心作用:用确切的构图范围、肢体状态与互动对象替代笼统词汇,把肢体动作表达清楚,提供明确的形态检查依据。
【模糊写法|中文】
一个在街上骑自行车的男子。
【Vague|English】
A man riding a bicycle on the street.
【可执行改写|中文】
全身构图:一位三十多岁的男子在城市林荫道上骑行,全身可见包括双脚,双手自然抓握平把公路车车把,双眼注视前方路面,双腿处于蹬踏脚踏板的动作中。
【Actionable|English】
Full-body composition: a man in his 30s riding on a tree-lined city street, full body visible including both feet, hands naturally gripping the flat handlebars of a road bike, eyes focused on the road ahead, legs actively pedaling.
- 验收重点:核对人物构图是否全身可见(包括双脚)、手部抓握车把与双腿蹬踏动作是否协调自然、视线朝向是否准确。
5. 精准字面文本建议加双引号(Specify exact text)
- 核心作用:用英文双引号明确指定文本字面内容、排版位置与出现频次,并声明排除额外文字;生成后必须逐字核对拼写与排版。
【模糊写法|中文】
咖啡馆门头木招牌,上面写着店名 Morning Brew 和副标题。
【Vague|English】
A wooden storefront sign for a coffee shop, with the shop name Morning Brew and a subtitle on it.
【可执行改写|中文】
复古木质咖啡馆门头招牌,正中以清晰衬线体排版文字 "Morning Brew",下方以较小无衬线体排版副标题 "Artisan Coffee",两处文字各出现且仅出现一次,招牌及画面其他区域无额外杂乱文字。
【Actionable|English】
Vintage wooden coffee shop storefront sign, centered typography in clean serif font reading "Morning Brew", with smaller sans-serif subtitle "Artisan Coffee" below it, each text rendered exactly once, with no extra clutter text anywhere on the sign or scene.
- 验收重点:逐字母核对 "Morning Brew" 与 "Artisan Coffee" 的拼写、大小写与层级排版,确认两处文字各出现且仅出现一次,且无多余错漏乱码。
6. 编辑时明确区分“改动项”与“保留项”(Separate changes from constraints)
- 核心作用:在图像局部编辑时显式划分改动区域与锁定区域,把编辑意图表达清楚,降低未修改区域发生意外变化的风险。
【模糊写法|中文】
把图里人物的上衣换成红色羽绒服。
【Vague|English】
Change the person's jacket in the image to a red down jacket.
【可执行改写|中文】
基于原图编辑:仅修改人物上衣为一件红色连帽羽绒服(change only the upper garment to a red hooded down jacket)。严格保留人物面部五官、发型发色、站立姿态、背景街道环境及原有光照角度不变。
【Actionable|English】
Based on original image edit: change only the subject's upper garment to a red hooded down jacket. Keep facial features, hair style and color, standing posture, background street environment, and original lighting angle strictly unchanged.
- 验收重点:比对原图确认红色羽绒服替换自然,重点核查人物面部、发型、姿态及背景光影是否保持不变,确认未发生非目标区域的被动变动。
7. 为多参考图明确分配角色(Assign roles to references)
- 核心作用:输入多张参考图时显式为各图分配编号与角色分工,阐明元素提取与承载关系,为画面融合提供检查依据。
【模糊写法|中文】
结合图 1 和图 2,做一张女人和狗在客厅里的图。
【Vague|English】
Combine Image 1 and Image 2 to make a picture of a woman and a dog in a living room.
【可执行改写|中文】
多图组合:图 1 作为主场景底图,保留客厅空间结构与暖色室内环境光;从图 2 中提取金毛寻回犬,放置在图 1 沙发旁的地毯上;狗的受光角度与地毯投影严格继承图 1 的光源方向。
【Actionable|English】
Multi-image composition: Image 1 serves as the base background scene, preserving the living room spatial structure and warm indoor ambient light; extract the golden retriever from Image 2 and place it on the rug next to the sofa in Image 1; the dog's lighting angle and cast shadow on the rug must inherit the light source direction from Image 1.
- 验收重点:核对图 1 客厅背景是否完整保留,图 2 金毛犬的主体特征与比例是否准确提取并融入,检查狗的受光与阴影是否与图 1 环境光照方向协调一致。
8. 小步迭代,单轮推进(Iterate deliberately)
- 核心作用:多轮精细调整时每次只推进单一变量,下一轮以前一轮已验收合格的图为输入基准,降低多次叠加修改导致的意外变化风险。
【模糊写法|中文】
把上一轮生成的图换个海滩背景,人物放大一点,光线调暗,再加一副眼镜。
【Vague|English】
Change the background of the image generated last round to a beach, make the person slightly bigger, dim the lighting, and add glasses.
【可执行改写|中文】
基于上一轮已验收确认的图像作为输入:本轮仅执行单项修改——为人物面部添加一副黑色细圆框眼镜(change only: add thin black round-frame glasses)。上一轮已验收确认的人物面部五官、发型、服装、站立构图与背景完全保持不变。
【Actionable|English】
Based on the verified image from the previous round as input: execute only a single change this round—add a pair of thin black round-frame glasses to the subject's face. Keep the previously verified facial features, hairstyle, clothing, standing composition, and background strictly unchanged.
- 验收重点:核对本轮新增黑框眼镜的佩戴位置与透视是否自然,并比对上一轮已验收图像,逐一确认面部特征、发型、服装和背景未发生非预期的被动改变。
第三部分:核心实战案例全景解析
官方指南提供了 22 个命名工作流(包含 9 个生成案例、8 个编辑案例、2 个跨轮次案例以及 3 个更多工作流)。英文原版提示词是实践起点,实际使用中需按具体输入与业务场景适配,产出仍需人工检查。下文梳理各案例的提示词设计目标、关键参数与机制要点。
场景一:高保真基础图像生成
案例 1:写实人像与胶片光影(Control style and lighting)
- 生成参数:
size="1024x1536",quality="medium" - 中英双语 Prompt: