ChatGPT Images 是 OpenAI 使用自然语言指令创建和编辑图像的对话体验。它可以将简介变成插图、横幅、背景、UI 资产、产品概念、故事板、精灵表或占位符。用户可以从文本开始,附加参考,请求本地化编辑并继续在对话中完善结果。
名称需要边界:ChatGPT Images 是最终用户体验,而开发人员使用 OpenAI 的 Image API 或 image_generation Responses API 中的工具。 OpenAI 的当前文档表示内置图像生成使用 gpt-image-2。 ChatGPT 计划或工作空间限制与 API 凭证、定价和组织要求不同。不要将它们作为一个可互换的配额来呈现。
能力和产品边界
| 表面 | 最佳使用 | 边界 |
|---|---|---|
| ChatGPT Images | 交互式创作和编辑 | 计划/工作空间的可用性和控制各不相同 |
| Image API | 直接应用程序生成或编辑 | 应用程序拥有编排、存储和 QA |
| Responses API | 对话式多步骤图像工作流程 | 主线模型的使用伴随着图像成本 |
| 参考编辑 | 转换、扩展或视觉引导 | 输入权和保真度需要审查 |
| 生成的版式 | 简短的展示文案和概念 | 关键副本应经过校对和排版 |
选择正确的工作流程
| 需要 | 路径 | 原因 |
|---|---|---|
| 与人一起探索循环 | ChatGPT Images | 快速对话迭代 |
| 从应用程序创建或编辑一张图像 | Image API | 直接生成和编辑端点 |
| 保持图像历史记录 | Responses API | 图片和之前的回复仍然在上下文中 |
| 制作大型目录 | 排队的 API 服务 | 需要配额、幂等性、成本和质量保证控制 |
| 提供精确的品牌艺术品 | 生成,然后在设计软件中完成 | 版式和网格需要确定性 |
Image API 公开 GPT 图像模型的生成和编辑。 Responses API 将图像生成公开为内置工具,并可以决定是生成还是编辑。应用程序还可以设置 行动 到 生成 或 编辑;在上下文中没有图像的情况下强制进行编辑会返回错误。
即时解剖
目的+受众
│
主题+动作──设定
│
构图/相机/层次结构
│
风格/材质/调色板/灯光
│
尺寸+精确文本+排除
▼
第一张图片
│
内容·布局·文字·身份·权利
▼
一次有针对性的编辑;保留其他一切
有用的提示不一定很长。 OpenAI 推荐具体的视觉语言:解释光从哪里来、什么属于前景、资源为谁服务以及什么不能出现。 “哑光黑色铝材、左侧柔和的窗光和右上角的空白空间”比“让它变得更优质”更容易测试。重复编辑期间必须保持固定的要求。
| 组件 | 弱 | 更高信息的教学 |
|---|---|---|
| 目的 | 制作一个漂亮的图像 | 初学者安全指南的编辑标题,分辨率为 1200×630 |
| 成分 | 展示笔记本电脑 | 笔记本电脑左侧,主题右侧,右上角空白复制空间 |
| 照明 | 电影般的 | 左侧柔和的日光,低对比度阴影 |
| 文字 | 添加标题 | 仅添加“SPRING WORKSHOP”,大写,一行 |
| 排除情况 | 没有奇怪的事情 | 没有徽标、额外文本、水印或未来派设备 |
| 编辑锁 | 换个杯子 | 仅更换杯子;保护农作物、人员和照明 |
参考图像编辑
参考可以定义内容、身份、构图、布局或风格。对于多张图像,标记它们的角色:“图像 1 提供产品和摄像机角度;图像 2 提供柔和的调色板和线条处理。”更喜欢通用的视觉特征,而不是要求模仿在世的艺术家或受保护的品牌处理。
| 编辑 | 指令模式 | 检查风险 |
|---|---|---|
| 对象替换 | 只改变X;锁定背景、裁剪和光线 | 无要求的漂移 |
| 风格方向 | 保留内容/布局;应用命名通用特征 | 身份或商标模仿 |
| 扩张 | 通过匹配的视角和照明进行扩展 | 重复的物体或破碎的几何形状 |
| 人物连续性 | 重申固定的脸部、服装和比例 | 身份漂移 |
| 本地化编辑 | 选择一个区域并指定一项更改 | 破损的边缘、阴影或反射 |
每次迭代更改一个高影响变量。立即改变相机、调色板、姿势和排版的请求使得回归难以诊断。保存批准的版本并将它们并排比较,而不是依赖记忆。
版式和密集布局
图像生成可以起草海报、信息图表、图表和标记布局,但生成的像素并不是真实来源的文档。保持文本简短,引用准确的副本,指定大小写、位置以及是否允许任何其他文本。 OpenAI 建议检查每个单词并在设计工具中完成密集或生产关键的排版。
| 内容 | 验收规则 | 回退 |
|---|---|---|
| 标题 | 准确的拼写、大小写、换行符和边距 | 删除并排版 |
| 价格/日期/网址 | 100%准确 | 确定性叠加 |
| 正本 | 批准的文本在交货尺寸下可读 | 布局软件和法律审查 |
| 图表标签 | 每个节点、箭头和关系都与源匹配 | 重建为向量 |
| 本地化文本 | 原生字形和换行审查 | 特定于区域设置的排版 |
超越“看起来不错”的评价
| 尺寸 | 问题 | 测量 |
|---|---|---|
| 依从性 | 计数、关系和排除是否正确? | 要求级别通过/失败 |
| 成分 | 等级制度能在预期的作物中生存吗? | 缩略图和响应测试 |
| 文字 | 每个字符都准确吗? | OCR 加上人工验证 |
| 编辑地点 | 仅请求的区域发生变化吗? | 叠加和人工审核 |
| 身份/产品 | 定义细节是否保留? | 参考清单 |
| 无障碍 | 能描述有意义的内容吗? | 替代文本和对比审查 |
| 权利/安全 | 输入权和政策是否得到满足? | 记录批准门 |
尽可能对候选人进行盲目比较。衡量每个提示接受的图像和每个接受的资产的成本,而不仅仅是原始生成速度。需要重复再生的廉价图像可能比更强的第一次通过花费更多。
作为当前的外部校准点之一, Arena 文本转图像排行榜 日期为 2026 年 8 月 10 日 gpt-image-2 (中)在盲投票实验室排名中名列第一。这是在一个测试环境中广泛偏好的证据,而不是证明它赢得了每个品牌、排版或编辑任务。在选择生产模型之前,使用您自己的提示和验收标准运行一个小型基准测试。
输出和经验控制
对于 gpt-image-2, OpenAI 记录灵活的输出尺寸,包括常见的正方形、横向和纵向预设,在已发布的约束下最多可达 3840 像素边缘。 2560×1440 以上的分辨率被标记为实验性的。输出可以是 PNG、JPEG 或 WebP; JPEG 通常速度更快,而 JPEG 和 WebP 公开压缩控制。与早期的 GPT 图像工作流程不同, gpt-image-2 目前不支持透明背景。
Image API 可以请求多个候选人 n。 Image API 和 Responses API 都可以通过以下方式流式传输零到三个部分预览 部分图像;快速的最终生成可能会发出更少的预览,并且每个预览都会添加图像输出标记。将流媒体视为一种具有可衡量成本的用户体验选择,而不是免费的默认设置。
| 控制 | 决定 | 测试 |
|---|---|---|
| 尺寸/长宽比 | 比赛最终名次 | 裁剪、权重和移动渲染 |
| 品质 | 吃水低;仅为入围者筹集资金 | 接受率与延迟/成本 |
| 格式化/压缩 | 选择 PNG、JPEG 或 WebP 作为传送路径 | 工件、文件重量和浏览器支持 |
| 部分流媒体 | 显示缓慢作业的进度 | 取消和最终更换 |
| 候选人数 | 仅当选择增加价值时才能产生更多 | 总成本和审核时间 |
生产架构
客户
│ 授权 · 配额 · 维度 · 同意
▼
作业 API ── 幂等性 ── 队列
▼
Image API / Responses API
固定设置
│
超时·重试·成本账本
▼
审核 · 视觉 QA · 权利门
▼
私人存储 · 过期链接 · 删除
| 失败 | 控制 |
|---|---|
| 重复付费生成 | 应用程序幂等性和持久的工作状态 |
| 支出失控 | 用户像素、候选者、并发数和每日限制 |
| 长请求 | 异步队列、状态和取消 |
| 不安全的输入/输出 | 政策检查、审核和升级 |
| 敏感参考文献 | 最小权限、短期保留和删除 |
| 行为改变 | 黄金提示金丝雀和记录的设置 |
| 交付腐败 | 验证数据、MIME、维度和校验和 |
GPT Image API 访问可能需要 API 组织验证。启动前检查开发者控制台。切勿将 API 密钥放置在 Web 或移动客户端中;从受控服务器调用 OpenAI 并由经过身份验证的租户进行速率限制。
成本和可靠性规划
| 成本驱动因素 | 优化 | 护栏 |
|---|---|---|
| 质量和尺寸 | 在探索期间使用草稿设置 | 允许的预设 |
| 候选人数 | 按顺序生成直至接受 | 最多候选人/职位 |
| 再生 | 使用提示模板和有针对性的编辑 | 审核阈值后停止 |
| 响应编排 | 保持上下文相关且有意为之 | 分别跟踪文本/模型和图像的使用情况 |
| 存储 | 生命周期临时输出 | 保留和删除政策 |
| 人工审核 | 首先自动化机械检查 | 需要审查高风险资产 |
不要发布目录文章中的静态价格作为购买保证。 OpenAI 定价和计划限制可能会发生变化。根据官方定价页面计算目标工作负载,然后添加重试、丢弃输出、存储和审阅者成本。
隐私、权利和安全
| 风险 | 控制 |
|---|---|
| 与真人相似 | 在适当的情况下获得许可并记录目的 |
| 受版权保护的参考 | 确认许可/所有权并请求原始处理 |
| 商标混淆 | 避免虚假背书并审查商业背景 |
| 敏感上传 | 最小化数据;定义保留、访问和删除 |
| 欺骗性合成媒体 | 使用适合上下文的披露/出处 |
| 禁止内容 | OpenAI 政策和组织规则 |
| 数据集创建 | 存储出处/同意并支持删除 |
OpenAI 表示信用是可选的,但披露仍然有用或雇主、平台、客户或法律要求。模型能力绝不授予参考、主题、徽标或商业用途的权利。
ChatGPT Images 与类似产品比较
| 选项 | 选择它是为了 | 重要制约因素 |
|---|---|---|
| ChatGPT Images / GPT Image 2 | 对话简报、基于参考的编辑、文本感知资产和混合研究到视觉工作 | 精确的排版、重复的标识和严格的构图仍然需要质量检查 |
| Midjourney | 强大的视觉艺术指导、快速的四选项探索、风格参考、重新纹理、网页编辑器中的平移和缩放 | 当前的编辑器文档称 V8.2 图像可以进入编辑器,而编辑当前在 V6.1 上运行;工作流程和集成与 chat/API 产品不同 |
| Adobe Firefly | Creative Cloud 交接、生成填充样式编辑以及在 Adobe 或合作伙伴模型之间进行选择 | Adobe 的商业安全定位适用于 Adobe Firefly 型号;合作伙伴模型有自己的条款和适用性 |
| Gemini / Nano Banana 2 | 快速迭代、世界知识和基于网络的提示、文本本地化、主题一致性以及从 512px 到 4K 的输出 | 可用性、控制和使用条款因 Gemini 表面和 API 而异 |
| Photoshop,Figma 或矢量工具 | 精确的网格、可编辑的文本、合法的副本、徽标和确定性的最终交付 | 更多的手工生产时间;通常最好作为一代又一代的最后一步 |
没有普遍的赢家。当对话应包含摘要和修订时,选择 ChatGPT Images; Midjourney 当艺术指导广度是主要目标时;当 Adobe 工作流程和模型来源处于中心地位时,Firefly; Nano Banana 2 当快速、知识意识迭代或多语言文本具有决定性作用时。对于高风险布局,请将任何生成器与确定性设计软件相结合。
收养计划
- 将 ChatGPT 用户工作流程与 API 要求分开。
- 定义目的、维度、受众、参考和排除。
- 构建涵盖文本、编辑、多样性和滥用案例的提示。
- 选择 Image API 进行直接作业,或选择 Responses API 进行多回合上下文。
- 使用书面规则计算每项已接受资产的成本。
- 排版价格、合法副本、URL 和最终品牌文本。
- 添加身份验证、配额、幂等性、队列和支出限制。
- 适度的输入/输出以及文件权利和同意。
- 存储模型、设置、提示/参考沿袭和审查决策。
- 金丝雀模型/模板更改并维护删除。
常见问题解答
ChatGPT Images 是 Image API 吗?
不。ChatGPT Images 是会话式用户体验。 Image API 和 Responses API 是具有独立集成和使用经济性的开发人员界面。
使用哪种型号?
OpenAI 的当前文档标识 gpt-image-2 用于内置图像生成。由于型号有变化,请确认官方指南。
开发者应该选择哪个API?
使用 Image API 进行直接生成或编辑。当图像参与对话或迭代上下文时,使用 Responses API。
它可以创建精确的文本吗?
它可以起草简短的显示文本,但每个字符都需要审查。排版交易、法律和品牌关键副本。
可以编辑一个区域吗?
是的。选择或识别该区域,陈述一项更改并重复保持不变的内容。检查整个图像是否有漂移。
是否需要肖像许可?
OpenAI 建议在适当的情况下进行护理并获得许可。适用的权利取决于背景和管辖权。
官方消息来源及验证
- OpenAI GPT Image 2 模型文档
- OpenAI 图像生成 API 指南
- OpenAI ChatGPT 图像生成指导
- Midjourney 编辑器文档
- Adobe Firefly 基于文本的图像编辑
- Adobe Firefly AI 照片编辑器和模型出处信息
- Google Nano Banana 2 公告
- Arena 文本转图像排行榜
上次独立审核日期为 2026 年 8 月 20 日。型号、可用性、参数、定价和政策发生变化;在生产前验证官方文档和活跃帐户。


