OpenAI图像生成延迟砍半,Sketch草图解锁创作新范式

2026.09.09 09:09
OpenAI于9月8日正式发布ChatGPT Images 2.5,图像生成延迟最多降低50%,推出Sketch草图功能、评论标注编辑和创作模板。API端同步上线Flare与Sunburst双模型,定价与上一代持平。在Midjourney V8.1、Flux 2等竞品环伺之下,OpenAI正以生态整合和速度加精度双线打法重新定义图像生成赛道的竞争规则。

每周有超过30亿张图像从OpenAI的模型管道中流出。这个数字足以让任何竞争对手沉默。但OpenAI似乎并不满足于沉默,它们想要的是统治力。

2026年9月8日,OpenAI正式发布ChatGPT Images 2.5。距离4月21日的Images 2.0仅隔不到五个月,OpenAI在图像生成赛道投下一枚新的炸弹:生成延迟最高降低50%,新增Sketch草图功能、评论标注编辑、创作模板,以及两款定位差异化的API模型。

这不是一次温和的版本迭代。这是OpenAI在图像生成领域的全面提速,字面意义上的,和战略意义上的。

从DALL·E 3到Images 2.5:迭代周期压缩70%

回顾OpenAI的图像生成之路,节奏并不总是这么快。

2023年10月,DALL·E 3正式集成到ChatGPT,第一次让用户可以在对话中自然地生成图像。那时的DALL·E 3是行业标杆,但OpenAI在这之后沉寂了整整17个月。直到2025年3月,GPT-4o的原生图像生成能力取代了DALL·E 3,随后在当年晚些时候以gpt-image-1的形态开放API。

然后节奏骤然加速。2026年4月21日,gpt-image-2(ChatGPT Images 2.0)正式发布。不到五个月后的今天,Images 2.5接棒。

从17个月到5个月,迭代周期压缩超过70%。这背后指向一个清晰的信号:多模态战场上的弹药,正在被加速推入炮膛。

延迟砍半,质量不妥协

Images 2.5最直观的升级是速度。OpenAI官方数据称,与Images 2.0相比,图像生成延迟最多降低50%。

这个数字放在日常使用中或许只是一个感觉,但放在工作流层面意味着质变。在ChatGPT中反复调整提示词、多轮修改出图时,每一轮节省的几秒钟会指数级放大整体创作效率。对API开发者而言,50%的延迟降低直接影响了用户留存率和产品体验设计。慢一倍的竞品在交互上天然吃亏。

更重要的是,速度并未以质量妥协为代价。新版本在细节锐度、自然光照、纹理丰富度上全面超越上一代。官方公告强调,模型在参考照片的主体保真度上大幅提升。人像生成时面部更像本人,产品图生成时品牌元素更不易被创造性发挥带偏。

Sketch草图:从写出来到画出来

在所有新功能中,Sketch草图功能最具产品想象力。

用户只需在ChatGPT中输入@Sketch指令,即可在对话框中直接手绘草图,辅以文字描述,模型便能将其转化为精细图像。本质上,这是将AI图像生成的输入方式从纯文本拓展到了草图加文本的双模态。

这个改变比听起来更深刻。传统AI图像生成的核心瓶颈之一,是文本描述的贫瘠性。很多视觉概念难以用文字精确传达。调整提示词十几次仍然不满意的情况,每位AI绘画用户都经历过。Sketch在很大程度上解决了这个痛点:你想说但说不清楚的构图、比例、位置关系,直接画出来就行。The Verge在报道中不无幽默地写道,ChatGPT Sketch能把你糟糕的涂鸦变成精细的AI图像。

与此同时,OpenAI还引入了模板功能和分享提示词功能。模板覆盖海报、商品图等高频格式,降低创作启动门槛。分享提示词允许用户一键分享并让他人用自己的照片和细节二次创作,本质上是在构建一条创作社交链。

评论标注编辑:从粗楹重画到精细手术刀

对专业用户而言,图片内评论标注功能的引入可能比Sketch更具实用价值。

过去,在AI生成的图像上做局部修改,通常意味着要么重新写一遍提示词、祈祷模型理解你的微调意图,要么在外部工具里手动修图。Images 2.5允许用户直接在图像的特定位置添加批注,发出删除此区域、将此改为蓝色等精确指令。模型仅对指定区域进行修改,其余部分保持不变,且在多轮编辑中能有效保持图像质量的一致性。

这是AI图像编辑从粗楹重画向精细手术刀迈进的关键一步。对于从事产品设计、电商营销、广告创意的用户来说,这项功能直接关系到工作流能不能真正跑起来。

多轮编辑一致性更是隐藏的杀手锏。OpenAI在官方公告中展示的案例视频清晰呈现了这一能力:在连续多轮对话中修改图像的风格、构图和细节,每一次修改都精准作用于目标区域,而背景、主体和已确认的元素纹丝不动。对生产级工作流来说,这意味着开发者在API中做定向修改时,不再需要每次重建整个素材。

API双模型:Flare和Sunburst的差异化站位

在API层面,OpenAI推出两款定位迥异的模型。

GPT-Image-2.5 Flare定位为默认选择,面向创作者内容、社交媒体、产品体验、视觉搜索、快速原型和高批量生成等场景。它继承了质量提升和编辑改进的全部优势,同时比GPT-Image-2延迟降低50%,是大多数API应用的首选。

GPT-Image-2.5 Sunburst则瞄准更复杂的工作流,专为成品级营销素材和精修产品图设计,提供更高的编辑控制精度,但生成时间相对较长。简言之,Flare负责快和广,Sunburst负责精和深。

两款模型在API中采用完全相同的定价:每100万图像输出token 30美元,每100万图像输入token 8美元,文本输入另行计费。值得注意的是,这一价格与GPT-Image-2完全一致。在提升质量和速度的同时不加价,OpenAI的打法意图十分明确。API支持多种分辨率,单边最长3840像素,总像素数范围在655,360到8,294,400之间。

这种双模型策略反映了OpenAI对开发者生态的深刻理解。不同应用场景对速度与精度的取舍完全不同。与其用一个模型讨好所有人,不如让市场自行选择。

安全:不能忽视的第三维度

在图像生成领域,能做出什么和能放出什么之间的鸿沟正在急剧拉大。

2025年4月,GPT-4o的图像生成能力刚上线时,就出现了用户用其制作假收据、假处方和假护照的案例。Menlo Ventures的投资人甚至在社交媒体上发推称你可以用4o生成假收据,引发广泛关注。这类事件直接暴露了图像模型在安全边界上的脆弱性。

Images 2.5延续了既有的安全机制并做了针对性升级。OpenAI在其同步发布的系统卡中披露了详细的安全评估数据:在对抗性测试中,GPT-Image-2.5-Sunburst的最终不安全呈现率为1.09%,Flare为1.41%,均低于Images 2.0的1.64%。所有输出内容均嵌入了C2PA元数据,并叠加了Google DeepMind的SynthID隐形水印。前者是行业标准的溯源框架,后者提供更不易被移除的隐式标记。

但安全不是静态的。OpenAI在系统卡中也坦承,Images 2.5的高真实感能力在缺乏防护时可能被用于制作更逼真的深度伪造内容,包括政治、色情或其他涉及真实人物和事件的敏感图片。每一次模型能力的跃升,都可能打开新的滥用通道。C2PA加SynthID的双重叠加至少在行业标准上做好了分内之事。但在深度伪造技术日新月异的背景下,这些围栏够不够高,还需要时间检验。

图像生成赛道的权力格局正在改写

如果把视线拉远,Images 2.5的发布是在一个更具火药味的竞争格局中发生的。

图像生成赛道在2026年已进入白热化阶段。Midjourney V8.1在2026年6月成为默认模型,仍占据审美探索的高地,但在API化和企业工作流整合方面长期落后。Black Forest Labs的Flux 2凭借开源权重模型和极具竞争力的API成本(每张图0.01到0.10美元),在开发者群体中快速崛起。Ideogram 4、Recraft V4.1、Google Gemini 3.1 Flash Image、Meta Muse Image等也在各自细分领域虎视眈眈。

OpenAI的护城河在于生态整合。ChatGPT每周30亿张图像的生成量本身就是巨大的飞轮。更多用户意味着更多数据反馈,更多数据反馈意味着更快的模型迭代。Sketch、模板、评论标注等功能进一步将创作行为锁定在ChatGPT生态内。API的Flare/Sunburst双模型则试图同时占领速度和精度两个阵地。

但挑战同样明显。Midjourney的审美品质仍然是不可替代的护城河。Flux 2的开源策略让开发者拥有了不依赖OpenAI的自由。Gemini图像生成与Google搜索生态的深度捆绑也构成潜在威胁。OpenAI能否在这一轮图像生成竞赛中延续其在文本领域的领先地位,取决于它能否在做好看和好用之间找到持久的平衡。

延迟砍半是一次漂亮的加速,但赛道的终点还远未到来。当生成一张好图的成本趋近于零,真正的战场将转向谁能让创作过程本身变得不可替代。

作品声明:内容由AI生成