旧金山——9 月 8 日,OpenAI 发布 ChatGPT Images 2.5。官方升级清单很标准:细节更锐利、光照与纹理更自然、生成延迟相比 Images 2.0 最多降低 50%、多轮编辑更稳定。同步上线的还有一批产品功能(Sketch 手绘、模板、图上评论、提示词分享),以及 API 侧两个新模型——GPT-Image-2.5 Flare(质量、编辑与速度全面改进)和 GPT-Image-2.5 Sunburst(更长生成时间换更高精度)。

照例的参数罗列之外,有一个数字值得停下来看一眼:每周,用户在 ChatGPT Images 和 API 的 GPT-Image 系列模型上生成的图片已超过 30 亿张。图像生成已经从"玩具功能"变成一条周产 30 亿件的消费级流水线。在这个量级上谈"模型升级",真正重要的就不是样张好不好看,而是每一张图的生产成本——尤其是返工成本。这正是 Images 2.5 这次升级的主线。

[1]
编辑插画:risograph 版画质感,珊瑚粉、青绿、暖黄、深蓝四色。天空中蜿蜒的传送带如河流般运送无数空白相框流向发光地平线;中央一只大手举起儿童蜡笔画的房子,画作穿过半透明棱镜后变成发光的写实房屋;右下角另一只手握红笔,在一张"宇航员狗"卡片上画出精确的红圈。
封面插画:每周 30 亿张图的流水线(传送带)上,蜡笔草图穿过棱镜变成写实图像(Sketch),红笔圈住的那一张是唯一被修改的——精确编辑的时代。AI 生成图像。, AI-generated editorial illustration.

从"生成"到"编辑":这次升级的真实重心

把官方材料逐节拆开,四个核心改进里有三个都在围绕同一件事:让"改图"变得可靠。

**其一,参考图保真。**Images 2.5 更擅长以参考照片为基础工作:主体更可辨认,光照纹理更自然,特征更可能跨场景保留。对普通用户,这意味着"把我家狗 P 进宇航服"之后那还确实是你家狗;对 API 客户,这意味着以品牌素材为锚的批量变体生产终于不会跑偏。

**其二,精确编辑。**官方承诺是"只改你要求改的部分,其余细节原样保留——即使主体与背景更复杂"。做过生成式修图的人都知道这是行业级痛点:传统扩散模型的"局部重绘"经常顺手把你要保留的部分也"优化"了。

**其三,多轮编辑一致性。**长对话里连续下达修改指令,早先的改动更可能保持一致,每次新编辑建立在已有成果之上而不降低画质。这一条直接决定图像模型能不能进入生产流水线:企业需要的不是"抽卡式"地反复从头生成,而是像改设计稿一样逐轮收敛。

**其四,复杂指令与风格理解。**更准确地处理含真实世界信息的图像内容、更复杂的版式(含透明背景)、更忠实地还原指定视觉风格——官方点名的场景是"成系列的品牌素材""保持既定层级的 UI 概念稿""符合既定结构的演示配图"。注意这三个场景都是 B 端付费场景。

结论清晰:**Images 2.5 不是一次"画得更好看"的升级,而是一次"更听指挥"的升级。**OpenAI 在把图像模型从"灵感发生器"改造成"设计部门的正式员工"——考核指标从惊艳度换成了返工率。

[1]

Sketch:草稿纸进了聊天框

产品侧最值得关注的是新功能 Sketch:在 ChatGPT 里直接手绘——房间布局、服装轮廓、随手涂鸦——模型把你的草图当作视觉参考生成完整图像,可附加风格描述。入口是对话框里输入"@Sketch"。

这个功能的意义不在于"画画"本身,而在于补上了人机之间长期缺失的那个输入模态。语言天生不擅长表达空间关系——"左边一点、再矮一点、大概占画面三分之一"这种描述,远不如一根线来得精确。手绘是人类最古老的设计沟通方式,把它接进图像生成,等于承认纯文本提示词已经触到了表达带宽的天花板。模板、图上评论、提示词分享则是同一方向的配套:模板解决"从空白开始"的冷启动,图上评论把修改意见钉在像素位置上,提示词分享把"怎么写出来的"变成可复用的社交资产。

[1]

30 亿张/周:图像模型的"电力局"时刻

每周 30 亿张图,意味着图像生成已经度过了"新鲜感驱动"的阶段,进入了公用事业阶段——用户对它的期待从"哇"变成"稳",供应商的竞争力从"能不能生成"变成"单位成本下的可用率"。

在这个语境下重新看 API 的双模型策略,分工就清楚了:Flare 是走量的默认款,吃"快 + 好"的主流需求;Sunburst 用更长生成时间换细节精度,服务高价值的专业场景。这与文本模型的"标准版/思考版"分层是同一种定价哲学——把延迟和精度变成两个可售卖的档位。

全量铺开的速度也值得一提:发布当天即向所有 ChatGPT、ChatGPT Work 与 Codex 用户开放,桌面、移动、网页三端同步——没有任何 waitlist。在每周 30 亿张的基数上直接切换,这本身就是对推理成本控制力的展示。

[1]

分析:三个判断

**第一,图像生成的竞争焦点正式从"审美"转向"可控"。**各家头部模型在"惊艳样张"上早已拉不开代差,真正的分水岭是多轮编辑一致性、参考保真、局部修改不串台——全是"工程可靠性"指标。OpenAI 这次的版本叙事完全围绕这些词展开,说明买家(尤其是企业买家)已经用真金白银投票过了。

**第二,Sketch 是对"提示词工程学"的一次温和告别。**过去两年围绕文生图积累的大量提示词技巧,本质上是在用自然语言模拟空间指令。手绘输入直接绕过了这层转换损耗。对普通用户,这是门槛的消失;对靠"提示词模板"卖课的中间商,这是商业模式的讣告。

**第三,30 亿张/周是一个治理信号。**当图像生成达到这个量级,"AI 生成内容标识"就不再是可选项而是基础设施——内容凭证、来源元数据、平台级检测,都会从"锦上添花"变成"没有就出事"。在这个体量上,安全能力的实际水位会比模型能力更快地被社会检验。

图像模型的上半场是"能不能画",下半场是"听不听话"。Images 2.5 的发布说明:下半场的哨声已经吹响了。

[1]

附:短帖版(微博 / X 可直接发)

ChatGPT Images 2.5 发布:每周 30 亿张图的流水线上换了新机器。延迟最多降 50%,但真正的升级是"听指挥"——只改你圈出来的地方、多轮修改不串台、参考图里的狗还是你家狗。新功能 Sketch 让你直接画草图当参考,提示词工程迎来温和讣告。API 双模型:Flare 走量,Sunburst 走精度。图像生成的下半场开赛:不比谁画得惊艳,比谁返工少。#ChatGPT #图像生成 #OpenAI

[1]