一张画像,没有署名,没有展签,没有画家签名——但它挂在那里,每一个路过的人都能看出它出自谁的手笔。
2026年8月9日,LM Arena 的 Image Arena 盲测榜单上,悄然出现了一个新名字:mona-lisa-1。没有官方公告,没有新闻稿,甚至没有社交媒体预告。但社区测试者几乎在第一时间锁定了它的身份——将生成图像扔进 OpenAI 官方内容验证工具一测,SynthID 水印赫然在目。
GPT-Image 2 在今年4月21日才正式上线,满打满算不到四个月。OpenAI 已经在准备下一局了。
匿名模型空降,历史重演
LM Arena 由 LMSYS 组织运营,用户可以在不知晓模型身份的情况下,对两个模型的输出进行对比投票。这种盲测机制最大程度排除了品牌偏见,因此成为行业公认的模型能力风向标。
mona-lisa-1 出现后,社区测试者迅速行动。@AiBattle_ 将模型生成的图像提交到 OpenAI 官方验证工具,检测结果确认图像包含 SynthID 水印。@WolfRiccardo、@synthwavedd、@ivanainai 等多名社区 KOL 独立完成了同样的验证,结论一致——这些图像来自 OpenAI 的图像生成模型。
这不是第一次了。2026年4月初,三个代号为 packingtape-alpha、maskingtape-alpha 和 gaffertape-alpha 的匿名模型曾短暂出现在 LM Arena 上,数小时后被撤下。两周后的4月21日,GPT-Image 2 正式发布。历史正在以几乎相同的剧本重演——唯一的区别是,这次 OpenAI 没有撤下模型,而是让它持续留在 Arena 中接受测试。
社区测试者还发现了一个关键线索:通过"Charlie Kirk 测试"(一种探测模型知识截止日期的提示词模式),mona-lisa-1 能准确描述2025年5月22日之前的重大事件,但对之后的信息一无所知。这意味着模型的训练很可能在2025年就已经完成——比 GPT-Image 2 的2025年12月知识截止日期还要早。
为什么是"蒙娜丽莎"?
品牌命名从来不是随机的。
OpenAI 此前的图像模型命名体系清晰明了:gpt-image-1(2025年4月)、gpt-image-1.5(2025年12月)、gpt-image-2(2026年4月)。每次迭代都是"GPT-Image"系列的延续,暗示着图像生成只是 GPT 大模型生态的一个功能模块。
mona-lisa-1 打破了这一传统。
首先,它不再使用"GPT-Image"前缀。达·芬奇的《蒙娜丽莎》是人类艺术史上最具辨识度的画作,代表着"经典""永恒"与"完美"。将其作为图像模型的代号,传达的是"我们不再只是做图像生成,我们在做视觉创作"的定位升级。
其次,"-1"后缀暗示这是一个全新产品家族的开端,而非临时测试代号。相比之下,此前"tape"系列的命名(packingtape、maskingtape、gaffertape)明显是临时性的内部测试标签。
第三,品牌独立意味着产品独立。GPT-Image 一直依附于 GPT 大模型体系,名字上就低了一头。而"蒙娜丽莎"可以脱离聊天模型独立存在——这让人联想到 Midjourney,一个没有大公司背景的独立产品,却占据了创意阶层的心智高地。OpenAI 显然想要同样的位置,甚至更多。
GPT-Image 2 还不够好,但真正的压力来自四面八方
GPT-Image 2 在2026年4月发布时,被公认为"最全面的图像生成模型"。它在文本渲染、复杂场景理解、多图一致性等方面表现突出,综合能力一度超越了 Midjourney V7 和 Google Imagen 3。OpenAI 甚至在4月22日宣布,DALL-E 2 和 DALL-E 3 将于5月12日全面下线——GPT-Image 2 正式成为 OpenAI 唯一的图像生成产品。
但四个月后的今天,竞争格局已经面目全非。
Midjourney 在6月10日将 V8.1 设为默认模型,渲染速度比前代快4到5倍,支持原生2K输出,在美学品质上重新拉开差距。到7月24日,V8.2 已经成为新默认模型,迭代速度之快令人咋舌。Google 的 Gemini 3.1 Flash Image 全面可用,Nano Banana Pro 在真实感方面持续领跑。Flux 1.1 Pro 成为"去 AI 感"的标杆,尤其在皮肤纹理和自然光影上表现惊艳。Ideogram 4 加入了开源阵营,在文本渲染和可控性上步步紧逼。
GPT-Image 2 最大的软肋,恰恰是"AI 感"——尽管它在文本理解和复杂场景构建上无人能及,但生成的图像在皮肤纹理、自然光影和生物细节上,始终被用户诟病"塑料感"太重。社区测试者对 mona-lisa-1 的初步反馈显示,它在真实感和细节层次上确实有所提升,塑料感有所减轻——但部分结果仍存在明显的噪声和块状伪影,指令跟随能力也被评价为"参差不齐"。
换句话说,GPT-Image 2 的短板在四个月里被竞争对手逐一放大,OpenAI 必须回应。mona-lisa-1 就是这份回应——尽管它目前看起来还只是"回应"而非"超越"。
盲测背后的产品节奏与战略意图
回顾 GPT-Image 2 的发布路径:4月4日"tape"系列模型出现在 Arena 上,数小时后被撤下;4月中旬部分 ChatGPT Plus 用户发现图像输出质量明显提升(A/B 测试);4月21日正式发布。整个过程大约17天。
mona-lisa-1 的测试方式更加开放和持久。它没有被撤下,而是持续留在 Arena 中供用户反复测试。这意味着 OpenAI 可能采取了更社区化的测试策略——让更多用户参与盲测,收集更充分的反馈数据,再决定最终的发布形态与质量调校方向。
这也意味着 mona-lisa-1 可能还不是最终版本。从社区反馈来看,噪声控制和指令跟随能力仍有明显改进空间。模型在 Arena 上"放风"的时间越长,说明它离量产化越远——但也说明 OpenAI 对社区反馈的重视程度越高。
还有一个值得关注的信号:如果 mona-lisa-1 的训练在2025年5月就已经完成,那么 OpenAI 在过去15个月里一直"压着"这个模型没有发布。为什么?
答案可能藏在商业节奏里。2025年4月到2026年4月,OpenAI 用 GPT-Image 1→1.5→2 的逐步升级,完成了从 DALL-E 3 到统一图像模型的平稳过渡。如果2025年就发布一个能力远超当时版本的模型,不仅会打乱自己的产品节奏,还会让 GPT-Image 1.5 和 2 的增量升级失去意义。
现在,GPT-Image 2 已经站稳了脚跟,DALL-E 系列也已正式退役。mona-lisa-1 的"出山"时机恰到好处。
谁将受益,谁将出局
如果 mona-lisa-1 成为 GPT-Image 系列的正式继任者,它将在三个层面改变行业格局。
技术层面:OpenAI 从"大模型+图像生成"的捆绑策略,转向独立的视觉模型品牌。这意味着视觉生成将不再只是 GPT 体系的一个功能模块,而是一条独立的产品线,可以单独打磨、独立迭代、甚至独立定价。这让人联想到 Google 将 Imagen 与 Gemini 解耦的策略——视觉模型正在获得自己的"公民身份"。
商业层面:GPT-Image 2 的定价模式是 ChatGPT Plus 订阅(20美元/月)加上 API 按量计费(输入8美元、输出30美元每百万 token)。如果 mona-lisa-1 成为独立产品,OpenAI 完全可能推出专门的图像生成订阅方案,直接对标 Midjourney 的30美元/月 Pro 方案。这将是一场正面价格战——而 OpenAI 手握 ChatGPT 的4亿月活用户,分发能力远超任何竞争对手。
竞争层面:OpenAI 在图像生成赛道上的迭代节奏正在持续加速。从 gpt-image-1 到 gpt-image-1.5 隔了8个月,从1.5到2隔了4个月,从2到 mona-lisa-1 可能只有4个月。这种节奏意味着 OpenAI 正在将图像生成提升到与语言模型同等重要的战略位置——甚至可能成为下一个"杀手级应用"的核心载体。
最大的赢家是用户。竞争加速意味着更好的产品、更低的价格和更多的选择。
最大的输家是那些"中间层"模型——既没有 Midjourney 的美学统治力,又没有 OpenAI 的生态优势,更没有 Google 的算力支撑。Ideogram、Recraft 这样的第三方模型,在巨头夹击下的生存空间将进一步收窄。那些依赖"DALL-E 平替"定位的创业公司,则需要重新思考自己的商业叙事。
当"蒙娜丽莎"终于揭开面纱时,AI 图像生成领域的牌桌上,可能只剩下三只手了。






快报