开源文生图领域正在经历一场无声的碎片化危机。FLUX.1-dev 的 12B 参数能生成令人屏息的艺术级画面,却在理解「红色的球在蓝色的方块左边」这类指令时频频翻车。Z-Image 的 6B 参数在指令遵循上游刃有余,但画风美感总差一口气。SD3.5-Medium 虽然只有 2.5B 参数,却小得均衡,每一项都能做到还不错,但没有一项做到顶尖。用户不得不在不同模型之间来回切换,像一个遥控器上堆满了电视、空调和音响的按键,每一个都只能控制一台设备。问题不是没有好模型,而是没有一个模型能同时拥有所有好模型的「绝活」。
开源文生图的「三体困境」
2025 年的开源文生图生态,表面上百花齐放,实则暗藏着一个结构性矛盾。
先看三组数据。在 Aesthetic 评分上,FLUX.1-dev 以 5.717 分碾压 SD3.5-Medium 的 5.383 分,差距超过 6%。在 HPSv3 人类偏好评分上,FLUX 的 11.925 分更是甩开 SD3.5-Medium 的 9.341 分近 28%。但在指令遵循类任务上,情况完全反转。GenEval 综合评分中,FLUX 仅得 65.20%,而 Z-Image 达到 69.40%,SD3.5-Medium 也有 67.30%。更极端的差异出现在属性绑定(attribute binding)任务上。FLUX 仅 52.80%,Z-Image 44.30%,两个模型各有短板,却都远非理想。
这就是开源文生图领域最尴尬的悖论:美学、指令遵循、效率,三者不可兼得。 每个模型都有自己的「天赋点」,但这些天赋被锁死在各自的技术架构里,无法像拼乐高一样组合到同一个模型身上。
问题根源:异构的「巴别塔」
为什么不能直接拿一个模型的知识去教另一个模型?答案藏在两个技术层面。
第一层是自编码器(autoencoder, VAE)的不兼容。FLUX、SD3.5、Z-Image 各自使用不同的 VAE,将图像映射到不同维度和分布的潜空间。一个模型的「latent」在另一个模型看来完全是「外语」。传统的知识蒸馏方法,如 score matching、velocity matching,要求师生模型在同一坐标系下运作。当坐标系都不一致时,蒸馏根本无法进行。
第二层是噪声调度(noise schedule)的不匹配。不同模型采用不同的时间步采样策略和噪声分布,使得「第 t 步」在模型 A 和模型 B 中的含义完全不同。时间步索引失去了跨模型的可传递性。
这两个问题合在一起,构成了开源文生图领域最顽固的异构壁垒。此前 Flow-OPD 等方法已经证明了同策略蒸馏(On-Policy Distillation)在流匹配模型上的威力,但仅限于同构架构,即师生使用相同的 VAE 和噪声调度。当面对真正异构的教师模型时,整个范式需要重新设计。
像素桥:降维,再降维,然后打通
Poly-OPD 的核心洞察异常简洁:既然在潜空间里无法对话,那就回到像素空间。
具体来说,Poly-OPD 的「像素桥」(Pixel Bridge)策略分三步走。第一步,学生模型生成一张图像。此时它处在一个「错误」的潜空间里,这个空间只有学生自己的 VAE 能理解。第二步,将这张图像解码到像素空间,得到一张真正的 RGB 图片。第三步,用选定的教师模型的 VAE 重新编码,把这张图片「翻译」成教师能理解的潜空间表示。
这听起来像是一个笨办法,多了一道「解码到编码」的环节,增加了计算开销。但正是这个看似笨拙的翻译,打破了异构模型之间最根本的交流障碍。
更关键的是第三步之后的处理。Poly-OPD 不仅仅把翻译后的潜变量直接丢给教师,而是先将其加噪到与教师噪声调度匹配的特定水平,再由教师进行去噪「修正」。这个「先加噪、再修正」的机制,确保了教师模型在它最熟悉的信噪比区域提供监督信号,而不是在信息已经丢失太多或噪声太少的极端区域给出无意义的指导。论文通过消融实验验证了这一设计。去除「加噪修正」环节后,学生的 GenEval 综合评分下降超过 3 个百分点。
能力可选:让模型像换滤镜一样切换「天赋」
Poly-OPD 的另一大亮点是「能力可选适配器」(Capability-Selectable Adapters)。传统多任务学习或模型合并的一个常见问题是:多个能力被强行压缩到同一套参数里,彼此之间会产生干扰。一个侧重美学的任务学到的表征,可能对指令遵循任务产生负面影响。这种「跷跷板效应」在 Flow-OPD 论文中已被明确揭示。
Poly-OPD 的解决方案是在学生模型上附加一组轻量级适配器,每个适配器对应一个教师的能力维度。推理时,用户只需切换适配器,就能让模型在不同的「天赋模式」之间自由切换。需要美学优先时,加载偏好模式适配器;需要指令遵循时,加载组合模式适配器。适配器本身的参数量极小,切换成本几乎为零。
这种设计的巧妙之处在于,它绕过了「把所有能力塞进一个模型」的硬约束,转而采用「一个模型、多套插件」的架构。这既保留了多教师蒸馏的优势,又避免了能力之间的相互干扰,同时还为用户提供了按需选择的能力。你不需要为「模型什么都能做」付出额外的参数代价。
缺口感知采样:把资源花在最需要的地方
多教师蒸馏还有一个更深层的问题:不同教师在不同能力维度上的优势区间差异巨大。在某个任务上,教师 A 可能仅比学生好一点点,而教师 B 领先一大截。如果对所有任务一视同仁地采样,训练资源会被浪费在「学生已经快追上教师」的维度上。
Poly-OPD 引入了「缺口感知自适应采样」(Gap-Aware Adaptive Sampling),动态评估每个教师-学生能力对的差距,然后将更多训练资源分配给差距最大的维度。实验表明,这种策略对结构化任务的效果尤为显著。双物体组合提升了 14.93 个百分点,属性绑定提升了 8.25 个百分点,位置关系提升了 7.20 个百分点。这些正是文中模型能力最薄弱的环节。相比之下,颜色和计数这类基础能力的提升幅度分别只有 3.48 和 0.84 个百分点,因为学生模型在这些维度上已经接近教师的水平。
数据说话:2.5B 模型如何「越级」挑战
Poly-OPD 的实验设置极具说服力。学生模型是参数量仅 2.5B 的 SD3.5-Medium,教师则是 12B 的 FLUX.1-dev 和 6B 的 Z-Image。两者分别是学生体量的 4.8 倍和 2.4 倍。
在偏好模式下,经过 Poly-OPD 蒸馏的学生模型(Poly-OPD-Preference)在 Aesthetic 评分上达到 5.464,较 SD3.5-Medium 的 5.383 提升 1.5%。ImageReward 从 0.922 跃升至 1.168,提升高达 26.7%。HPSv3 从 9.341 提升至 11.354,增幅 21.5%。这些数字意味着,一个 2.5B 的小模型,在美学偏好上已经逼近 12B 的 FLUX 教师。HPSv3 得分 11.354 对 FLUX 的 11.925,差距仅 4.8%。
在组合模式下,结果更为惊人。GenEval 综合评分从 67.30% 跃升至 73.30%,不仅远超 FLUX 的 65.20%,还超过了 Z-Image 教师的 69.40%。分项来看,双物体组合提升 14.93 个百分点,属性绑定提升 8.25 个百分点,位置关系提升 7.20 个百分点。最值得一提的是属性绑定:学生得分 67.00%,而两位教师分别是 52.80% 和 44.30%。学生不仅没有被教师的天花板封顶,反而实现了跨维度超越。在 DPG-Bench 上,学生从 84.51 提升到 85.80,与 Z-Image 教师的差距缩小到 0.28 分以内,并在「关系」子项上拿到全场最佳 85.20 分。
这一现象背后的机制,与「知识交叉授粉」高度相关。当多个教师从不同角度提供密集的逐轨迹监督时,学生被迫学习一个更平滑、更通用的表征,最终在某些维度上超越了任何一个单一教师所能达到的上限。
开源 AI 的「集大成」范式正在到来
Poly-OPD 的意义远不止于一篇论文的技术贡献。它指向了一个更深层的趋势:开源 AI 正在从「单模型竞争」走向「能力聚合」。
过去两年,开源文生图领域的主旋律是「谁家模型更强」。FLUX 对标 Midjourney,SD3.5 对标 FLUX,Z-Image 对标 SD3.5,每一个新模型都试图在某个维度上登顶。但这条路越来越窄。模型规模从 2.5B 膨胀到 12B 再到 20B+,训练成本指数级增长,但能力提升却越来越边际化。
Poly-OPD 提出了另一种思路。与其让每个模型从头学所有技能,不如让模型「分科学习,集中蒸馏」。FLUX 学美学,Z-Image 学指令遵循,SD3.5 学效率,然后通过异构同策略蒸馏,将各科「状元」的知识融合到一个轻量级学生模型中。这本质上是一种「知识经济学」的优化:把最稀缺的训练资源集中在各个专长方向的突破上,再用蒸馏技术把分散的成果聚合起来。
这一范式已经在 LLM 领域得到验证。DeepSeek-V4、GLM-5、Mimo v2 等模型均通过多教师同策略蒸馏(MOPD)实现了多领域能力融合,避免了传统多任务学习中的「跷跷板效应」。同期发布的 Any-OPD 进一步将异构蒸馏推广到任意成对的流匹配生成器之间,彻底打破了「同构」这一前提假设。Poly-OPD 则聚焦于多教师场景,将能力可选和缺口感知采样引入这一框架,形成了完整的「异构多教师蒸馏」技术栈。
对开源生态而言,这意味着更少的碎片化,更多的「集大成者」。未来,用户可能不再需要为「要美还是要准」做选择题。一个模型,多套适配器,一切兼得。
开源文生图的未来,不是造出更好的「一张脸」,而是学会把每一张脸最美的部分,拼到同一个人身上。






快报