如果为图像生成模型同时训练多个 LoRA,会发生什么?

DiffSynth-Studio 是魔搭社区自研的开源 Diffusion 模型框架。围绕这个问题,我们做了一段时间的系统性探索,逐渐形成一个判断:LoRA 不只是基础模型的轻量微调工具,更是拓展与重组模型能力的模块化组件,而决定能力上限的关键在于"如何分配 LoRA"。

沿着这个思路,本次我们重点开源两项新工作。MultiAlign 按 Timestep 分配 LoRA,用 MoE LoRA 在指令遵循、文本渲染、美学对齐等多个维度全方位提升基础能力;TreeAdapter 按内容分配 LoRA,用超过 1 万个 LoRA 组建了一个树形模型系统,在稀有物种生成上的精准程度甚至超过 GPT-Image-2 等闭源大模型。二者都建立在我们更早的一项工作 ArtAug 之上——它通过按数据分配 LoRA,验证了这条路线的可行性

开源地址:

  • ArtAug:https://www.modelscope.cn/models/DiffSynth-Studio/ArtAug-lora-FLUX.1dev-v1
  • MultiAlign:https://www.modelscope.cn/models/DiffSynth-Studio/MultiAlign-FLUX.1-dev
  • TreeAdapter:https://www.modelscope.cn/models/DiffSynth-Studio/TreeAdapter-KleinBase4B
  • Github: https://github.com/modelscope/DiffSynth-Studio

效果展示

在展开技术细节之前,先直观感受一下两项重点工作带来的变化。

MultiAlign 则在指令遵循、多物体组织与画面文字渲染等更综合的场景上提升明显。下面三组样例均使用长提示词,涵盖复杂场景布置与画面内嵌英文,每组左为 FLUX.1-dev,右为本方法:

 

Prompt 1:

A beautiful Mediterranean kitchen with white plaster walls, a blue ceramic bowl of oranges on a stone island, a copper kettle behind the bowl, a folded olive-green towel on the right edge, and a sunlit window with herbs in terracotta pots along the sill; warm natural light, tasteful rustic elegance, and the towel embroidered with "CASA LUNA"

FLUX.1-dev

 

Ours

 

 

Prompt 2:

A glowing winter Christmas market square, with a decorated evergreen tree in the center, a stall of gingerbread on the left, a carousel on the right, and strings of warm lights above snowy cobblestones; festive cinematic charm and the stall sign reading "HOLIDAY TREATS"

FLUX.1-dev

 

Ours

 

 

Prompt 3:

A dreamy alpine breakfast by a panoramic window, with a wooden tray on a bed holding a croissant, a pot of coffee, and a bowl of apricots, while a cream blanket folds across the lower edge and snowy peaks fill the view beyond; soft luxury travel styling, bright crisp light, and a small jar labeled "MOUNTAIN HONEY"

FLUX.1-dev

 

Ours

 

 

TreeAdapter 则聚焦稀有物种生成,借助超过 1 万个 LoRA 组成的模型系统,还原不同物种的独特视觉特征:

 

这些直观差异的背后,是不同的 LoRA 分配思路。下面分别展开。

 

MultiAlign:用 MoE LoRA 全方位提升模型基础能力

技术报告:即将到来

模型:https://www.modelscope.cn/models/DiffSynth-Studio/MultiAlign-FLUX.1-dev

图像生成模型发展到今天,各方面的模型能力已经与最初的 Stable Diffusion 1.5 相比都有了明显提升,ArtAug 能增强图像细节,但我们也需要其他多个方面的能力,例如文字渲染、指令遵循能力等。

我们观察到,在 Diffusion 模型的去噪迭代过程中,从高斯随机噪声开始,逐渐变为清晰的图像,每一个阶段的模型在做不同的事情。当噪声含量高时,模型在构建整体的构图;当噪声含量低时,模型在填充局部的细节。那么可以用不同的模型分别处理不同的生成阶段。

 

Stable Diffusion XL 就是这样的模型,两个模型分别侧重于不同的能力,在不同的生成阶段进行推理。Wan-2.2-A14B 也是类似的架构,这种 MoE 架构能够充分发挥模型的潜力。

我们借鉴了这样的模型架构,设计了 MoE LoRA。在模型的生成过程中,用 Timestep 区分当前的步骤,一个直接的方案是在不同 Timestep 上使用不同的 LoRA,但这会带来不少参数的浪费,所以我们构建了一个更轻量的模型结构,让 LoRA 的权重根据 Timestep 产生改变。训练的目标包括三个,由三个模型分别量化:GenEval(指令遵循能力)、OCR(文本渲染能力)、PickScore(美学对齐能力)

 

模型的各方面综合能力都有了提升,我们将会在晚些时候公开这个模型的技术报告。

 

MultiAlign 证明了按照 Timestep 分配 LoRA 所带来的模型能力提升。

 

TreeAdapter:用 1w+ LoRA 组建模型系统

技术报告:https://arxiv.org/abs/2607.24215v1

模型:https://www.modelscope.cn/models/DiffSynth-Studio/TreeAdapter-KleinBase4B

如果说图像生成模型发展到现在还有哪些能力有所欠缺,那必然是数据量缺少导致的。精美图像数据让模型生成的图像更符合人类审美,丰富的带文本图像数据让模型学会了在画面中书写字迹。而在生物学领域,如今的模型仍然无法精确地生成稀有物种的图像,这是由于这类数据服从长尾分布,每一个物种都有独特的特征,相似的物种有相似的特征,而这些特征恰恰是现代生物学研究所关注的。

 

生物学上有“界门纲目科属种”的分类体系,我们按照这样的树形分类体系,创建一个 LoRA 模型系统,每一个树形分类节点对应一个 LoRA 模型。

 

在推理过程中,当我们要生成某一物种的图像时,在这个 LoRA 模型系统中检索得到它所属的分类,进而得到树形图上的一条路径,以及路径上节点对应的 LoRA,这些 LoRA 共同包含这个物种的视觉特征,保证生成的物种图像精准可控。

 

由于生物学上的物种数量过于庞大,这个 LoRA 模型系统包含了超过 1 万个 LoRA,自然界的生物丰富多样,庞大的 LoRA 模型系统是生物数亿年进化的缩影,利用这个 LoRA 模型系统,我们得以生成各种各样的生物,其精准程度甚至超越了 GPT-Image-2 等闭源大模型。

TreeAdapter 证明了按照内容分配 LoRA 所带来的模型能力提升。

 

ArtAug:用差分训练增强模型的细节渲染能力

技术报告:https://arxiv.org/abs/2412.12888

模型:https://www.modelscope.cn/models/DiffSynth-Studio/ArtAug-lora-FLUX.1dev-v1

图像生成模型的细节渲染质量高度依赖训练数据的质量,那么能否让模型"照着更好的自己"学习?这是 ArtAug 要解决的问题,这项研究工作完成于一年前。

 

我们收集了多个“数据对”,每个数据对包含两张图像,一张由模型自身生成,另一张也由模型自身生成,但后者使用了耗时更长的分区提示词润色,因此后者的细节更丰富。随后采用差分训练的方式训练 LoRA 模型学习两张图像的差异。

什么是差分训练?给定图 A 和图 B,先用图 A 训练 LoRA A,再将 LoRA A 融入基础模型,基于融合的基础模型,用图 B 训练 LoRA B。此时,LoRA A 可以用于生成图 A,LoRA A + LoRA B 可以用于生成图 B,那么 LoRA B 就可以将图 A 改成图 B。

 

针对每一个数据对,我们都训练了这样的“LoRA B”,将其融合,就得到了一个增强模型,可以大幅度提升模型的细节渲染能力。我们继续用增强模型生成新的数据对,再用数据对训练新的增强模型,迭代多次后,模型能力逐渐收敛,生成的图像更加符合人类的审美。

 

ArtAug 证明了按照数据分配 LoRA 所带来的模型能力提升。

 

结语

LoRA 是基础模型能力拓展的媒介,我们希望探索更多 LoRA 模型的潜力。同时,我们也致力于模型基础框架的建设,我们将通过开源项目 DiffSynth-Studio,用框架建设孵化技术创新!

 

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐