一、明确我们要训练什么(目标)

在训练之前,我们要收集足够的图片素材,以下类型的图片张数仅供参考

训练目标 推荐图片数量 关注重点
角色/人物 20 – 50 张 服装变化、角色细节、多角度
风格 50 – 100 张 画风一致性、色彩特征、笔触
产品/物体 50 – 100 张 不同角度、不同光照、不同场景
IP 形象 ~100 张 白底图 + 场景图 + 纯背景图搭配

注意:至少要有10张图片!

 

图片质量要求(很重要,否则训练出来效果不好)

1.清晰度

图片必须 高清、无模糊、无噪点

能看清主体的轮廓、颜色、材质和细节

避免使用压缩严重、截图模糊、水印遮挡的图片(如果使用,后面模型生成出来的照片水印处会模糊带有水印)

 

2. 分辨率与尺寸

推荐分辨率:512×512 ~ 1024×1024(常见为 1024×768)

宽高必须是 64 的倍数(如 512、576、640、768、832、1024 等)

不建议使用过小(< 512)或过大(> 1536)的图片(在魔搭平台上宽高太大可能训练不了要求要裁剪)

推荐使用 PNG 格式以减少压缩损失

 

3. 图片内容要求

3.1.主体突出

图片应最大化展示训练主体,主体占画面比例尽量大

避免大面积留白或主体过小的构图

需要裁切处理,去除无关边缘

 

3.2.背景干净

尽量使用纯色/简洁背景(白底、纯色底最佳)

避免复杂、花哨的背景干扰模型学习

如果训练角色,可搭配少量场景图(比例约 4:4:2):

~40 张 纯白/纯色背景

~40 张 带简单场景

~20 张 纯背景/环境图(可选)

 

二、实操开始

1. 首先找到顶部栏,点击 AIGC专区

 

 

2. 旁边这一栏中,我们可看到 模型训练 ,打开它

 

 

3. 底模的选择(仅供参考)

 

训练目标 首选 备选 选择理由
角色 / 人物(写实真人) Klein Base 9B Z‑Image 写实质感、人脸一致性最顶;Z‑Image 对亚洲脸更友好
角色 / 人物(二次元 / 动漫) Z‑Image 其它动漫模型 Z‑Image 非蒸馏可训且二次元强;纯二次元也可考虑截图外的 SD1.5 / NAI / AnimagineXL 系(生态最成熟)
风格(画风 / 笔触 / 色调) Qwen‑2512 Z‑Image 非蒸馏能完整保留风格信号;带文字的海报风 / 国风优先 Qwen
产品 / 物体(电商 / 写实) Klein Base 9B Qwen‑2512 写实 + 包装文字 / 价格渲染强;Klein 的"编辑 + 多参考"利于产品多角度一致性
IP 形象(吉祥物 / 带 Logo / 多场景) Qwen‑2512 Z‑Image(Base) IP 常需 Logo / 中英文 + 多场景一致性,Qwen 的文字与一致性最稳

 

4. 训练总步数不用管他,6000差不多了,(步数太多容易导致训练失败)

5. 上传收集足够的图片素材

6. 打标,全选图片开始打标,等待打标完成(建议选择通义千问打标,因为千问打标是中文,以后生成图片写提示词肯定也用中文)

7. 一定要点击开始免费训练!!!不然在阿里云上训练虽然更快但要收取费用

8. 训练时间较长,耐心等待一下,训练完就可以用自己的模型生成图片了

 

三、展示一下自己训练的模型

1.反面案例

模型链接:

https://modelscope.cn/models/zhushiyyds/yinghua

 

这个模型是我用了10张照片训练的,这些照片它们的主题不同。使用这个模型生成的图片,和直接使用底模生成的图片区别不大。(如下两张图对比)

提示词:

一位二次元动漫风格的女生,正面微侧身站立,占据画面中心。银色长发呈波浪状垂至肩下,左侧一缕头发被黑色发带束起,发带上系有蓝绿色丝带;右耳上方额外系有一条相同蓝绿色丝带,与发带呼应。面部特征精致空灵:大而圆润的蓝色眼睛,虹膜细节清晰,眼神柔和略带忧郁,睫毛纤细分明;脸颊泛有淡粉红晕,皮肤白皙如瓷,无瑕疵。身穿无袖白色连衣裙,领口带褶边装饰,胸前正中缝制一枚小巧的白色缎面蝴蝶结;外搭一件宽松露肩罩衫,主体为白色薄纱材质,袖口与下摆点缀浅蓝色滚边,自然滑落露出双肩及锁骨区域。背景为从上至下渐变的纯白到浅灰,无纹理或图案。光线为柔和正面漫射光,轻微高光落在发丝、鼻梁、肩部与蝴蝶结表面,阴影仅存在于颈部下方、手臂内侧与裙摆褶皱处,过渡自然。线条干净流畅,无描边或夸张轮廓,色彩饱和度低,整体以白、浅灰、银、淡蓝、粉红为主调。画面不含任何文字元素。

 

(这一张是底模生成的)

 

(这一张是底模+训练的模型生成的)

2.正面案例

模型链接:

https://modelscope.cn/models/zhushiyyds/ZSAIGC_StarRail

 

这个模型是我用了10张崩铁的游戏风景照片训练的,这些照片它们的主题相同。使用这个模型生成的图片,和直接使用底模生成的图片区别很大,第二张图有明显的崩铁画风。(如下两张图对比)

提示词:

dimly lit city, industrial style, stone and brick, characters present, platform figure, glowing orange, arches pipes, balconies, steampunk fantasy

 

(这一张是底模生成的)

 

(这一张是底模+训练的模型生成的)

 

总结一下:主题很重要,我们需要使用跟主题相符的图片训练模型,并且在使用训练的模型生成图片时,需要围绕训练的主题,否则效果不好。(个人观点,仅供参考)


https://modelscope.cn/profile/zhushiyyds

 

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐