关于用Dreambooth微调Stable Diffusion生成个人多场景图像的技术咨询
Dreambooth微调Stable Diffusion生成个性化场景图像的最优方案
一、训练数据集的选择:面部+身体兼具是核心
- 核心数据集:准备10-15张同时包含清晰面部和完整身体的照片,覆盖不同姿态(站立、坐姿、侧身)、光照环境(室内暖光、室外自然光、阴天),背景尽量简洁但避免纯纯色(比如白墙),让模型学习你面部特征与身体形态的关联逻辑。
- 补充数据集:搭配3-5张面部特写(不同角度、表情,比如微笑、平视、低头)+3-5张全身/半身姿态图(比如走路、抬手、抱臂),用来强化细节,但补充图的数量不能超过核心数据集,防止模型过度偏向单一部位。
- 避坑点:不要用过度修图的照片(比如磨皮到面部细节丢失),不要所有照片都是同一角度/背景,否则模型会固化场景,无法生成多样化的新场景。
二、微调过程中的关键设置
- 实例标识符(Instance Prompt):使用独特的非通用词汇,比如
a photo of zxc123 person,不要用真实姓名或常见名词(比如“张三”“girl”),避免模型混淆通用语义。 - 训练步数:10-20张图的数据集,训练1500-2500步即可,每500步保存一个检查点,后续测试后选择效果最优的检查点,禁止过度训练(会导致过拟合,生成的图几乎是训练图的复刻)。
- 学习率:设置在
2e-6至5e-6区间,太高容易过拟合,太低则无法有效学习你的特征。 - 分类器-free引导(CFG):微调阶段将CFG值设为7-9,帮助模型更好区分你的特征与通用人物特征。
三、微调完成后的提示词设置要点
- 基础结构:
[实例标识符], [场景细节], [姿态动作], [光照/风格], 画质描述,示例:a photo of zxc123 person, sitting in a vintage coffee shop, holding a ceramic latte cup, warm yellow lighting, 8k, sharp focus。 - 避免过度强调局部:不要在提示词中加入
extremely detailed face这类强引导词,否则模型会过度聚焦面部,导致身体比例失调或场景缺失。 - 场景与动作要具体:明确描述场景元素(比如“beach with golden sand and crashing waves”)和动作(比如“swimming in the ocean, splashing water with hands”),给模型清晰的生成方向。
- 负提示词必备:通用负提示词
blurry, low quality, deformed face, extra limbs, disfigured, bad anatomy必须加上,再根据测试结果补充针对性内容(比如生成身体扭曲就加twisted body)。
四、实战优化技巧
- 测试循序渐进:先从简单场景(比如室内坐姿)测试,确认面部和身体匹配度后,再尝试复杂场景(海滩游泳、户外跑步)。
- 补图微调:如果生成的图像面部和身体明显不匹配,说明模型没学好两者的关联,补充3-5张你在不同姿态下的全身照,用较低学习率(
1e-6)再训练500-1000步。 - 避开训练场景:不要用训练数据里出现过的场景作为生成目标,比如训练时用了自家客厅的图,生成时就换咖啡馆、海滩这类全新场景,避免模型直接复刻训练图。
内容的提问来源于stack exchange,提问作者Arthur Hakobyan
相关产品推荐
相关产品推荐

