You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

关于用Dreambooth微调Stable Diffusion生成个人多场景图像的技术咨询

Dreambooth微调Stable Diffusion生成个性化场景图像的最优方案

一、训练数据集的选择:面部+身体兼具是核心

  • 核心数据集:准备10-15张同时包含清晰面部和完整身体的照片,覆盖不同姿态(站立、坐姿、侧身)、光照环境(室内暖光、室外自然光、阴天),背景尽量简洁但避免纯纯色(比如白墙),让模型学习你面部特征与身体形态的关联逻辑。
  • 补充数据集:搭配3-5张面部特写(不同角度、表情,比如微笑、平视、低头)+3-5张全身/半身姿态图(比如走路、抬手、抱臂),用来强化细节,但补充图的数量不能超过核心数据集,防止模型过度偏向单一部位。
  • 避坑点:不要用过度修图的照片(比如磨皮到面部细节丢失),不要所有照片都是同一角度/背景,否则模型会固化场景,无法生成多样化的新场景。

二、微调过程中的关键设置

  • 实例标识符(Instance Prompt):使用独特的非通用词汇,比如a photo of zxc123 person,不要用真实姓名或常见名词(比如“张三”“girl”),避免模型混淆通用语义。
  • 训练步数:10-20张图的数据集,训练1500-2500步即可,每500步保存一个检查点,后续测试后选择效果最优的检查点,禁止过度训练(会导致过拟合,生成的图几乎是训练图的复刻)。
  • 学习率:设置在2e-6至5e-6区间,太高容易过拟合,太低则无法有效学习你的特征。
  • 分类器-free引导(CFG):微调阶段将CFG值设为7-9,帮助模型更好区分你的特征与通用人物特征。

三、微调完成后的提示词设置要点

  • 基础结构:[实例标识符], [场景细节], [姿态动作], [光照/风格], 画质描述,示例:a photo of zxc123 person, sitting in a vintage coffee shop, holding a ceramic latte cup, warm yellow lighting, 8k, sharp focus。
  • 避免过度强调局部:不要在提示词中加入extremely detailed face这类强引导词,否则模型会过度聚焦面部,导致身体比例失调或场景缺失。
  • 场景与动作要具体:明确描述场景元素(比如“beach with golden sand and crashing waves”)和动作(比如“swimming in the ocean, splashing water with hands”),给模型清晰的生成方向。
  • 负提示词必备:通用负提示词blurry, low quality, deformed face, extra limbs, disfigured, bad anatomy必须加上,再根据测试结果补充针对性内容(比如生成身体扭曲就加twisted body)。

四、实战优化技巧

  • 测试循序渐进:先从简单场景(比如室内坐姿)测试,确认面部和身体匹配度后,再尝试复杂场景(海滩游泳、户外跑步)。
  • 补图微调:如果生成的图像面部和身体明显不匹配,说明模型没学好两者的关联,补充3-5张你在不同姿态下的全身照,用较低学习率(1e-6)再训练500-1000步。
  • 避开训练场景:不要用训练数据里出现过的场景作为生成目标,比如训练时用了自家客厅的图,生成时就换咖啡馆、海滩这类全新场景,避免模型直接复刻训练图。

内容的提问来源于stack exchange,提问作者Arthur Hakobyan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.05 08:01:55