You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Stable Diffusion无需额外训练引入新宝可梦的嵌入方案咨询

关于Stable Diffusion宝可梦嵌入训练与提取的问题

我手头有一个包含1000种宝可梦的数据集,每种宝可梦对应10张图片,且配有标注精准的宝可梦名称元数据。我想微调Stable Diffusion模型,实现用「a drawing of [name]」这类提示词生成对应宝可梦图像,甚至能生成宝可梦风格的Donald Trump图像(基础模型已能识别Donald Trump)。

但生成虚构新宝可梦(比如名为Megachu、体型粗壮、红身带翼的皮卡丘变体)时,模型无法识别这类新名称。Dreambooth、Textual Inversion等常规方法训练耗时耗力,所以我希望通过输入宝可梦嵌入向量,让模型基于嵌入而非名称生成对应宝可梦——比如Megachu这类新宝可梦,只需将其图像提取嵌入后输入模型就能生成,类似人脸嵌入的流程。

作为Stable Diffusion架构新手,我有以下两个问题:

问题1

如何利用Stable Diffusion现有权重,基于1000种宝可梦的图片训练对应的嵌入向量?需要修改模型的哪些层?是否要将向量表示为tokens?

问题2

如何从任意图像中提取宝可梦嵌入?嵌入模型是否需要与扩散模型分离?

另外,我曾尝试过Stable Diffusion Variations,但它无法保留角色特征,比如生成的Megachu会改变颜色、翅膀形状或体型。

内容的提问来源于stack exchange,提问作者offchan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.07 06:30:36