StableDiffusion3出来一段时间了,毁誉参半。
不过不能否认,SD是一款划时代的产品。
它的实现基于复杂的数学思想,这个就不探讨了。下面仅从宏观方面分析它的工作流程。
做为一个大图像模型,它的训练数据高达几十亿。在训练阶段,利用无监督学习神经网络,训练出一个噪声预测模型。
这个模型是SD的核心组件之一,另外的核心部件包括CLIP 编码器和VAE。
CLIP编码器负责将提示词转换为向量,
噪声预测模型将被采样器调用,经过多次的去噪操作,得出最终的潜空间图像。
VAE负责把潜空间的图像解码为像素空间的图像。
采样器有很多种,对应不同的采样算法。
除了在webUI上常见的参数,比较少见的是控制提示词的参数。
主要包括conditioningSetTimeStepRange、conditioningConbine、conditionZeroOut。
这个参数可以控制提示词在采样过程中的参与时机、参与方式、归零等等。
最近AI发展很迅猛。要抓紧时间学习了。
版权声明:本文转载于今日头条,版权归作者所有,如果侵权,请联系本站编辑删除