Open Release of Stable Diffusion 3 Medium
主要内容
Stable Diffusion 3是Stability AI目前为止最先进的文本转图像开放源代码算法。
这款模型的小巧设计使其完美适合用于消费级PC和笔记本电脑,以及企业级图形处理单元上运行。它已经满足了标准化的文字转图像模型所需要的一切条件,适应市场需求的下一代模型正在到来。
基于 Stable Diffusion 模型,参数数量为20亿的SD3 大型模型,该模型具有诸多显著特点:
总体质量和摄影实效:采用先进的图像处理技术,能够生成精确、色彩饱和且光线自然的图像,同时也可以制作出高品质且多样化风格的输出。利用如16 通道 VAE的创新性技术解决了其他模型经常会遇到的问题,例如手部和面部实体效果不足等问题。
快速理解功能:可以识别且正确处理长度较大、复杂性较高的交互式输入,包括空间思维、组合元素、动作和风格。使用三种或更多的文本编码器,可以为用户提供性能与效率之间的取舍。
字体:利用我们的扩增式变换器结构,大幅降低读写错误、调整空白间隙、书写形成字符和搭配笔画方面的失误。实现了前所未有的文本清晰度,并使输出效果更准确丝滑。
资源效率高:它能够在消费者级的GPU上运行而不会导致性能下降,因为它使用了少量视频内存。
微调优化:可以从小数据集上吸收额外细节,这是一种非常完美的个性定制方法。
与NVIDIA的合作
我们与Nvidia合作,使用其TensorRT技术为稳定概率模型系列产品中的所有版本提高了性能。包括Stable Diffusion 3 Medium在内的所有版本都利用Nvidia® RTX™ GPU和TensorRT™技术,使其在性能方面表现得更好。通过这种方式我们将能够获得最佳性能,并提高50%的性能水平。
下载优化 TensorRT 的Stable Diffusion 3 Medium :https://huggingface.co/stabilityai/stable-diffusion-3-medium-tensorrt。
与AMD的合作
英特尔已对SD3 Medium进行了优化,以匹配包括英特尔最新一代APU、消费级GPU和MI-300X Enterprise Gpu在内的多种AMD设备。
如何启动该程序
下载 Stable Diffusion 3 Medium 绘图的权重:https://huggingface.co/stabilityai/stable-diffusion-3-medium
Diffusers运行:
import torch
from diffusers import StableDiffusion3Pipeline
pipe = StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3-medium-diffusers", torch_dtype=torch.float16)
pipe = pipe.to("cuda")
image = pipe(
"A cat holding a sign that says hello world",
negative_prompt="",
num_inference_steps=28,
guidance_scale=7.0,
).images[0]
image