文档首页 云服务器 云服务器ECS 最佳实践 自助建站 AIGC实践 搭建SDXL-Turbo模型文生图推理 AIGC实践
搭建SDXL-Turbo模型文生图推理
搭建SDXL-Turbo模型文生图推理
本文主要介绍如何在云服务器实例中部署Stable Diffusion XL Turbo模型,并使用CPU加速文生图推理。
功能特色
本实践使用了 火山引擎 第3代云服务器 通用型g3i ,该规格实例采用 火山引擎 自研最新DPU架构并搭载了第5代英特尔®至强®可扩展处理器(Emerald Rapids,EMR),结合新一代硬件AI加速指令AMX-BF16( Intel Advanced Matrix Extensions )以及基于其上的IPEX框架优化,实现了系统级优化方案来加速SDXL-Turbo模型的文生图推理速度。 背景信息
Intel® Extension for PyTorch(IPEX)是由Intel开源并维护的一个PyTorch扩展库,大幅度提升了使用PyTorch在Intel处理器上运行AI应用,尤其是深度学习应用的性能。Intel正不断为PyTorch贡献IPEX的优化性能,为PyTorch社区提供最新的Intel硬件和软件改进。更多信息,请参见 IPEX 。 SDXL-Turbo模型
本实践使用的推理模型为SDXL-Turbo(Stable Diffusion XL Turbo),该模型是Stability AI在Stable Diffusion基于SDXL 1.0的蒸馏(Distillation)版本,专为实时合成的文生图场景服务。该模型能够确保即使在一到两个采样步骤,也能保持高的图片质量。
操作步骤
步骤一:环境准备
创建搭载了第5代英特尔®至强®可扩展处理器(Emerald Rapids,EMR)实例,详细操作请参见 购买云服务器 。 实例规格:本文选择 通用型g3i (ecs.g3i.8xlarge)规格。 镜像:本文选择Ubuntu 22.04 LTS 64位。 说明
请确保Docker版本不低于19.03,且 DOCKER_BUILDKIT=1 。
步骤二:部署SDXL-Turbo模型
pip install -U huggingface_hub hf_transfer
HF_ENDPOINT=https://hf-mirror.com HF_HUB_ENABLE_HF_TRANSFER=1 huggingface-cli download --resume-download stabilityai/sdxl-turbo --local-dir sdxl-turbo --local-dir-use-symlinks=False
将如下文件上传至在SDXL-Turbo模型同级目录下。操作详情可查看 本地数据上传 。 pipeline_stable_diffusion_xl_ipex.py pipeline_stable_diffusion_xl_ipex.py 在Dockerfile文件同级目录下,执行如下命令,制作Docker镜像。
docker build -t sdxl:v1 .
docker run --name sdxl --privileged=true -v /root/models:/models -it sdxl:v1 bash
步骤三:运行SDXL-Turbo模型
在容器 sdxl 的交互模式中,执行如下命令,进入模型目录。 在Docker容器中,推理生成的图片将以 saved_pic0ite$Nubmer$.png 格式命名。
numactl --localalloc --physcpubind=48-71 python sd_pipe_sdxl_turbo.py --height 512 --width 512 --repeat 11 --step 4 --bf16 --prompt "A spaceship traveling through the stars. highly detailed, 8k"
性能说明
测试数据
本节展示了使用ecs.g3i.8xlarge规格实例,通过Stable Diffusion XL Turbo模型生成不同分辨率与数据精度图片的耗时信息。
说明
下表测试数据仅做参考,实际数据可能会因您的操作环境而发生变化,请以实际情况为准。
测试结论
在搭载英特尔EMR处理器的ecs.g3i.8xlarge规格实例中,根据本实践调整后的文生图模型,可通过使能高级矩阵扩展加速引擎(AMX指令集)有效加速推理速度,最快可达 0.735 images/s,实现秒级生图性能。与未使用或不支持AMX指令集加速的实例相比,其文生成图性能可提升293% ~ 388%。
因此,在追求性价比、丰富实例资源场景下,您可以使用搭载英特尔EMR处理器的实例规格(例如 通用型g3i )代替GPU实例,通过系统级加速方案获取最优性价比的高效文生图服务。
最近更新时间:2025.07.01 16:22:56