Z‐Image - Apkawa/stable-diffusion-wiki-awesome GitHub Wiki
Z-Image-Base
Базовая модель, мб медленнее чем turbo, но за счет того что веса в ней полные, то будет поддаваться дообучению и дистиляции. На момент 2025-12-12 еще не выпущена
Z-Image-Edit
Модель для редактирования изображений, возможно будет как qwen-image-edit но более доступной для слабого железа
На момент 2025-12-12 еще не выпущена
Z-Image-Turbo
Доступная дистилированная модель которая работает на слабом железе На 3060 6Гб генерируется за 20-30 секунд для изображения размером в 1024. В качестве clip используется qwen3
Все настройки даны для ноутбучной видеокарты 3060 6Гб
Установка
Зависимости, для винды 10
- cuda-12.8
- Требуется последний comfyui, можно использовать portable
Воркфлоу
Рабочий процесс взят из реддита
Скачайте изображение и загрузите в качестве рабочего процесса.
FP8 model : https://huggingface.co/T5B/Z-Image-Turbo-FP8/blob/main/z-image-turbo-fp8-e4m3fn.safetensors GGUF text encoder : https://huggingface.co/unsloth/Qwen3-4B-GGUF/tree/main
Без оптимизаций - 27-35 секунд для 8 шагов, 12-15 секунд для 4 шагов
Настройки
Steps - 8 (можно использовать 4 для прототипирования) CFG - 1 Sampler\Scheduler - Euler a\beta или dpmpp_sde\ddim_uniform (для этого семплера можно поставить Step=4-5 почти без потери качества) AuraFlow Shift - 3
У модели есть проблема вариативности при разных зернах. решается различными методами
- AuraFlow Shift - 7
- Используем дополнительную ноду KSampler с Step=1 и CFG=0, выход ноды передаем на вход уже в основную ноду, по сути генерируем заготовку изображения
https://www.youtube.com/watch?v=zMAnWBytkZI
Промптинг
Промпт можно писать и в стиле sdxl и с использованием натурального языка, в том числе русский, китайский.
Модель отлично понимает контекст и следует промпту, получается даже мемы писать. Чем детальнее тем больше вероятность получить то что надо
Так же удается писать русский текст на табличках.
Пример:
Эскиз дизайна. реалистичное студийное портретное фото анфас одной и той же девушки, отличается только прическами.
Рыжая девушка 20 лет в белой блузке.
1. Вверху слева: Прическа Ирокез
2. Вверху справа: косички
3. В центре слева: Твинтейлы
4. В центре справа: каре
5. Внизу слева: ежик
6. Внизу справа: викторианская прическа
Иногда путает порядок карточек, но в целом модель сохраняет одного персонажа, можно использовать проекции, или коллаж фото разных планов и тд. Фантазия безгранична.
An old beige CRT monitor displays a pixelated green computer interface running a DOS-based program.
At the top center of the screen is the text "COMFYUI FOR DOS 3.1 (VGA)".
To the left, a flowchart shows several boxes labeled "LOAD CHECKPOINT", "KSAMPLER", "VAE DECODE", and "SAVE IMAGE" with connecting lines indicating a process. To the right of the flowchart is a pixelated image of a cartoon female fox with orange fur, black eyes, and a white nose and chest.
Below the fox is the text "GENERATING: WAIFU_001.PcX".
A horizontal green progress bar spans the bottom of the screen.
Light from a window reflects off the monitor.
To the right of the monitor is a beige tower computer case with a CD-ROM drive and a floppy disk drive on the front.
A beige keyboard with gray keys is located in front of the monitor, and part of a wooden desk can be seen beneath the computer.
Остальные примеры можно посмотреть на civitai
Так же хорошей рабочей идеей является улучшение промпта в чатботе (qwen, deepseek) для прописывания сцены и генерации в z-image
Выводы
Данная модель по сути заменяет sdxl и даже sd1.5, т.к. при сходном объеме и скорости дает высокое качество промптинга уровня flux и qwen Ждем выпуска base и edit версий