Z‐Image - Apkawa/stable-diffusion-wiki-awesome GitHub Wiki

Z-Image-Base

Базовая модель, мб медленнее чем turbo, но за счет того что веса в ней полные, то будет поддаваться дообучению и дистиляции. На момент 2025-12-12 еще не выпущена

Z-Image-Edit

Модель для редактирования изображений, возможно будет как qwen-image-edit но более доступной для слабого железа

На момент 2025-12-12 еще не выпущена

Z-Image-Turbo

Доступная дистилированная модель которая работает на слабом железе На 3060 6Гб генерируется за 20-30 секунд для изображения размером в 1024. В качестве clip используется qwen3

Все настройки даны для ноутбучной видеокарты 3060 6Гб

Установка

Зависимости, для винды 10

  • cuda-12.8
  • Требуется последний comfyui, можно использовать portable

Воркфлоу

Рабочий процесс взят из реддита

Скачайте изображение и загрузите в качестве рабочего процесса.

FP8 model : https://huggingface.co/T5B/Z-Image-Turbo-FP8/blob/main/z-image-turbo-fp8-e4m3fn.safetensors GGUF text encoder : https://huggingface.co/unsloth/Qwen3-4B-GGUF/tree/main

Без оптимизаций - 27-35 секунд для 8 шагов, 12-15 секунд для 4 шагов

Настройки

Steps - 8 (можно использовать 4 для прототипирования) CFG - 1 Sampler\Scheduler - Euler a\beta или dpmpp_sde\ddim_uniform (для этого семплера можно поставить Step=4-5 почти без потери качества) AuraFlow Shift - 3

У модели есть проблема вариативности при разных зернах. решается различными методами

  1. AuraFlow Shift - 7
  2. Используем дополнительную ноду KSampler с Step=1 и CFG=0, выход ноды передаем на вход уже в основную ноду, по сути генерируем заготовку изображения

https://www.youtube.com/watch?v=zMAnWBytkZI

Промптинг

Промпт можно писать и в стиле sdxl и с использованием натурального языка, в том числе русский, китайский.

Модель отлично понимает контекст и следует промпту, получается даже мемы писать. Чем детальнее тем больше вероятность получить то что надо

Так же удается писать русский текст на табличках.

Пример:

Эскиз дизайна. реалистичное студийное портретное фото анфас одной и той же девушки, отличается только прическами.
Рыжая девушка 20 лет в белой блузке.

1. Вверху слева: Прическа Ирокез
2. Вверху справа: косички
3. В центре слева: Твинтейлы
4. В центре справа: каре
5. Внизу слева: ежик
6. Внизу справа: викторианская прическа

Иногда путает порядок карточек, но в целом модель сохраняет одного персонажа, можно использовать проекции, или коллаж фото разных планов и тд. Фантазия безгранична.


An old beige CRT monitor displays a pixelated green computer interface running a DOS-based program. 
At the top center of the screen is the text "COMFYUI FOR DOS 3.1 (VGA)". 
To the left, a flowchart shows several boxes labeled "LOAD CHECKPOINT", "KSAMPLER", "VAE DECODE", and "SAVE IMAGE" with connecting lines indicating a process. To the right of the flowchart is a pixelated image of a cartoon female fox with orange fur, black eyes, and a white nose and chest. 
Below the fox is the text "GENERATING: WAIFU_001.PcX". 
A horizontal green progress bar spans the bottom of the screen. 
Light from a window reflects off the monitor. 
To the right of the monitor is a beige tower computer case with a CD-ROM drive and a floppy disk drive on the front. 
A beige keyboard with gray keys is located in front of the monitor, and part of a wooden desk can be seen beneath the computer.

Остальные примеры можно посмотреть на civitai

Так же хорошей рабочей идеей является улучшение промпта в чатботе (qwen, deepseek) для прописывания сцены и генерации в z-image

Выводы

Данная модель по сути заменяет sdxl и даже sd1.5, т.к. при сходном объеме и скорости дает высокое качество промптинга уровня flux и qwen Ждем выпуска base и edit версий

Links