Wan в ComfyUI: запуск видеомодели на своей видеокарте

08.09.2026

Выпуски Wan 2.1 и 2.2 выложены весами, и ролик по ним считают на своей видеокарте через ComfyUI. Здесь собрано, какие файлы для этого берут, сколько видеопамяти просит каждое издание, сколько идёт расчёт по замерам практиков и на чём он обрывается.

Попробуйте Wan 2.7 без своей видеокарты — чат с нейросетью онлайн и без регистрации, ниже на странице.

Какие выпуски Wan выложены весами

Скачать и запустить у себя можно два выпуска — Wan 2.1 и Wan 2.2. Даты стоят в разделе новостей у разработчика: код и веса Wan 2.1 выложены 25 февраля 2025 года, Wan 2.2 — 28 июля того же года, и в тот же день выпуск 2.2 появился в ComfyUI (хранилище Wan2.1, хранилище Wan2.2).

Лицензия у обоих выпусков Apache 2.0, и разработчик добавляет к ней оговорку: прав на то, что вы этими моделями снимете, он за собой не оставляет. Та же лицензия стоит в карточке каждой модели Wan-AI на Hugging Face, а инструкция ComfyUI по Wan 2.2 говорит прямо, что коммерческая работа разрешена.

Выпуски 2.5, 2.6, 2.7 и 3.0 считаются на стороне Alibaba: у организации Wan-Video кодом выложены два номера, 2.1 и 2.2, и других номеров нет ни у одной модели Wan-AI на Hugging Face. Что умеет каждый поздний выпуск — на страницах Wan 2.7 и Wan 3.0 Video, ряд выпусков целиком — на странице Wan нейросеть.

Про сам выпуск 2.2 — что вышло под этим именем и когда, чем он отличается от 2.1, сколько длится его ролик и почему у ролика нет звука — написано на странице Wan 2.2. Здесь дальше только механика запуска: файлы, память, время расчёта.

Издания Wan 2.2: A14B, 5B и сжатые пересборки

Издание A14B собрано из двух экспертов, и веса его лежат двумя папками — high_noise_model и low_noise_model, по 53,2 гигабайта каждая. Первый эксперт работает в начале расчёта и отвечает за общее построение кадра, второй работает в конце и отвечает за подробности. Обе папки нужны для одного ролика, поэтому их размеры складываются: хранилище Wan2.2-T2V-A14B на Hugging Face занимает 117,53 гигабайта вместе с текстовым кодировщиком. Название «high noise», по которому эту модель часто ищут, — имя папки, а не отдельная модель.

Издание TI2V-5B лежит одной моделью на 18,63 гигабайта, делает ролик и из текста, и из картинки и выдаёт 720P при 24 кадрах в секунду.

В ComfyUI обычно берут не оригинальные файлы, а одну из двух пересборок: сложенную в один файл на издание, на которую ссылается инструкция ComfyUI, либо семейство GGUF, которое запускается через дополнение ComfyUI-GGUF.

Что скачиваютРазмерОткуда
Wan2.2-T2V-A14B, обе папкипо 53,2 ГБ каждая, хранилище целиком 117,53 ГБWan-AI на Hugging Face
Wan2.2-TI2V-5B18,63 ГБ в трёх файлах, хранилище целиком 31,85 ГБWan-AI на Hugging Face
Один файл на эксперта A14B26,61 ГБ в полной точности, 13,31 ГБ в половиннойпересборка Comfy-Org для ComfyUI
Издание 5B одним файлом9,31 ГБтам же
GGUF на одного эксперта A14Bот 4,94 ГБ у Q2_K до 14,35 ГБ у Q8_0, у Q4_K_M 8,99 ГБQuantStack
GGUF издания 5Bот 1,73 до 5,03 ГБQuantStack
Текстовый кодировщик umt510,59 ГБ в полной точности, 6,27 ГБ в сжатойпересборка Comfy-Org
Сжимающий блок wan2.2_vae1,31 ГБпересборка Comfy-Org

Размеры сняты по перечню файлов в хранилищах: пересборка для ComfyUI, GGUF от QuantStack, веса A14B, веса 5B.

Две части остаются двумя и в сжатом виде: Q4_K_M весит 8,99 гигабайта за эксперта, то есть около восемнадцати гигабайт на модель плюс кодировщик и сжимающий блок. У издания 5B часть одна.

Счётчик Hugging Face за тридцать дней показывает, что берут: пересборку Comfy-Org — 4 920 783 раза, GGUF от QuantStack — 552 613, оригинальные веса A14B — 3 076 раз.

Сколько видеопамяти просит Wan

Числа называют две стороны, и называют разное.

Что запускаютСколько видеопамяти названоКто называет
A14B выпуска 2.2не меньше 80 ГБ, с выгрузкой модели и переводом весов в другой тип чиселразработчик, хранилище Wan2.2
TI2V-5B выпуска 2.2не меньше 24 ГБ, в пример дана RTX 4090разработчик, там же
TI2V-5B выпуска 2.2укладывается в 8 ГБ при выгрузке средствами ComfyUIComfyUI, инструкция по Wan 2.2
Издание 1.3B выпуска 2.18,19 ГБразработчик, хранилище Wan2.1
Облегчённое издание выпуска 2.18 ГБComfyUI, инструкция по Wan 2.1

Расхождение идёт от способа запуска. Разработчик считает для своего кода, где веса грузятся целиком и в исходной точности; ComfyUI — для своей связки, где слои подгружаются по мере надобности, а веса берутся сжатыми.

Верхнюю границу называет разбор канала Codebreakers: одновременная загрузка всех моделей без выгрузки занимает около 60 гигабайт видеопамяти, и даже карты на 48 гигабайт для этого мало. Там же дан ориентир по сжатию: на 8–16 гигабайтах начинают с Q4 или Q5, на 16–24 берут Q8 или половинную точность.

Точного числа на каждую степень сжатия не публикует никто: в карточках GGUF у QuantStack и в хранилище Comfy-Org стоят только размеры файлов, а таблицы времени и пиковой памяти по видеокартам в хранилищах разработчика лежат картинками, а не текстом. Расход зависит от разрешения, числа кадров, числа шагов расчёта и от того, сколько слоёв уходит в оперативную память: в разборе канала Sebastian Kamph перекладывание блоков снижает расход с 14 до 10 гигабайт — расчёт идёт дольше, качество остаётся прежним.

Порядок работы: от файлов до готового ролика

  1. Поставьте ComfyUI и откройте готовую схему запуска. Инструкция по Wan 2.2 показывает схемы под оба издания и даёт ссылки на файлы.
  2. Выберите издание под свою видеокарту. TI2V-5B — одна модель на 18,63 гигабайта, A14B — две папки по 53,2 гигабайта или пересборка поменьше.
  3. Скачайте три вещи, а не одну. Модель, кодировщик umt5 на 10,59 гигабайта в полной точности или 6,27 в сжатой и сжимающий блок wan2.2_vae на 1,31 гигабайта.
  4. Для A14B возьмите обе части в одной и той же степени сжатия. В разборе канала Sudo AI это названо прямо: нужны и high_noise, и low_noise, и обе одного сжатия.
  5. Поставьте дополнение ComfyUI-GGUF. Если файлы взяты в этом формате.
  6. Запустите расчёт. У A14B ролик проходит две стадии подряд — сначала эксперт high_noise, потом low_noise, и время складывается из обоих проходов.

Сколько идёт расчёт на своей видеокарте

Замеры практиков ниже — на пятисекундный ролик.

ВидеокартаЧто запускалиСколько шёл расчётКто замерял
RTX 5090, 32 ГБ14B в исходной точностибольше получасаCodebreakers
RTX 5090, 32 ГБто же с четырёхшаговым ускорениемменьше 5 минутCodebreakers
RTX 4090, 24 ГБ14B, обе стадииоколо 7 минут на проход, около 14 минут на обаMDMZ
RTX 3060, 12 ГБсборка 14B в половинной точности, 4 шага, 832×480, 81 кадроколо 315 секундVantage with AI
Ноутбук, 8 ГБ14B в GGUF Q4_K_S с ускоряющей приставкойоколо 150 секундAtelier Darren
RTX A5000, 16 ГБиздание 5B, 1280×704, 121 кадр20 минутAI Generation

Адреса разборов: Codebreakers, MDMZ, Vantage with AI, Atelier Darren, AI Generation. Строки между собой напрямую не сравниваются: число шагов, разрешение и приставки везде разные.

Разрыв между первой и второй строкой таблицы и есть то, что даёт сжатие с ускоряющей приставкой. Разбор канала Atelier Darren начинается с того же счёта: время снизилось с 12 минут до 189 секунд после перехода на GGUF с приставкой LightX2V.

Свои числа называет и разработчик, оба без отдельной настройки на скорость: облегчённое издание выпуска 2.1 снимает пятисекундный ролик в 480P на RTX 4090 примерно за четыре минуты, а TI2V-5B выпуска 2.2 — тот же ролик в 720P меньше чем за девять минут на бытовой видеокарте.

Какую степень сжатия брать, две стороны решают по-разному. Разбор канала FoxtonAI советует брать самое высокое Q, которое влезает в видеопамять: время у всех GGUF выходит близким. Замер канала Atelier Darren показывает обратное: Q4_K_S дал около 150 секунд против 339,69 секунды у Q6_K при незаметной разнице в качестве.

Где расчёт обрывается

Восемь гигабайт видеопамяти держат 14B в GGUF при разрешении ниже 720p: на 720p в разборе канала Tensor Alchemist на той же карте и том же файле вышла ошибка нехватки памяти. Двенадцать гигабайт на 14B в разборе канала Digital Spaceport закончились вылетом в самом конце расчёта; там же измерена цена выгрузки — расход падает вдвое, а расчёт во столько же раз удлиняется. На 16 гигабайтах ту же ошибку на 14B получил разбор канала AI Generation, и там сказано, что не хватило ни 16 гигабайт видеопамяти, ни 64 гигабайт обычной.

Обычная память останавливает работу не реже видеопамяти: в разборе канала Egor Smyshnikov Work на 32 гигабайтах оперативной второй сэмплер не запустился, и система сообщила, что файл подкачки слишком мал. Своё предупреждение даёт и разбор кадра на выходе: у канала Nio Motion ComfyUI сообщил о нехватке памяти и перешёл на разбор плитками.

Что даёт издание 5B

Издание 5B считает быстро, и это его главное свойство. Разбор канала MDMZ называет скорость единственным крупным выигрышем этого издания и рядом говорит, что до качества 14B ему далеко: движение ограниченнее, а ролики выходят скованными.

Разбор канала FoxtonAI описывает то же подробнее: качество заметно ниже, в кадре появляются деформации и артефакты, лица и здания выходят нечёткими, а текст в кадре разваливается полностью.

Дополнения сообщества: ускоряющие приставки и сборки

Ускоряющая приставка LightX2V названа в описании хранилища Wan2.1 среди работ сообщества: её файлы на четыре шага расчёта лежат в пересборке Comfy-Org рядом с весами и весят по 1,14 гигабайта, а идёт связка, по тому же описанию, на RTX 5090 и на RTX 4060 с восемью гигабайтами. Сборки Rapid AllInOne, которые ищут ещё и по слову remix, складывают Wan 2.2 с ускорителями, кодировщиком и сжимающим блоком в один файл на 21,68–22,66 гигабайта; в карточке сказано, что сборка идёт и на восьми гигабайтах, и там же эти файлы помечены как заброшенные.

Тот же ролик в браузере с оплатой за секунды

Своя видеокарта нужна не всегда: тот же кадр считается на стороне модели, и тогда всё делается в браузере — с обычного компьютера или с телефона. За секунду в 720p у Wan 2.7 берут 9 ₽, у Wan 3.0 Video отсчёт идёт от 4,5 ₽ за секунду. Сумму видно ещё до запуска, оплата рублями с карты российского банка, счёт только по секундам готового видео.

Порядок, в котором описывают сцену, разобран на странице Wan нейросеть.

В браузере идут поздние выпуски: Wan 2.7 снимает по описанию, от присланного кадра, по образцам героев и правит готовый ролик, Wan 3.0 Video доходит до тридцати секунд и берёт на вход звук. Ряд выпусков целиком — на странице Wan нейросеть, сам выпуск, файлы которого тут разбираются, — на странице Wan 2.2, остальные видеомодели — на странице нейросеть для видео.

Тот же расчёт, вызванный из своей программы, — Wan API.

Частые вопросы

Где скачать Wan 2.2 и какие файлы нужны? Веса лежат у Wan-AI на Hugging Face: A14B двумя папками по 53,2 гигабайта, TI2V-5B одной моделью на 18,63 гигабайта. Для ComfyUI берут пересборки — один файл на эксперта у Comfy-Org (13,31 гигабайта в половинной точности) или GGUF у QuantStack от 4,94 гигабайта. Кроме модели скачивают кодировщик umt5 и сжимающий блок wan2.2_vae на 1,31 гигабайта.

Что такое high noise и low noise у Wan 2.2 и почему файлов два? Издание A14B устроено из двух экспертов: high_noise отвечает за общее построение кадра в начале расчёта, low_noise — за подробности в конце. Обе части нужны для одного ролика и берутся в одной степени сжатия, поэтому размеры складываются: у Q4_K_M это 8,99 гигабайта за эксперта, около восемнадцати на модель.

Сколько видеопамяти нужно, чтобы запустить Wan 2.2? Разработчик называет для A14B видеокарту не меньше чем на 80 гигабайт, а для издания 5B — не меньше 24 гигабайт, с RTX 4090 в примере. ComfyUI для того же издания 5B называет 8 гигабайт при своей выгрузке в оперативную память. Числа на каждую степень сжатия GGUF не публикует никто — в карточках стоят только размеры файлов.

Можно ли запустить Wan 2.5, 2.6, 2.7 или 3.0 на своём компьютере? Весами выложены выпуски 2.1 и 2.2, оба под лицензией Apache 2.0; что за выпуск 2.2 и что он умеет, разобрано на странице Wan 2.2. Выпуски 2.5 и новее считаются на стороне Alibaba, и работа с ними идёт через сервис: Wan 2.7, Wan 3.0 Video.

Чем издание 5B отличается от A14B? Издание 5B — одна модель на 18,63 гигабайта в 720P, и разработчик называет для неё меньше девяти минут на пятисекундный ролик. У A14B две части по 53,2 гигабайта и два прохода расчёта. Разборы каналов MDMZ и FoxtonAI сходятся в том, что у 5B ниже качество: движение ограниченнее, появляются деформации, а текст разваливается.

Как запустить Wan 2.1 в ComfyUI и чем он отличается от 2.2? Порядок тот же: файл модели, кодировщик, сжимающий блок и готовая схема из инструкции ComfyUI. Разница в изданиях: у 2.1 есть облегчённое на 1,3 миллиарда параметров, которому по описанию хранилища хватает 8,19 гигабайта видеопамяти. Издание из двух частей появилось в 2.2.

Сколько времени идёт расчёт ролика на своей видеокарте? Замеры расходятся в десятки раз. На RTX 5090 пятисекундный ролик по 14B в исходной точности считался больше получаса, а с четырёхшаговым ускорением — меньше пяти минут; на восьмигигабайтном ноутбуке с GGUF Q4_K_S и приставкой вышло около 150 секунд.

Чат с нейросетью онлайн

ChatGPT, Claude, Gemini, Nano Banana и другие нейросети — в одном окне, прямо в браузере. Выберите нужную в списке над полем ввода и напишите задание: первый ответ бесплатно и без регистрации. Больше моделей и история разговоров — в чате с нейросетью.