Wan в ComfyUI: запуск видеомодели на своей видеокарте
08.09.2026
Выпуски Wan 2.1 и 2.2 выложены весами, и ролик по ним считают на своей видеокарте через ComfyUI. Здесь собрано, какие файлы для этого берут, сколько видеопамяти просит каждое издание, сколько идёт расчёт по замерам практиков и на чём он обрывается.
Попробуйте Wan 2.7 без своей видеокарты — чат с нейросетью онлайн и без регистрации, ниже на странице.
Какие выпуски Wan выложены весами
Скачать и запустить у себя можно два выпуска — Wan 2.1 и Wan 2.2. Даты стоят в разделе новостей у разработчика: код и веса Wan 2.1 выложены 25 февраля 2025 года, Wan 2.2 — 28 июля того же года, и в тот же день выпуск 2.2 появился в ComfyUI (хранилище Wan2.1, хранилище Wan2.2).
Лицензия у обоих выпусков Apache 2.0, и разработчик добавляет к ней оговорку: прав на то, что вы этими моделями снимете, он за собой не оставляет. Та же лицензия стоит в карточке каждой модели Wan-AI на Hugging Face, а инструкция ComfyUI по Wan 2.2 говорит прямо, что коммерческая работа разрешена.
Выпуски 2.5, 2.6, 2.7 и 3.0 считаются на стороне Alibaba: у организации Wan-Video кодом выложены два номера, 2.1 и 2.2, и других номеров нет ни у одной модели Wan-AI на Hugging Face. Что умеет каждый поздний выпуск — на страницах Wan 2.7 и Wan 3.0 Video, ряд выпусков целиком — на странице Wan нейросеть.
Про сам выпуск 2.2 — что вышло под этим именем и когда, чем он отличается от 2.1, сколько длится его ролик и почему у ролика нет звука — написано на странице Wan 2.2. Здесь дальше только механика запуска: файлы, память, время расчёта.
Издания Wan 2.2: A14B, 5B и сжатые пересборки
Издание A14B собрано из двух экспертов, и веса его лежат двумя папками — high_noise_model и low_noise_model, по 53,2 гигабайта каждая. Первый эксперт работает в начале расчёта и отвечает за общее построение кадра, второй работает в конце и отвечает за подробности. Обе папки нужны для одного ролика, поэтому их размеры складываются: хранилище Wan2.2-T2V-A14B на Hugging Face занимает 117,53 гигабайта вместе с текстовым кодировщиком. Название «high noise», по которому эту модель часто ищут, — имя папки, а не отдельная модель.
Издание TI2V-5B лежит одной моделью на 18,63 гигабайта, делает ролик и из текста, и из картинки и выдаёт 720P при 24 кадрах в секунду.
В ComfyUI обычно берут не оригинальные файлы, а одну из двух пересборок: сложенную в один файл на издание, на которую ссылается инструкция ComfyUI, либо семейство GGUF, которое запускается через дополнение ComfyUI-GGUF.
| Что скачивают | Размер | Откуда |
|---|---|---|
| Wan2.2-T2V-A14B, обе папки | по 53,2 ГБ каждая, хранилище целиком 117,53 ГБ | Wan-AI на Hugging Face |
| Wan2.2-TI2V-5B | 18,63 ГБ в трёх файлах, хранилище целиком 31,85 ГБ | Wan-AI на Hugging Face |
| Один файл на эксперта A14B | 26,61 ГБ в полной точности, 13,31 ГБ в половинной | пересборка Comfy-Org для ComfyUI |
| Издание 5B одним файлом | 9,31 ГБ | там же |
| GGUF на одного эксперта A14B | от 4,94 ГБ у Q2_K до 14,35 ГБ у Q8_0, у Q4_K_M 8,99 ГБ | QuantStack |
| GGUF издания 5B | от 1,73 до 5,03 ГБ | QuantStack |
| Текстовый кодировщик umt5 | 10,59 ГБ в полной точности, 6,27 ГБ в сжатой | пересборка Comfy-Org |
| Сжимающий блок wan2.2_vae | 1,31 ГБ | пересборка Comfy-Org |
Размеры сняты по перечню файлов в хранилищах: пересборка для ComfyUI, GGUF от QuantStack, веса A14B, веса 5B.
Две части остаются двумя и в сжатом виде: Q4_K_M весит 8,99 гигабайта за эксперта, то есть около восемнадцати гигабайт на модель плюс кодировщик и сжимающий блок. У издания 5B часть одна.
Счётчик Hugging Face за тридцать дней показывает, что берут: пересборку Comfy-Org — 4 920 783 раза, GGUF от QuantStack — 552 613, оригинальные веса A14B — 3 076 раз.
Сколько видеопамяти просит Wan
Числа называют две стороны, и называют разное.
| Что запускают | Сколько видеопамяти названо | Кто называет |
|---|---|---|
| A14B выпуска 2.2 | не меньше 80 ГБ, с выгрузкой модели и переводом весов в другой тип чисел | разработчик, хранилище Wan2.2 |
| TI2V-5B выпуска 2.2 | не меньше 24 ГБ, в пример дана RTX 4090 | разработчик, там же |
| TI2V-5B выпуска 2.2 | укладывается в 8 ГБ при выгрузке средствами ComfyUI | ComfyUI, инструкция по Wan 2.2 |
| Издание 1.3B выпуска 2.1 | 8,19 ГБ | разработчик, хранилище Wan2.1 |
| Облегчённое издание выпуска 2.1 | 8 ГБ | ComfyUI, инструкция по Wan 2.1 |
Расхождение идёт от способа запуска. Разработчик считает для своего кода, где веса грузятся целиком и в исходной точности; ComfyUI — для своей связки, где слои подгружаются по мере надобности, а веса берутся сжатыми.
Верхнюю границу называет разбор канала Codebreakers: одновременная загрузка всех моделей без выгрузки занимает около 60 гигабайт видеопамяти, и даже карты на 48 гигабайт для этого мало. Там же дан ориентир по сжатию: на 8–16 гигабайтах начинают с Q4 или Q5, на 16–24 берут Q8 или половинную точность.
Точного числа на каждую степень сжатия не публикует никто: в карточках GGUF у QuantStack и в хранилище Comfy-Org стоят только размеры файлов, а таблицы времени и пиковой памяти по видеокартам в хранилищах разработчика лежат картинками, а не текстом. Расход зависит от разрешения, числа кадров, числа шагов расчёта и от того, сколько слоёв уходит в оперативную память: в разборе канала Sebastian Kamph перекладывание блоков снижает расход с 14 до 10 гигабайт — расчёт идёт дольше, качество остаётся прежним.
Порядок работы: от файлов до готового ролика
- Поставьте ComfyUI и откройте готовую схему запуска. Инструкция по Wan 2.2 показывает схемы под оба издания и даёт ссылки на файлы.
- Выберите издание под свою видеокарту. TI2V-5B — одна модель на 18,63 гигабайта, A14B — две папки по 53,2 гигабайта или пересборка поменьше.
- Скачайте три вещи, а не одну. Модель, кодировщик umt5 на 10,59 гигабайта в полной точности или 6,27 в сжатой и сжимающий блок wan2.2_vae на 1,31 гигабайта.
- Для A14B возьмите обе части в одной и той же степени сжатия. В разборе канала Sudo AI это названо прямо: нужны и high_noise, и low_noise, и обе одного сжатия.
- Поставьте дополнение ComfyUI-GGUF. Если файлы взяты в этом формате.
- Запустите расчёт. У A14B ролик проходит две стадии подряд — сначала эксперт high_noise, потом low_noise, и время складывается из обоих проходов.
Сколько идёт расчёт на своей видеокарте
Замеры практиков ниже — на пятисекундный ролик.
| Видеокарта | Что запускали | Сколько шёл расчёт | Кто замерял |
|---|---|---|---|
| RTX 5090, 32 ГБ | 14B в исходной точности | больше получаса | Codebreakers |
| RTX 5090, 32 ГБ | то же с четырёхшаговым ускорением | меньше 5 минут | Codebreakers |
| RTX 4090, 24 ГБ | 14B, обе стадии | около 7 минут на проход, около 14 минут на оба | MDMZ |
| RTX 3060, 12 ГБ | сборка 14B в половинной точности, 4 шага, 832×480, 81 кадр | около 315 секунд | Vantage with AI |
| Ноутбук, 8 ГБ | 14B в GGUF Q4_K_S с ускоряющей приставкой | около 150 секунд | Atelier Darren |
| RTX A5000, 16 ГБ | издание 5B, 1280×704, 121 кадр | 20 минут | AI Generation |
Адреса разборов: Codebreakers, MDMZ, Vantage with AI, Atelier Darren, AI Generation. Строки между собой напрямую не сравниваются: число шагов, разрешение и приставки везде разные.
Разрыв между первой и второй строкой таблицы и есть то, что даёт сжатие с ускоряющей приставкой. Разбор канала Atelier Darren начинается с того же счёта: время снизилось с 12 минут до 189 секунд после перехода на GGUF с приставкой LightX2V.
Свои числа называет и разработчик, оба без отдельной настройки на скорость: облегчённое издание выпуска 2.1 снимает пятисекундный ролик в 480P на RTX 4090 примерно за четыре минуты, а TI2V-5B выпуска 2.2 — тот же ролик в 720P меньше чем за девять минут на бытовой видеокарте.
Какую степень сжатия брать, две стороны решают по-разному. Разбор канала FoxtonAI советует брать самое высокое Q, которое влезает в видеопамять: время у всех GGUF выходит близким. Замер канала Atelier Darren показывает обратное: Q4_K_S дал около 150 секунд против 339,69 секунды у Q6_K при незаметной разнице в качестве.
Где расчёт обрывается
Восемь гигабайт видеопамяти держат 14B в GGUF при разрешении ниже 720p: на 720p в разборе канала Tensor Alchemist на той же карте и том же файле вышла ошибка нехватки памяти. Двенадцать гигабайт на 14B в разборе канала Digital Spaceport закончились вылетом в самом конце расчёта; там же измерена цена выгрузки — расход падает вдвое, а расчёт во столько же раз удлиняется. На 16 гигабайтах ту же ошибку на 14B получил разбор канала AI Generation, и там сказано, что не хватило ни 16 гигабайт видеопамяти, ни 64 гигабайт обычной.
Обычная память останавливает работу не реже видеопамяти: в разборе канала Egor Smyshnikov Work на 32 гигабайтах оперативной второй сэмплер не запустился, и система сообщила, что файл подкачки слишком мал. Своё предупреждение даёт и разбор кадра на выходе: у канала Nio Motion ComfyUI сообщил о нехватке памяти и перешёл на разбор плитками.
Что даёт издание 5B
Издание 5B считает быстро, и это его главное свойство. Разбор канала MDMZ называет скорость единственным крупным выигрышем этого издания и рядом говорит, что до качества 14B ему далеко: движение ограниченнее, а ролики выходят скованными.
Разбор канала FoxtonAI описывает то же подробнее: качество заметно ниже, в кадре появляются деформации и артефакты, лица и здания выходят нечёткими, а текст в кадре разваливается полностью.
Дополнения сообщества: ускоряющие приставки и сборки
Ускоряющая приставка LightX2V названа в описании хранилища Wan2.1 среди работ сообщества: её файлы на четыре шага расчёта лежат в пересборке Comfy-Org рядом с весами и весят по 1,14 гигабайта, а идёт связка, по тому же описанию, на RTX 5090 и на RTX 4060 с восемью гигабайтами. Сборки Rapid AllInOne, которые ищут ещё и по слову remix, складывают Wan 2.2 с ускорителями, кодировщиком и сжимающим блоком в один файл на 21,68–22,66 гигабайта; в карточке сказано, что сборка идёт и на восьми гигабайтах, и там же эти файлы помечены как заброшенные.
Тот же ролик в браузере с оплатой за секунды
Своя видеокарта нужна не всегда: тот же кадр считается на стороне модели, и тогда всё делается в браузере — с обычного компьютера или с телефона. За секунду в 720p у Wan 2.7 берут 9 ₽, у Wan 3.0 Video отсчёт идёт от 4,5 ₽ за секунду. Сумму видно ещё до запуска, оплата рублями с карты российского банка, счёт только по секундам готового видео.
Порядок, в котором описывают сцену, разобран на странице Wan нейросеть.
В браузере идут поздние выпуски: Wan 2.7 снимает по описанию, от присланного кадра, по образцам героев и правит готовый ролик, Wan 3.0 Video доходит до тридцати секунд и берёт на вход звук. Ряд выпусков целиком — на странице Wan нейросеть, сам выпуск, файлы которого тут разбираются, — на странице Wan 2.2, остальные видеомодели — на странице нейросеть для видео.
Тот же расчёт, вызванный из своей программы, — Wan API.
Частые вопросы
Где скачать Wan 2.2 и какие файлы нужны? Веса лежат у Wan-AI на Hugging Face: A14B двумя папками по 53,2 гигабайта, TI2V-5B одной моделью на 18,63 гигабайта. Для ComfyUI берут пересборки — один файл на эксперта у Comfy-Org (13,31 гигабайта в половинной точности) или GGUF у QuantStack от 4,94 гигабайта. Кроме модели скачивают кодировщик umt5 и сжимающий блок wan2.2_vae на 1,31 гигабайта.
Что такое high noise и low noise у Wan 2.2 и почему файлов два? Издание A14B устроено из двух экспертов: high_noise отвечает за общее построение кадра в начале расчёта, low_noise — за подробности в конце. Обе части нужны для одного ролика и берутся в одной степени сжатия, поэтому размеры складываются: у Q4_K_M это 8,99 гигабайта за эксперта, около восемнадцати на модель.
Сколько видеопамяти нужно, чтобы запустить Wan 2.2? Разработчик называет для A14B видеокарту не меньше чем на 80 гигабайт, а для издания 5B — не меньше 24 гигабайт, с RTX 4090 в примере. ComfyUI для того же издания 5B называет 8 гигабайт при своей выгрузке в оперативную память. Числа на каждую степень сжатия GGUF не публикует никто — в карточках стоят только размеры файлов.
Можно ли запустить Wan 2.5, 2.6, 2.7 или 3.0 на своём компьютере? Весами выложены выпуски 2.1 и 2.2, оба под лицензией Apache 2.0; что за выпуск 2.2 и что он умеет, разобрано на странице Wan 2.2. Выпуски 2.5 и новее считаются на стороне Alibaba, и работа с ними идёт через сервис: Wan 2.7, Wan 3.0 Video.
Чем издание 5B отличается от A14B? Издание 5B — одна модель на 18,63 гигабайта в 720P, и разработчик называет для неё меньше девяти минут на пятисекундный ролик. У A14B две части по 53,2 гигабайта и два прохода расчёта. Разборы каналов MDMZ и FoxtonAI сходятся в том, что у 5B ниже качество: движение ограниченнее, появляются деформации, а текст разваливается.
Как запустить Wan 2.1 в ComfyUI и чем он отличается от 2.2? Порядок тот же: файл модели, кодировщик, сжимающий блок и готовая схема из инструкции ComfyUI. Разница в изданиях: у 2.1 есть облегчённое на 1,3 миллиарда параметров, которому по описанию хранилища хватает 8,19 гигабайта видеопамяти. Издание из двух частей появилось в 2.2.
Сколько времени идёт расчёт ролика на своей видеокарте? Замеры расходятся в десятки раз. На RTX 5090 пятисекундный ролик по 14B в исходной точности считался больше получаса, а с четырёхшаговым ускорением — меньше пяти минут; на восьмигигабайтном ноутбуке с GGUF Q4_K_S и приставкой вышло около 150 секунд.
Чат с нейросетью онлайн
ChatGPT, Claude, Gemini, Nano Banana и другие нейросети — в одном окне, прямо в браузере. Выберите нужную в списке над полем ввода и напишите задание: первый ответ бесплатно и без регистрации. Больше моделей и история разговоров — в чате с нейросетью.