ЧТО ВООБЩЕ ПОМЕНЯЛОСЬ К 2026
Ещё два года назад AI видео означало пятисекундные глючные клипы с плавающими пальцами и морфингом лиц. В 2026 картина другая. Флагманские модели уверенно держат физику сцены на 10-20 секундах, понимают камеру («долли-ин», «орбита вокруг объекта»), синхронизируют губы с речью и генерируют звук вместе с картинкой. Генерация видео перестала быть демо-игрушкой и залезла в реальные пайплайны: реклама, превизуализация, motion-графика, b-roll для ютуба.
Главный сдвиг — не столько в качестве отдельных флагманов, сколько в том, что open source перестал быть смешным. Модели с открытыми весами теперь выдают результат, который годом ранее считался эксклюзивом закрытых API. Это ломает старую логику «плати или ничего».
SORA: ФЛАГМАН OPENAI
Sora от OpenAI остаётся эталоном по «понимаю, что происходит в сцене». Модель сильна там, где важна согласованность длинного нарратива: объект не телепортируется между кадрами, тени падают правильно, вода ведёт себя как вода. Второе поколение Sora добавило генерацию синхронного звука и заметно улучшило контроль над персонажами — можно закрепить внешность героя и переносить его между сценами.
Слабые места честно есть. Модель дорогая по кредитам, доступ идёт через подписку и веб-интерфейс, а API для программного доступа обвешан лимитами и модерацией. Для быстрых итераций «сгенерировал 50 вариантов за вечер» это плохо подходит — упрётесь в квоту и кошелёк.
- Сила: сюжетная связность, физика, длинные планы, встроенный звук.
- Слабость: цена, жёсткая модерация, ограниченный программный доступ.
- Кому: тем, кому нужен один идеальный шот, а не сотня черновиков.
RUNWAY: ИНСТРУМЕНТ ДЛЯ МОНТАЖЁРА
Runway с линейкой Gen-4 сделал ставку не на «вау-генерацию из текста», а на управляемость. Здесь лучший в индустрии набор инструментов вокруг видео: motion brush (задаёшь, какая часть кадра двигается), контроль траектории камеры, image-to-video с сохранением стиля, инпейнтинг по видео, расширение кадра. Runway — это меньше «магия из промпта», больше «рабочая станция».
Для тех, кто реально монтирует, Runway часто удобнее Sora: предсказуемость важнее пикового качества. Референс-based генерация (даёшь картинку персонажа и получаешь его в движении) работает стабильно, что критично для брендового контента, где герой должен выглядеть одинаково в десяти роликах.
KLING: КИТАЙСКИЙ ТЯЖЕЛОВЕС
Kling от Kuaishou стал главным сюрпризом. По ощущениям сообщества он часто выдаёт самое реалистичное движение людей и лучшую лип-синхронизацию среди закрытых моделей, при этом дешевле Sora. Kling силён в человеческой анатомии и танцах — там, где другие модели ломаются на быстром движении конечностей. Есть отдельные режимы под лица, липсинк по аудио и продление ролика до минуты с лишним.
Минус — доступ и приватность. Модель облачная, серверы в Китае, для чувствительного контента это стоп-фактор. Но по соотношению цена/реализм в 2026 Kling — один из лучших вариантов для контента с людьми.
OPEN SOURCE: WAN, HUNYUANVIDEO, LTX, MOCHI
Самое интересное происходит в открытых весах. Здесь несколько семейств, каждое под свою задачу:
- Wan (Alibaba) — на текущий момент считается сильнейшей открытой text-to-video и image-to-video моделью по качеству. Есть версии разного размера под разное железо.
- HunyuanVideo (Tencent) — крупная модель с очень «киношной» эстетикой, хорошо ложится в дообучение под свой стиль через LoRA.
- LTX-Video (Lightricks) — король скорости. Генерит короткий клип быстрее реального времени на топовой потребительской карте. Для итераций и пайплайнов — золото.
- Mochi (Genmo) — сильная база по движению, полностью открытая лицензия Apache 2.0.
Ключевое преимущество открытых моделей: они бесплатны в использовании, работают локально (приватность), поддаются дообучению и встраиваются в ноды ComfyUI. Свежие релизы и форки этих моделей удобно отслеживать в каталоге REDDYX — веса и репозитории обновляются буквально каждую неделю.
СРАВНИТЕЛЬНАЯ ТАБЛИЦА
| Модель | Тип | Сильная сторона | Длина клипа | Локально | Цена |
|---|---|---|---|---|---|
| Sora | Закрытая | Связность сцены, звук | до ~20 сек | Нет | Подписка, дорого |
| Runway Gen-4 | Закрытая | Контроль, инструменты | ~10 сек + extend | Нет | Кредиты, средне |
| Kling | Закрытая | Реализм людей, липсинк | до ~1 мин+ | Нет | Кредиты, дёшево |
| Wan | Open source | Общее качество | ~5 сек/сегмент | Да | Бесплатно |
| HunyuanVideo | Open source | Кино-стиль, LoRA | ~5-6 сек | Да | Бесплатно |
| LTX-Video | Open source | Скорость | ~5-10 сек | Да | Бесплатно |
Цифры длины и качества — обобщённые, по замерам сообщества и заявлениям авторов; конкретные значения зависят от версии, разрешения и настроек сэмплера.
ЗАПУСКАЕМ OPEN SOURCE ЛОКАЛЬНО
Практика важнее теории. Ниже минимальный рабочий пример генерации видео на открытой модели через библиотеку diffusers. Нужна GPU с достаточным объёмом VRAM (реалистично — 16 ГБ и выше, с оптимизациями можно ниже).
import torch
from diffusers import DiffusionPipeline
from diffusers.utils import export_to_video
# грузим открытую видеомодель (пример на HunyuanVideo)
pipe = DiffusionPipeline.from_pretrained(
"hunyuanvideo-community/HunyuanVideo",
torch_dtype=torch.bfloat16,
)
# экономим VRAM: выгружаем слои на CPU по мере надобности
pipe.enable_model_cpu_offload()
pipe.vae.enable_tiling()
prompt = (
"cinematic shot of a red fox running through snowy forest, "
"golden hour light, shallow depth of field, 35mm film look"
)
output = pipe(
prompt=prompt,
height=544,
width=960,
num_frames=61, # ~2.5 сек при 24 fps
num_inference_steps=30,
generator=torch.Generator("cuda").manual_seed(42),
).frames[0]
export_to_video(output, "fox.mp4", fps=24)
print("Готово: fox.mp4")
Хотите следить за такими инструментами первыми — подпишитесь на Telegram-канал REDDYX AI: новые репозитории и разборы каждые 30-60 минут.