🎥 Kandinsky 6.0 Video — новая линейка моделей генерации видео со звуком
Сбер представил новую линейку моделей генерации видео с синхронным звуком Kandinsky 6.0 Video и открыл код и веса под лицензией MIT. Модели поддерживают создание видео с диалогами, музыкой и звуками окружения. Аудиодорожка синхронизирована с происходящим в кадре, а движения губ персонажей — с их речью.
Предыдущая версия Kandinsky более полугода занимала первое место среди открытых моделей в категории text-to-video на arena.ai и была сопоставима по качеству с Veo 3.
Флагман новой линейки — Kandinsky 6.0 Video Pro — показывает качество на уровне Veo 3.1 Audio, а среди открытых моделей уступает только MiniMax H3, достигая паритета с LTX 2.5.
Компактная версия Kandinsky 6.0 Video Lite с 3 млрд параметров адаптирована для запуска на потребительских видеокартах NVIDIA: от RTX 5060 Ti до 5090.
📌 Веса моделей доступны на Hugging Face, код — на GitHub. Также опубликован подробный технический отчет с описанием архитектуры, данных, процесса обучения и результатов тестирования.
➡️ Kandinsky 6.0 Video поддерживает запуск в Diffusers, ComfyUI, FastVideo, SGLang и vLLM-omni. Также модель можно попробовать бесплатно в ГигаЧате в разделе генерации видео.
Комментарии