Мир ИИ

LTX-2.5: открытая видеомодель, которую можно скачать

LTX-2.5: открытая видеомодель, которую можно скачать

Lightricks продолжает выкладывать веса своей видеолинейки: LTX-2.5 построена на асимметричном двухпоточном диффузионном трансформере на 22 млрд параметров, веса и код доступны публично. Предыдущая версия 2.3, вышедшая 5 марта 2026 года под лицензией Apache 2.0, стала первой открытой моделью, которая генерирует видео и синхронный звук в одном проходе, — до неё звук приделывали отдельной моделью. В каталоге KeyDealer видеомоделей нет и эта статья не про доступ к ним через наш API. Она про развилку, которая встаёт перед каждым, кому нужно видео: скачать веса и держать железо или платить за готовую генерацию.

Что за архитектура

Разберём, что стоит за словами «асимметричный двухпоточный диффузионный трансформер», потому что асимметрия здесь — не украшение.

Видео и звук — данные разной природы. У видео высокое пространственное разрешение и относительно низкая частота кадров, у звука наоборот: никакой пространственной структуры, зато десятки тысяч отсчётов в секунду. Один поток обрабатывает картинку, второй — звук, и они разной «толщины». Отсюда асимметрия.

Смысл в том, что потоки обмениваются информацией во время генерации. Именно поэтому губы попадают в реплику, а удар в кадре совпадает со звуком удара. Когда звук приделывают отдельной моделью после видео, синхронность приходится вытягивать вручную.

Что умела версия 2.3

По версии 2.5 публичных подробностей пока меньше, поэтому опишем то, что документировано для предыдущей — она вышла 5 марта 2026 года и задаёт базовый уровень линейки.

СвойствоЗначение
Параметров22 млрд
ЛицензияApache 2.0
Разрешениедо 4K
Частота кадров50
Звуксинхронный, в одном проходе
Вертикальный форматнативно до 1080×1920
LoRA-адаптерыдо 3 одновременно

Отдельно отмечалась переработанная VAE — за счёт неё стали чище текстуры, лица, волосы и текст в кадре. Текст в генеративном видео традиционно разваливается, так что это не косметическая правка.

Нативная вертикаль до 1080×1920 — тоже не мелочь. Когда модель умеет только горизонталь, вертикальный ролик получается кадрированием, и половина кадра уходит в мусор.

Почему синхронный звук — сложная задача

Стоит объяснить, почему это вообще подавали как достижение, а не как очевидную функцию.

Когда звук генерируется отдельной моделью после видео, у неё на входе только готовый ролик. Она не знает, что было в замысле, — она видит результат и пытается угадать, чем он должен звучать. Получается озвучка постфактум, и рассинхрон в пару кадров тут норма, а не сбой.

Человеческий глаз к такому рассинхрону безжалостен. Расхождение звука и артикуляции в 40–50 миллисекунд уже читается как «что-то не так», хотя объяснить, что именно, зритель обычно не может. Именно по этому признаку дешёвое генеративное видео опознаётся мгновенно.

Когда потоки идут вместе, у модели общее представление о происходящем в сцене. Звук не подбирается к картинке — оба выходят из одного замысла. Это меняет не столько техническое качество, сколько ощущение достоверности.

Развилка: веса или сервис

Здесь та же логика, что и с текстовыми моделями, но цифры жёстче.

Скачать веса имеет смысл, если генерация идёт потоком и непрерывно, если ролики нельзя отдавать во внешний сервис, и если нужны собственные LoRA-адаптеры под конкретный стиль. Открытая лицензия Apache 2.0 тут принципиальна: она не ограничивает коммерческое использование.

Платить за сервис имеет смысл, если ролики нужны эпизодически. Видеокарта серверного класса стоит денег каждый день, а не только в те часы, когда вы что-то генерируете. Простой железа — самая недооценённая статья расходов в подобных расчётах. Почему вендоры вообще открывают веса и что за этим стоит экономически, разбирали в материале о позиции вендоров.

Для типичной задачи «нужно двадцать роликов в месяц под соцсети» ответ очевиден и он не в пользу собственного кластера. Ровно для этого сценария у нас есть второй сервис — TrendMix: генерация видео и картинок под контент, без разворачивания весов и без покупки железа, оплата по факту.

Чего в каталоге KeyDealer нет

Проговорим прямо, чтобы не создавать ложных ожиданий.

Видеомоделей у нас нет. Живой каталог на 12 августа — 25 позиций: текстовые семейства Claude, GPT, Gemini, GLM, Grok, GPT-OSS плюс генерация изображений GPT Image.

Картинки есть, видео — нет. GPT Image работает через POST /v1/images/generations с фиксированной ценой за изображение, а не за токены. Сколько именно стоит одна картинка и как её считать через API — в отдельном разборе, а планирование расхода на серию — в материале про бюджет на картинки.

LTX мы не тестировали. Все характеристики в этой статье — из публикаций разработчика и обзоров, перечисленных в источниках.

По версии 2.5 деталей меньше, чем по 2.3. Подтверждены размер в 22 млрд параметров, тип архитектуры и открытая публикация весов и кода. Разрешение, частота кадров и лицензия в таблице выше относятся к версии 2.3 — переносить их на 2.5 без проверки мы не считаем корректным.

Что проверить до того, как выбирать

Если вы всерьёз сравниваете варианты, вопросы стоит задавать в таком порядке — от того, что отсекает целые классы решений, к деталям.

Куда попадают исходники. Если в кадре продукт до анонса, лица сотрудников или что-то под соглашением о неразглашении, вопрос стоимости вторичен. Открытые веса тут выигрывают не ценой, а тем, что данные не покидают периметр.

Какой формат нужен на выходе. Вертикаль для соцсетей, горизонталь для сайта, квадрат для карточек. Модель, которая умеет только горизонталь, добавит вам этап кадрирования и потерю качества на каждом ролике.

Нужен ли звук вообще. Значительная часть роликов для соцсетей идёт под музыку или закадровый голос, записанные отдельно. Если так, преимущество синхронной генерации для вас не работает и переплачивать за него незачем.

Сколько роликов в месяц. Это тот самый вопрос, который решает всё. Двадцать — считайте сервис. Двадцать в день — считайте железо.

Нужен ли свой стиль. LoRA-адаптеры позволяют дообучить модель под узнаваемую эстетику. В готовых сервисах такой возможности обычно нет или она сильно ограничена.

Почему открытое видео важнее открытого текста

Небольшое наблюдение напоследок.

В тексте открытые веса конкурируют с закрытыми моделями, но проигрывают в удобстве: API текстовой модели стоит копейки за запрос, разворачивать своё почти всегда невыгодно.

В видео экономика другая. Генерация ролика стоит на порядки дороже генерации абзаца, и разрыв между «своё железо» и «сервис» сокращается гораздо быстрее. Поэтому открытые видеомодели давят на цены заметно жёстче, чем открытые текстовые, — и линейка LTX здесь один из главных рычагов.

Что до качества: единственная проверка, которая чего-то стоит, — прогнать свои реальные сценарии. Рейтинги видеомоделей ещё менее показательны, чем текстовые, потому что «хорошо» в видео зависит от задачи сильнее, чем в тексте.

Причина простая. В тексте у качества есть более или менее общие признаки: фактическая верность, связность, отсутствие выдумок. В видео критерий разваливается на несоизмеримые части. Для продуктового ролика важна чистота текстур и правильная геометрия предмета. Для короткого видео под соцсети важнее динамика и то, удержит ли оно взгляд первые две секунды. Для анимации важна стилистическая цельность, и фотореализм там прямо вреден.

Модель, выигрывающая по усреднённому баллу, может проигрывать конкретно вашему сценарию с заметным отрывом. Поэтому сравнение имеет смысл только на своих промптах и своих типах кадра — десяток генераций скажет больше, чем любая сводная таблица.

Что держать в голове

LTX-2.5 — 22 млрд параметров, открытые веса и код, архитектура с раздельными потоками для видео и звука. Линейка первой среди открытых научилась выдавать синхронный звук в одном проходе, версия 2.3 умела 4K на 50 кадрах под Apache 2.0.

Практический вывод: если ролики нужны потоком и своё железо уже есть — веса скачиваются. Если эпизодически — считайте простой карты, а не только стоимость генерации.

Как мы проверяем факты и почему у каждой цифры стоит источник — на странице о проекте. Текстовые модели и генерация изображений — по ключу, который заводится за минуту: keydealer.ru/login.

Частые вопросы

Что такое LTX-2.5?

Видеомодель Lightricks на 22 млрд параметров с архитектурой асимметричного двухпоточного диффузионного трансформера. Веса и код опубликованы.

Чем линейка LTX отличается от других видеомоделей?

Она генерирует видео и синхронный звук за один проход, а не собирает их из двух отдельных моделей. Версия 2.3 была первой открытой моделью с таким свойством.

Видеомодели есть в каталоге KeyDealer?

Нет. На 12 августа 2026 года в каталоге 25 моделей — текстовые семейства и генерация изображений GPT Image через POST /v1/images/generations. Видео мы не отдаём.

Что нужно, чтобы запустить LTX у себя?

Видеокарта серверного класса. Точные требования зависят от разрешения и длительности ролика, а также от выбранного варианта модели — распространяются облегчённые дистиллированные сборки.

А если не хочется возиться с железом?

Тогда нужен сервис, где генерация уже развёрнута и оплачивается по факту. Для контента под соцсети мы сделали TrendMix.

Источники