LLM API и интеграция

Нейросеть для сценария видео: что она пишет

Нейросеть для сценария видео: что она пишет

Видео мы не генерируем: в каталоге на 13 сентября 2026 года 53 позиции, из них 42 текстовые и 11 рисуют изображения, а видеомоделей нет ни одной. Зато текстовая часть ролика закрывается целиком: структура, варианты первых трёх секунд, текст под озвучку, раскадровка словами и адаптация одного сценария под разные площадки. Синтеза речи у нас тоже нет — озвучивает человек или сторонний сервис, модель отдаёт текст.

Дальше по порядку: как собирать структуру, почему первые три секунды пишутся отдельным запросом, чем текст под озвучку отличается от текста для чтения, как выглядит раскадровка словами и что положить в запрос, чтобы сценарий не оказался безликим.

Что нейросеть делает со сценарием, а чего в каталоге нет

Сразу про границы, чтобы не было ожиданий не по адресу.

Нет в каталоге. Генерации видео, синтеза речи, распознавания речи. Ни одной позиции ни по одному из трёх пунктов. Если нужен голос или готовый ролик, это закрывается за пределами нашего ключа.

Есть в каталоге. Текстовые модели, которые пишут и переписывают сценарий, и модели изображений — ими удобно делать кадры для раскадровки и обложку. Подбор рисующих позиций — какая нейросеть лучше рисует.

Что из этого действительно ускоряется. Структура, варианты формулировок, переписывание под длительность, адаптация под площадки, раскадровка словами. Это перебор форм при известном содержании — та работа, где машинная скорость даёт больше всего.

Что не ускоряется. Само содержание. Что сказать, зачем и на каком примере — решаете вы, и это половина сценария.

Как собрать структуру ролика

Структура задаётся вами и проверяется по секундам, иначе модель выдаст три абзаца ровного текста без единого поворота.

Рабочий каркас короткого ролика выглядит так — шесть блоков с привязкой ко времени:

  1. Хук, 0–4 секунды. Предмет назван, есть конфликт. Не завязка, не представление автора.
  2. Усиление, 4–11 секунд. Обещание или контраст. Решение не выдаётся, интрига держится.
  3. Узнавание, 11–22 секунды. Зритель видит свою ситуацию. Это и есть точка удержания — если её нет, дальше не смотрят.
  4. Разрыв шаблона, 22–33 секунды. Привычный способ объявляется негодным, новый оказывается неожиданно простым.
  5. Результат, 33–50 секунд. Показать, что получилось. Если показывать нечего, блок пропускается честно, а не имитируется.
  6. Призыв, 50–57 секунд. Один, и он следует из текста, а не пришит к концу.

Этот каркас кладётся в запрос как требование, а не как пожелание. Полезный приём: попросить модель вернуть сценарий таблицей с секундами по каждому блоку — сразу видно, какой блок выпал. Про формулировку таких требований — как написать системный промпт.

Третий блок модель пропускает чаще всего: он требует знания аудитории, а она его не имеет. Проверяйте его отдельно.

Как написать первые три секунды

Первые секунды пишутся отдельным запросом и пачкой вариантов. Это единственная часть ролика, где перебор оправдан всегда.

Просите восемь-двенадцать вариантов в одном запросе, с разными ходами: вопрос, конфликт, ошибка, сравнение, ситуация из жизни, неожиданное утверждение. Первые два-три будут шаблонными — интересное начинается дальше по списку, и это нормально.

Две вещи, которые отличают работающий хук от нерабочего:

Предмет в первой фразе. Если из неё непонятно, о чём ролик, зритель листает. «Я кое-что попробовал» — не хук: нет предмета.

Чувство раньше цифры. Измеренный результат — хорошее доказательство, но плохой крючок. «Минус 66 % расхода» ничего не значит для человека, который не считал расход; «платишь всё больше за одно и то же» — значит. Цифра работает внутри ролика, подтверждая обещанное.

Отдельно: не вводите в первые секунды термин, которого зритель не знает. Один новый термин на ролик — потолок, и лучше объяснить его позже. Смежная механика отбора формулировок — нейросеть для рекламных объявлений.

Как написать текст под озвучку

Текст под озвучку — это не текст для чтения глазами, и модель по умолчанию пишет второе.

Что просить явно: короткие предложения, простые конструкции, без вводных оборотов и без скобок. Числа словами там, где их произносят. Никаких «см. выше» и «как мы уже говорили» — в аудио этого не существует.

Полезный приём: попросить модель прочитать собственный текст вслух мысленно и переписать места, где сбивается дыхание. Формулировка звучит странно, но результат заметен — длинные периоды распадаются на произносимые куски.

Длительность считается по словам. Спокойная речь — примерно 110–130 слов в минуту, бодрая подача в коротком ролике — до 160. Значит, тридцатисекундный ролик это 70–80 слов, а не «примерно страница». Просите укладываться в число слов, а не в число знаков: в знаках модель промахивается сильнее.

Озвучку записывает человек или сторонний сервис — синтеза речи в каталоге нет. Модель отдаёт текст, дальше он идёт в микрофон.

Как сделать раскадровку словами

Раскадровка словами — таблица, где каждой строке текста сопоставлено, что в этот момент на экране.

Просите четыре колонки: секунды, реплика, что в кадре, что делает монтаж. Последняя колонка нужна, чтобы отделить статичный план от перебивки и понять, сколько материала предстоит снять.

Три правила, которые делают раскадровку полезной:

  • Кадр описывается зримо. «Показать проблему» — не описание. «Крупный план экрана, на нём растущий счёт» — описание.
  • На каждый блок структуры хотя бы одна смена плана. Иначе ролик визуально стоит на месте, даже если текст двигается.
  • Отдельной колонкой — что снять, а что найти. Это сразу превращает раскадровку в список задач.

Кадры-референсы можно нарисовать моделями изображений и сложить в один документ рядом с текстом — так сценарий становится понятным тому, кто будет снимать. Подбор форматов и размеров — картинки для соцсетей через API.

Как адаптировать сценарий под разные площадки

Отдельным запросом на каждую площадку. Один запрос «сделай версии для всех» даёт четыре одинаковых текста разной длины.

Что называть в запросе для каждой площадки:

  • Длительность и ориентацию кадра. Вертикаль до минуты и горизонтальное видео на десять минут — разные жанры, а не разный хронометраж.
  • Звук по умолчанию. Там, где ролик стартует без звука, смысл должен читаться по подписям, и сценарий пишется с расчётом на текст в кадре.
  • Что считается призывом. Подписка, комментарий, переход по ссылке, сохранение — разные площадки поощряют разное, и призыв меняется вместе с этим.
  • Тон. Один и тот же материал в деловой ленте и в развлекательной подаче звучит по-разному, и это не косметика.

Обратный порядок тоже работает: длинный ролик разбирается на несколько коротких, каждый со своим хуком. Для этого удобна отдельная механика — пересказ текста нейросетью, а планирование серии проще вести вместе с контент-планом и постами в соцсетях.

Что положить в запрос, чтобы сценарий не был безликим

Сценарий вытягивает бриф, а не модель. Безликость — это почти всегда пустой запрос, а не слабая позиция в каталоге.

Шесть вещей, которых модель не знает и знать не может:

  1. Кто зритель. Не «предприниматели», а человек в конкретной ситуации: что он сейчас делает, чем недоволен, чего боится.
  2. Что произошло на самом деле. Реальный случай, разговор, жалоба, ошибка. Настоящая история весит больше любого приёма.
  3. Цифры и ограничения. Чем конкретнее, тем меньше воды. Заодно это защита от выдуманных фактов.
  4. Что нельзя обещать. Прямой список запретов — самая работающая часть брифа.
  5. Как звучит автор. Пара абзацев вашего текста в качестве образца работает лучше десяти прилагательных про тон.
  6. Чем ролик заканчивается. Призыв решается до написания, иначе он пришивается к готовому тексту и это слышно.

Отдельный приём против гладкости: дайте модели два своих прошлых сценария — удачный и неудачный — и скажите, чем первый лучше. Про подбор формулировок в запросе — промт-инжиниринг: что работает, про влияние настроек на разнообразие вариантов — температура модели.

Какую модель брать под сценарий

Дешёвую — на поток и на перебор вариантов, дорогую — на длинную линию и на финальную сборку. Ставка одинакова на вход и на выход, указана за миллион токенов на 13 сентября 2026 года.

Позиция₽ за 1M токеновПод какую часть
gpt-oss-20b0обкатать бриф и каркас, бесплатно
nemotron-3-super0бесплатная, пачки вариантов хука
deepseek-v4-flash1поток коротких сценариев
qwen-3-6-flash3быстрые переписывания под длительность
gemini-3-flash6адаптация под площадки
gpt-5-6-luna8универсальная под текст
haiku-4-58короткие реплики и подписи в кадре
sonnet-530длинный сценарий одной линией
opus-530финальная сборка и разбор слабых мест

Разумная схема — две модели на одну задачу: дешёвая выдаёт двадцать вариантов хука, дорогая собирает из выбранного цельный текст. Так перебор стоит копейки, а качество финальной сборки не страдает.

Сколько стоит сценарий в рублях

Считается по объёму текста, и объёмы здесь маленькие. Ниже — сколько сценариев укладывается в миллион токенов, чтобы цену можно было посчитать умножением.

Что делаемДлина готового текстаОбъём одного запросаСколько таких в 1M токенов
Короткий ролик 30–45 секунд70–110 слов2–3 тысячи токенов с брифом300–500
Пачка из 10 вариантов хука10 строк1–2 тысячи токенов500–1000
Ролик на 2–3 минуты300–450 слов5–8 тысяч токенов120–200
Обучающее видео на 10 минут1300–1600 слов15–25 тысяч токенов40–60
Раскадровка словами к готовому текстутаблица по кадрам3–6 тысяч токенов150–300
Адаптация под четыре площадкичетыре версии6–10 тысяч токенов100–160

Дальше умножайте строку на ставку из таблицы моделей: миллион токенов стоит 1 ₽ на самой дешёвой платной позиции и 30 ₽ на дорогой. Даже на дорогой поток коротких роликов обходится в незаметные для бюджета деньги, и основная статья расхода в этой работе — не модель, а съёмка и монтаж. Механика подсчёта — как считать токены.

Как проверить сценарий до съёмки

Четыре проверки, которые занимают десять минут и экономят пересъёмку.

Прочитать вслух с секундомером. Сразу видно, укладывается ли текст и где сбивается дыхание.

Закрыть первый абзац и посмотреть, понятно ли, о чём ролик. Если да — хук лишний и его надо переписать. Если нет — проверьте, что предмет назван в первой фразе.

Найти блок узнавания. Место, где зритель встречает себя. Если такого места нет, ролик досмотрят только те, кто и так вам верит.

Проверить факты и цифры отдельно. Модель уверенно пишет числа, которых ей никто не давал. Всё, что звучит как факт, должно иметь источник у вас, а не в сценарии.

Полезно также прогнать финальный текст на машинную гладкость: ровные абзацы одинаковой длины и отсутствие живых оговорок — признак того, что автора в тексте не осталось. Разбор признаков — как проверить текст на ИИ. Похожая дисциплина для длинных текстов — нейросеть для написания статей.

Чего мы не утверждаем

Мы не генерируем видео и не обещаем этого. В каталоге текст, изображения и переранжирование. Синтеза речи и распознавания речи тоже нет.

Мы не утверждаем, что каркас из шести блоков подходит любому ролику. Он собран под короткие вертикальные форматы с холодной аудиторией. Для обучающего видео на десять минут структура другая, и переносить её механически не стоит.

Мы не даём гарантий по удержанию и просмотрам. Сценарий — одна из переменных, рядом с ним съёмка, монтаж, звук, обложка и то, кому площадка покажет ролик. Оценивать сценарий по числу просмотров одного выпуска бессмысленно.

Что нужно, чтобы попробовать

Ключ заводится за минуту на keydealer.ru/login: почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на весь каталог — на 13 сентября 2026 года это 53 позиции, 38 доступны сразу.

Пять текстовых позиций тарифицируются по нулевой ставке и открываются после первого платного пополнения. На них удобно отладить бриф и каркас: двадцать вариантов хука на бесплатной модели стоят ноль, а разница между хорошим и плохим брифом видна уже на первой пачке. Если сценарии потом уходят в публикацию автоматикой, посмотрите автопостинг в Telegram, а про хранение ключа — как хранить API-ключи.

Что держать в голове

Модель пишет форму, содержание приносите вы. Складный текст она выдаёт с первого раза, но он будет подходить любому конкуренту, пока в запросе нет вашего зрителя, вашего случая и ваших цифр.

Структура важнее формулировок. Ролик разваливается не потому, что фраза неудачная, а потому, что выпал блок, где зритель должен был узнать себя. Проверка по секундам ловит это за минуту, а переписывание отдельных фраз — нет.

И держите границу в голове: у нас текстовая часть. Сценарий, реплики, раскадровка словами и кадры-референсы — да; голос, монтаж и само видео — за пределами каталога, и честнее сказать это заранее, чем обнаружить в середине работы. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ: keydealer.ru/login.

Частые вопросы

Можно ли сгенерировать видео через API KeyDealer?

Нет. В каталоге текстовые модели и модели, которые рисуют изображения, а видеомоделей нет ни одной. Синтеза и распознавания речи тоже нет. Сценарий, текст под озвучку и раскадровка словами — это текстовая задача, и она закрывается полностью.

Как заставить нейросеть написать не безликий сценарий?

Дать ей то, чего она не может знать: кто герой, какая у него конкретная боль, что произошло на самом деле, какие цифры и ограничения у продукта. Без этого получится складный текст, подходящий любому конкуренту. Сценарий вытягивает не модель, а бриф.

Сколько вариантов первых секунд просить у модели?

Восемь-двенадцать за один запрос. Первые два-три обычно шаблонные, интересное начинается дальше, а дешевле попросить сразу пачку, чем гонять модель по одному варианту. Выбирать всё равно вам: модель не знает, что зацепит вашу аудиторию.

Может ли нейросеть сделать раскадровку?

Словами — да: разложить текст по кадрам, описать, что в кадре, какой план, какая длительность и что происходит на экране. Картинки к кадрам можно сгенерировать отдельно моделями изображений. Само видео по этой раскадровке снимает или монтирует человек.

Как адаптировать один сценарий под разные площадки?

Отдельным запросом на каждую площадку, а не одним на все сразу. В запросе называйте длительность, ориентацию кадра, где у зрителя звук включён, а где нет, и что считается призывом к действию. Одинаковый текст на вертикальном коротком ролике и на десятиминутном видео не работает ни там, ни там.

Какую модель брать под сценарии?

Для потока коротких роликов хватает дешёвой быстрой позиции, потому что задача про форму, а не про знания. Модель подороже заметна там, где нужно удержать линию в длинном сценарии и не рассыпать её на набор тезисов.

Источники