LLM API и интеграция
Нейросеть для сценария видео: что она пишет
Видео мы не генерируем: в каталоге на 13 сентября 2026 года 53 позиции, из них 42 текстовые и 11 рисуют изображения, а видеомоделей нет ни одной. Зато текстовая часть ролика закрывается целиком: структура, варианты первых трёх секунд, текст под озвучку, раскадровка словами и адаптация одного сценария под разные площадки. Синтеза речи у нас тоже нет — озвучивает человек или сторонний сервис, модель отдаёт текст.
Дальше по порядку: как собирать структуру, почему первые три секунды пишутся отдельным запросом, чем текст под озвучку отличается от текста для чтения, как выглядит раскадровка словами и что положить в запрос, чтобы сценарий не оказался безликим.
Что нейросеть делает со сценарием, а чего в каталоге нет
Сразу про границы, чтобы не было ожиданий не по адресу.
Нет в каталоге. Генерации видео, синтеза речи, распознавания речи. Ни одной позиции ни по одному из трёх пунктов. Если нужен голос или готовый ролик, это закрывается за пределами нашего ключа.
Есть в каталоге. Текстовые модели, которые пишут и переписывают сценарий, и модели изображений — ими удобно делать кадры для раскадровки и обложку. Подбор рисующих позиций — какая нейросеть лучше рисует.
Что из этого действительно ускоряется. Структура, варианты формулировок, переписывание под длительность, адаптация под площадки, раскадровка словами. Это перебор форм при известном содержании — та работа, где машинная скорость даёт больше всего.
Что не ускоряется. Само содержание. Что сказать, зачем и на каком примере — решаете вы, и это половина сценария.
Как собрать структуру ролика
Структура задаётся вами и проверяется по секундам, иначе модель выдаст три абзаца ровного текста без единого поворота.
Рабочий каркас короткого ролика выглядит так — шесть блоков с привязкой ко времени:
- Хук, 0–4 секунды. Предмет назван, есть конфликт. Не завязка, не представление автора.
- Усиление, 4–11 секунд. Обещание или контраст. Решение не выдаётся, интрига держится.
- Узнавание, 11–22 секунды. Зритель видит свою ситуацию. Это и есть точка удержания — если её нет, дальше не смотрят.
- Разрыв шаблона, 22–33 секунды. Привычный способ объявляется негодным, новый оказывается неожиданно простым.
- Результат, 33–50 секунд. Показать, что получилось. Если показывать нечего, блок пропускается честно, а не имитируется.
- Призыв, 50–57 секунд. Один, и он следует из текста, а не пришит к концу.
Этот каркас кладётся в запрос как требование, а не как пожелание. Полезный приём: попросить модель вернуть сценарий таблицей с секундами по каждому блоку — сразу видно, какой блок выпал. Про формулировку таких требований — как написать системный промпт.
Третий блок модель пропускает чаще всего: он требует знания аудитории, а она его не имеет. Проверяйте его отдельно.
Как написать первые три секунды
Первые секунды пишутся отдельным запросом и пачкой вариантов. Это единственная часть ролика, где перебор оправдан всегда.
Просите восемь-двенадцать вариантов в одном запросе, с разными ходами: вопрос, конфликт, ошибка, сравнение, ситуация из жизни, неожиданное утверждение. Первые два-три будут шаблонными — интересное начинается дальше по списку, и это нормально.
Две вещи, которые отличают работающий хук от нерабочего:
Предмет в первой фразе. Если из неё непонятно, о чём ролик, зритель листает. «Я кое-что попробовал» — не хук: нет предмета.
Чувство раньше цифры. Измеренный результат — хорошее доказательство, но плохой крючок. «Минус 66 % расхода» ничего не значит для человека, который не считал расход; «платишь всё больше за одно и то же» — значит. Цифра работает внутри ролика, подтверждая обещанное.
Отдельно: не вводите в первые секунды термин, которого зритель не знает. Один новый термин на ролик — потолок, и лучше объяснить его позже. Смежная механика отбора формулировок — нейросеть для рекламных объявлений.
Как написать текст под озвучку
Текст под озвучку — это не текст для чтения глазами, и модель по умолчанию пишет второе.
Что просить явно: короткие предложения, простые конструкции, без вводных оборотов и без скобок. Числа словами там, где их произносят. Никаких «см. выше» и «как мы уже говорили» — в аудио этого не существует.
Полезный приём: попросить модель прочитать собственный текст вслух мысленно и переписать места, где сбивается дыхание. Формулировка звучит странно, но результат заметен — длинные периоды распадаются на произносимые куски.
Длительность считается по словам. Спокойная речь — примерно 110–130 слов в минуту, бодрая подача в коротком ролике — до 160. Значит, тридцатисекундный ролик это 70–80 слов, а не «примерно страница». Просите укладываться в число слов, а не в число знаков: в знаках модель промахивается сильнее.
Озвучку записывает человек или сторонний сервис — синтеза речи в каталоге нет. Модель отдаёт текст, дальше он идёт в микрофон.
Как сделать раскадровку словами
Раскадровка словами — таблица, где каждой строке текста сопоставлено, что в этот момент на экране.
Просите четыре колонки: секунды, реплика, что в кадре, что делает монтаж. Последняя колонка нужна, чтобы отделить статичный план от перебивки и понять, сколько материала предстоит снять.
Три правила, которые делают раскадровку полезной:
- Кадр описывается зримо. «Показать проблему» — не описание. «Крупный план экрана, на нём растущий счёт» — описание.
- На каждый блок структуры хотя бы одна смена плана. Иначе ролик визуально стоит на месте, даже если текст двигается.
- Отдельной колонкой — что снять, а что найти. Это сразу превращает раскадровку в список задач.
Кадры-референсы можно нарисовать моделями изображений и сложить в один документ рядом с текстом — так сценарий становится понятным тому, кто будет снимать. Подбор форматов и размеров — картинки для соцсетей через API.
Как адаптировать сценарий под разные площадки
Отдельным запросом на каждую площадку. Один запрос «сделай версии для всех» даёт четыре одинаковых текста разной длины.
Что называть в запросе для каждой площадки:
- Длительность и ориентацию кадра. Вертикаль до минуты и горизонтальное видео на десять минут — разные жанры, а не разный хронометраж.
- Звук по умолчанию. Там, где ролик стартует без звука, смысл должен читаться по подписям, и сценарий пишется с расчётом на текст в кадре.
- Что считается призывом. Подписка, комментарий, переход по ссылке, сохранение — разные площадки поощряют разное, и призыв меняется вместе с этим.
- Тон. Один и тот же материал в деловой ленте и в развлекательной подаче звучит по-разному, и это не косметика.
Обратный порядок тоже работает: длинный ролик разбирается на несколько коротких, каждый со своим хуком. Для этого удобна отдельная механика — пересказ текста нейросетью, а планирование серии проще вести вместе с контент-планом и постами в соцсетях.
Что положить в запрос, чтобы сценарий не был безликим
Сценарий вытягивает бриф, а не модель. Безликость — это почти всегда пустой запрос, а не слабая позиция в каталоге.
Шесть вещей, которых модель не знает и знать не может:
- Кто зритель. Не «предприниматели», а человек в конкретной ситуации: что он сейчас делает, чем недоволен, чего боится.
- Что произошло на самом деле. Реальный случай, разговор, жалоба, ошибка. Настоящая история весит больше любого приёма.
- Цифры и ограничения. Чем конкретнее, тем меньше воды. Заодно это защита от выдуманных фактов.
- Что нельзя обещать. Прямой список запретов — самая работающая часть брифа.
- Как звучит автор. Пара абзацев вашего текста в качестве образца работает лучше десяти прилагательных про тон.
- Чем ролик заканчивается. Призыв решается до написания, иначе он пришивается к готовому тексту и это слышно.
Отдельный приём против гладкости: дайте модели два своих прошлых сценария — удачный и неудачный — и скажите, чем первый лучше. Про подбор формулировок в запросе — промт-инжиниринг: что работает, про влияние настроек на разнообразие вариантов — температура модели.
Какую модель брать под сценарий
Дешёвую — на поток и на перебор вариантов, дорогую — на длинную линию и на финальную сборку. Ставка одинакова на вход и на выход, указана за миллион токенов на 13 сентября 2026 года.
| Позиция | ₽ за 1M токенов | Под какую часть |
|---|---|---|
gpt-oss-20b | 0 | обкатать бриф и каркас, бесплатно |
nemotron-3-super | 0 | бесплатная, пачки вариантов хука |
deepseek-v4-flash | 1 | поток коротких сценариев |
qwen-3-6-flash | 3 | быстрые переписывания под длительность |
gemini-3-flash | 6 | адаптация под площадки |
gpt-5-6-luna | 8 | универсальная под текст |
haiku-4-5 | 8 | короткие реплики и подписи в кадре |
sonnet-5 | 30 | длинный сценарий одной линией |
opus-5 | 30 | финальная сборка и разбор слабых мест |
Разумная схема — две модели на одну задачу: дешёвая выдаёт двадцать вариантов хука, дорогая собирает из выбранного цельный текст. Так перебор стоит копейки, а качество финальной сборки не страдает.
Сколько стоит сценарий в рублях
Считается по объёму текста, и объёмы здесь маленькие. Ниже — сколько сценариев укладывается в миллион токенов, чтобы цену можно было посчитать умножением.
| Что делаем | Длина готового текста | Объём одного запроса | Сколько таких в 1M токенов |
|---|---|---|---|
| Короткий ролик 30–45 секунд | 70–110 слов | 2–3 тысячи токенов с брифом | 300–500 |
| Пачка из 10 вариантов хука | 10 строк | 1–2 тысячи токенов | 500–1000 |
| Ролик на 2–3 минуты | 300–450 слов | 5–8 тысяч токенов | 120–200 |
| Обучающее видео на 10 минут | 1300–1600 слов | 15–25 тысяч токенов | 40–60 |
| Раскадровка словами к готовому тексту | таблица по кадрам | 3–6 тысяч токенов | 150–300 |
| Адаптация под четыре площадки | четыре версии | 6–10 тысяч токенов | 100–160 |
Дальше умножайте строку на ставку из таблицы моделей: миллион токенов стоит 1 ₽ на самой дешёвой платной позиции и 30 ₽ на дорогой. Даже на дорогой поток коротких роликов обходится в незаметные для бюджета деньги, и основная статья расхода в этой работе — не модель, а съёмка и монтаж. Механика подсчёта — как считать токены.
Как проверить сценарий до съёмки
Четыре проверки, которые занимают десять минут и экономят пересъёмку.
Прочитать вслух с секундомером. Сразу видно, укладывается ли текст и где сбивается дыхание.
Закрыть первый абзац и посмотреть, понятно ли, о чём ролик. Если да — хук лишний и его надо переписать. Если нет — проверьте, что предмет назван в первой фразе.
Найти блок узнавания. Место, где зритель встречает себя. Если такого места нет, ролик досмотрят только те, кто и так вам верит.
Проверить факты и цифры отдельно. Модель уверенно пишет числа, которых ей никто не давал. Всё, что звучит как факт, должно иметь источник у вас, а не в сценарии.
Полезно также прогнать финальный текст на машинную гладкость: ровные абзацы одинаковой длины и отсутствие живых оговорок — признак того, что автора в тексте не осталось. Разбор признаков — как проверить текст на ИИ. Похожая дисциплина для длинных текстов — нейросеть для написания статей.
Чего мы не утверждаем
Мы не генерируем видео и не обещаем этого. В каталоге текст, изображения и переранжирование. Синтеза речи и распознавания речи тоже нет.
Мы не утверждаем, что каркас из шести блоков подходит любому ролику. Он собран под короткие вертикальные форматы с холодной аудиторией. Для обучающего видео на десять минут структура другая, и переносить её механически не стоит.
Мы не даём гарантий по удержанию и просмотрам. Сценарий — одна из переменных, рядом с ним съёмка, монтаж, звук, обложка и то, кому площадка покажет ролик. Оценивать сценарий по числу просмотров одного выпуска бессмысленно.
Что нужно, чтобы попробовать
Ключ заводится за минуту на keydealer.ru/login: почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на весь каталог — на 13 сентября 2026 года это 53 позиции, 38 доступны сразу.
Пять текстовых позиций тарифицируются по нулевой ставке и открываются после первого платного пополнения. На них удобно отладить бриф и каркас: двадцать вариантов хука на бесплатной модели стоят ноль, а разница между хорошим и плохим брифом видна уже на первой пачке. Если сценарии потом уходят в публикацию автоматикой, посмотрите автопостинг в Telegram, а про хранение ключа — как хранить API-ключи.
Что держать в голове
Модель пишет форму, содержание приносите вы. Складный текст она выдаёт с первого раза, но он будет подходить любому конкуренту, пока в запросе нет вашего зрителя, вашего случая и ваших цифр.
Структура важнее формулировок. Ролик разваливается не потому, что фраза неудачная, а потому, что выпал блок, где зритель должен был узнать себя. Проверка по секундам ловит это за минуту, а переписывание отдельных фраз — нет.
И держите границу в голове: у нас текстовая часть. Сценарий, реплики, раскадровка словами и кадры-референсы — да; голос, монтаж и само видео — за пределами каталога, и честнее сказать это заранее, чем обнаружить в середине работы. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ: keydealer.ru/login.
Частые вопросы
Можно ли сгенерировать видео через API KeyDealer?
Нет. В каталоге текстовые модели и модели, которые рисуют изображения, а видеомоделей нет ни одной. Синтеза и распознавания речи тоже нет. Сценарий, текст под озвучку и раскадровка словами — это текстовая задача, и она закрывается полностью.
Как заставить нейросеть написать не безликий сценарий?
Дать ей то, чего она не может знать: кто герой, какая у него конкретная боль, что произошло на самом деле, какие цифры и ограничения у продукта. Без этого получится складный текст, подходящий любому конкуренту. Сценарий вытягивает не модель, а бриф.
Сколько вариантов первых секунд просить у модели?
Восемь-двенадцать за один запрос. Первые два-три обычно шаблонные, интересное начинается дальше, а дешевле попросить сразу пачку, чем гонять модель по одному варианту. Выбирать всё равно вам: модель не знает, что зацепит вашу аудиторию.
Может ли нейросеть сделать раскадровку?
Словами — да: разложить текст по кадрам, описать, что в кадре, какой план, какая длительность и что происходит на экране. Картинки к кадрам можно сгенерировать отдельно моделями изображений. Само видео по этой раскадровке снимает или монтирует человек.
Как адаптировать один сценарий под разные площадки?
Отдельным запросом на каждую площадку, а не одним на все сразу. В запросе называйте длительность, ориентацию кадра, где у зрителя звук включён, а где нет, и что считается призывом к действию. Одинаковый текст на вертикальном коротком ролике и на десятиминутном видео не работает ни там, ни там.
Какую модель брать под сценарии?
Для потока коротких роликов хватает дешёвой быстрой позиции, потому что задача про форму, а не про знания. Модель подороже заметна там, где нужно удержать линию в длинном сценарии и не рассыпать её на набор тезисов.