LLM API и интеграция

Нейросеть для перевода текста: как сделать через API

Нейросеть для перевода текста: как сделать через API

Перевод через API устроен иначе, чем работа обычного переводчика, и это одновременно его сила и источник типовых проблем. Модель видит весь фрагмент целиком, а не отдельное предложение, поэтому справляется с местоимениями, разговорными оборотами и терминами, которые зависят от темы. Она же принимает ваши правила: глоссарий, тон, формат, требование не трогать разметку. Взамен требует того, что переводчику не нужно, — явных инструкций, разбиения по смыслу и проверки результата, потому что уверенно подставить неверный термин она может так же легко, как правильный. Разбираем весь путь и считаем стоимость.

Что модель делает лучше переводчика

Три вещи, ради которых это вообще затевается.

Учитывает контекст. Слово, значение которого определяется абзацем выше, будет переведено правильно. Классический пример — многозначные термины, которые в тексте про финансы и в тексте про технику означают разное.

Следует правилам. Глоссарий, обращение на «вы», сохранение оформления, запрет переводить названия продуктов — всё это формулируется в задании и обычно соблюдается.

Сохраняет структуру. Списки, заголовки, разметку. Обычные переводчики регулярно ломают это, потому что работают по предложению.

Взамен появляется то, чего у переводчика нет: модель может уверенно ошибиться в термине. Она не подчёркивает сомнительные места и не сообщает, что перевела наугад.

Как составить задание

Здесь сосредоточена основная работа, и от неё зависит больше, чем от выбора модели.

Укажите оба языка явно. Не «переведи», а «переведи с английского на русский». Автоопределение работает, но на смешанных текстах ошибается.

Задайте назначение текста. Инструкция, маркетинговая страница, юридический документ и переписка переводятся по-разному. Одно предложение о назначении меняет результат сильнее, чем абзац требований к стилю.

Передайте глоссарий. Список «термин — перевод» для всего, что должно переводиться однообразно. Это единственный надёжный способ добиться единой терминологии между кусками.

Запретите лишнее. «Не добавляй пояснений», «не меняй разметку», «названия продуктов оставляй как есть». Без явного запрета модель считает пояснение полезным.

Дайте пример. Пара «оригинал — правильный перевод» из вашего же материала работает лучше, чем описание стиля словами.

Последний пункт стоит выделить. Если из всего перечисленного вы сделаете только его, качество вырастет заметнее, чем от идеально сформулированных требований — тот же принцип, что и в системном промпте.

Разбиение и единство терминологии

Главная техническая сложность при объёмах.

Большой документ не отправляется одним куском: он либо не помещается в контекст, либо помещается, но обходится дорого и хуже обрабатывается. Значит текст режется на части — и вот здесь появляется проблема, которой нет у переводчика-человека.

Части переводятся независимо, и терминология расходится. В первой главе термин переведён так, в пятой — иначе, потому что модель не помнит предыдущих кусков.

Что помогает:

Глоссарий в каждом запросе. Он небольшой, и передавать его при каждом обращении дешевле, чем потом сводить расхождения.

Резать по смыслу. Раздел, глава, абзац — но не посреди предложения и не посреди списка. Разрыв в середине конструкции портит обе половины.

Давать соседний фрагмент как контекст. Последний абзац предыдущей части, помеченный как «для контекста, не переводить». Помогает с местоимениями и связками.

Сводить термины после. Простая программная проверка: встречается ли термин из глоссария в переводе там, где он был в оригинале.

Сколько это стоит

Считаем, потому что перевод — сценарий с самым предсказуемым объёмом и самой частой недооценкой.

Особенность в том, что объём удваивается: исходный текст уходит как входные токены, перевод возвращается как выходные. Плюс глоссарий и инструкции при каждом обращении.

Вторая особенность — язык. Кириллица расходует больше токенов, чем латиница, и перевод на русский обходится дороже, чем перевод с русского, при том же смысловом объёме. Как это считать — в разборе как считать токены.

Практические следствия:

  1. Считайте по обеим сторонам. Прикидка «сколько токенов в исходнике» занижает счёт примерно вдвое.
  2. Не гоняйте текст дважды. Схема «перевести, потом попросить улучшить» удваивает расход; чаще дешевле сразу задать требования точнее.
  3. Держите глоссарий коротким. Он уходит в модель при каждом куске.
  4. Проверьте экономику на нулевых позициях. В каталоге на 1 сентября 2026 года восемь позиций тарифицируются по нулевой ставке после платного пополнения — что там доступно.

Как проверять качество

Методика, без которой выбор модели превращается в вкусовщину.

Возьмите двадцать реальных фрагментов. Из своих текстов, с типичной для вас лексикой, а не примеры из статей.

Прогоните через две-три модели одинаково. Один промпт, один глоссарий.

Считайте не «нравится», а число правок до готового. Это переводится в рабочее время редактора, в отличие от общего впечатления.

Смотрите отдельно на термины. Общая гладкость и точность терминологии — разные вещи, и модель может быть сильна в одном и слаба в другом.

Методику подробнее разбирали в материале как выбрать модель под задачу. Выборку сохраните: модели обновляются, и через квартал её захочется прогнать заново.

Что автоматизировать, а что нет

Граница, которую стоит провести заранее.

Можно отдать полностью: внутренняя переписка, черновые переводы для понимания смысла, описания товаров, документация для разработчиков.

Нужен редактор: всё, что видит клиент, и всё, что имеет юридические последствия. Модель ошибётся редко, но ошибка будет выглядеть как нормальный текст, и без человека вы её не поймаете.

Не стоит отдавать: тексты, где точность формулировки и есть содержание — договоры, регламенты, медицинские инструкции. Не потому что модель плоха, а потому что цена ошибки несоразмерна экономии.

Промежуточный вариант, который хорошо работает: модель переводит, а редактор вычитывает. Это дешевле полного перевода человеком и надёжнее полной автоматизации.

Что делать с уже переведённым

Отдельная задача, которая всплывает после первого прогона большого объёма: у вас есть переводы, сделанные раньше — руками, другим сервисом или другой моделью. Выбрасывать их не нужно, и вот что с ними стоит сделать.

Соберите из них глоссарий. Готовые переводы — это самый точный источник вашей терминологии. Выпишите повторяющиеся термины и их принятые эквиваленты; такой глоссарий надёжнее составленного с нуля, потому что отражает реально сложившееся употребление.

Возьмите оттуда примеры для промпта. Пара «оригинал — принятый у нас перевод» из собственных материалов задаёт стиль лучше любого описания.

Используйте как эталон для замера. У вас есть тексты с известным правильным ответом — это готовая выборка для сравнения моделей, собирать её отдельно не нужно.

Не переводите заново то, что уже переведено. Звучит очевидно, но при автоматизации типичная ошибка — гонять через модель весь документ при каждом обновлении, хотя изменился один абзац. Сравнение версий программно и перевод только различий сокращает счёт в разы на живой документации.

Последний приём особенно заметен на документации и интерфейсах, где текст меняется постоянно, но небольшими фрагментами.

Чего мы не утверждаем

Не сравниваем модели по качеству перевода. Своих замеров мы не делали; проверять надо на своей языковой паре.

Не обещаем терминологической точности. Глоссарий её повышает, но не гарантирует; проверка остаётся на вашей стороне.

Не даём готового промпта. Он пишется под тип текста и языковую пару.

Цифры каталога — на дату. Восемь позиций с нулевой ставкой — состояние на 1 сентября 2026 года.

И про порядок работы: сначала соберите глоссарий и один пример, потом выбирайте модель. Промпт с глоссарием на средней модели даёт результат лучше, чем сильная модель без правил, — а стоит существенно дешевле.

Что держать в голове

Перевод через API выигрывает у обычного переводчика за счёт контекста и правил, но требует явного задания, глоссария и проверки. Молчаливая ошибка в термине — главный риск, и ловится он программной сверкой, а не вычиткой на глаз.

И про деньги: объём удваивается, а кириллица дороже латиницы. Прикидка «по числу знаков в исходнике» занижает счёт минимум вдвое. Отдельно держите в уме, что перевод — задача с самым предсказуемым объёмом из всех: по числу знаков в исходнике месячный расход прикидывается заранее, если не забыть про удвоение и про кириллицу.

Как мы проверяем факты и что храним из запросов — на странице о проекте и в llms.txt. Прогнать свои тексты на нескольких моделях по одному ключу: keydealer.ru/login.

Частые вопросы

Можно ли переводить тексты через API нейросети?

Да, это одна из задач, где модель работает хорошо: она учитывает контекст всего фрагмента, а не переводит по предложениям.

Чем это лучше обычного переводчика?

Модель видит контекст и может следовать вашим правилам: терминологии, тону, формату. Обычный переводчик работает по предложению и правил не принимает.

Сколько стоит перевод миллиона знаков?

Считается по токенам, а не по знакам, и объём удваивается: исходный текст идёт как входные токены, перевод — как выходные. Кириллица расходует больше токенов, чем латиница.

Как заставить модель соблюдать терминологию?

Передавать глоссарий в запросе и проверять готовый перевод программно на наличие нужных терминов.

Какая модель лучше переводит?

Универсального ответа нет. Проверять надо на своих текстах и своей языковой паре — двадцати реальных фрагментов достаточно, чтобы увидеть разницу.

Источники