LLM API и интеграция
Пересказ текста нейросетью: как получить саммари
Пересказ — задача, где модель работает хорошо и где результат чаще всего разочаровывает. Причина не в модели: просьба «перескажи» не содержит критерия, что оставить, а без критерия сохраняется общее и выбрасывается конкретное — потому что общее короче и звучит нейтральнее. Получается гладкий текст, из которого нельзя принять ни одного решения. Разбираем, чем задавать форму, что делать с текстами, которые не помещаются в контекст, почему многоуровневое сведение теряет детали и как ловить выдуманные цифры, которых в оригинале не было.
Почему «перескажи» даёт воду
Механизм простой, и он объясняет весь дальнейший рецепт.
Модель не знает, зачем вам пересказ. Для отчёта руководителю, для поиска нужного документа, для решения о покупке — это три разных саммари одного текста. Без указания цели она выбирает нейтральный вариант: общие формулировки, отсутствие острых углов, ровная интонация.
Второе обстоятельство: конкретика длиннее общих слов. «Выручка выросла на 14% при падении маржи до 8%» длиннее, чем «финансовые показатели изменились неоднозначно». Когда просят «покороче», без явного указания сокращается именно конкретика.
Отсюда правило, которое решает большую часть проблемы: скажите, что обязательно должно остаться. Цифры, сроки, имена, решения, суммы — перечислите явно, и они уцелеют.
Из чего состоит хорошее задание
Пять элементов, каждый меняет результат заметно.
Для кого и зачем. «Для руководителя, который решает, продлевать ли договор» — одна фраза, а результат другой.
Длина в конкретных единицах. Не «кратко», а «пять пунктов по одному предложению» или «один абзац до 600 знаков». Расплывчатое «кратко» модель понимает по-своему.
Форма. Список, абзац, таблица, поля. Форма задаёт структуру мышления сильнее, чем инструкции о содержании.
Что обязательно сохранить. Все числа, даты, названия сторон, принятые решения. Это единственная защита от вымывания конкретики.
Что не нужно. «Без вступления», «без вывода о том, что тема важна», «не пересказывай общеизвестное».
Плюс приём, который сильнее любого описания: дайте пример хорошего саммари — своего, на другом тексте. Модель хорошо копирует форму, которую видит, — тот же принцип, что и в системном промпте.
Разные виды саммари
Полезно понимать, что вы просите, — это разные задачи.
Сжатие. Тот же текст короче, с сохранением структуры. Подходит для документов, где важна полнота.
Выжимка по критерию. Только то, что относится к заданному вопросу. Остальное выбрасывается сознательно.
Структурированные поля. Стороны, суммы, сроки, обязательства — по местам. Самая проверяемая форма, потому что каждое поле сверяется с оригиналом — как получить строгую структуру.
Аннотация для поиска. Два-три предложения, по которым человек поймёт, нужен ли ему этот документ. Здесь потеря деталей допустима и даже нужна.
Ошибка, которая встречается чаще всего, — просить одно, а ожидать другое. Аннотация для поиска не заменяет структурированные поля, и наоборот.
Что делать с длинным текстом
Практическая часть, где появляются потери.
Документ, который не помещается в контекст, приходится обрабатывать по частям: пересказать каждую, затем свести пересказы в общий. Схема рабочая, но у неё есть цена.
На каждом уровне сведения теряются детали. Число, уцелевшее в пересказе главы, может не пройти во второй круг. Чем больше уровней, тем сильнее вымывание.
Что помогает:
Резать по смыслу. Глава, раздел, логический блок — не по числу символов. Разрыв посреди мысли портит обе половины — как это устроено на документах.
Извлекать факты отдельно от пересказа. Числа, даты и имена собирать в структуру на первом проходе и передавать дальше не пересказом, а списком. Тогда они не размываются.
Сохранять привязку к источнику. Для каждого пункта саммари — номер раздела, откуда он взят. Это делает результат проверяемым и заодно резко снижает долю выдумок.
Не сводить в один абзац то, что было на сто страниц. Слишком сильное сжатие даёт текст, из которого ничего нельзя узнать. Иногда честный ответ — «саммари этого документа не может быть короче двух страниц».
Если задача не «пересказать всё», а «найти ответ на вопрос», то пересказ вообще не нужен: нужен поиск нужных фрагментов и ответ по ним. Это дешевле и точнее.
Как ловить выдуманные детали
Пересказ кажется безопасным: он же производный от текста. Это не так.
Модель может добавить деталь, которой в оригинале не было, — особенно цифру, которая «логично» следует из контекста, или уточнение, которое обычно бывает в таких документах. Выглядит это как остальной текст, никак не выделяется — почему так происходит.
Три проверки:
Требуйте ссылку на фрагмент. Каждый пункт саммари сопровождается указанием, откуда он взят. Дальше ваш код проверяет, что фрагмент существует.
Сверяйте числа программно. Все числа из саммари должны встречаться в исходном тексте. Простая проверка, ловит целый класс ошибок.
Не поручайте арифметику. Если в саммари нужна сумма или доля, считайте её сами по извлечённым значениям.
Сколько это стоит
Экономика пересказа устроена иначе, чем у большинства задач.
Основной расход — входной. Весь исходный текст уходит в модель, а ответ короткий. То есть платите вы за то, что отправили, а не за то, что получили.
Отсюда:
Повторные пересказы одного текста стоят полную цену каждый раз. Кэш промптов в нашем каталоге не поддерживается, скидки за повторный контекст нет. Если саммари нужно много раз — сохраните его, а не пересчитывайте.
Чистка текста окупается. Колонтитулы, повторяющиеся шапки, служебная разметка — это оплаченные токены, которые ничего не добавляют.
Многоуровневое сведение дороже одного прохода. Промежуточные пересказы отправляются повторно. Учитывайте это при прикидке.
Как перевести объём в рубли — в разборе стоимости миллиона токенов.
Какую модель брать
Пересказ — задача на изложение, а не на рассуждение.
Разница между дешёвой и дорогой моделью здесь обычно небольшая: обе понимают текст, обе умеют сокращать. Заметнее она становится на сложных документах с юридическими формулировками и на очень длинных текстах, где нужно удерживать связи между удалёнными частями.
Порядок разумный: взять недорогую, сделать двадцать пересказов своих реальных документов, сравнить с тем, что написал бы человек. Проверяется за вечер — методика.
Типовые ошибки в задании
Шесть формулировок, которые встречаются чаще всего и портят результат предсказуемым образом.
«Кратко перескажи». Нет ни длины, ни цели, ни критерия. Даёт ровно тот водянистый результат, из-за которого потом винят модель.
«Выдели главное». Главное для кого? Без адресата модель выберет то, что чаще называют главным вообще, — то есть общие места.
«Сохрани все важные детали». Определение важности отсутствует, значит решать будет модель. Перечислите категории: числа, даты, стороны, суммы, решения.
«Напиши своими словами». Провоцирует пересказ смысла вместо сохранения формулировок — а в юридических и технических текстах формулировка и есть содержание.
«Сделай интересно». Приглашение к добавлению того, чего в тексте не было.
Задание длиннее самого текста. На коротких документах бывает и так; тогда дешевле и точнее прочитать текст самому.
Общий признак плохого задания: по нему нельзя проверить результат. Если из формулировки не следует, как отличить хорошее саммари от плохого, модель этого тоже не знает.
Чего мы не утверждаем
Не даём готового промпта. Он пишется под тип документа и цель пересказа.
Не сравниваем модели по качеству саммари. Своих замеров мы не делали.
Не обещаем, что проверки ловят всё. Они ловят числа и несуществующие ссылки; искажение смысла ловит только человек.
И про ожидания: саммари не бывает лучше исходного текста. Если документ написан невнятно, пересказ будет невнятным — только короче, и это не повод менять модель.
Что держать в голове
Водянистое саммари — следствие задания без критерия, а не слабости модели. Скажите, для кого пересказ, какой длины, в какой форме и что обязательно должно остаться, — и результат меняется сразу.
И два практических правила: числа проверять программно, а если нужен ответ на вопрос, а не пересказ всего, — не пересказывать вовсе, а искать нужные фрагменты.
Как мы проверяем факты и что храним из запросов — на странице о проекте и в llms.txt. Прогнать свои документы на нескольких моделях по одному ключу: keydealer.ru/login.
Частые вопросы
Как сделать пересказ текста нейросетью?
Отправить текст вместе с заданием, где указаны длина, форма и для кого пересказ. Просто «перескажи» даёт расплывчатый результат, потому что модель не знает, что вам важно.
Почему саммари получается водянистым?
Потому что в задании не указано, что оставить. Без критерия модель сохраняет общие формулировки и выбрасывает конкретику — она короче и звучит нейтральнее.
Как пересказать текст, который не помещается в контекст?
Разбить на части, пересказать каждую, затем свести промежуточные пересказы в общий. При этом часть деталей теряется на каждом уровне.
Может ли модель выдумать деталь в пересказе?
Да, особенно цифры и имена. Пересказ выглядит производным от текста, но проверка на месте всё равно нужна.
Какая модель нужна для саммари?
Обычно недорогая. Пересказ — задача на изложение, а не на рассуждение, и разница между дешёвой и дорогой моделью здесь невелика.