ИИ-агенты и автоматизация

Инструкции агенту устарели: разбор от OpenAI

Инструкции агенту устарели: разбор от OpenAI

OpenAI выпустила разбор, который стоит прочитать всем, у кого есть накопленные инструкции для кодинг-агентов: правила, помогавшие прошлым моделям, новой мешают. Главное последствие денежное — указание «прочитай проект перед каждой правкой» теперь просто жжёт контекст, а лишние 10 000 токенов на сессии из тридцати шагов дают 300 000 оплаченных входных токенов сверху.

Разберём, что именно вендор советует убрать, почему неясная инструкция дороже отсутствующей и как проверить свои файлы за вечер.

Что произошло

За последний год у команд накопились инструкции для агентов в трёх формах: файлы навыков, файл правил репозитория и сами формулировки задач. Писались они под модели, которые плохо выбирали, что читать, и потому требовали прямых указаний.

Новое поколение выбирает само. Вендор пишет об этом прямо: подталкивать модель прочитать весь проект перед каждой правкой — хороший способ сжечь контекст и замедлить работу.

Отсюда неприятное следствие. Инструкции не устарели молча и безвредно, как устаревает комментарий в коде. Они продолжают исполняться и продолжают стоить денег на каждом шаге.

Почему неясная инструкция хуже, чем никакой

Второй тезис документации важнее первого. Новая модель лучше следует длинным инструкциям и одновременно чувствительнее к тому, что лежит в контексте.

Практический эффект: неясная или противоречивая формулировка в файле навыка заставляет модель остановиться и заблокировать работу раньше времени. То есть вы получаете не «чуть хуже результат», а незаконченную задачу и непонятную причину.

Вендор советует явно задавать приоритет: что важнее — указание пользователя или правило из файла навыка. Без этого модель решает сама, и решает не всегда так, как вы ожидали.

Как найти виноватую инструкцию

Самый полезный приём из всей публикации — отладочный. Вместо того чтобы гадать, попросите агента назвать конкретный файл и процитировать строку, из-за которой он остановился, попросил подтверждение или ушёл в сторону.

Такой ответ превращает расплывчатое «агент тупит» в конкретную строку, которую можно удалить или переписать. Приём работает и с другими семействами: это не особенность одного вендора, а способ вытащить причину из контекста.

Что проверить в своих файлах

Порядок ревизии, который закрывает большинство случаев.

  1. Уберите указания читать всё подряд. Чтение каталога целиком перед каждой правкой — прямой расход без отдачи.
  2. Найдите противоречия. Два правила, требующие разного, дают паузу вместо работы.
  3. Проставьте приоритет. Явно скажите, что указание в задаче важнее общего правила из файла.
  4. Уберите правила, написанные под конкретную старую модель. То, что помогало младшей модели, ограничивает старшую.
  5. Ограничьте тесты. Указание перезапускать тесты только при новых падениях убирает несоразмерные прогоны на мелких правках.
  6. Проверьте, что файл вообще актуален. Правило, описывающее структуру проекта двухлетней давности, вредит буквально.

Сколько это стоит в деньгах

Главная причина заниматься ревизией — счёт, а не эстетика. Механика простая: история переотправляется в модель на каждом шаге, поэтому лишний объём в контексте оплачивается не один раз, а столько раз, сколько шагов в сессии.

Возьмём лишние 10 000 токенов инструкций и сессию из тридцати шагов. Это 300 000 лишних входных токенов за одну задачу.

Модель₽ за миллионПереплата за сессиюЗа 100 сессий
qwen-3-6-flash30,9090
gemini-3-flash61,80180
haiku-4-582,40240
sonnet-4-6123,60360
opus-5309,00900
gpt-6-astra6018,001 800

Сто сессий в месяц — это один разработчик, работающий с агентом ежедневно. На команде из пяти человек и флагманской модели переплата за устаревшие инструкции выходит в девять тысяч рублей в месяц, и получает за них компания ровно ноль.

Как считать свой профиль — в статье как считать токены.

Что делать с делегированием подагентам

Отдельная рекомендация касается тех, у кого агент умеет раздавать работу параллельным исполнителям.

По описанию вендора модель обучена делить задачу и передавать части подагентам, но на практике делает это реже, чем от неё ждут. Вывод для разработчика обвязки простой: если многоагентная схема у вас есть, степень делегирования нужно задавать явно, отдельным указанием, а не надеяться на инициативу модели.

Здесь стоит держать в голове экономику. Параллельные исполнители не бесплатны: каждый тащит свой контекст, и три подагента на одной задаче — это три истории вместо одной. Делегирование окупается на действительно независимых кусках работы и проигрывает на задачах, где подагентам нужен один и тот же контекст.

Что советуют по стилю ответов

Третий блок рекомендаций к деньгам отношения не имеет, но к качеству имеет прямое.

Вендор описывает желаемый стиль так: короткие абзацы с одной мыслью, списки только там, где элементы действительно однородны или последовательны, простые слова и конкретные примеры, активный залог, главное в начале. Отдельно — не вкладывать списки друг в друга, если иерархию можно выразить прозой.

Полезно это не потому, что чужой стилевой гайд обязателен, а потому, что показывает механику: стиль ответа задаётся инструкцией и поддаётся настройке так же, как поведение. Если ответы агента вас не устраивают по форме, это чинится в файле правил, а не сменой модели.

Ревизия за вечер

Практический порядок, который занимает пару часов и обычно окупается первой же неделей.

Соберите все файлы, до которых дотягивается агент: правила репозитория, навыки, системные промпты в коде. Прогоните типовую задачу и посчитайте входные токены на шаг. Уберите инструкции из списка выше, прогоните ту же задачу и сравните две цифры — расход и долю результата, которую пришлось переделывать руками.

Если расход упал, а доля переделок не выросла, инструкции были лишними. Если выросла — вернули не то, и теперь вы знаете, какое именно правило работало. Это дешевле любых рассуждений о том, нужен ли файл правил вообще.

Что менять в коде, а не в промпте

Отдельный пункт, который легко пропустить, потому что он не про текст инструкций. При переходе со старых моделей меняется параметр работы с кэшем промптов: вместо прежнего поля удержания используется новое, со значением времени жизни.

Это правка в коде интеграции. Если её не сделать, поведение кэша отличается от ожидаемого, а заметить это по ответам модели невозможно — видно только в счёте. Механика кэша разобрана в статье кэш промптов: как экономить.

Оговорка про наш маршрут: в каталоге prompt_cache.status равен unsupported у всех текстовых позиций, скидка за попадание в кэш не начисляется. Вендорские параметры кэша имеют значение при прямом доступе.

Что это значит для других семейств

Публикация посвящена одной линейке, но вывод переносится.

Инструкции живут дольше моделей. Файл правил, написанный полтора года назад, переживёт три поколения моделей и будет применяться ко всем трём.

Сильная модель страдает от лишних правил сильнее слабой. Она внимательнее к контексту, а значит послушнее исполняет и плохие указания тоже.

Ревизия инструкций — регулярная работа, а не разовая настройка. Разумно пересматривать файл правил при каждой смене модели в конфигурации.

Смежный разбор того, как вести файл памяти проекта, есть в статье как пользоваться Claude Code, а про устройство агентного цикла — в статье как сделать ИИ-агента.

Чего мы не утверждаем

Мы не проверяли рекомендации на собственных замерах. Это описание поведения от разработчика модели, а не наш эксперимент.

Мы не переносим выводы на все модели механически. У каждой линейки своя чувствительность к контексту, и проверять нужно на своей задаче.

Мы не называем цифру экономии в процентах. Расчёт в таблице — модель поведения на заданных допущениях, а не измеренный результат.

Что нужно, чтобы проверить у себя

Ключ заводится за минуту на keydealer.ru/login — почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на все 53 позиции каталога.

Разумный первый шаг — прогнать одну типовую задачу дважды: со своим текущим файлом правил и с урезанным. Разница в расходе видна сразу, а качество результата сравнивается на глаз.

Что держать в голове

Инструкции агенту — не документация, а исполняемый код, который оплачивается на каждом шаге.

Неясное правило дороже отсутствующего: оно не ухудшает ответ, а останавливает работу.

Ревизию файлов правил стоит делать при каждой смене модели, а не когда счёт станет заметным. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ: keydealer.ru/login.

Частые вопросы

Почему старые инструкции агенту стали вредить?

Они писались под модели, которые сами не решали, что читать. Новое поколение выбирает нужные файлы само, поэтому правило «прочитай весь проект перед правкой» теперь сжигает контекст и замедляет работу, не улучшая результат.

Что именно советует проверить вендор?

Все файлы навыков и AGENTS.md, до которых дотягивается модель. В документации сказано прямо: инструкции в них могут влиять на поведение, а неясные или противоречивые формулировки заставляют модель останавливаться и не доделывать работу.

Как понять, какая инструкция тормозит агента?

Попросить его назвать конкретный файл и процитировать строку, из-за которой он остановился или сменил курс. Вендор предлагает такой отладочный приём отдельным промптом.

Что поменялось в параметрах кэша?

При переходе со старых моделей параметр удержания кэша заменён на новый, со значением времени жизни. Это правка в коде, а не в промпте, и её легко пропустить.

Правда ли, что агент стал прогонять лишние тесты?

По описанию вендора модель тщательно проверяет работу перед завершением, и на мелкой правке объём тестов бывает несоразмерным. Лечится явным указанием перезапускать тесты только при новых падениях.

Сколько стоит лишний контекст в агентной сессии?

История переотправляется на каждом шаге, поэтому лишние 10 000 токенов в контексте на сессии из тридцати шагов превращаются в 300 000 оплаченных входных токенов. На ставке 8 ₽ за миллион это 2,40 ₽ за сессию, на ставке 30 ₽ — 9 ₽.

Источники