Лимиты в терминальных ИИ-агентах заканчиваются не от объёма сделанной работы, а от объёма лишнего, что лежит в контексте. Один и тот же проект можно вести, упираясь в потолок дважды в день, а можно — не замечая его вовсе. Ниже разобрано, куда уходят токены в Claude Code, Codex, Kimi Code и любом другом агенте такого класса, и какие приёмы дают самый заметный выигрыш: от языка инструкций до устройства системного промпта, субагентов и механики пятичасового окна.
Куда на самом деле уходят токены
Модель работает не со словами, а с токенами — фрагментами текста, которые иногда совпадают со словом, а чаще составляют его часть. Разбиение зависит от того, на каких данных обучали токенизатор, и здесь кириллица проигрывает: английское слово занимает в среднем полтора токена, русское — два с половиной или три. Сравнительные замеры дают разброс от двукратной до трёхкратной разницы, а простая транслитерация русского текста латиницей сокращает счёт примерно вдвое. Вывод простой: работая на русском, вы платите за тот же смысл в полтора-два раза больше.
Вторая асимметрия — между чтением и генерацией. Входные токены везде стоят кратно дешевле выходных, потому что вход обрабатывается параллельно, а ответ пишется последовательно, по токену за шаг.
| Модель | Вход, $ за 1 млн токенов | Выход, $ за 1 млн токенов |
|---|---|---|
| Claude Opus 5 | 5 | 25 |
| Claude Sonnet 5 | 2 | 10 |
| Claude Haiku 4.5 | 1 | 5 |
| GPT-5.6 Sol | 5 | 30 |
| GPT-5.6 Terra | 2 | 12 |
Разрыв в пять-шесть раз объясняет, почему длинные рассуждения обходятся дороже длинных документов, и почему уровень «размышлений» у агента влияет на расход сильнее, чем размер прочитанного файла.
Третий фактор — квадратичный рост вычислений. Чтобы дописать очередной токен, модель сопоставляет его с каждым из уже лежащих в контексте. Тысяча токенов даёт около миллиона парных сопоставлений, две тысячи — уже четыре миллиона. Контекст вырос вдвое, нагрузка — вчетверо. Забитое окно дорого обходится провайдеру, и он закладывает это в лимиты подписки.
На каком языке писать инструкции
Из разницы в токенизации не следует, что каждый свой запрос нужно переводить на английский вручную: время вы потратите, а выигрыш съест сам процесс перевода. Рабочая схема другая — на английском пишутся постоянные части контекста: системный промпт, файлы CLAUDE.md и AGENTS.md, описания скилов и субагентов. Туда же добавляется правило: внутренние рассуждения и служебные действия вести на английском, ответ пользователю выдавать на русском. Диалог для вас остаётся русским, а самая объёмная и постоянно перечитываемая часть контекста — английской.
Отдельный сюжет — китайские модели. Их токенизаторы обучены сразу на двух языках, вокабуляр под иероглифы расширен, и практики называют экономию около трети токенов при работе с Qwen на китайском. Проверка этого утверждения даёт неоднозначную картину: исследование, сравнивавшее стоимость токенов и долю решённых задач при программировании на китайском и английском, преимущества китайского не обнаружило. Похоже, выигрыш существует на уровне чистой компрессии текста, но растворяется, когда модель начинает рассуждать и вызывать инструменты. Переходить на язык, которым вы не владеете, ради этой экономии смысла нет.
Длинный чат вредит дважды
Привычка вести весь проект в одном диалоге бьёт и по лимитам, и по качеству. Пик работоспособности агента лежит примерно между сотней и двумя сотнями тысяч токенов; дальше начинается то, что называют context rot — модель хуже находит нужное в собственном контексте и чаще ошибается.
Замеры на восемнадцати моделях показывают, что деградация не включается на каком-то пороге: качество снижается постепенно по мере роста входа, задолго до заполнения окна, и происходит это со всеми фронтирными моделями. Отдельно измерен эффект «потери в середине»: если нужный фрагмент лежит не в начале и не в конце контекста, точность падает более чем на треть. Причина архитектурная: механизм внимания слабее связывает далеко разнесённые токены, и обучением это не лечится.
Окно на миллион токенов, таким образом, не разрешение его заполнять. Это запас, из которого разумно расходовать первую пятую часть.
Короткие сессии без потери нити
Возражение против дробления всегда одно: проект длинный, контекст нужно сохранять. Сохранять его нужно не в диалоге, а на диске. Рабочий комплект выглядит так:
- ТЗ с требованиями и ограничениями;
- описание архитектуры, которое нужно скорее вам самим, чтобы видеть, что агент не расходится с замыслом;
- дорожная карта с этапами, статусами и явным указанием, с какого пункта продолжать;
- лог: что сделано, что сломалось, какие решения приняты и почему.
Каждый новый диалог начинается с чтения дорожной карты и продолжает работу с отмеченной точки, а по завершении этапа обновляет её и лог. Агент постоянно находится в зоне своей лучшей производительности, а вы не платите за перетаскивание всей истории проекта из запроса в запрос.
Команды, которые держат контекст в форме
| Команда | Что делает | Когда применять |
|---|---|---|
/clear | Очищает текущий диалог; история остаётся в сохранённых сессиях, вернуться можно через /resume | Задача закрыта, начинается следующая |
/compact | Сжимает накопленный контекст в краткую выжимку | Работа не закончена, а окно подходит к пределу |
/btw | Задаёт вопрос в стороне: ответ показывается поверх диалога и в историю не попадает | Нужно что-то уточнить, пока агент занят делом |
/context, /status | Показывают, сколько занято и что именно занимает | Перед решением, чистить или продолжать |
У /compact есть ловушка, о которой узнают на практике: если сжимать один и тот же диалог раз за разом, исходная задача постепенно растворяется в пересказах пересказов. Команда безопасна ровно настолько, насколько подробна ваша дорожная карта — при потере деталей агент восстановит их из файла, а не из очередного summary.
Про /btw полезно знать ограничения: боковой запрос не вызывает инструменты и отвечает только тем, что уже лежит в контексте, ответ даётся один, без продолжения диалога. Зато он не прерывает текущую работу и переиспользует кэш основного диалога, поэтому обходится в копейки. В приложении Codex ту же роль играет боковой чат, который исчезает вместе с закрытием приложения.
Семьдесят тысяч токенов до первого слова
Откройте /context в чистом диалоге и увидите, что занято уже несколько десятков тысяч токенов; у активного пользователя набегает под семьдесят тысяч. Туда входят системный промпт агента, ваши CLAUDE.md или AGENTS.md, подключённые MCP-серверы, описания всех установленных скилов и файлы памяти. При рабочем коридоре в сто-двести тысяч это уже заметная доля, потраченная до того, как вы сформулировали задачу.
Совет создателя Claude Code Бориса Черни звучит радикально: раз в полгода удалять свой CLAUDE.md, скилы и хуки целиком и смотреть, что модель станет делать без них — результат может удивить. Логика в том, что половина накопленных инструкций компенсирует слабости конкретной модели, и с выходом следующей эта половина превращается в балласт. Показательный пример: к релизу Opus 5 в Anthropic удалили более восьмидесяти процентов собственного системного промпта Claude Code. Более мягкий вариант той же процедуры: снести всё и возвращать по строке, проверяя, что каждая реально что-то меняет.
Ревизию стоит делать руками, а не по памяти. Загляните в глобальные каталоги ~/.claude и ~/.agents, посмотрите список скилов, плагинов и MCP-серверов и удалите то, чем не пользуетесь месяцами. Типичный кандидат на вылет: MCP для управления браузером, если браузер уже встроен в само приложение. Две реализации одной возможности занимают контекст и путают агента. Если не помните, зачем заводили конкретный скил, спросите об этом самого агента прямо в проекте.
Системный промпт, который экономит вместо того, чтобы тратить
Главный принцип: агент должен видеть только тот контекст, который нужен текущей задаче. Четыре правила закрывают большую часть перерасхода.
Первое правило — индекс проекта. В промпте описывается карта каталогов: где бэкенд, где фронтенд, где документация, где логи. Получив задачу про фронтенд, агент идёт сразу в нужную папку вместо обхода всего дерева. Без карты он честно исследует проект целиком, и половина контекста уходит на файлы, которые не имеют к задаче отношения.
Второе правило меняет порядок работы внутри папки. По умолчанию агент читает файлы подряд, а нужно наоборот: сперва обычный поиск через терминал (rg или аналог) по ключевым словам задачи, и только потом чтение того, что нашлось. При поломке в скидках агент ищет «discount», «coupon», «price», получает список из трёх файлов и читает три файла вместо ста.
Третье правило переносит тот же приём внутрь файла. Лог на тридцать тысяч строк или объёмный модуль читаются не целиком, а фрагментами вокруг найденных совпадений. На больших файлах это разница между несколькими тысячами токенов и несколькими сотнями.
Четвёртое правило отсекает шум. Некоторые файлы нужны проекту, но никогда не нужны модели: .env с секретами, node_modules, артефакты сборки, кэши. Их читать прямо запрещается — это экономит контекст и заодно снимает риск утащить секреты в диалог.
К правилам добавляются требования к поведению: отвечать коротко и по делу, не пересказывать запрос перед ответом, после каждого этапа обновлять дорожную карту и лог. Сам промпт держится компактным — подробности выносятся в отдельные файлы, на которые он ссылается. И к каждому правилу нужен пример: формулировка без примера выполняется агентом заметно хуже.
Субагенты: грязную работу — в отдельный контекст
Главный агент не обязан делать всё сам, и чаще всего не должен. Самый наглядный случай тут поиск в интернете. Страница приходит вместе с разметкой, скриптами и навигационным мусором; полезного текста в ней может быть десятая часть, а осядет в основном контексте всё. После трёх таких запросов окно забито, а работа ещё не началась.
Субагент выполняет задачу в собственном контексте и возвращает наверх только результат. Выигрыш двойной: основной диалог остаётся чистым, а для подзадачи можно взять модель попроще. Поиск и разбор страниц не требуют флагманской модели, здесь уместны младшие тиры вроде GPT-5.6 Luna или Haiku, которые стоят в разы дешевле. Отдельно настраивается уровень размышлений: для поиска высокий бесполезен, а платите вы за каждый токен рассуждений.
Разумный набор ролей выглядит так: главный агент на сильной модели планирует, держит архитектуру и ведёт дорожную карту; исследователь ходит в интернет; кодер пишет; ревьюер проверяет. Создать такого субагента можно, попросив об этом самого агента в Claude Code или Codex — конфигурация с выбором модели и уровня размышлений заводится в пару шагов.
Выбор инструмента: где та же подписка даёт больше работы
Подписка выгоднее оплаты по API, и разрыв велик. Подсчёты пользователей показывают, что объём работы, укладывающийся в двадцатидолларовую подписку, по прайсу API стоил бы сотни долларов в месяц — компании фактически субсидируют этот режим. Отсюда следует, что сравнивать инструменты имеет смысл не по цене подписки, а по тому, сколько работы в неё влезает.
По оценкам, которые ходят в сообществе, двадцать долларов в Codex дают примерно вдвое больший объём, чем те же двадцать в Claude Code, а на стодолларовом тарифе разрыв составляет около 1,7–1,8 раза. Цифры приблизительные, к тому же токены у разных провайдеров считаются по-разному, поэтому прямое сравнение условно. Подтверждается другое, измеримое: на одинаковых задачах Codex расходует в два-четыре раза меньше токенов, чем Claude Code. В одном из замеров задача обошлась в 1,5 миллиона токенов против 6,2 миллиона, в другом — 72 тысячи против 235 тысяч. Разница в лимитах во многом отсюда и берётся.
Это не приговор Claude Code — качество на сложных задачах измеряется отдельно. Но если ваша боль формулируется словами «постоянно упираюсь в лимиты», выбор инструмента влияет на неё сильнее любых оптимизаций промпта.
Пятичасовое окно и как сдвинуть его на удобное время
В Claude Code действуют лимиты двух уровней: пятичасовые окна и недельные потолки. Пятичасовое окно привязано не к часам на стене, а к вашему первому сообщению. Написали первый запрос в 10:00 — обновление придёт в 15:00, независимо от того, сожгли вы квоту за тридцать минут или растянули на все пять часов.
Отсюда простой приём. Если вы садитесь за работу в десять и выжигаете окно к двенадцати, разбудите агента заранее: любое сообщение в семь утра запускает отсчёт, и обновление придёт уже в двенадцать, ровно к моменту, когда квота закончилась. Вставать ради этого не нужно, в Claude Code есть routines, запланированные задачи по расписанию. Достаточно повесить ежедневный триггер на раннее утро, поставить самую дешёвую модель и попросить ответить одним словом: этот запрос и станет первым сообщением, открывающим окно.
Приём работает только при регулярном графике. Если вы садитесь за работу в разное время, автоматический ранний запуск будет сдвигать окно туда, где оно вам не нужно.
С чего начать
- Откройте
/contextв пустом диалоге и посмотрите, сколько занято до начала работы. Всё, чем не пользуетесь (скилы, MCP, старые правила), удалите. - Переведите постоянные части контекста на английский, добавив правило отвечать пользователю по-русски.
- Заведите в проекте дорожную карту и лог, чтобы новый диалог начинался с них, а не с пересказа истории.
- Впишите в системный промпт карту каталогов, порядок «сначала поиск, потом чтение», чтение больших файлов фрагментами и список запрещённых к чтению путей. К каждому правилу — пример.
- Вынесите поиск в интернете и другие шумные задачи на субагентов с младшими моделями и низким уровнем размышлений.
- Держите рабочее окно в пределах двухсот тысяч токенов:
/clearмежду задачами,/compactтолько при наличии внешней дорожной карты. - Если график работы стабильный, настройте раннее автоматическое сообщение, чтобы пятичасовое окно обновлялось к нужному вам часу.
Экономия контекста и качество работы агента здесь одно и то же действие, увиденное с двух сторон. Короткий и чистый контекст даёт и более точные ответы, и меньший расход, так что каждая мера из списка выше засчитывается дважды. Начинать разумно с ревизии того, что лежит в контексте до первого запроса: это занимает полчаса и обычно освобождает больше, чем все остальные приёмы вместе.
Сравните модели перед запуском
Тарифы, лимиты и список моделей — на стороне сервиса. Если что-то разойдётся с описанным здесь, напишите: поправим материал и проставим новую дату проверки.
Открыть каталог моделей«SEO Разум» не продаёт доступ к API и не является поставщиком токенов.