Как тратить меньше токенов?
Caveman и Ponytail, плюс фундаментальные способы экономить токены: компакт, короткий CLAUDE.md, меньше MCP, сабагенты, дешёвые модели, кэш.
Меньше токенов — это не только дешевле. Это ещё и умнее: чем свободнее контекст-окно, тем меньше агент «тупеет» и теряет детали. Способы — от косметики до фундамента.
Caveman — сжать общение
Caveman («пещерный человек») — режим (ставится как плагин/skill), в котором агент общается сжато: выкидывает артикли, вводные слова, вежливости и воду, оставляя только техническую суть и код. Экономия выхода — порядка 75%.
Обычно: «Sure! I'd be happy to help. The issue is likely caused by...»
Caveman: «Bug in auth middleware. Token expiry uses < not <=. Fix:»- Хорош когда: много длинных сессий, агент пишет простыни текста, важнее скорость и цена, чем гладкие формулировки.
- Минус: ответы выглядят телеграфно. Код, коммиты и предупреждения caveman не ломает — там пишется нормально.
Caveman режет выход — то, что генерирует модель. Но основной расход часто во входе (файлы, история, CLAUDE.md). Поэтому caveman — приятный бонус, а не главный рычаг. Главное — ниже.
Ponytail — писать меньше кода
Ponytail — сосед caveman по идее, но бьёт с другой стороны. Caveman сжимает текст ответа; Ponytail заставляет агента писать меньше самого кода — бороться с оверинжинирингом.
Принцип — «лесенка лени»: перед тем как писать код, агент проходит вопросы сверху вниз и останавливается на первом подходящем:
- А оно вообще нужно? (принцип YAGNI — «тебе это не понадобится»)
- Может, хватит стандартной библиотеки?
- Может, это уже есть в платформе/фреймворке?
- Может, закрывается уже установленной зависимостью?
- Можно ли в одну строку?
- Иначе — пишем минимум, который работает.
Девиз: «лучший код — тот, который ты не написал». По бенчмаркам авторов — около −54% строк и −20% стоимости при сохранении проверок и безопасности.
- Ставится плагином (
/plugin install ponytail@ponytailв Claude Code), уровниlite/full/ultra— как у caveman. - Команды:
/ponytail-review— найти оверинжиниринг в диффе,/ponytail-audit— пройтись по всему репо. - Хорош когда: агент любит плодить лишние абстракции, обёртки и «защиту от того, чего не бывает».
Связка простая: caveman делает короче разговор, ponytail — короче код. Меньше кода — это не только дешевле по токенам, но и меньше багов и проще поддержка. Оба — про дисциплину агента, а не про настройки контекста.
Фундаментальные способы
Бьют по входу — там, где обычно утекает больше всего:
- Чистить окно.
/compactсжимает историю, не бросая сессию. Подробнее — Контекст и откат. - Короткий
CLAUDE.md. Файл памяти грузится каждую сессию — раздутый съедает окно постоянно. Держи только то, что реально влияет на работу. - Меньше MCP-серверов. Каждый MCP добавляет описания своих инструментов в контекст. Подключай нужное проекту, а не «всё на всякий случай».
- Сабагенты на широкий поиск. Сабагент перелопатит десятки файлов у себя и вернёт выжимку — основная сессия остаётся чистой.
- Точечный контекст. Не вываливай весь репозиторий: дай конкретные файлы и чёткую задачу.
- Дешёвая модель на простое. Рутину (переименовать, отформатировать) незачем гонять на самой мощной модели — Haiku или Sonnet справятся дешевле.
- Просить кратко. Прямое «отвечай кратко, без воды» или режим вывода «concise» режут выход без плагинов.
Дешёвая модель для сабагентов
Два пункта выше складываются в один мощный приём: сабагенты на широкий поиск — и каждому из них своя, дешёвая модель. Сбор контекста (читать, искать, вернуть выжимку) — простая работа, самая мощная модель там не нужна.
Модель задаётся во фронтматтере файла сабагента в .claude/agents/:
---
name: context-confluence
description: Ищет описание фичи в Confluence. Use when нужно собрать требования по фиче.
model: haiku
---
Найди описание фичи, верни обязательные поля, бизнес-правила и статусы.
Только выжимку — лишнего не тащи.Оркестратор (основной агент) остаётся на мощной модели, а несколько «сборщиков» бегают на Haiku. На воркфлоу вроде /generate-test, где параллельно работают четыре агента, это заметно режет счёт без потери качества.
И про кэш (ниже) это безопасно: у сабагента отдельная сессия, так что его модель не сбрасывает кэш основного контекста. А вот дёргать модель туда-сюда в основной сессии — как раз не стоит.
Про кэш — почему важно
Повторяющийся дорогой контекст (CLAUDE.md, описания MCP) кэшируется: при повторном чтении он стоит почти даром (около 0.1× от обычной цены). Но кэш сбрасывается, когда посреди сессии меняешь модель, настройки или набор плагинов. Практический вывод: не дёргай модель туда-сюда без нужды — каждый сброс заставляет пересчитывать контекст по полной.
Порядок действий по эффекту: сначала убери лишнее из входа (короткий CLAUDE.md, меньше MCP, точечный контекст, /compact), потом подбирай модель под задачу, и уже сверху — caveman для выхода.
Проверь себя
1. Что делает caveman-режим?
2. В чём разница между caveman и ponytail?
3. Почему короткий CLAUDE.md экономит токены сильнее, чем кажется?
4. Почему не стоит без нужды переключать модель посреди сессии?
5. Как удешевить сабагентов, которые просто собирают контекст?
CodeGraph — индекс кодовой базы
CodeGraph — CLI + MCP-сервер, который заранее строит граф-индекс кода. Агент не шарит по файлам через grep/read, а спрашивает индекс — меньше токенов и вызовов.
Как дать агенту браузер
Playwright даёт агенту живой браузер: открывать страницы, кликать, читать DOM, снимать локаторы — и гонять e2e-тесты. Как подключить.