Багодельня
Инструменты и плагины

Как тратить меньше токенов?

Caveman и Ponytail, плюс фундаментальные способы экономить токены: компакт, короткий CLAUDE.md, меньше MCP, сабагенты, дешёвые модели, кэш.

Меньше токенов — это не только дешевле. Это ещё и умнее: чем свободнее контекст-окно, тем меньше агент «тупеет» и теряет детали. Способы — от косметики до фундамента.

Caveman — сжать общение

Caveman («пещерный человек») — режим (ставится как плагин/skill), в котором агент общается сжато: выкидывает артикли, вводные слова, вежливости и воду, оставляя только техническую суть и код. Экономия выхода — порядка 75%.

Обычно:  «Sure! I'd be happy to help. The issue is likely caused by...»
Caveman: «Bug in auth middleware. Token expiry uses < not <=. Fix:»
  • Хорош когда: много длинных сессий, агент пишет простыни текста, важнее скорость и цена, чем гладкие формулировки.
  • Минус: ответы выглядят телеграфно. Код, коммиты и предупреждения caveman не ломает — там пишется нормально.

Caveman режет выход — то, что генерирует модель. Но основной расход часто во входе (файлы, история, CLAUDE.md). Поэтому caveman — приятный бонус, а не главный рычаг. Главное — ниже.

Ponytail — писать меньше кода

Ponytail — сосед caveman по идее, но бьёт с другой стороны. Caveman сжимает текст ответа; Ponytail заставляет агента писать меньше самого кода — бороться с оверинжинирингом.

Принцип — «лесенка лени»: перед тем как писать код, агент проходит вопросы сверху вниз и останавливается на первом подходящем:

  1. А оно вообще нужно? (принцип YAGNI — «тебе это не понадобится»)
  2. Может, хватит стандартной библиотеки?
  3. Может, это уже есть в платформе/фреймворке?
  4. Может, закрывается уже установленной зависимостью?
  5. Можно ли в одну строку?
  6. Иначе — пишем минимум, который работает.

Девиз: «лучший код — тот, который ты не написал». По бенчмаркам авторов — около −54% строк и −20% стоимости при сохранении проверок и безопасности.

  • Ставится плагином (/plugin install ponytail@ponytail в Claude Code), уровни lite / full / ultra — как у caveman.
  • Команды: /ponytail-review — найти оверинжиниринг в диффе, /ponytail-audit — пройтись по всему репо.
  • Хорош когда: агент любит плодить лишние абстракции, обёртки и «защиту от того, чего не бывает».

Связка простая: caveman делает короче разговор, ponytail — короче код. Меньше кода — это не только дешевле по токенам, но и меньше багов и проще поддержка. Оба — про дисциплину агента, а не про настройки контекста.

Фундаментальные способы

Бьют по входу — там, где обычно утекает больше всего:

  • Чистить окно. /compact сжимает историю, не бросая сессию. Подробнее — Контекст и откат.
  • Короткий CLAUDE.md. Файл памяти грузится каждую сессию — раздутый съедает окно постоянно. Держи только то, что реально влияет на работу.
  • Меньше MCP-серверов. Каждый MCP добавляет описания своих инструментов в контекст. Подключай нужное проекту, а не «всё на всякий случай».
  • Сабагенты на широкий поиск. Сабагент перелопатит десятки файлов у себя и вернёт выжимку — основная сессия остаётся чистой.
  • Точечный контекст. Не вываливай весь репозиторий: дай конкретные файлы и чёткую задачу.
  • Дешёвая модель на простое. Рутину (переименовать, отформатировать) незачем гонять на самой мощной модели — Haiku или Sonnet справятся дешевле.
  • Просить кратко. Прямое «отвечай кратко, без воды» или режим вывода «concise» режут выход без плагинов.

Дешёвая модель для сабагентов

Два пункта выше складываются в один мощный приём: сабагенты на широкий поиск — и каждому из них своя, дешёвая модель. Сбор контекста (читать, искать, вернуть выжимку) — простая работа, самая мощная модель там не нужна.

Модель задаётся во фронтматтере файла сабагента в .claude/agents/:

---
name: context-confluence
description: Ищет описание фичи в Confluence. Use when нужно собрать требования по фиче.
model: haiku
---

Найди описание фичи, верни обязательные поля, бизнес-правила и статусы.
Только выжимку — лишнего не тащи.

Оркестратор (основной агент) остаётся на мощной модели, а несколько «сборщиков» бегают на Haiku. На воркфлоу вроде /generate-test, где параллельно работают четыре агента, это заметно режет счёт без потери качества.

И про кэш (ниже) это безопасно: у сабагента отдельная сессия, так что его модель не сбрасывает кэш основного контекста. А вот дёргать модель туда-сюда в основной сессии — как раз не стоит.

Про кэш — почему важно

Повторяющийся дорогой контекст (CLAUDE.md, описания MCP) кэшируется: при повторном чтении он стоит почти даром (около 0.1× от обычной цены). Но кэш сбрасывается, когда посреди сессии меняешь модель, настройки или набор плагинов. Практический вывод: не дёргай модель туда-сюда без нужды — каждый сброс заставляет пересчитывать контекст по полной.

Порядок действий по эффекту: сначала убери лишнее из входа (короткий CLAUDE.md, меньше MCP, точечный контекст, /compact), потом подбирай модель под задачу, и уже сверху — caveman для выхода.

Проверь себя

  1. 1. Что делает caveman-режим?

  2. 2. В чём разница между caveman и ponytail?

  3. 3. Почему короткий CLAUDE.md экономит токены сильнее, чем кажется?

  4. 4. Почему не стоит без нужды переключать модель посреди сессии?

  5. 5. Как удешевить сабагентов, которые просто собирают контекст?

On this page