Работают ли rtk, caveman и другие инструменты для экономии токенов?
Немного — и намного меньше обещанного. JetBrains провела парные тесты в Claude Code и сравнила счета: caveman обещал 65 %, а сократил выходные токены на 8,5 %; rtk обещал 60–90 %, а на низком уровне рассуждений вышел на 7,6 % дороже, на высоком — так же. Качество выполнения задач ни тот ни другой не ухудшили. Перед установкой посмотрите в /usage, куда уходят ваши токены; после — смотрите на свой расход, а не на число, которое сообщает инструмент.
Codex
Открытых парных тестов на Codex нет. Оценивайте так же: сравнивайте расход токенов своего аккаунта, а не число, которое сообщает инструмент.
И rtk, и caveman поддерживают Codex, но оба теста выше проводились только в Claude Code, поэтому цифры переносить нельзя. А логику — можно: OpenAI пишет, что токены тратят и ваш промпт, и файлы, и история чата, и результаты инструментов, и ответ. Вывод команд — лишь одна часть из этого, а сжатие одной части в целом экономит мало. Чтобы проверить самому, /usage daily и /usage weekly в Codex CLI показывают расход токенов вашего аккаунта, а /status — сколько осталось. OpenAI называет и другие способы экономить: писать точные промпты, давать только нужные файлы, держать AGENTS.md коротким, отключать ненужные MCP-серверы и использовать модель поменьше для рутины.
Что сказано в официальной документации
Tokens are small units of information that ChatGPT reads and writes. Your prompt, files, chat history, tool results, and ChatGPT's response all use tokens.Limit the number of MCP servers you use. Every MCP server adds more context to your messages and uses more of your limit. Disable MCP servers when you don't need them./usage — View account token usage or use a rate-limit reset. Inspect daily, weekly, or cumulative ChatGPT token activity from inside the TUI.Claude
Измеренная экономия мала: caveman сократил выходные токены на 8,5 %; rtk вышел на 7,6 % дороже или так же. Качество выполнения задач не упало.
Оба теста провела JetBrains: Claude Code, claude-sonnet-5, 86 задач по программированию из SkillsBench, каждая задача выполнялась один раз с инструментом и один раз без него, затем результаты сравнивались попарно. caveman был принудительно включён для каждого ответа — лучший для него случай: выходных токенов стало на 8,5 % меньше (с 592 тыс. до 542 тыс. на 82 парах задач), стоимость — примерно на 10 %. rtk ставился в конфигурации по умолчанию: на низком уровне рассуждений медианная стоимость задачи была на 7,6 % выше (80 пар, p=0.004); на высоком — +0,1 % (p=0.99). Обещанные цифры — те, что стояли в двух README на момент тестов, в июле 2026 года.
Что сказано в официальной документации
rtk advertised saving: 60–90%. Measured on real agent work: +7.6% more expensive at low reasoning effort (p=0.004), ±0% at high effort. Setup: Claude Code 2.1.201 · claude-sonnet-5 low and high efforts · SkillsBench. Task quality: unchanged in both arms, at both effort levels.Advertised saving: 65%. Measured saving: 8.5%. Output-token saving on real agentic tasks, with the skill forcibly activated. This is the ceiling, not the usual-case result.a tool's self-reported savings are a claim about its counterfactual, not about your bill. rtk's scoreboard said 96 million tokens saved while the invoice went up. If you evaluate any context-compression tool, measure the paired bill, not the tool's diff.On a Pro, Max, Team, or Enterprise plan, /usage also shows a breakdown of what counts against your plan limits: Attribution: recent usage attributed to skills, subagents, plugins, and individual MCP servers, each shown as a percentage of the total.Почему экономия мала
Та часть, которую эти инструменты могут сжать, изначально невелика. В программировании большая часть вывода агента — код, диффы и вызовы инструментов, и caveman оставляет всё это как есть. Короче становятся только небольшие пояснения между вызовами инструментов.
Claude Code читает файлы и ищет по ним собственными инструментами Read и Grep, которые не проходят через хук Bash, используемый rtk. Примерно пятая часть того, что читает модель, — вывод инструментов, до которого rtk может дотянуться. Максимально возможную экономию JetBrains оценивает примерно в 3 % счёта.
Если вам нужно только отфильтровать шумный вывод команд, в документации Claude Code уже есть пример хука, который возвращает только ошибки.
Что сказано в официальной документации
Advertised savings come from chat-style prose answers. Agentic output is different: code, diffs, tool invocations, and exact error strings dominate the token stream, and Caveman correctly leaves all of it verbatim.Custom hooks can preprocess data before Claude sees it. Instead of Claude reading a 10,000-line log file to find errors, a hook can grep for ERROR and return only matching lines, reducing context from tens of thousands of tokens to hundreds.Что оба проекта пишут сейчас
После тестов оба README изменились. rtk теперь пишет, что сокращает до 90 % вывода bash, который читает агент, и что это не то же самое, что сократить счёт на 90 %. caveman сам приводит результат 8,5 %, а позже добавил прокси, сжимающий вывод инструментов; эту часть JetBrains не тестировала.
Сжатие в обоих инструментах настоящее, и качество выполнения задач в обоих тестах сохранилось. Различаются характер работы и то, как считается экономия.
Что сказано в официальной документации
RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%.The JetBrains number is why the proxy exists. They measured the skill alone, in July 2026, before the proxy shipped.Частые заблуждения
- Инструмент пишет, что сэкономил десятки миллионов токенов, — значит, счёт упал на столько же
Нет. В полном прогоне на низком effort счётчик rtk сообщил о 96,2 млн сэкономленных токенов, а счёт за те же задачи вырос. JetBrains называет три причины. Счётчик сравнивает с полным исходным выводом, который Claude Code всё равно обрезал бы. Он оценивает токены как число символов, делённое на 4, в момент выполнения команды, тогда как большая часть стоимости ввода в сессии — перечитывание по кэш-ставке. И хук не видит большую часть контекста.
- Поставишь один skill для экономии токенов — и расход упадёт больше чем вдвое
Нет. Обещанные 65 % получены на ответах в стиле чата. Когда агент пишет код, большая часть его вывода — код, диффы и вызовы инструментов, а их такие skills не трогают. Измеренный потолок — на 8,5 % меньше выходных токенов при skill, принудительно включённом для каждого ответа; при обычном использовании экономия меньше.
- Тесты показали маленькую экономию, значит, эти инструменты — обман
Нет. Качество выполнения задач в обоих тестах сохранилось, и сжатие настоящее. Вердикт JetBrains по rtk: «Honest engineering, wrong counterfactual.» (честная инженерия, неверная база для сравнения). Оба README теперь сами это признают: rtk разделяет сокращение вывода bash и сокращение счёта, а caveman приводит цифру 8,5 %. Разрыв возникает из-за характера работы и способа подсчёта экономии, а не из-за поддельных инструментов.
Советы
- Прежде чем что-то ставить, посмотрите, куда уходят токены: в Claude Code запустите /usage (d или w — за 24 часа или 7 дней) и /context. Если большую часть забирают долгие сессии или субагенты, инструмент, сжимающий вывод команд, не поможет.
- Чтобы проверить инструмент, сравните свой расход: несколько дней без него и несколько дней с ним, на похожей работе, в /usage (в Codex — /usage weekly). Не принимайте счётчик инструмента за результат.
- Не судите по одному прогону. В тесте rtk повторение той же задачи без изменений сдвигало медианную стоимость на 22 %. Первый прогон caveman на 10 задачах показал экономию 29,5 %; на 86 задачах вышло 8,5 %.
- После установки следите за лишними ходами. В тесте rtk сессии занимали на 13,8 % больше ходов и на 14,3 % больше чтений из кэша — туда и ушли лишние расходы.
- Чтобы фильтровать только вывод тестов и логов, на странице Claude Code о расходах есть готовый пример хука PreToolUse, который возвращает только ошибки. Сторонний инструмент не нужен.
- У каждого skill есть своя цена на каждом ходу: его описание отправляется всегда.