¿De verdad funcionan las herramientas para ahorrar tokens como rtk y caveman?
Un poco, y mucho menos de lo anunciado. JetBrains hizo pruebas por pares en Claude Code y comparó la factura: caveman anunciaba un 65 % y recortó un 8,5 % los tokens de salida; rtk anunciaba un 60–90 % y costó un 7,6 % más con razonamiento bajo, y lo mismo con razonamiento alto. Ninguno empeoró la calidad de las tareas. Antes de instalar uno, mira en /usage adónde van tus tokens; después, fíjate en tu uso, no en la cifra que da la herramienta.
Codex
No hay pruebas por pares públicas en Codex. Júzgalo igual: compara el uso de tokens de tu cuenta, no la cifra que da la herramienta.
Tanto rtk como caveman funcionan con Codex, pero las dos pruebas de arriba solo se hicieron en Claude Code, así que las cifras no se pueden trasladar. El razonamiento sí: OpenAI dice que tu prompt, los archivos, el historial del chat, los resultados de herramientas y la respuesta gastan tokens. La salida de los comandos es una parte de eso, y comprimir una parte ahorra poco en conjunto. Para comprobarlo tú, /usage daily y /usage weekly en la CLI de Codex muestran el uso de tokens de tu cuenta, y /status muestra lo que queda. OpenAI cita otras formas de ahorrar: escribir prompts precisos, dar solo los archivos relevantes, mantener AGENTS.md corto, apagar los servidores MCP que no necesites y usar un modelo más pequeño para el trabajo rutinario.
Qué dice la documentación oficial
Tokens are small units of information that ChatGPT reads and writes. Your prompt, files, chat history, tool results, and ChatGPT's response all use tokens.Limit the number of MCP servers you use. Every MCP server adds more context to your messages and uses more of your limit. Disable MCP servers when you don't need them./usage — View account token usage or use a rate-limit reset. Inspect daily, weekly, or cumulative ChatGPT token activity from inside the TUI.Claude
El ahorro medido es pequeño: caveman recortó un 8,5 % los tokens de salida; rtk costó un 7,6 % más o lo mismo. La calidad de las tareas no bajó.
Las dos pruebas las hizo JetBrains: Claude Code, claude-sonnet-5, las 86 tareas de programación de SkillsBench, cada tarea ejecutada una vez con la herramienta y otra sin ella, y comparadas por pares. caveman se forzó en todas las respuestas, el mejor caso: los tokens de salida bajaron un 8,5 % (de 592k a 542k en 82 pares de tareas), y el coste, alrededor de un 10 %. rtk usó su instalación por defecto: con razonamiento bajo, la mediana del coste por tarea fue un 7,6 % mayor (80 pares, p=0.004); con razonamiento alto fue +0,1 % (p=0.99). Las cifras anunciadas son las que decían los dos README cuando se hicieron las pruebas, en julio de 2026.
Qué dice la documentación oficial
rtk advertised saving: 60–90%. Measured on real agent work: +7.6% more expensive at low reasoning effort (p=0.004), ±0% at high effort. Setup: Claude Code 2.1.201 · claude-sonnet-5 low and high efforts · SkillsBench. Task quality: unchanged in both arms, at both effort levels.Advertised saving: 65%. Measured saving: 8.5%. Output-token saving on real agentic tasks, with the skill forcibly activated. This is the ceiling, not the usual-case result.a tool's self-reported savings are a claim about its counterfactual, not about your bill. rtk's scoreboard said 96 million tokens saved while the invoice went up. If you evaluate any context-compression tool, measure the paired bill, not the tool's diff.On a Pro, Max, Team, or Enterprise plan, /usage also shows a breakdown of what counts against your plan limits: Attribution: recent usage attributed to skills, subagents, plugins, and individual MCP servers, each shown as a percentage of the total.Por qué el ahorro es pequeño
La parte que estas herramientas pueden comprimir ya es pequeña de entrada. Al programar, la mayor parte de la salida del agente es código, diffs y llamadas a herramientas, y caveman deja todo eso como está. Solo se acortan las breves explicaciones entre llamadas a herramientas.
Claude Code lee y busca archivos con sus propias herramientas Read y Grep, que no pasan por el hook de Bash que usa rtk. Alrededor de una quinta parte de lo que lee el modelo es salida de herramientas a la que rtk llega. JetBrains sitúa el mejor ahorro posible en alrededor del 3 % de la factura.
Si solo quieres filtrar la salida ruidosa de los comandos, la documentación de Claude Code ya incluye un ejemplo de hook que devuelve solo los fallos.
Qué dice la documentación oficial
Advertised savings come from chat-style prose answers. Agentic output is different: code, diffs, tool invocations, and exact error strings dominate the token stream, and Caveman correctly leaves all of it verbatim.Custom hooks can preprocess data before Claude sees it. Instead of Claude reading a 10,000-line log file to find errors, a hook can grep for ERROR and return only matching lines, reducing context from tens of thousands of tokens to hundreds.Qué dicen ahora los dos proyectos
Los dos README han cambiado desde las pruebas. rtk dice ahora que recorta hasta el 90 % de la salida de bash que lee el agente, y que eso no es lo mismo que recortar la factura un 90 %. caveman cita él mismo el resultado del 8,5 %, y desde entonces ha añadido un proxy que comprime la salida de herramientas; JetBrains no probó esa parte.
La compresión de las dos herramientas es real, y la calidad de las tareas se mantuvo en las dos pruebas. Lo que cambia es el tipo de trabajo y cómo se cuenta el ahorro.
Qué dice la documentación oficial
RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%.The JetBrains number is why the proxy exists. They measured the skill alone, in July 2026, before the proxy shipped.Errores frecuentes
- La herramienta dice que ahorró decenas de millones de tokens, así que la factura bajó otro tanto
No. En la tanda completa con razonamiento bajo, el contador de rtk dio 96,2 millones de tokens ahorrados mientras la factura de las mismas tareas subía. JetBrains da tres razones. Compara con la salida original completa, que Claude Code habría truncado de todos modos. Estima los tokens como caracteres divididos entre 4 cuando se ejecuta el comando, mientras que la mayor parte del coste de entrada de una sesión son relecturas a la tarifa de caché. Y el hook nunca ve la mayor parte del contexto.
- Instalas una skill para ahorrar tokens y el uso baja más de la mitad
No. El 65 % anunciado sale de respuestas tipo chat. Cuando un agente escribe código, la mayor parte de su salida es código, diffs y llamadas a herramientas, y estas skills no tocan eso. El máximo medido es un 8,5 % menos de tokens de salida con la skill forzada en todas las respuestas; el uso normal ahorra menos.
- Las pruebas midieron poco ahorro, así que estas herramientas son un timo
No. La calidad de las tareas se mantuvo en las dos pruebas y la compresión es real. El veredicto de JetBrains sobre rtk fue «Honest engineering, wrong counterfactual» (ingeniería honesta, referencia de comparación equivocada). Los dos README lo dicen ya: rtk distingue entre recortar la salida de bash y recortar la factura, y caveman cita la cifra del 8,5 %. La diferencia viene del tipo de trabajo y de cómo se cuenta el ahorro, no de que las herramientas sean falsas.
Consejos
- Antes de instalar nada, mira adónde van los tokens: en Claude Code ejecuta /usage (pulsa d o w para 24 horas o 7 días) y /context. Si la mayor parte se la llevan las sesiones largas o los subagentes, una herramienta que comprime la salida de comandos no ayudará.
- Para probar una herramienta, compara tu uso: unos días sin ella y unos días con ella, con trabajo parecido, en /usage (/usage weekly en Codex). No tomes el contador de la herramienta como resultado.
- No juzgues por una sola ejecución. En la prueba de rtk, repetir la misma tarea sin cambios movió la mediana del coste un 22 %. La primera tanda de caveman, con 10 tareas, dio un 29,5 % de ahorro; con 86 tareas fue un 8,5 %.
- Después de instalarla, vigila si hay turnos de más. En la prueba de rtk, las sesiones necesitaron un 13,8 % más de turnos y un 14,3 % más de lecturas de caché; ahí se fue el coste extra.
- Para filtrar solo la salida de tests y logs, la página de costes de Claude Code trae un ejemplo listo de hook PreToolUse que devuelve solo los fallos. No hace falta ninguna herramienta de terceros.
- Cada skill tiene su propio coste en cada turno: su descripción viaja siempre.
Anuncios de reinicio de Codex · Anuncios de reinicio de Claude