Wiki de uso: cuándo se reinician los límites y cómo ahorrar tokens

Cuándo se reinician los límites y cómo hacer que duren más. Consulta por temas, con respuestas separadas para Codex y Claude, basadas en la documentación oficial, con citas y enlaces.

¿Cómo ahorrar tokens en Claude Code y Codex?

Tres cosas gastan la mayoría de los tokens: una sesión que lleva horas abierta, los subagentes y el contenido fijo que viaja en cada turno (CLAUDE.md o AGENTS.md, servidores MCP, descripciones de skills). Empieza por tres pasos: limpia el chat al cambiar de tarea, deja el nivel de razonamiento en medium (el predeterminado en Codex; /effort medium en Claude Code) y da un modelo más pequeño a los subagentes sencillos. El límite de 5 horas y el semanal se miden en tokens.

Codex

Abre un chat nuevo para cada tarea, usa el razonamiento medium en el día a día, deja el trabajo rutinario a un modelo más pequeño y apaga los servidores MCP que no uses.

El uso de Codex depende del tamaño del contexto, el modelo, el nivel de razonamiento y las llamadas a herramientas, así que ahorrar tokens es recortar un poco de cada uno. Usa /new (o /clear) al cambiar de tarea y /compact cuando una tarea se ha alargado; /status muestra el uso de tokens y cuánto contexto queda. Elige el modelo y el nivel de razonamiento en /model: medium para el trabajo diario, más alto solo para problemas difíciles, y GPT-5.6 Terra o Luna para tareas rutinarias, lo que según OpenAI puede hacer que tus límites duren más. Fast mode gasta el límite más rápido, así que apágalo con /fast cuando vayas justo. Mantén AGENTS.md corto y desactiva los servidores MCP que no uses: los dos viajan en cada mensaje.

Qué dice la documentación oficial

Different models can use different amounts of your allowance for the same task. Larger inputs and outputs, higher reasoning settings, Fast mode and tasks with multiple steps can also increase usage.
OpenAI Help Center · Managing usage with GPT-6 Astra in Work and Codex
Higher effort can use more of your allowance and does not always produce a better result.
OpenAI Help Center · Managing usage with GPT-6 Astra in Work and Codex
Limit the number of MCP servers you use. Every MCP server adds more context to your messages and uses more of your limit. Disable MCP servers when you don't need them.
OpenAI Developers · Codex pricing
Switch to a smaller model for routine tasks. Using GPT-5.6 Terra or GPT-5.6 Luna can extend your local-message usage limits, depending on the model you switch from.
OpenAI Developers · Codex pricing
Reduce the size of your AGENTS.md. If you work on a larger project, you can control how much context you inject through AGENTS.md files by nesting them within your repository.
OpenAI Developers · Codex pricing

Claude

Abre primero /usage y mira qué señala. Sesión larga: /clear. Subagentes: un modelo más pequeño. Contenido fijo: recórtalo.

Con suscripción, /usage en Claude Code atribuye el uso reciente a skills, subagentes, plugins y cada servidor MCP, y señala cualquier comportamiento que suponga el 10 % o más, cada uno con un consejo; pulsa d o w para cambiar entre 24 horas y 7 días. Dos de sus consejos, citados del panel de /usage. Uno dice que las sesiones largas son más caras incluso con caché, que uses /compact a mitad de tarea y /clear al cambiar de tarea: "Longer sessions are more expensive even when cached. /compact mid-task, /clear when switching to new tasks." El otro dice que cada subagente hace sus propias peticiones, que no los lances a la ligera y que pienses en un modelo más barato para los sencillos: "Each subagent runs its own requests. Be deliberate about spawning them — and consider configuring a cheaper model for simpler subagents." Por tanto: /clear entre tareas y /compact solo a mitad de una; usa Sonnet en el día a día y /effort medium (el valor predeterminado es high), y pasa a un modelo mayor o a más effort solo para problemas difíciles; escribe model: haiku en los subagentes sencillos; ejecuta /context para ver cuánto ocupa el contenido fijo, y mantén CLAUDE.md por debajo de 200 líneas. El panel hace una estimación a partir del historial de sesiones de este equipo, así que no incluye otros dispositivos ni claude.ai.

Qué dice la documentación oficial

On a Pro, Max, Team, or Enterprise plan, /usage also shows a breakdown of what counts against your plan limits: Attribution: recent usage attributed to skills, subagents, plugins, and individual MCP servers, each shown as a percentage of the total.
Claude Code docs · Manage costs effectively
Use /clear to start fresh when switching to unrelated work. Stale context wastes tokens on every subsequent message.
Claude Code docs · Manage costs effectively
Sonnet handles most coding tasks well and costs less than Opus. Reserve Opus for complex architectural decisions or multi-step reasoning.
Claude Code docs · Manage costs effectively

Errores frecuentes

  • Instalas una skill o herramienta para ahorrar tokens y el uso baja más de la mitad

    No baja tanto. Estas herramientas anuncian entre un 60 % y un 90 %. En pruebas por pares de JetBrains, medidas sobre la factura, rtk costó un 7,6 % más por tarea con razonamiento bajo y no cambió nada con razonamiento alto, y caveman ahorró alrededor de un 8,5 % frente al 65 % anunciado. Mira en /usage y /context adónde van tus tokens antes de instalar nada.

  • Si mis tokens se agotan rápido, es que hago algo mal

    No siempre. A veces la culpa es de la plataforma, y nada de lo que cambies servirá. En su informe del 2026-04-23, Anthropic atribuyó a un fallo de caché de Claude Code los avisos de que los límites de uso se agotaban más rápido de lo esperado, y reinició los límites de uso de todos los suscriptores. Mira en el registro de reinicios de este sitio si hay un anuncio reciente, y después revisa tus hábitos.

  • Los prompts en inglés gastan menos tokens

    Ninguna fuente oficial lo dice. Los dos proveedores citan el tamaño del contexto, el modelo, el nivel de razonamiento y las llamadas a herramientas como lo que determina el uso; el idioma del prompt no está en ninguna de las dos listas. Las partidas grandes son las sesiones largas y los subagentes, así que recorta eso primero.

Empieza por aquí

  • Limpia el chat al cambiar de tarea: /clear en Claude Code, /new en Codex. Si la conversación antigua se queda, cada mensaje posterior vuelve a pagar por ella.
  • Deja el nivel de razonamiento en medium. Es el predeterminado en Codex; en Claude Code el predeterminado es high, así que escribe /effort medium. Súbelo solo para problemas difíciles: un nivel más alto es más lento, gasta más y no siempre da un resultado mejor.
  • Da un modelo más pequeño a los subagentes sencillos: model: haiku al principio del archivo del subagente en Claude Code, default_subagent_model en [agents] en el config.toml de Codex.
  • Usa /compact solo cuando una tarea va por la mitad y el contexto ha crecido demasiado. Es en sí una petición grande, no una limpieza rutinaria.
  • Ejecuta /context en Claude Code o /status en Codex para ver qué está llenando el contexto.
  • Mantén CLAUDE.md por debajo de 200 líneas y AGENTS.md igual de corto. Pasa los procedimientos de tareas concretas a skills, que solo se cargan cuando se usan.
  • Desactiva los servidores MCP y desinstala los plugins que no uses. Ocupan sitio en cada turno.
  • Escribe prompts concretos que nombren el archivo y la función, como «arregla la función login de auth.ts». «Mejora este código» hace que el agente lea de forma muy amplia.
  • ¿Sigue sin bastar? Mira cuánto falta para tu próximo reinicio antes de decidir si esperas.

Anuncios de reinicio de Codex · Anuncios de reinicio de Claude