# Cómo no desperdiciar la cuota de Claude Code

> **Qué es esto.** Las reglas de la casa para que una ventana de Claude cueste lo que
> tiene que costar. No son buenas prácticas copiadas de un blog: salen de **medir las
> 49 sesiones reales** de la Mac de Manuel entre el 1-jul y el 13-ago-2026.
>
> **Quién manda acá.** Igual que [`REGLAS-EQUIPO.md`](REGLAS-EQUIPO.md): estas reglas
> las reescriben Andrea o Manuel. El resto —programadores y agentes de Claude— las leen
> y las siguen. Y viven en el repo, no en la memoria de nadie: cada ventana carga su
> memoria al arrancar, así que un acuerdo nuevo nunca llega a las que ya están abiertas.
>
> **Si no programás, este documento no es para vos**: leé
> [`GUIA-CLAUDE-PARA-TODOS.md`](GUIA-CLAUDE-PARA-TODOS.md), que dice lo mismo en una
> página, sin nada técnico y sin pedirte abrir una terminal.

---

## 0. Lo único que hay que entender

**El costo no es lo que Claude escribe. Es cuántas veces relee lo que ya había.**

Cada vez que le mandás un mensaje, Claude **vuelve a leer toda la conversación entera**
para poder contestar. No la recuerda: la relee. Una sesión con 500.000 tokens de
contexto paga esos 500.000 tokens **en cada mensaje**, aunque le hayas escrito «sí».

Eso es el 76% de la factura:

| De qué está hecho el gasto | Equivalente | |
|---|---:|---:|
| Releer el contexto ya cargado | $43.668 | **75,7%** |
| Escribirlo al caché la primera vez | $8.220 | 14,2% |
| **Lo que Claude escribe** (sus respuestas y su código) | $5.795 | **10,0%** |
| Lo que vos escribís | $5 | 0,0% |

Todo lo demás de este documento son consecuencias de esa tabla.

> Las 49 sesiones metieron **29 millones** de tokens de contenido nuevo (archivos leídos,
> salidas de comandos, respuestas). Se pagaron **29 mil millones**. Cada token entró una
> vez y se releyó unas mil veces.

---

## 1. LEY: `/clear` al cambiar de tarea

**Al terminar un tiquete, `/clear`. Al empezar otro, `/clear`.** No «cuando se ponga
lenta»: al cambiar de tema, aunque la ventana lleve diez minutos.

Lo que cuesta la misma petición según cuánto contexto arrastre:

| Contexto acumulado | Costo por petición | Cuánto del gasto total se fue ahí |
|---|---:|---:|
| 0 – 100k | **$0,16** | 1,9% |
| 100 – 200k | $0,23 | 5,7% |
| 200 – 300k | $0,33 | 7,9% |
| 300 – 400k | $0,45 | 9,6% |
| 400 – 500k | $0,53 | 11,4% |
| 500 – 600k | $0,60 | 11,2% |
| 700 – 800k | $0,78 | 13,0% |
| 900k – 1M | **$1,24** | 12,4% |

**Ocho veces más cara, por el mismo trabajo.** Y el 56% de todo el gasto ocurrió por
encima de los 500k — la zona donde la ventana ya debería haberse limpiado hace rato.

**El umbral duro es 250k.** Simulando las mismas 49 sesiones, con el mismo trabajo hecho,
pero limpiando antes de pasar de 250k: **$35.153 en vez de $57.713. Se ahorra el 39%.**

> ⚠️ **Y no es que haya habido una sesión mala.** Las doce sesiones más caras tienen un
> contexto medio de **entre 417k y 517k**. Todas. Vivir a medio millón de tokens es el
> estado normal de una ventana que nadie limpia, no un accidente.

**Cómo se ve cuando está mal hecho:** una sesión con 20.977 peticiones que arrancó el
1-jul y se cerró el 25-jul. Veinticuatro días de tareas distintas apiladas, y cada
mensaje del día 24 pagando por lo que se leyó el día 1.

---

## 2. Sonnet por defecto; Opus cuando hay que pensar

**Opus cuesta $0,89 por petición. Sonnet cuesta $0,18. Cinco veces.**

En lo medido: 51.539 peticiones en Sonnet costaron $9.183 — menos que **una sola sesión**
de Opus de 8.418 peticiones, que costó $9.039.

| Con Sonnet | Con Opus |
|---|---|
| Aplicar un arreglo ya decidido | Diseñar cómo se arregla algo que todavía no se entiende |
| Cambios repetitivos en muchos archivos | Depurar un bug que no se reproduce |
| Buscar dónde está algo | Decidir arquitectura o migración |
| Escribir pruebas, documentación, changelog | Revisar un PR buscando qué está mal |
| Consultas y reportes rutinarios | Cuando Sonnet ya se equivocó dos veces |

Se cambia con `/model` en cualquier momento, incluso a mitad de la tarea: pensá con Opus,
ejecutá con Sonnet.

---

## 3. Lo que entra al contexto, se paga mil veces

De los tokens que entran a una ventana, **el 74% los mete `Read`** — casi 4.000 tokens
por llamada. Bash mete el 23%.

| No | Sí |
|---|---|
| Leer un archivo de 3.000 líneas entero | `grep` primero, después leer sólo el pedazo |
| `cat archivo.log` | `tail -50 archivo.log` |
| Volver a leer el archivo para «verificar» lo que acabás de editar | Si la edición falló, la herramienta ya te lo dijo |
| Un `ssh servidor "comando que escupe todo"` | Acotar la salida **en el servidor**, antes de que viaje |
| Pegar un volcado enorme en el chat | Guardarlo en un archivo y leer sólo lo que hace falta |

Por Bash, los que más pesaron: `cd` con comandos encadenados (2,3M de tokens), `ssh`
(1,2M), `grep` sin acotar (680k), `cat` (302k).

**Para búsquedas amplias, usar un subagente.** El subagente lee veinte archivos en su
propio contexto y te devuelve la conclusión: 1.518 tokens en vez de los 80.000 que
costaría leerlos en la ventana principal. Se pide así: *«usá un subagente para buscar…»*.

---

## 4. Una ventana, un tema

Trabajar con 4-5 ventanas abiertas **está bien y es más barato** —siempre que cada una
tenga su tema y su contexto chico—. Lo caro es una sola ventana que sirve para todo.

- Cada ventana, en su worktree y en su tiquete (ver la skill `trabajo-en-repos`).
- Ventana que ya cumplió su tiquete: se cierra. No se recicla «por si acaso».
- Si volvés a un tema viejo, es más barato `/clear` y volver a explicar en tres líneas
  que arrastrar el historial completo de la vez pasada.

---

## 5. No es acá donde se ahorra

Para que nadie pierda el tiempo optimizando lo que no pesa:

- **`CLAUDE.md` y la memoria pesan ~10.000 tokens** sobre una petición media de 481.000.
  El 2%. Recortarlos ayuda y es gratis, pero **no es el problema**.
- **Lo que vos escribís es el 0,0% de la factura.** Escribí largo, escribí con detalle,
  poné todo el contexto de una vez. Un pedido bien explicado que evita tres idas y
  vueltas ahorra tres peticiones a $0,89.
- **Rehacer no es caro; equivocarse sí.** Pedir una verificación extra o un subagente
  que confirme cuesta centavos comparado con un despliegue mal hecho.

---

## 6. Cómo saber en qué se te está yendo

- **`/usage` en tu propia máquina**: qué consumiste y en qué. Es el único lugar donde
  sale el «en qué».
- **Panel de la organización** (Ajustes → Uso): el «cuánto» por persona, para todo el
  equipo. No dice en qué.
- **El aviso automático**: al pasar de 250k de contexto, la ventana te avisa sola. Está
  en [`herramientas/claude-costo/`](herramientas/claude-costo/) y se instala con el
  guion de ahí. No depende de que nadie se acuerde.

---

## Resumen para pegar en la pared

1. **`/clear` al cambiar de tarea.** Y siempre antes de los 250k. (−39%)
2. **Sonnet por defecto**, Opus para pensar. (−80% en lo que se pueda mover)
3. **Nada entra entero al contexto**: `grep` antes de `Read`, `tail` antes de `cat`.
4. **Subagente** para buscar en muchos archivos.
5. **Una ventana, un tiquete.** Al cerrar el tiquete, se cierra la ventana.
6. **Escribí largo**: tus mensajes no cuestan nada; las idas y vueltas sí.

---

> **Cómo se midió.** Las transcripciones de Claude Code viven en
> `~/.claude/projects/*/*.jsonl` y cada respuesta trae su consumo exacto
> (`input_tokens`, `output_tokens`, `cache_creation_input_tokens`,
> `cache_read_input_tokens`). Se sumaron las 49 sesiones locales del 1-jul al
> 13-ago-2026 y se valoraron con la tarifa pública de la API. El guion está en
> [`herramientas/claude-costo/medir-consumo.py`](herramientas/claude-costo/medir-consumo.py)
> y se puede volver a correr cuando se quiera.
>
> **Sobre los pesos en dólares.** El equipo no paga por token: paga un plan. Esos $57.679
> son el **equivalente en tarifa de API**, y sirven para comparar una práctica contra otra
> — que es de lo que se trata—. Lo que se agota en la vida real es la cuota, y se agota en
> la misma proporción.
>
> Escrito el 13-ago-2026, después de que Manuel pidiera un proyecto de buenas prácticas
> para bajar el costo. La primera medición desarmó el supuesto de partida: nadie estaba
> gastando de más por escribir mucho ni por tener el `CLAUDE.md` largo. Se gastaba por
> dejar las ventanas abiertas.
