Vai al contenuto
Capitolo 04 · 8 min

API e Console: 3 leve di costo

Queste vivono nel codice o nella Console di Anthropic, e l'articolo le definisce le impostazioni a maggiore impatto sui costi dell'intero pezzo. Usate bene, ognuna può cambiare il conto in modo sostanziale; le cifre in dollari qui sotto sono dell'autore, non nostre.

Paga per stampare una pagina una volta e fotocopiala a un decimo del costo, oppure ribattila da zero ogni volta. Il caching è la fotocopiatrice.

manageskeepsThe consoleKeys + limitsSpend in check
The API console manages keys, rate limits, and spend.

16. Breakpoint di cache_control: dove metterli

Dove: il campo cache_control su un blocco di contenuto nella richiesta API. Cosa fa: marca un prefisso del tuo prompt come cacheabile; le richieste successive con lo stesso prefisso vengono fatturate a una frazione della tariffa di input. Perché conta: è la singola leva di costo più grande dell'API, e la maggior parte delle persone posiziona male il breakpoint ottenendo risparmi parziali. L'articolo riporta un conto da 340 $/mese sceso a 87 $ dopo aver corretto il breakpoint.

Il breakpoint va al confine tra contenuto statico e dinamico: tutto ciò che sta prima viene messo in cache, tutto ciò che sta dopo viene ricalcolato. Mettilo dopo il tuo system prompt stabile / i tool / il contesto lungo, e prima dell'input utente specifico della richiesta.

pythonCopia il prompt
messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "text",
                "text": LONG_STABLE_CONTEXT,
                "cache_control": {"type": "ephemeral"},  # cache the prefix
            },
            {"type": "text", "text": per_request_question},  # recomputed
        ],
    }
]

Sono comunemente disponibili due TTL: un default effimero corto e uno più lungo per i system prompt che non cambiano tra le sessioni. Come regola pratica l'articolo indica: un prefisso in cache si ripaga quando lo leggi due o più volte dentro la finestra del TTL. (Verifica i moltiplicatori correnti di scrittura/lettura della cache e i TTL nella documentazione API.)

17. inference_geo e la tassa sulla residenza dei dati

Dove: l'articolo descrive un parametro di richiesta che instrada l'inferenza verso una regione specifica (solo US, solo EU, ecc.). Perché conta: riporta che la residenza regionale aggiunge un sovrapprezzo che non compare sul listino standard; lo vedi in fattura.

18. Workspace e rate limit per funzionalità

Dove: Console → Settings → Workspaces → il tuo workspace → rate limits. Cosa fa: imposta un rate limit per workspace (e, nota l'articolo, per funzionalità dentro un workspace), separato dai limiti a livello di account. Perché conta: un limite di account ti evita la bancarotta; un limite di workspace evita che un job batch impazzito si mangi la quota che serve alla tua chat rivolta ai clienti restituendo 429.

  • Crea un workspace per superficie: chat interattiva, elaborazione batch, strumenti interni, sperimentale.
  • Imposta il limite di ogni workspace a circa il 60-70% del tuo tier di account, lasciando margine a chi ha bisogno di picchi.
  • Imposta tetti per funzionalità dentro un workspace per tutto ciò che fa lavoro batch; l'articolo segnala un tetto a livello di funzionalità che di default è illimitato e facile da mancare.

Una riga per ciascuno

  • cache_control è la leva di costo più grande dell'API: metti il breakpoint al confine statico/dinamico così il prefisso stabile finisce in cache.
  • Un prefisso in cache si ripaga quando viene letto 2 o più volte dentro il TTL; usa il TTL più lungo per i system prompt che non cambiano.
  • La residenza regionale può aggiungere un sovrapprezzo; verifica che il requisito sia reale prima di vincolare una regione (nome del parametro non verificato).
  • Isola le superfici in workspace e imposta tetti per funzionalità, così un job batch non può affamare il traffico interattivo.
API e Console: 3 leve di costo · Cours d'IA · SDEN