Aller au contenu
Chapitre 04 · 8 min

API & Console : 3 leviers de coût

Ces réglages vivent dans le code ou dans la Console Anthropic, et l'article les qualifie de plus impactants sur les coûts de tout l'ensemble. Bien utilisés, chacun peut changer une facture de façon substantielle ; les montants en dollars ci-dessous sont ceux de l'auteur, pas les nôtres.

Payez pour imprimer une page une fois et photocopiez-la pour un dixième du prix, ou retapez-la de zéro à chaque fois. Le cache, c'est la photocopieuse.

manageskeepsThe consoleKeys + limitsSpend in check
The API console manages keys, rate limits, and spend.

16. Les points de rupture cache_control : où les placer

Où : le champ cache_control sur un bloc de contenu dans la requête API. Ce que ça fait : marque un préfixe de votre prompt comme cachable ; les requêtes suivantes avec le même préfixe sont facturées à une fraction du tarif d'entrée. Pourquoi ça compte : c'est le plus gros levier de coût de l'API, et la plupart des gens placent le point de rupture au mauvais endroit et n'obtiennent que des économies partielles. L'article rapporte une facture de 340 $/mois tombée à 87 $ après correction du point de rupture.

Le point de rupture se place à la frontière entre contenu statique et contenu dynamique : tout ce qui précède est mis en cache, tout ce qui suit est recalculé. Placez-le après votre system prompt stable / vos outils / votre long contexte, avant l'entrée utilisateur propre à chaque requête.

pythonCopier le prompt
messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "text",
                "text": LONG_STABLE_CONTEXT,
                "cache_control": {"type": "ephemeral"},  # cache the prefix
            },
            {"type": "text", "text": per_request_question},  # recomputed
        ],
    }
]

Deux TTL sont couramment disponibles : un défaut éphémère court et un plus long pour les system prompts qui ne changent pas entre les sessions. Comme règle empirique, l'article donne : un préfixe mis en cache est rentabilisé dès qu'il est relu deux fois ou plus dans la fenêtre du TTL. (Confirmez les multiplicateurs d'écriture/lecture du cache et les TTL actuels dans la documentation de l'API.)

17. inference_geo et la taxe de résidence des données

Où : l'article décrit un paramètre de requête qui route l'inférence vers une région précise (US uniquement, UE uniquement, etc.). Pourquoi ça compte : il rapporte que la résidence régionale ajoute un surcoût qui n'apparaît pas sur la grille tarifaire standard ; vous le voyez sur la facture.

18. Limites de débit par workspace et par fonctionnalité

Où : Console → Settings → Workspaces → votre workspace → rate limits. Ce que ça fait : définit une limite de débit par workspace (et, note l'article, par fonctionnalité au sein d'un workspace), distincte de vos limites au niveau du compte. Pourquoi ça compte : une limite de compte vous évite la ruine ; une limite de workspace empêche un job batch emballé de dévorer l'allocation dont votre chat client a besoin et de renvoyer des 429.

  • Créez un workspace par surface : chat interactif, traitement batch, outils internes, expérimental.
  • Réglez la limite de chaque workspace à environ 60 à 70 % de votre palier de compte, en laissant de la marge pour celui qui doit monter en charge.
  • Fixez des plafonds par fonctionnalité dans un workspace pour tout ce qui fait du batch ; l'article note un plafond au niveau fonctionnalité qui est illimité par défaut et facile à rater.

En une ligne chacun

  • cache_control est le plus gros levier de coût de l'API : placez le point de rupture à la frontière statique/dynamique pour que le préfixe stable soit mis en cache.
  • Un préfixe mis en cache est rentabilisé dès qu'il est relu 2 fois ou plus dans le TTL ; utilisez le TTL long pour les system prompts qui ne changent pas.
  • La résidence régionale peut ajouter un surcoût ; vérifiez que l'exigence est réelle avant d'épingler une région (nom du paramètre non vérifié).
  • Isolez les surfaces dans des workspaces et fixez des plafonds par fonctionnalité pour qu'un job batch ne puisse pas affamer le trafic interactif.
API & Console : 3 leviers de coût · Cours d'IA · SDEN