For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navigation principale

Optimisation des coûts

Gagnez en efficacité et réduisez vos coûts.

Il existe plusieurs façons de réduire les coûts d’utilisation des modèles OpenAI. Coût et latence sont généralement liés : réduire le nombre de tokens et de requêtes accélère souvent le traitement. L’API Batch d’OpenAI et le traitement Flex offrent d’autres moyens de réduire les coûts.

Coût et latence

Pour réduire la latence et les coûts, envisagez les stratégies suivantes :

  • Réduisez le nombre de requêtes : limitez le nombre de requêtes nécessaires pour accomplir les tâches.
  • Réduisez le nombre de tokens au minimum : diminuez le nombre de tokens d’entrée et optimisez les sorties du modèle pour qu’elles soient plus courtes.
  • Choisissez un modèle plus petit : utilisez des modèles qui concilient réduction des coûts et de la latence et maintien de la précision.

Pour approfondir ces stratégies, consultez notre guide sur l’optimisation de la latence.

API Batch

Exécutez des tâches de manière asynchrone. L’API Batch propose un ensemble de points de terminaison simples à utiliser pour regrouper des requêtes dans un seul fichier, lancer leur traitement par lots, consulter l’état du lot pendant l’exécution des requêtes, puis récupérer l’ensemble des résultats une fois le traitement terminé.

Bien démarrer avec l’API Batch →

Traitement Flex

Réduisez considérablement le coût des requêtes Chat Completions ou Responses en contrepartie de temps de réponse plus longs et d’une indisponibilité occasionnelle des ressources. Idéal pour les tâches hors production ou moins prioritaires, comme les évaluations de modèles, l’enrichissement de données ou les charges de travail asynchrones.

Bien démarrer avec le traitement Flex →