Il existe plusieurs façons de réduire les coûts d’utilisation des modèles OpenAI. Coût et latence sont généralement liés : réduire le nombre de tokens et de requêtes accélère souvent le traitement. L’API Batch d’OpenAI et le traitement Flex offrent d’autres moyens de réduire les coûts.
Coût et latence
Pour réduire la latence et les coûts, envisagez les stratégies suivantes :
- Réduisez le nombre de requêtes : limitez le nombre de requêtes nécessaires pour accomplir les tâches.
- Réduisez le nombre de tokens au minimum : diminuez le nombre de tokens d’entrée et optimisez les sorties du modèle pour qu’elles soient plus courtes.
- Choisissez un modèle plus petit : utilisez des modèles qui concilient réduction des coûts et de la latence et maintien de la précision.
Pour approfondir ces stratégies, consultez notre guide sur l’optimisation de la latence.
API Batch
Exécutez des tâches de manière asynchrone. L’API Batch propose un ensemble de points de terminaison simples à utiliser pour regrouper des requêtes dans un seul fichier, lancer leur traitement par lots, consulter l’état du lot pendant l’exécution des requêtes, puis récupérer l’ensemble des résultats une fois le traitement terminé.
Bien démarrer avec l’API Batch →
Traitement Flex
Réduisez considérablement le coût des requêtes Chat Completions ou Responses en contrepartie de temps de réponse plus longs et d’une indisponibilité occasionnelle des ressources. Idéal pour les tâches hors production ou moins prioritaires, comme les évaluations de modèles, l’enrichissement de données ou les charges de travail asynchrones.