Pour choisir le bon modèle, qu’il s’agisse de gpt-6-astra ou d’un modèle plus petit comme gpt-5.6-terra, vous devez trouver un équilibre entre précision, latence et coût. Ce guide présente les principes essentiels pour vous aider à faire des choix éclairés, accompagnés d’un exemple pratique.
Principes fondamentaux
Les principes de sélection d’un modèle sont simples :
- Optimisez d’abord la précision : améliorez la précision jusqu’à atteindre votre objectif.
- Optimisez ensuite le coût et la latence : cherchez à maintenir cette précision avec le modèle le moins cher et le plus rapide possible.
1. Privilégiez d’abord la précision
Commencez par définir un objectif de précision clair pour votre cas d’usage : déterminez le niveau « suffisamment bon » pour passer en production. Pour y parvenir, suivez ces étapes :
- Définissez un objectif de précision clair : choisissez la mesure de précision à utiliser et la valeur à atteindre.
- Par exemple, 90 % des appels au service client doivent être orientés correctement dès le premier échange.
- Constituez un jeu de données d’évaluation : créez un jeu de données permettant de mesurer les performances du modèle par rapport à ces objectifs.
- Pour reprendre l’exemple ci-dessus, recueillez 100 exemples d’interactions précisant la demande de l’utilisateur, l’orientation choisie par le LLM, l’orientation attendue et si le choix était correct ou non.
- Utilisez le modèle le plus puissant pour l’optimisation : commencez par le modèle le plus performant disponible pour atteindre vos objectifs de précision. Enregistrez toutes les réponses afin de pouvoir les utiliser pour la distillation d’un modèle plus petit.
- Utilisez la génération augmentée par récupération pour optimiser la précision
- Utilisez l’affinage pour optimiser la cohérence et le comportement
Au cours de ce processus, recueillez des paires de prompts et de réponses pour les utiliser dans des évaluations, l’apprentissage few-shot ou l’affinage. Cette pratique, appelée prompt baking, vous permet de produire des exemples de qualité pour une utilisation ultérieure.
Pour découvrir d’autres méthodes et outils, consultez notre guide d’optimisation de la précision.
Définissez un objectif de précision réaliste
Calculez un objectif de précision réaliste en évaluant l’impact financier des décisions du modèle. Par exemple, dans un scénario de classification de fausses informations :
- Article correctement classé : si le modèle classe correctement l’article, il vous épargne le coût d’une vérification humaine, estimé ici à 50 $.
- Article mal classé : si le modèle classe à tort un article fiable comme faux ou ne détecte pas un article contenant de fausses informations, cela peut déclencher une procédure de révision, voire une réclamation, ce qui pourrait nous coûter 300 $.
Dans notre exemple de classification d’articles, il faudrait une précision de 85,8 % pour couvrir les coûts. Viser 90 % ou plus garantit donc un retour sur investissement global. Utilisez ces calculs pour définir un objectif de précision adapté à votre propre structure de coûts.
2. Optimisez le coût et la latence
Le coût et la latence sont secondaires, car si le modèle n’atteint pas votre objectif de précision, ces considérations n’ont pas d’intérêt. Toutefois, une fois que vous disposez d’un modèle adapté à votre cas d’usage, vous pouvez suivre l’une de ces deux approches :
- Comparez avec un modèle plus petit en zero-shot ou en few-shot : remplacez le modèle par un modèle plus petit et moins cher, puis vérifiez s’il maintient la précision tout en réduisant le coût et la latence.
- Distillation du modèle : affinez un modèle plus petit à l’aide des données recueillies pendant l’optimisation de la précision.
Le coût et la latence sont généralement liés : réduire le nombre de tokens et de requêtes accélère habituellement le traitement.
Voici les principales stratégies à envisager :
- Réduisez les requêtes : limitez le nombre de requêtes nécessaires pour accomplir les tâches.
- Minimisez les tokens : réduisez le nombre de tokens d’entrée et optimisez les sorties du modèle pour qu’elles soient plus courtes.
- Choisissez un modèle plus petit : utilisez des modèles qui réduisent le coût et la latence tout en maintenant la précision.
Pour approfondir ces stratégies, consultez notre guide sur l’optimisation de la latence.
Exceptions à la règle
Ces principes comportent des exceptions évidentes. Si votre cas d’usage impose des contraintes très fortes de coût ou de latence, fixez des seuils pour ces mesures avant de commencer vos tests, puis écartez les modèles qui les dépassent. Une fois ces seuils définis, ces recommandations vous aideront à améliorer la précision du modèle dans le respect de vos contraintes.
Exemple pratique
Pour illustrer ces principes, nous allons développer un classificateur de fausses informations avec les objectifs ci-dessous. L’expérience suivante s’appuie sur des résultats historiques de la famille GPT-4o pour illustrer le workflow. Pour vos évaluations actuelles, commencez par gpt-6-astra et comparez ses résultats à ceux de modèles plus petits ou affinés.
- Précision : atteignez 90 % de classifications correctes
- Coût : dépensez moins de 5 $ pour 1 000 articles
- Latence : maintenez le temps de traitement sous 2 secondes par article
Expériences
Nous avons mené trois expériences pour atteindre notre objectif :
- Zero-shot : nous avons utilisé
GPT-4oavec un prompt simple sur 1 000 enregistrements, sans atteindre l’objectif de précision. - Apprentissage few-shot : nous avons inclus 5 exemples few-shot, ce qui a permis d’atteindre l’objectif de précision, mais a dépassé le budget en raison du nombre accru de tokens dans le prompt.
- Modèle affiné : nous avons affiné
GPT-4o-miniavec 1 000 exemples étiquetés, ce qui a permis d’atteindre tous les objectifs avec une latence et une précision similaires, mais des coûts nettement inférieurs.
| ID | Méthode | Précision | Objectif de précision | Coût | Objectif de coût | Latence moyenne | Objectif de latence |
|---|---|---|---|---|---|---|---|
| 1 | gpt-4o zero-shot | 84,5 % | 1,72 $ | < 1 s | |||
| 2 | gpt-4o few-shot (n=5) | 91,5 % | ✓ | 11,92 $ | < 1 s | ✓ | |
| 3 | gpt-4o-mini affiné avec 1 000 exemples | 91,5 % | ✓ | 0,21 $ | ✓ | < 1 s | ✓ |
Conclusion
En passant de gpt-4o à gpt-4o-mini avec un affinage, nous avons obtenu des performances équivalentes pour moins de 2 % du coût, avec seulement 1 000 exemples annotés.
Cette démarche est importante : vous ne pouvez souvent pas passer directement à l’affinage, car vous ne savez pas s’il convient à l’optimisation recherchée, ou vous ne disposez pas d’assez d’exemples annotés. Commencez par gpt-6-astra pour établir votre objectif de précision, puis testez des modèles plus petits ou affinés lorsque le coût et la latence entrent en jeu.