Skip to main content

Sélection du modèle

Choisir le bon modèle peut avoir un impact significatif sur le coût et la qualité.

Recommandations par type de tâche

Niveaux de coût

Optimisation des coûts

1. Utilisez d’abord des modèles plus petits

2. Définissez max_tokens

Définissez toujours une limite max_tokens raisonnable :

3. Optimisez les prompts

4. Regroupez les requêtes similaires

Optimisation des performances

5. Utilisez le streaming pour l’UX

Le streaming améliore les performances perçues :

6. Choisissez des modèles rapides pour un usage interactif

7. Définissez des timeouts

Fiabilité

8. Implémentez des retries

9. Gérez les erreurs proprement

10. Utilisez des modèles de secours

Sécurité

11. Protégez les clés API

12. Validez les entrées utilisateur

13. Définissez des limites pour les clés API

Créez des clés API distinctes avec des limites de dépenses pour :
  • Développement/tests
  • Production
  • Différentes applications

Surveillance

14. Suivez l’utilisation

Vérifiez régulièrement votre tableau de bord pour :
  • L’utilisation des token par modèle
  • La répartition des coûts
  • Les taux de succès du cache
  • Les taux d’erreur

15. Journalisez les métriques importantes

16. Configurez des alertes

Configurez des alertes de solde faible dans votre tableau de bord pour éviter toute interruption de service.

Liste de contrôle

  • Utilisation du modèle approprié pour chaque tâche
  • Définition de limites max_tokens
  • Prompts concis
  • Mise en cache activée lorsque pertinent
  • Regroupement des requêtes similaires
  • Streaming pour une UX interactive
  • Modèles rapides pour un usage en temps réel
  • Timeouts configurés
  • Logique de retry implémentée
  • Gestion des erreurs en place
  • Modèles de secours configurés
  • Clés API dans des variables d’environnement
  • Validation des entrées
  • Clés séparées pour dev/prod
  • Limites de dépenses définies