Exercice 12 / 18

Évaluer et améliorer ses prompts

Tests, itération, métriques

Un prompt n'est jamais « fini ». Pour des cas d'usage réels, il faut mesurer sa qualité et l'améliorer par itérations.

1. Définir le succès

Avant d'optimiser, clarifie ce que tu veux :

  • Exactitude : la réponse est-elle factuelle ?
  • Format : respecte-t-elle la structure demandée ?
  • Pertinence : répond-elle à la question ?
  • Ton/style : correspond-il à la marque ?
  • Concision : pas de blabla inutile ?

2. Constituer un jeu de tests

Crée un petit dataset de 10 à 50 entrées représentatives :

  • Cas faciles (golden path)
  • Cas limites (ambigus, vides, trop longs)
  • Cas pièges (questions hors-sujet, prompts injection)

Pour chaque entrée, défini la sortie attendue ou les critères de qualité.

3. Comparer plusieurs variantes

Pour améliorer un prompt :

  1. Note la version actuelle (V1).
  2. Crée une variante (V2) avec un changement précis (ex : ajouter un exemple).
  3. Lance les deux sur le jeu de tests.
  4. Compare les sorties (manuellement ou avec un LLM juge).
  5. Garde la meilleure, recommence.
La boucle d'amélioration d'un prompt : noter la version en place, en créer une variante, lancer les deux sur le jeu de tests, comparer les sorties, garder la meilleure et recommencer

C'est l'A/B testing des prompts.

4. LLM-as-judge

Utiliser un LLM pour noter les sorties d'un autre LLM. Pratique pour scaler l'évaluation.

Prompt juge :

Note cette réponse sur 10 selon : exactitude (4 pts), clarté (3 pts), format (3 pts). Donne aussi un commentaire court.

Limites : un LLM juge peut avoir ses propres biais. Toujours vérifier sur un échantillon humain.

5. Métriques courantes

  • Accuracy : % de bonnes réponses (pour classification)
  • BLEU / ROUGE : similarité texte (pour résumés, traductions)
  • Custom rubric : grille de critères pondérés
  • Win rate : préférence humaine entre 2 versions

6. Outils

  • PromptFoo, Langfuse, Arize : plateformes d'éval
  • OpenAI Evals, Anthropic Workbench : intégrés aux APIs
  • Spreadsheets : suffit pour démarrer

7. Bonnes pratiques

  • Versionne tes prompts (git, base de données)
  • Trace chaque appel en prod (input, output, latence, coût)
  • Re-teste quand tu changes de modèle (un prompt optimisé pour GPT-4 peut être moins bon pour Claude)
  • Itère par petits pas : un seul changement à la fois pour identifier ce qui aide
✏️ Exercice

Tu veux comparer 2 versions d'un prompt qui résume un article de presse.

V1 = court : « Résume cet article. » V2 = détaillé : « Résume en 5 puces de 1 phrase, en mentionnant idée principale, 3 arguments clés, conclusion. »

Décris la méthode d'évaluation que tu utiliserais (jeu de tests, critères, scoring) pour décider laquelle est meilleure.

Envie d'aller plus loin ? Découvrez nos formations certifiées Bac+2 à Bac+5 →