Nouveau — Baromètre SSA 2026 : où en sont vraiment les grands comptes européens sur l'IA ? Télécharger l'étude

AccueilMéthode

Méthode · Juin 2026

Évaluer un agent avant de le mettre en production

La grille d'évaluation s'écrit avant la première ligne de code. Écrite après, elle décrit ce que le système fait déjà — ce qui n'est pas une évaluation.

Un prototype d'agent se fabrique en quelques jours. C'est devenu la partie facile, et c'est ce qui rend la démonstration si trompeuse : ce qu'on montre en réunion est un système qui a réussi les trois exemples qu'on lui a soumis.

L'évaluation répond à une autre question : sur trente occurrences représentatives, dont les cas tordus, à quelle fréquence le système se trompe, de quelle manière, et est-ce que cette manière est acceptable pour le métier concerné ?

Pourquoi l'ordre compte

Une grille écrite après le développement décrit le système tel qu'il est. Les critères s'alignent inconsciemment sur ce qui fonctionne déjà, les cas limites qui échouent deviennent « hors périmètre », et le seuil de réussite se fixe juste en dessous du résultat obtenu. Personne ne triche : c'est un biais mécanique, et il est très difficile à éviter une fois qu'on a le résultat sous les yeux.

Écrite avant, la grille engage. Elle oblige à formuler ce qu'on considérerait comme un échec, et cette formulation est souvent la partie la plus instructive de tout le projet — c'est là qu'on découvre que deux directions n'attendaient pas la même chose.

Ce qu'elle contient

Quatre éléments, et rien de plus : les critères d'évaluation, formulés en langage métier plutôt qu'en métrique technique ; le seuil de réussite par critère, chiffré ; les cas limites que le système doit traiter correctement, listés nommément ; et la ligne de base humaine, mesurée sur le même échantillon.

La ligne de base humaine est celle qu'on saute le plus souvent, et c'est la plus importante. Sans elle, un taux d'exactitude de 87 % ne veut rien dire : il faut savoir si l'équipe qui fait le travail aujourd'hui est à 95 % ou à 72 %.

La câbler dans l'intégration continue

Une grille qui vit dans un tableur meurt avec le projet. Câblée dans votre intégration continue, elle continue de tourner à chaque changement de modèle, de prompt ou de source de données — c'est-à-dire exactement aux moments où un système se dégrade sans que personne ne s'en aperçoive.

C'est aussi ce qui permet à vos équipes de reprendre le système après notre départ sans perdre la mesure. Une passation qui ne transfère pas la capacité à mesurer ne transfère rien du tout.


Toutes nos ressources

Parlons de votre prochaine décision IA.

45 minutes avec un associé. Vous repartez avec une lecture claire de votre maturité et deux cas d'usage prioritaires.