Le projet de l’IA dit « des performances plus élevées ». La question la plus importante est de vérifier si les conditions de comparaison sont alignées.

Voici un exemple de test hypothétique, qui ne correspond pas au projet actuel. Le projet A affirme traiter une image en 2 secondes, tandis que le projet B le fait en 1 seconde. A inclut tout : la lecture de l’image, la mise en file d’attente et la sortie complète, sur une carte graphique standard. B ne compte que le temps de génération du modèle, avec une carte graphique plus puissante et une requête unique après préchauffage. Les chiffres peuvent être vrais, mais on ne peut pas écrire que « B est plus performant », car les deux parties ne mesurent pas la même chose.

Pour que la comparaison soit valable, les prérequis doivent être identiques : le type de tâche, les échantillons d’entrée, le matériel, le niveau de concurrence et les points de départ/arrêt de la mesure. Il faut aussi vérifier si la qualité de la sortie est conforme : être plus rapide mais se tromper davantage n’a aucun sens si l’on ne regarde que la vitesse. S’il manque un élément, la conclusion ne peut être formulée que comme suit : « chacun a rapporté un résultat différent ; pour l’instant, une comparaison croisée n’est pas possible ».

Quand vous voyez de nouvelles notes, demandez au responsable du projet de confirmer le même jeu de tests, le même protocole de mesure et les mêmes indicateurs de qualité. Si vous ne l’obtenez pas, remplacez « plus performant » par « conditions non alignées, à vérifier ». Si, au départ, les deux parties réalisent des tâches différentes, une comparaison croisée n’est pas non plus valide ; il faut alors demander si elles atteignent toutes deux le même objectif.