Prestation
Audit IA
Un audit IA établit si un système d’intelligence artificielle peut être mis en production, et ce qui l’en empêche. Il porte sur cinq couches — le corpus, la récupération, le prompt, le périmètre d’action et les coûts — et se conclut par un rapport qui nomme chaque défaut, sa cause et sa correction.
Pourquoi un système d’IA déçoit-il en production ?
Neuf fois sur dix, la mauvaise réponse d’un système d’IA ne vient pas du modèle mais de ce qu’on lui a donné à lire. Le modèle est la couche la plus visible et la moins souvent en cause.
Le test qui tranche prend dix minutes : prenez cinq réponses fausses et vérifiez, pour chacune, si l’information correcte figurait dans le contexte transmis. Si elle n’y était pas, aucun changement de modèle ne corrigera quoi que ce soit — le travail est en amont, dans le corpus ou dans la récupération.
C’est la raison pour laquelle un audit commence par le corpus et ne regarde le prompt qu’en troisième position. L’ordre inverse — le réflexe le plus courant — produit un cycle où l’on corrige un cas en en cassant deux autres. Le détail de la méthode figure dans reprendre un système construit par quelqu’un d’autre.
Que vérifie l’audit, couche par couche ?
L’audit examine cinq couches, dans cet ordre : corpus, récupération, prompt, périmètre, coûts. L’ordre n’est pas indifférent — un défaut amont masque systématiquement les gains obtenus en aval.
| Couche | Ce qui est vérifié | Défaut le plus fréquent |
|---|---|---|
| Corpus | Volume réel, fraîcheur, versions concurrentes, source faisant autorité, droits d’accès | Trois versions d’une procédure, aucune datée, aucune désignée comme valide |
| Récupération | Le bon document remonte-t-il ? Découpage, recherche des références exactes, filtrage des droits | Les droits filtrés après la recherche, ce qui n’est pas une protection |
| Prompt | Règles contradictoires, consignes ajoutées après incident, comportement en cas de doute | Une règle qui compense un défaut de récupération et fabrique des réponses hors sujet |
| Périmètre | Actions autorisées, réversibilité, point d’arrêt humain, journalisation | Personne n’a accepté de répondre des actions du système |
| Coûts | Coût par appel et par fonctionnalité, contexte envoyé, dispersion, plafonds | Trois appels expliquent plus de la moitié de la facture, et personne ne le sait |
Chaque constat est étayé par une mesure, pas par une impression : taux d’erreur sur un jeu de cas réels, nombre de jetons par requête, part des questions dont le bon document n’a jamais été récupéré.
Comment vérifier l’auditabilité d’une réponse IA ?
Une réponse est auditable lorsque l’on peut retrouver les éléments qui permettent de la contrôler : la demande, les sources accessibles, la configuration du système, les actions proposées et la décision prise. Une réponse plausible accompagnée d’un lien ne suffit pas si ce lien ne soutient pas l’affirmation.
Pour un cas donné, vérifiez cinq preuves : l’identité et les droits utilisés lors de la recherche ; la version et le passage du document retenu ; la version du modèle et de la configuration ; les appels d’outils proposés, bloqués ou exécutés ; enfin la validation humaine quand elle est requise. Conservez des identifiants de référence et des traces proportionnées, plutôt qu’une copie générale de toutes les données sensibles.
Rejouer un cas sert à comparer des comportements : un modèle non déterministe peut produire une formulation différente. Le contrôle doit porter sur les faits, les permissions et les effets autorisés. Les ressources pour construire un jeu de tests et évaluer un agent sur huit cas synthétiques donnent un point de départ.
La conformité est-elle couverte ?
Oui, sur trois points : la catégorie de risque du système au sens du règlement européen, la documentation exigible, et le dispositif de supervision humaine.
Le cadrage commence par les pratiques interdites de l’article 5, en tenant compte de leurs conditions et exceptions. L’inférence d’émotions au travail est par exemple interdite sauf pour des raisons médicales ou de sécurité. La qualification dépend du fonctionnement, des données utilisées et de la finalité : une simple étiquette « analyse de sentiment » ne permet pas de conclure. Les exigences sont ensuite examinées selon la catégorie du système et votre rôle dans sa chaîne de valeur.
Pour le reste, l’audit établit ce qu’il faut réclamer au fournisseur du modèle et ce que vous devez produire vous-même — une distinction rarement faite, et qui décide de la faisabilité du dossier. Voir ce que l’ingénieur doit livrer et écrire la fiche d’un système d’IA. Les références sont les articles 5, 43 et 50 du règlement européen sur l’intelligence artificielle.
Que recevez-vous à la fin ?
Trois livrables : un rapport de constats mesurés, un jeu de tests constitué sur vos cas réels, et un plan de correction classé par rapport effort-bénéfice.
- Le rapport — un constat par couche, la mesure qui l’étaye, la cause et la correction. Pas de recommandation générique : chaque point renvoie à une observation sur votre système.
- Le jeu de tests — trente cas réels avec la réponse attendue, dont un tiers de cas limites tirés de vos échecs observés. Il reste chez vous et sert à chaque changement de modèle, deux à trois fois par an. Voir construire un jeu de tests en une journée.
- Le plan de correction — ce qui se règle en une journée, ce qui demande une semaine, ce qui relève d’une décision d’organisation et non d’ingénierie.
Une conclusion possible : ne pas continuer
Un cas d’usage sans corpus fiable, ou dont la décision servie n’a pas de responsable identifié, ne deviendra pas viable en changeant de modèle. L’audit le dit alors clairement et désigne le cas d’usage qui mérite l’effort à la place.
Questions fréquentes
Qu’est-ce qu’un audit IA ?
Un audit IA est l’examen méthodique d’un système d’intelligence artificielle déjà construit ou en cours de construction, pour établir s’il peut être mis en production et ce qui l’en empêche. Il porte sur cinq couches : le corpus documentaire, la chaîne de récupération, le prompt, le périmètre d’action et les coûts. Il se conclut par un rapport listant les défauts constatés, leur cause et leur correction, par ordre de gravité.
Combien de temps prend un audit IA ?
Entre trois et dix jours selon la taille du corpus et le nombre de systèmes concernés. Un système documentaire unique se diagnostique en trois jours ; un parc de plusieurs assistants avec des dépendances entre eux demande une à deux semaines. Le premier jour suffit en général à identifier la cause principale des mauvaises réponses.
Que contient le rapport d’audit ?
Un constat par couche avec les mesures qui l’étayent, un jeu de tests constitué à partir de vos cas réels, la liste des corrections classées par rapport effort-bénéfice, et le coût mensuel réel du système ventilé par fonctionnalité. Le jeu de tests reste chez vous et sert à chaque évolution ultérieure.
Un audit IA est-il obligatoire ?
L’AI Act n’impose pas un audit externe général à chaque projet d’IA. Les exigences dépendent du système, de son usage et du rôle de l’organisation. Certains systèmes à haut risque sont soumis à une évaluation de conformité ; les obligations de transparence de l’article 50 visent des situations déterminées, notamment certaines interactions avec des personnes et certains contenus générés ou manipulés. Un audit technique aide à réunir les preuves, mais ne remplace pas une évaluation de conformité requise ni une qualification juridique du cas.
Faut-il auditer avant ou après la mise en production ?
Avant, si le système n’est pas encore en service : les corrections coûtent alors une fraction de ce qu’elles coûteront ensuite. Après, si le système est déjà exploité et donne des résultats décevants — c’est le cas le plus fréquent, et le diagnostic est alors plus riche parce qu’on dispose des questions réellement posées.
Que se passe-t-il si l’audit conclut qu’il faut arrêter ?
C’est une conclusion possible et elle est dite clairement. Un cas d’usage qui ne repose sur aucun corpus fiable, ou dont la décision servie n’a pas de responsable identifié, ne deviendra pas viable en changeant de modèle. Renoncer coûte moins cher que persévérer, et l’audit indique alors quel autre cas d’usage mérite l’effort.
Faire auditer un système
Quinze minutes suffisent à dire si un audit est utile dans votre cas, et à quel périmètre. Si la réponse est non, je vous le dirai à ce moment-là.
Prendre quinze minutes