Parlons de votre projet
Aller au contenu
Toutes les publications

Ce qu'un système d'IA consomme avant la première réponse

Par Docteur en intelligence artificielle · Conseil, conception de systèmes et formation

Green AICoûtArchitectureMesure14 juillet 202610 min

La plupart des bilans ne comptent que l'inférence. C'est la plus petite part de ce qu'un système documentaire consomme réellement.

Le bilan qu'on présente, et celui qui compte

Un bilan énergétique d'IA qui ne compte que les réponses ignore la plus grosse part de la consommation d'un système documentaire. L'indexation, la constitution des embarquements et les traitements par lot pèsent davantage, et ils ont lieu avant qu'aucun utilisateur n'ait posé de question.

La raison de cet angle mort est simple : l'inférence est la seule part qui apparaisse sur une facture, ligne par ligne, avec un nombre de jetons. Le reste se produit une fois, en amont, souvent sur une autre infrastructure, et personne ne le rattache au système.

Sur les chaînes documentaires que j'exploite, la mise en service consomme l'équivalent de plusieurs mois d'usage courant. Un bilan qui commence à la première réponse se trompe donc d'un facteur qui n'est pas marginal.

Répartition de la consommation entre indexation, embarquements, traitements par lot et réponses
La part comptée par la plupart des bilans est la plus petite des quatre.

Les trois postes invisibles

L'indexation, les embarquements et les traitements par lot forment l'essentiel de la consommation, et aucun des trois n'est visible depuis l'interface. Il faut les nommer pour pouvoir les mesurer.

L'indexation lit chaque document du corpus, l'extrait, le découpe. Sur un corpus de plusieurs dizaines de milliers de pièces, l'opération dure des heures et se répète à chaque changement de découpage.

Les embarquements transforment chaque fragment en vecteur. Ce calcul est proportionnel au volume du corpus, et il recommence intégralement à chaque changement de modèle d'embarquement, qui est la décision la moins réversible de toute la chaîne, comme rappelé dans les embeddings expliqués à une direction.

Les traitements par lot, enfin, sont ceux qu'on oublie le plus : enrichissement de métadonnées, classification systématique, contrôles de complétude. Ils tournent la nuit, personne ne les regarde, et ils traitent parfois l'ensemble du corpus quand seuls quelques documents ont changé.

Ce qu'il faut relever pour établir un bilan honnête

  • Le volume du corpus en nombre de fragments, pas en giga-octets : c'est le fragment qui est calculé.
  • La fréquence de réindexation complète, et ce qui la déclenche. Une réindexation mensuelle non justifiée est le premier gisement d'économie.
  • Le périmètre des traitements par lot : tout le corpus, ou seulement les documents modifiés ?
  • Le nombre de jetons envoyés par requête, qui reste le seul poste que la plupart des équipes suivent. Voir mesurer le coût par fonctionnalité.

Pourquoi ce décompte change les décisions

Quand la consommation amont est comptée, le découpage et la fréquence de réindexation deviennent des décisions énergétiques, pas seulement techniques. C'est le seul effet qui compte vraiment.

Un découpage plus fin multiplie le nombre de fragments, donc le nombre d'embarquements à calculer, donc la consommation d'indexation. Cette conséquence n'apparaît nulle part quand on choisit une taille de fragment.

De même, une réindexation complète programmée chaque semaine sur un corpus qui change à la marge consomme cinquante fois ce que consommerait une reprise incrémentale. Le réglage prend une heure à changer.

Ces deux décisions sont prises au cadrage, presque toujours sans référence à leur coût. Les documenter suffit à les rendre discutables, ce qui est exactement le rôle de la fiche décrite dans écrire la fiche d'un système d'IA.

Le cas particulier des documents images

Traiter une page comme image consomme beaucoup plus que la traiter comme texte, et la différence se paie à chaque passage. C'est le poste qui dérape le plus vite sur un corpus mixte.

Un corpus d'entreprise contient toujours une proportion de PDF scannés. Les faire lire par un modèle multimodal fonctionne très bien et coûte plusieurs fois ce que coûte l'extraction d'un texte natif.

La règle qui limite la casse : extraire une fois à l'indexation plutôt que de renvoyer l'image à chaque question. Le traitement devient un coût unique au lieu d'un coût récurrent, et le résultat est interrogeable comme n'importe quel texte.

C'est le même raisonnement que celui posé dans la multimodalité native et ses usages réels, vu cette fois par le poste de consommation.

Le chiffre à établir avant tout discours

Le nombre de fragments du corpus, multiplié par le nombre de réindexations complètes par an. Ce produit dit à lui seul si le système est sobre ou non, et il se calcule en dix minutes.

Ce que ça implique pour un dossier d'investissement

Un dossier qui présente un coût énergétique par requête, sans le coût de mise en service ni celui des reprises, présente un chiffre faux. Il faut les deux lignes.

La première est un coût d'entrée, ponctuel, qui s'amortit sur la durée de vie du système. La seconde est récurrente et proportionnelle à l'usage. Les confondre conduit soit à surestimer un usage faible, soit à sous-estimer un système qu'on réindexe souvent.

Je recommande de présenter les deux séparément, avec le seuil d'usage à partir duquel l'amont devient négligeable. Sur les systèmes documentaires que je connais, ce seuil se situe assez haut pour que la question mérite d'être posée.

Cette structure de coût est la même que celle décrite dans où part réellement un budget d'IA, et elle se documente au même endroit.

Questions fréquentes

Qu'est-ce qui consomme le plus dans un système documentaire ?

L'indexation et le calcul des embarquements, qui traitent l'intégralité du corpus, puis les traitements par lot. Les réponses aux utilisateurs sont la plus petite des quatre parts.

Pourquoi ces postes n'apparaissent-ils pas dans les bilans ?

Parce qu'ils ont lieu une fois, en amont, souvent sur une autre infrastructure, et qu'ils ne produisent pas de ligne de facture par requête comme l'inférence.

Quel réglage réduit le plus la consommation amont ?

La fréquence de réindexation complète. Sur un corpus qui change à la marge, une reprise incrémentale consomme une fraction de ce que consomme une reprise intégrale hebdomadaire.

Faut-il traiter les documents scannés autrement ?

Oui : extraire le texte une fois à l'indexation plutôt que de renvoyer l'image à chaque question transforme un coût récurrent en coût unique, pour un résultat interrogeable de la même façon.

Votre prochain projetParlons-en.Réserver un échange de 15 minutes sur Cal.com, dans un nouvel onglet