À lire · Page 6
Des méthodes et des arbitrages, écrits après le terrain.
Toutes les publications
131 articles · Page 6 sur 8

Le coût réel d'un système d'IA en production
Le coût d'un système d'IA n'est pas le prix des jetons. C'est six postes, dont un seul est visible sur la facture du fournisseur.
Coût2024-09-249 min

Modèles de raisonnement : la réflexion devient un budget
La qualité devient un réglage : plus de réflexion, plus de justesse, plus de coût. Ce curseur doit être posé par tâche, jamais une fois pour tout le système.
Raisonnement2024-09-1210 min

Mise en cache du contexte : le répété ne se paie qu'une fois
La plupart des systèmes renvoient le même contexte à chaque requête. Le facturer une seule fois divise la note, à condition d'avoir rangé le prompt dans le bon ordre.
Coût2024-08-1410 min

L'AI Act entre en vigueur : ce que l'ingénieur doit livrer
Le texte est entré en vigueur le 1er août 2024. Voici sa traduction en livrables d'ingénierie, ceux qui se décident à l'architecture et pas à la recette.
AI Act2024-08-0610 min

Sorties structurées : le format garanti supprime une étape fragile
Analyser du texte pour en extraire un objet est la source d'erreur la plus banale d'une chaîne automatisée. Le format garanti la supprime entièrement.
Architecture2024-08-0610 min

Llama 3.1 405B : ce que télécharger des poids ne fournit pas
Le modèle ouvert atteint le niveau des meilleurs fermés. Ce qui reste à fournir soi-même représente l'essentiel du coût, et se découvre après la décision.
Llama2024-07-2310 min

GPT-4o mini : les usages qui basculent quand le coût s'effondre
Le tri systématique du courrier, l'enrichissement de base, le contrôle exhaustif : trois usages qui passent du côté rentable quand le prix unitaire s'effondre.
Coût2024-07-1810 min

Modèles ouverts : quand la souveraineté devient une décision d'architecture
Faire tourner un modèle chez soi n'est pas une position de principe. C'est un arbitrage qui se calcule, et qui se retourne selon le volume et le type de données.
Modèles ouverts2024-07-029 min

Claude 3.5 : quand le palier intermédiaire dépasse l'ancien palier haut
Le palier intermédiaire d'une nouvelle génération dépasse le palier supérieur de la précédente. Toute répartition figée devient un surcoût silencieux.
Claude2024-06-2010 min

Le jour où le modèle a changé sans prévenir
Personne n'a touché au système. Il répond pourtant différemment depuis mardi. C'est un scénario ordinaire, et il se prépare.
Exploitation2024-06-188 min

Agents IA : le périmètre avant l'autonomie
Un agent sans périmètre écrit est un incident en attente. La question n'est pas ce qu'il sait faire, mais ce qu'il n'a pas le droit de faire seul.
Agents2024-05-1410 min

GPT-4o : la latence devient un critère de conception
Sous trois cents millisecondes, un échange devient une conversation. Au-delà de trois secondes, l'utilisateur abandonne. Entre les deux se joue l'adoption.
GPT-4o2024-05-1310 min

Llama 3 : l'écart se resserre sur les tâches structurées
Sur les tâches qui composent l'essentiel du volume réel, l'écart entre ouvert et fermé est devenu négligeable. C'est là que se joue l'économie d'un système.
Llama2024-04-1810 min

Les embeddings, expliqués à une direction
Une direction n'a pas besoin de comprendre les mathématiques. Elle a besoin de savoir quelles décisions ce choix engage, et lesquelles sont coûteuses à revenir.
Pédagogie2024-04-097 min

Évaluation continue : le chaînon manquant des projets IA
Un système d'IA ne tombe pas en panne : il se dégrade. Sans évaluation continue, la dégradation n'est pas détectée, elle est seulement ressentie.
Évaluation2024-03-199 min

Grok : des poids publiés ne sont pas des poids exploitables
Publier des poids et rendre un modèle utilisable sont deux choses distinctes. L'écart se mesure en mémoire vidéo, et il est plus grand qu'annoncé.
Modèles ouverts2024-03-1710 min

Claude 3 : choisir le palier, pas le modèle
Trois modèles d'une même famille, même interface, coûts séparés par un facteur soixante. La question devient : quelle tâche mérite quel palier.
Claude2024-03-0410 min

Gemini 1.5 : un million de jetons, et le test qui compte
Une fenêtre d'un million de jetons ne vaut que si le modèle y retrouve ce qu'on y a mis. Le test tient en une demi-journée et change souvent la conclusion.
Gemini2024-02-1510 min