5 023 articles, 9 publiés
Vingt-trois défauts entre un filtre et un rédacteur en chef
- Un filtre mécanique a ramené 5 023 articles notés à 672 candidats crédibles. Il n'en a classé aucun : 58 % obtenaient un 21/21 parfait sur leur meilleur axe de décision.
- Une personne en a ensuite lu 96 et en a gardé 9. Trois de ces neuf verdicts n'ont basculé qu'après lecture du corps de l'article, pas de son résumé.
- Nous avons reconstruit ce jugement sous forme de système. Sur le même corpus, il a reproduit 8 des 9 choix humains — et coupé le neuvième, gardé pour ne pas laisser une rubrique vide.
- Y parvenir a demandé vingt-trois défauts mesurés. Cinq des correctifs décisifs vivent dans le code, pas dans le prompt : regroupement par histoire, vote d'approbation, plafonds de composition, contrôle de la voix, vérification des citations.
- Rien de tout cela n'était déployé à l'époque. Ni envoi, ni inscription, ni archive publique.
- La construction fut la partie rapide. Le jugement fut le travail.
La semaine dernière, un de nos filtres a laissé passer 672 articles comme crédibles. Il n'en a classé aucun.
Cette phrase contient tout le problème de la plupart des projets d'IA, et il a fallu une mesure pour le voir.
Voici l'entonnoir, honnêtement :
| Étape | Volume |
|---|---|
| Articles ingérés et notés | 5 023 |
| Franchissent un axe de décision à ≥ 16/21 | 810 |
| Issus d'une source de palier A ou B | 672 |
| Lus en entier | 96 |
| Publiés | 9 |
Les trois premières lignes ont été construites en une journée. Ce sont des scores, des seuils et une table de qualité des sources — du travail ordinaire, que les outils de codage assistés rendent plus rapide chaque mois. L'implémentation a cessé d'être le goulot d'étranglement.
Les deux dernières lignes sont le produit. Et c'est là que vivaient les vingt-trois défauts.
Le filtre n'avait plus rien à dire
Sur les 672 candidats crédibles, 390 — soit 58 % — obtenaient un 21 sur 21 parfait sur leur meilleur axe de décision. 6 % de plus obtenaient 20.
Un tri sur une clé saturée n'est pas un classement. C'est l'ordre d'insertion en base, déguisé. Porter la barre à 21 laisserait encore 390 articles à égalité. Il n'y avait aucun seuil à régler, parce que l'échelle avait cessé de discriminer exactement là où discriminer était tout le travail.
La seconde barrière échouait autrement. 53 % du vivier « crédible palier A/B » venait de plateformes de publication ouvertes — papers.cool 97, arXiv 74, Medium 64, YouTube 36, HackerNoon 23. La table de qualité note le flux, pas l'auteur. « Artificial Intelligence on Medium » est en palier A et porte des milliers d'auteurs sans rapport. Un billet Medium anonyme se retrouvait donc à côté du Wall Street Journal, à crédibilité égale, tous deux à 21/21.
Deux barrières, toutes deux franchies, aucune ne décidant quoi que ce soit.
Ce que la base humaine a coûté, et ce qu'elle a rapporté
Une personne a lu 96 articles et en a gardé 9. Soit 1,3 % du vivier crédible.
Ce qui mérite d'être consigné : trois de ces neuf verdicts ont changé après lecture du corps de l'article plutôt que de son résumé.
- Un billet Medium sur l'IA médicale se lisait comme une opinion. Le corps contenait une étude de NYU Langone — 12 médecins, 1 800 réponses notées en aveugle, chiffres complets. Rejeté sur le résumé, gardé sur le contenu.
- Un article sur la revue de contrats a basculé sur une seule phrase : le corrigé de l'étude avait été construit à partir des réponses de l'IA évaluée. Absent du résumé.
- Un article sur les chaînes d'approvisionnement reposait sur un unique contraste — cinq jours pour l'agent, dix-huit mois pour réconcilier deux dates — que seul le corps donnait.
Passer du résumé au corps fait passer un lot de dix d'environ 4 000 à 20 000 jetons d'entrée. C'est la décision la plus rentable de tout le système, et elle est restée invisible jusqu'à ce que quelqu'un mesure ce que les résumés jetaient.
Puis le système a retrouvé 8 des 9
Nous avons reconstruit le même jugement sous forme de chaîne : candidats, juge, édition, rédaction, rendu. Sur une semaine comparable, elle a traité 803 candidats → 485 crédibles → 143 admis → 8 publiés, en 1 minute 52, en français et en anglais.
Elle a reproduit 8 des 9 choix humains.
Elle a coupé le neuvième sur l'axe qui demande si l'article change ce que le lecteur fait. Cette coupe était juste. L'article avait été gardé pour ne pas laisser une rubrique vide — un quota, pas un jugement. Le système s'est montré plus strict que la personne qui l'avait formé.
C'est le résultat utile, et ce n'est pas « le modèle est intelligent ». C'était le même modèle au premier jour, quand le premier passage ne montrait même pas au juge 6 des 9 bonnes réponses.
Où vivaient réellement les vingt-trois défauts
Quatre schémas, et ils dépassent notre cas.
Un échantillonnage qui n'existait que parce qu'un humain fatigue. Le premier passage jugeait un échantillon, parce que 96 articles est ce qu'une personne peut lire. La machine juge les 481 en quatre-vingt-dix secondes. Nous avions encodé une limite humaine comme une contrainte du système, puis mesuré le système contre l'humain qu'il imitait. Retirer l'échantillon a récupéré l'essentiel des choix manquants.
Toute échelle sature. Le score d'angle saturait à 21/21. Puis l'échelle du nouveau juge a saturé à son tour — 66 % des articles admis obtenaient 14 ou 15 sur 15, et un axe donnait la note maximale à 51 % du corpus. Réancrer le barème sur la rareté (« 3 signifie parmi les meilleurs de la semaine, pas “il remplit les critères” ») a fait passer les admissions de 143 à environ 95, et rendu à l'ordre son caractère d'ordre. Un second axe, qui traitait « cite un régulateur » à égalité avec « a mesuré la chose », a été plafonné : admissions 376 → 254.
Le demander au modèle ne suffisait pas. Cinq mécanismes de qualité ont dû sortir du prompt pour entrer dans le code, chacun après avoir vu la version « prompt » échouer :
- Regroupement par histoire — le lien simple produisait un bloc unique de 46 articles avalant Waymo, Databricks et une cyberattaque sur une station d'épuration. Le lien complet à 0,82 était le seul seuil qui gardait aussi séparés deux incidents distincts OpenAI/Anthropic, à 0,806.
- Vote d'approbation — un seul rédacteur choisissant 9 articles sur 70, c'était de la variance pure. Trois bulletins indépendants, classés par nombre de voix puis rang moyen.
- Plafonds de composition — le vivier admis est dominé par la sécurité, si bien qu'un vote fidèle produisait six articles sur neuf autour d'un même thème et quatre rubriques vides. Plafonds de deux par rubrique et deux par thème, appliqués dans le code.
- Contrôle de la voix — un vérificateur de superlatifs, de formules d'atténuation, de racolage et de jargon. Une infraction déclenche une réécriture nommant la faute ; si elle persiste, l'article est remplacé, jamais rafistolé.
- Vérification des citations — la phrase à partager cite désormais la source mot pour mot, et la citation est vérifiée contre le corps de l'article. Le modèle en avait donné trois pour exactes qui ne l'étaient pas, en avait traduit deux, et en avait laissé une reformuler le titre.
Et le modèle inventera précisément ce que vous ne lui avez pas donné. Un objet d'e-mail a écrit « entrent en vigueur dans 24 mois » alors que l'article disait « à partir d'août 2026 » — parce que le prompt de l'objet recevait la note du juge et non le contenu. Il écrit désormais à partir de la copie finale, avec interdiction d'ajouter une date, un chiffre ou une échéance.
Ce qui cloche encore
Deux passages partagent 6 articles sur 9, contre 5 auparavant. La chaîne est stochastique de bout en bout ; le juge admet entre 91 et 100 articles selon le passage. Ce qui varie est la queue, pas la tête — l'article sur le règlement IA, celui sur le contrat non cessible et celui sur Mastercard sortent à chaque fois — mais ça varie.
Trois rubriques sont sorties vides cette semaine-là. Si l'une d'elles est vide toutes les semaines, c'est un défaut d'étiquetage, pas de la rigueur.
Ce qui se transporte
Personne dans ce projet ne manquait d'ingénierie. Le filtre a été rapide, et il était correct. Il ne décidait rien pour autant, et il serait parti en production avec l'air de fonctionner — 672 candidats crédibles, triés, un chiffre sur chaque ligne.
Ce qui a fait la différence, c'est d'avoir écrit à quoi ressemble une bonne décision, mesuré le système contre une base que quelqu'un avait réellement produite à la main, puis sorti chaque règle qui comptait du prompt pour la mettre dans le code, là où on ne peut pas l'en dissuader.
Ce savoir existait avant tout cela. Il était dans la tête d'une personne et dans une spécification que personne n'avait formalisée. Aucun modèle ne l'avait vu, et aucun fournisseur n'aurait pu l'atteindre.
Si l'IA devrait rapporter quelque part dans votre exploitation et que les chiffres ne le montrent pas encore, l'écart a généralement la même forme : le travail repose sur un jugement que personne n'a jamais écrit, et le pilote s'est mesuré contre rien.
Apportez-nous le travail qui devrait rapporter.
Apportez un processus où l'IA devrait rapporter.
Vingt minutes : si c'est faisable chez vous, et par où ça commence →Pas encore prêt à en parler ? Lisez comment se déroule la mission — rien à payer, rien à engager.