REGISTRE DES PREUVES

Ce que nous vendons, et ce sur quoi ça repose vraiment.

Chaque phrase de ce registre est une phrase que nous publions quelque part — la page d'accueil, la page entreprise, le profil. Sous chacune : l'étude qui la soutient, et le point où cette étude s'arrête. Nous avons ouvert chaque source primaire citée ici. Les deux que nous n'avons pas pu ouvrir sont nommées plus bas, au lieu d'être citées de seconde main.

Trois des sept entrées jouent contre nous, dont la dernière, qui dit que l'affirmation centrale de l'offre n'a jamais été testée. Un registre qui ne soutient que le vendeur est une plaquette avec des notes de bas de page.

Le registre

  1. « Le modèle sait faire le travail une fois. Pas mille fois de suite. »

    Page d'accueil · page entreprise

    Mesuré

    τ-bench (Yao et al., arXiv:2406.12045), mot pour mot : même les meilleurs agents à appel de fonctions (comme gpt-4o) réussissent moins de 50 % des tâches, et sont très inconstants — pass^8 inférieur à 25 % en commerce de détail. CRMArena-Pro (Salesforce Research, arXiv:2505.18878) : les meilleurs agents atteignent environ 58 % de réussite en un tour, et tombent à 35 % en multi-tours, sur dix-neuf tâches validées par des experts. METR (arXiv:2503.14499) mesure que l'horizon de fiabilité à 80 % est « environ 5 fois plus court » que celui à 50 % — tous les titres du type « l'IA fait maintenant des tâches de X heures » citent le seuil du pile ou face.

    Où ça s'arrêteτ-bench tourne sur des utilisateurs simulés et une base synthétique, avec des modèles de 2024. Et le contrepoids a sa place ici : sur GDPval (arXiv:2510.04374, le banc d'essai d'OpenAI lui-même), 47,6 % des livrables de Claude Opus 4.1 ont égalé ou battu ceux de professionnels ayant en moyenne quatorze ans d'expérience — sur le sous-ensemble de référence. La qualité en un coup, c'est la démonstration. La répétition contre un état, c'est la production. Les deux sont vraies.

    Ouvrir la source primaire →
  2. « Personne n'est remplacé. Le système applique leurs règles. »

    Profil · entrée Experience

    Mesuré

    Goldberg, « Man versus model of man », Psychological Bulletin 73(6), 1970, p. 422-432. Des modèles par moindres carrés ont été construits pour chacun de 29 psychologues cliniciens, à partir de leurs propres jugements sur 861 profils MMPI. Construits sur les 861 cas, 86 % de ces modèles prédisaient le diagnostic réel mieux que le clinicien dont ils étaient tirés (p < .001, test des signes) ; pour 28 des 29 juges (97 %), le modèle était au moins aussi valide. Le papier énonce le mécanisme sans détour : le clinicien « a ses jours » — ennui, fatigue, distraction — et le modèle retire ce bruit, pas le savoir.

    Où ça s'arrêteL'avantage diminue avec la taille de l'échantillon dont le modèle est tiré : 86 % sur tous les cas, 79 % sur un septième, 72 % sur un dixième, 62 % sur 33 cas. Et la limite honnête : le modelage n'a PAS amélioré le jugement composite des 29 cliniciens mis en commun. Face à plusieurs experts réunis, l'avantage disparaît. Un jugement clinique des années 1970 n'est pas un chiffrage d'affaire.

    Ouvrir la source primaire →
  3. « On met dans le processus le savoir-faire qui vit dans les têtes. »

    Page d'accueil · profil · page entreprise

    Mesuré

    Brynjolfsson, Li & Raymond, « Generative AI at Work », NBER w31161 (publié dans le Quarterly Journal of Economics 140(2), 2025). 5 179 agents de support client, 3 millions de conversations, déploiement échelonné, doubles différences sur les journaux administratifs de l'entreprise. L'accès à l'assistant augmente le nombre de dossiers résolus par heure de 14 % en moyenne — 34 % chez les novices et les moins qualifiés, avec un effet minime sur les expérimentés et les très qualifiés. L'outil était entraîné sur le corpus de l'entreprise, en surpondérant les conversations des meilleurs.

    Où ça s'arrêteLes auteurs qualifient eux-mêmes de « suggestive » la preuve que le modèle diffuse les bonnes pratiques, et le protocole est quasi-expérimental, pas un essai randomisé. Nous avons lu le document de travail NBER, gratuit (5 179 agents, 14 %) ; la version publiée, payante, rapporte 5 172 et 15 % — nous citons ce que nous avons ouvert. 89 % des agents travaillaient hors des États-Unis, surtout aux Philippines. Et il n'y a aucun bras de contrôle « IA générique » : voir la dernière entrée.

    Ouvrir la source primaire →
  4. « On mesure d'abord ce que le processus coûte aujourd'hui. »

    Page d'accueil · profil · page entreprise

    Joue contre nous

    METR (arXiv:2507.09089) : un essai contrôlé randomisé sur 16 développeurs open source expérimentés, traitant 246 tickets réels dans des dépôts sur lesquels ils travaillaient depuis environ cinq ans. Ils prévoyaient que l'IA réduirait leur temps de 24 %. Après coup, ils estimaient qu'elle l'avait réduit de 20 %. Mesuré : elle a augmenté le temps de 19 %. Les économistes avaient prédit −39 %, les experts en apprentissage automatique −38 %. Humlum & Vestergaard (NBER w33777) : 25 000 salariés dans 7 000 établissements, sur 11 métiers exposés au Danemark, réponses appariées aux registres administratifs — des effets nuls précis sur les salaires et les heures, « excluant tout effet supérieur à 2 % » deux ans après. Les utilisateurs déclarent économiser environ 3 % de leurs heures, et 85 % d'entre eux réaffectent ce temps à d'autres tâches.

    Où ça s'arrêteMETR, ce sont 16 développeurs, tous mainteneurs experts, et ses auteurs disent explicitement que ce n'est pas une preuve que l'IA ne fait pas gagner de temps à la plupart des développeurs. Généraliser l'écart de perception, jamais le +19 %. Humlum mesure des salaires et des heures, pas la qualité du travail. Ce que les deux établissent est étroit et suffisant : l'auto-déclaration se trompe de signe, donc un chiffre accepté avant de commencer n'est pas une formalité.

    Ouvrir la source primaire →
  5. « Le système est à vous : il évolue sans moi, aucun abonnement à ma présence. »

    Page entreprise · profil

    Mesuré, une fois

    Soloway, Bachant & Jensen (les deux derniers chez Digital Equipment Corporation), AAAI-87, p. 824-829, publié alors que XCON était en production. Mot pour mot : « En 7 ans, XCON est passé à environ 6 200 règles, dont approximativement 50 % changent chaque année. Alors que la performance de XCON est satisfaisante, il devient de plus en plus difficile à modifier. » Il avait démarré à environ 700 règles, et le papier note que « les problèmes de mise à jour continue d'un système aussi grand ne croissent pas linéairement ». Le système marchait. C'est le garder en vie qui était le problème.

    Où ça s'arrêteUn seul cas industriel, 1987, un système à règles et non un modèle. Le mécanisme se transfère — ce qui tue ces systèmes, c'est la garde et la maintenance, jamais la qualité du savoir — les chiffres non. L'étude que nous voulions mettre à côté, l'enquête de Gill (MIS Quarterly, 1995) sur le devenir des premiers systèmes experts, est payante partout où nous avons cherché. Nous ne l'avons pas lue, donc elle n'est pas ici.

    Ouvrir la source primaire →
  6. « Vous repartez avec la valeur prouvée. »

    Page d'accueil · page entreprise

    Joue contre nous

    Kwan et al., BMJ 2020;370:m3216 — 108 études, 122 essais, 1 203 053 patients et 10 790 praticiens. L'aide à la décision augmente la part de patients recevant le soin voulu de 5,8 points de pourcentage (IC 95 % : 4,0 à 7,6). Mais dans les 30 essais qui rapportent un critère clinique, l'amélioration médiane est de 0,3 % (écart interquartile −0,7 % à +1,9 %). Le comportement bouge de façon fiable. Le résultat, beaucoup moins. Roshanov et al., BMJ 2013;346:f657 — méta-régression de 162 essais randomisés : les systèmes évalués par leurs propres concepteurs affichent un rapport de cotes de 4,35 (IC 95 % : 1,66 à 11,44), un résultat que les auteurs décrivent comme robuste selon les méthodes et en validation interne.

    Où ça s'arrêteCe dernier chiffre nous vise. Nous construisons le système et nous serions ceux qui en rendent compte. Il n'y a pas de réponse rhétorique à cela — seulement une réponse structurelle : la base est acceptée par vous avant qu'on commence, et mesurée contre ce que le processus coûte aujourd'hui, ce qui est le seul dispositif qu'un concepteur ne peut pas noter en silence. Les deux papiers sont médicaux ; les transporter vers un chiffrage d'affaire est un raisonnement, pas une mesure. Et l'hétérogénéité est forte (I² = 76 %) — le quartile supérieur des résultats va de 10 % à 62 %.

    Ouvrir la source primaire →
  7. « Un assistant ancré sur votre savoir-faire bat un modèle générique sur votre travail. »

    L'affirmation qui porte toute l'offre

    Non testé

    Rien ne la teste directement. Aucune expérience randomisée de terrain ne compare un assistant ancré sur la connaissance interne à un modèle générique sur la même tâche ; deux passes de recherche en ont cherché une, aucune trouvée. Ce qui existe dans cet espace est du marketing d'éditeur, sans méthode et sans groupe de contrôle. La preuve indirecte la plus proche est un couple : le +34 % de Brynjolfsson chez les novices, avec un corpus maison, mis en regard d'Otis et al. — 640 entrepreneurs kényans, tirage au sort, un mentor d'affaires GPT-4 générique par WhatsApp — où les moins performants ont fait environ 8 % moins bien.

    Où ça s'arrêteDeux populations, deux tâches, deux protocoles : ce n'est pas un face-à-face, et nous ne le présenterons pas comme tel. Otis rapporte un effet moyen nul sous un plan pré-enregistré ; le gain chez les plus performants (« un peu plus de 15 % ») n'est pas un effet moyen significatif, seulement un effet quantile à la médiane. Ce qu'Otis établit solidement, c'est le tort fait aux moins performants, pas le bénéfice pour qui que ce soit. Et nous avons lu le document de travail — la version parue dans Management Science est payante.

    Ouvrir la source primaire →

Ce que nous n'avons pas pu lire

La règle de cette page : rien n'y entre dont nous n'avons pas ouvert la source primaire. Trois sources que nous voulions sont derrière un péage, sans copie en dépôt ouvert — elles ne soutiennent donc rien ici :

  1. Garg et al., JAMA 293(10), 2005 — la revue de référence sur l'aide à la décision. Fermée partout. Ses résultats sont repris par Kwan (2020) et Roshanov (2013), que nous avons lus : l'entrée ci-dessus tient sans elle.
  2. Gill, MIS Quarterly 19(1), 1995 — le suivi à cinq ans des premiers systèmes experts. Fermée. Son résumé va dans le sens de ce que nous soutenons, ce qui est précisément la raison de ne pas la citer sur son résumé.
  3. La version publiée dans le Quarterly Journal of Economics de Brynjolfsson, Li & Raymond. Nous avons lu le document de travail NBER, gratuit, et nous en citons les chiffres — 5 179 agents et 14 %, et non les 5 172 et 15 % de la version publiée.

Le trou, et ce qu'on en fait

L'affirmation qui porte toute la mission — qu'ancrer un système sur votre propre savoir-faire bat un modèle générique sur votre propre travail — n'a jamais été soumise à un test contrôlé, par personne. Le mécanisme est bien étayé des deux côtés. Le face-à-face n'a jamais été mené.

Alors on le mène sur vos dossiers. La mission s'ouvre par une tranche courte qui tourne sur vos affaires passées — vos documents, pas le temps de vos équipes — et ceux qui font le travail disent si ce qui revient est le leur ou si c'est générique. Ce n'est pas une démonstration de ce que l'IA sait faire. C'est le seul endroit où cette question se tranche vraiment, et la réponse peut être non.

Ce registre est tenu à partir de notre dossier de preuves interne, et corrigé dès qu'une source primaire dit le contraire — les lire pour cette page a fait apparaître trois citations erronées de notre part. Si vous en trouvez une autre, nous voulons le savoir.

Son pendant pose la question inverse : d'où viennent vraiment les statistiques sur l'IA que tout le monde cite. Ou apportez-nous un processus — vingt minutes, et un avis franc dans un sens comme dans l'autre : le service.