L'IA sur une réponse à appel d'offres
Ce qui se produit sans votre meilleur ingénieur, et ce qui ne se produira jamais sans lui
- Un mémoire technique se joue sur une date : le dossier part ou il ne part pas, et l'affaire est perdue sans avoir été jugée.
- Le goulot n'est pas la rédaction, c'est la relecture. L'expert relit les dix paragraphes parce que rien ne dit lesquels des trois sont faux.
- Le modèle ne tient pas la répétition : réussir huit fois de suite la même tâche tombe sous 25 % sur τ-bench, et une chaîne de vingt opérations fiables à 95 % tient 36 % du temps.
- Certaines questions d'un dossier relèvent du constat, et un logiciel les tranche seul. D'autres demandent un jugement dont quelqu'un répond, et celles-là ne se délèguent pas. Écrire cette ligne est le même travail que capter le savoir de la maison.
- Ça ne remplit pas votre carnet : 61 % des dirigeants citent la faiblesse de la demande comme premier frein, et 27 % seulement adoptent l'IA pour le chiffre d'affaires. Ça change la conversion de ce que vous recevez déjà.
- Une part de l'échec reste au niveau du modèle. L'ingénierie la réduit et la rend visible ; elle ne l'élimine pas.
Jeudi, 11 h 10. Le mémoire doit partir à midi. Michel l'a sous les yeux depuis mardi soir et il ne l'écrit pas : il le relit. Les dix paragraphes, l'un après l'autre, parce que rien ne lui dit lesquels des trois sont faux.
À côté, une deuxième consultation est arrivée lundi, sur un dossier qu'il connaît mieux. Elle ne partira pas. Ce n'est pas une décision, c'est une conséquence : il n'y a qu'un Michel.
Un mémoire technique se joue sur une date. Le dossier part à midi ou il ne part pas, et l'affaire est perdue sans avoir été jugée. C'est le seul endroit de votre commerce où le retard ne coûte pas une marge : il coûte l'affaire entière. Et la rédaction repose sur deux ou trois personnes — les mêmes qui suivent les chantiers en cours, qui répondent au client mécontent, et qui partent en congés en août.
La question n'est donc pas « l'IA sait-elle écrire un mémoire technique ». Elle sait en produire un qui se lit bien, et c'est précisément ce qui rend le sujet dangereux. La question est : qu'est-ce qui, dans ce dossier, peut être produit sans le jugement de votre meilleur ingénieur — et comment savoir lesquels des paragraphes restants méritaient vraiment son temps.
Le goulot n'est pas la rédaction, c'est la relecture
Demandez à votre chargé d'affaires combien d'heures il passe à écrire un mémoire, puis demandez à Michel combien il en passe à le relire. Le second chiffre surprend, parce qu'il ne figure sur aucune feuille de temps.
Il relit tout. Pas parce que tout est douteux : parce que personne n'a écrit ce qui demande un second regard. Sur dix paragraphes repris d'un dossier précédent, sept sont justes et transposables. Les trois autres décrivent un mode opératoire qui ne vaut plus pour ce chantier-là, une contrainte de site qui a changé, une référence dont le client n'a pas à entendre parler. Faute de cette ligne, l'expert repasse derrière les dix — son jugement se dépense là où il ne servait à rien, et il manque là où il fallait.
Mettre un modèle de langage sur ce processus sans toucher à ce point-là ne fait pas gagner de temps. Ça déplace le goulot : on produit dix paragraphes plus vite, et il faut toujours les relire tous. Pire, ils se lisent mieux, donc la relecture est moins vigilante.
Ce que l'IA écrit déjà correctement dans un mémoire technique
Soyons précis, parce que le sujet attire deux affirmations symétriques et fausses — « c'est un gadget » et « ça remplace un ingénieur ».
Sur des livrables professionnels notés en aveugle par des praticiens d'une quinzaine d'années d'expérience, les meilleurs modèles actuels font jeu égal ou mieux dans 47,6 % des cas (GDPval, OpenAI, 2025). Ce chiffre ne dit pas que le travail est fait : il dit que « c'est un gadget » est faux, et que le sujet mérite une décision plutôt qu'un haussement d'épaules.
Concrètement, sur une réponse à appel d'offres, se produisent honnêtement et se vérifient vite :
- la mise en forme du dossier au cadre de réponse imposé, et le contrôle de complétude pièce par pièce ;
- les fiches de références chantier, à partir de vos propres dossiers clos ;
- les CV et les trames d'organigramme d'affaire ;
- la reprise d'un mode opératoire standard de votre maison ;
- le premier jet des parties descriptives — moyens humains et matériels, démarche qualité, gestion des déchets ;
- la relecture croisée entre le règlement de consultation et votre mémoire, pour trouver les exigences auxquelles vous n'avez pas répondu.
Ce dernier point est le plus sous-estimé. Ce n'est pas de la rédaction, c'est de la vérification — et c'est là que la machine est sans rivale, parce qu'elle ne se fatigue pas à la page quarante d'un CCTP.
Un bon mémoire ne dit rien de cinquante mémoires
Le piège n'est pas que le modèle échoue. C'est qu'il réussit huit fois sur dix, et que huit fois sur dix ne suffit pas quand le résultat part chez un client sous votre signature.
La mesure est constante d'un banc d'essai à l'autre. Sur τ-bench, qui évalue des tâches de service en plusieurs tours, la probabilité de réussir huit fois de suite la même tâche tombe sous 25 %. Sur CRMArena-Pro, le passage d'une question isolée à une conversation en plusieurs tours fait chuter la réussite de 58 % à 35 %. Sur SOP-Bench, qui donne au modèle des procédures pourtant écrites et complètes, la réussite plafonne à 72,4 %.
Et l'arithmétique est impitoyable sur une chaîne. Un mémoire technique enchaîne facilement vingt opérations — extraire une exigence, retrouver la référence, l'adapter, vérifier une donnée, reformuler. À 95 % de fiabilité par opération, ce qui est déjà excellent, la chaîne complète tient 36 % du temps.
C'est pour ça qu'une démonstration convaincante ne dit presque rien de la production. Ce n'est pas un problème de modèle, et un modèle plus récent ne le règle pas. Anthropic l'a documenté sur sa propre expérience de longue durée : leur agent a échoué en première phase, écrivent-ils, « because of a lack of scaffolding », et le changement le plus efficace fut de « forcing Claudius to follow procedures ». La seconde phase a aussi changé de modèle en cours de route, donc l'échafaudage n'explique pas tout — mais il explique quelque chose.
La ligne entre le constat et ce qui vous engage
Les questions que pose un mémoire ne sont pas toutes de la même espèce, et personne n'a jamais écrit la différence.
Certaines relèvent du constat. Une exigence du règlement est traitée ou elle ne l'est pas. Une pièce est présente ou absente. Une fiche technique correspond au matériau prescrit ou non. Un délai annoncé est cohérent avec le planning ou il ne l'est pas. Il existe un critère, et un logiciel l'applique seul, à condition que le système autour de lui soit fiable — qu'il décompose, qu'il vérifie, qu'il garde l'état, qu'il sache reprendre et qu'il sache escalader.
D'autres demandent un jugement, et quelqu'un en répond. Faut-il annoncer ce mode opératoire-là sur ce site-là. Faut-il mettre en avant la référence du chantier voisin, dont le client connaît le maître d'ouvrage. Faut-il s'engager sur ce délai compte tenu de la charge de l'atelier en mars. Aucun niveau de capacité du modèle ne reprend cette part — ce n'est pas une limite technique qui reculera, c'est une question de responsabilité.
Écrire cette ligne est le chantier. Et il a une propriété que personne n'anticipe : écrire la ligne, c'est exactement le même travail que capter le savoir de la maison. Pour dire à un système ce que « correct » veut dire chez vous, il faut écrire ce que vos anciens savent et n'ont jamais eu à formuler. Les deux ne sont pas deux projets successifs, c'est un seul.
Pourquoi un ChatGPT d'entreprise ne suffit pas
L'objection arrive toujours à ce moment-là, et elle est légitime : pourquoi ne pas simplement donner un abonnement à l'équipe et verser les dossiers dedans.
Parce que ce qui manque n'est pas dans les dossiers. Un modèle branché sur vos archives retrouvera ce que vous avez écrit ; il ne saura pas lequel de ces dossiers on ne montre plus, ni pourquoi telle formulation a été abandonnée après un litige, ni que ce client-là veut une page de moins et pas une de plus. Ce savoir vit dans les têtes, et dans des documents que personne n'a formalisés. Aucune quantité de contexte ne le fait apparaître.
C'est aussi la raison pour laquelle les résultats plafonnent vite. Parmi les dirigeants de PME et d'ETI françaises ayant adopté une IA, 94 % s'en servent pour optimiser l'existant plutôt que pour refaire le travail (Bpifrance Le Lab, n=387 adoptants). Optimiser l'existant sur un processus dont le goulot est la relecture donne exactement ce qu'on a décrit plus haut : des brouillons plus rapides, et la même file d'attente devant le même expert.
Ce que ça change le jeudi à midi — et ce que ça ne change pas
Disons d'abord ce que ça ne change pas, parce que la promesse inverse circule beaucoup.
Ça ne remplit pas votre carnet. Vous ne répondrez pas à des consultations que vous ne receviez pas. Chez les dirigeants de PME françaises, 61 % citent la faiblesse de la demande comme premier frein à l'activité, et seuls 27 % adoptent l'IA pour faire croître leur chiffre d'affaires, contre 81 % pour la performance. Quiconque vous vend une augmentation du volume d'affaires vous vend une promesse que la mesure ne soutient pas.
Ce qui change est plus étroit et plus sûr : la conversion de ce que vous recevez déjà. Les consultations auxquelles vous renonciez faute de temps deviennent traitables. Celles que vous traitiez partent plus tôt, donc plus complètes. Et Michel, qui relisait dix paragraphes, en relit trois — les trois qui engagent la maison. Les sept autres sont partis à midi, et la deuxième consultation aussi.
Avant de signer, un client vérifie le prix et le délai ; la qualité, il la découvre après. Celui qui répond avant vous emporte l'affaire, même moins bon. C'est désagréable et c'est ainsi.
Ce qui restera faux, et qu'il faut voir venir
Une part de l'échec reste au niveau du modèle, et l'ingénierie la réduit sans l'éliminer : la réponse confiante et fausse sur le cas rare. Un système bien construit ne supprime pas ce risque, il le rend visible et adressé — il sait dire qu'il ne sait pas, et il sait à qui passer la main. C'est la raison d'être du chemin d'exception, et c'est ce qui distingue un dispositif de production d'une démonstration.
Si quelqu'un vous promet zéro erreur, il n'a pas lu les mesures.
La question à poser sur votre prochaine consultation
Une question à laquelle vous pouvez répondre seul, ce soir : sur les douze derniers mois, combien de consultations avez-vous laissées passer faute de temps, et non faute d'intérêt ? Si le chiffre est supérieur à zéro et que la cause est toujours la même file d'attente devant les deux mêmes personnes, le processus est mûr.
La question suivante est la seule qui engage quelque chose : dans votre dernier mémoire, quels paragraphes auraient pu partir sans relecture, et qui le savait ? Personne n'a la réponse écrite. La trouver est le travail.
Apportez un processus où l'IA devrait rapporter.
Vingt minutes : si c'est faisable chez vous, et par où ça commence →Pas encore prêt à en parler ? Lisez comment nous refondons un processus — rien à payer, rien à engager.