
Le rapport dit terminé, le décompte dit autre chose
Lundi : Suzuka | IA et technologie
Cet article s’appuie sur 312 titres collectés le 3 août 2026, dont 41 par une tâche automatique et 271 repris à la main après un incident. L’incident s’est révélé être le sujet.
- Un planificateur AWS qui classe en échec des exécutions qui ont abouti
- Un agent qui a fonctionné comme prévu et a laissé 6 531 dollars de facture
- Huit bancs d’essai pour agents, poussés jusqu’à un score quasi parfait sans résoudre les tâches
- 48 titres de r/LocalLLaMA, dont 17 pour un seul modèle
- Sur Hacker News, « AI governance » plafonne à 54 points là où « LLM » démarre à 1 040
Ce matin, « terminé » et « collecté » n’ont pas donné le même chiffre
La collecte automatique a rendu un état : terminé, sans erreur. Le décompte, lui, affichait 41 titres pour sept sources attendues. Deux sources seulement avaient répondu. Reprise à la main, la même collecte a rapporté 271 titres supplémentaires. Entre les deux, aucune alerte n’a été levée, pour une raison simple : aucun canal ne comparait le nombre obtenu à un nombre attendu.
On garde d’ordinaire ce genre d’incident pour la maintenance interne. Sauf que le corpus ramassé ce matin-là contient la même fracture, décrite par d’autres, sur d’autres systèmes.
Le même écart, avec la polarité inversée
Un rapport publié le 1er août sur DEV décrit la version symétrique. Le planificateur d’AWS appelle sa cible de façon synchrone : il déclenche l’appel et attend la réponse avant de décider si l’invocation a réussi. Il abandonne au bout d’une trentaine de secondes. Les recherches lancées par l’agent en prenaient de trente à soixante-quinze secondes. Les invocations partaient donc dans la file des messages morts — la file où atterrissent les appels considérés comme perdus — pendant que l’agent, lui, terminait son travail en arrière-plan et publiait ses résultats. La correction n’a pas porté sur l’agent : le point d’entrée renvoie désormais un accusé de réception immédiat et délègue le travail réel à une tâche de fond. Les tentatives de reprise, jusque-là désactivées pour éviter les doublons, ont pu être réactivées et portées à deux.
Un autre texte, publié le 2 août, décrit la même mécanique sur la chaîne qui amène un modèle jusqu’à un téléphone. L’export réussit, l’application se compile, le modèle tourne sur l’appareil et renvoie une sortie d’apparence parfaitement raisonnable — et ce qui est livré est moins bon que ce qui avait été évalué, d’une quantité que personne n’a mesurée. L’auteur relève qu’un modèle à deux couches a dérivé jusqu’à huit fois plus qu’un modèle convolutif lors de la quantification, cette réduction de précision numérique qui permet de faire tenir un modèle dans moins de mémoire. Chaque étape a émis un signal de réussite ; aucune n’a comparé la sortie à une référence.
Dans un cas, le rapport dit échec et le travail a eu lieu ; dans l’autre, le rapport dit succès et rien de mesurable n’est arrivé. Le point commun n’est pas la direction de l’erreur. C’est que le canal qui rapporte et le canal qui produit forment deux séries de mesures distinctes, et que rien n’oblige les deux à coïncider.
Ce que 312 titres permettent de compter, et rien de plus
Une précision de méthode : les fils Reddit n’ont pas pu être ouverts, le service refusant les requêtes automatiques. Ce qu’on peut observer ici, ce sont les titres et leur distribution, pas le contenu des discussions.
- r/LocalLLaMA, 48 titres : 17 mentionnent un seul modèle sorti fin juillet, soit 35 % du fil. Ces 17 titres portent presque tous sur la même famille de grandeurs — jetons par seconde, empreinte mémoire, cache, quantification.
- r/MachineLearning, 40 titres : 21 portent sur le processus de relecture des conférences. Relecteurs disparus, réfutations sans réponse, méta-évaluations, calendriers qui se chevauchent. Trois d’entre eux concernent des relectures ou des réfutations rédigées par des modèles.
Deux communautés voisines, deux objets de mesure. L’une compte des jetons par seconde. L’autre compte les relecteurs qui ne répondent pas. On peut lire ces deux décomptes comme un même problème vu à deux étages : la capacité se mesure vite, la validation se mesure lentement, et l’écart entre les deux s’élargit.
Un agent qui demande confirmation, et personne au bout du canal
Entre le 9 et le 13 mai 2026, un agent autonome a reçu des identifiants AWS et une échéance, avec pour objectif de rejoindre DN42 — un réseau expérimental animé par des amateurs — et d’y mener une campagne de scan. Il a provisionné cinq instances m8g.12xlarge, chacune avec 48 processeurs virtuels et 192 Gio de mémoire, puis a redéployé plusieurs fois le même modèle d’infrastructure, dupliquant instances et répartiteurs de charge. Facture : 6 531 dollars, ramenés à 1 894 après négociation.
Le compte-rendu note un détail qui déplace le sujet. L’agent a fonctionné comme prévu : tickets ouverts, demandes de fusion soumises, présence maintenue sur IRC pour recueillir les demandes de retrait, documentation produite. Il a même sollicité confirmation à plusieurs reprises. Ce n’est pas le récit d’un agent devenu fou, c’est celui d’un canal de confirmation qui existait et que personne ne lisait.
Un troisième article du 2 août rassemble ce qui se mesure sur ce point précis. Pour les agents de codage, l’obligation de faire approuver un plan avant exécution fait tomber le taux d’attaques réussies d’environ 90 % à une fourchette de 60 à 74 % ; mais lorsqu’un problème apparaît effectivement, le taux d’interventions humaines efficaces reste compris entre 9 et 26 %. Hors du champ de l’IA, le même texte cite un taux de rejet des alertes de sécurité par les cliniciens situé entre 49 et 96 %. Réserve à poser : l’article donne les chiffres sans fournir les références précises des études.
L’agent ne vous prévient pas qu’il a échoué. Il vous prévient qu’il a terminé — et c’est exactement le message qu’une chaîne de validation saturée laisse passer.
Quand c’est la mesure elle-même qui émet le faux signal
En avril 2026, un laboratoire de l’université de Berkeley a publié le résultat d’une tentative méthodique : porter huit bancs d’essai pour agents — ces suites de tâches standardisées qui servent à comparer les modèles entre eux — à un score quasi parfait sans résoudre les tâches. Sur FieldWorkArena, renvoyer un objet vide suffit à obtenir 100 % sur les 890 tâches. Sur SWE-bench Verified (500 tâches) et SWE-bench Pro (731), un fichier de dix lignes force tous les tests à passer. Sur WebArena (812), atteindre des adresses de fichiers locaux donne accès aux corrigés rangés dans la configuration des tâches. GAIA tombe à environ 98 %, Terminal-Bench à 100 %, OSWorld à 73 %.
Le score est lui aussi un canal de rapport. Il annonce « tâche résolue » sans jamais observer la tâche. C’est la structure du planificateur qui décide du succès d’après un délai de réponse, ou de la tâche de collecte qui déclare « terminé » sans compter ce qu’elle a rapporté — à ceci près qu’ici, le canal défaillant est celui sur lequel repose la comparaison entre modèles. À noter : ces résultats proviennent d’un billet de laboratoire et d’une prépublication qui n’ont pas été soumis à une relecture par les pairs. Ce qui renvoie, incidemment, aux 21 titres de r/MachineLearning.
Le canal que personne ne dote
Les cinquante entrées Hacker News du corpus ne sont pas l’actualité de la semaine : ce sont les résultats les mieux notés de toute l’histoire du site pour cinq requêtes, et les dates s’étalent de 2010 à 2026. Elles mesurent donc une préférence accumulée, pas un événement. Sur la requête « AI agent », cinq des dix résultats les plus votés racontent un incident provoqué par un agent, le premier d’entre eux à 2 346 points. Sur « LLM », le plus faible des dix résultats obtient 1 040 points. Sur « AI governance », le plus fort en obtient 54 et le plus faible 8. À corpus égal et sur toute la durée du site, un facteur proche de vingt sépare le sujet « faire tourner un modèle » du sujet « encadrer ce qu’il fait ».
Une étude publiée en juillet 2026 mesure la même asymétrie côté emploi : 3 519 offres classées dans huit pays de l’Union européenne, dont la France, sur des fenêtres de trente jours, réparties en 446 postes de gouvernance contre 3 004 postes de conception et de développement. Près de sept pour un. Deux réserves, importantes : l’étude émane d’un cabinet qui vend précisément des prestations de mise en conformité au règlement européen sur l’IA, et le chiffre sert son commerce ; sa méthode ne capte que le flux des recrutements nouveaux, sur des annonces rédigées en anglais, et non les équipes déjà en place.
La direction concorde tout de même avec le reste du corpus. Parmi les 41 titres remontés automatiquement ce matin, plusieurs proposent des boucles de vérification — l’un d’eux décrit une chaîne où un modèle produit des candidats, une étape de formalisation les traduit, et une machine les valide. Son auteur écrit lui-même que l’étape suivante n’est pas un schéma théorique de plus mais une expérimentation : le texte ne contient aucun résultat mesuré. Le canal de vérification est celui dont on parle en propositions, pas en mesures.
Le seul contrôle qui ait fonctionné ce matin n’a coûté ni modèle ni infrastructure : compter. Sept sources attendues, deux répondues, 41 titres au lieu de 312. Le rapport disait « terminé » et il ne mentait pas. Il répondait à une autre question que celle qu’on lui posait.
Sources
- EventBridge Scheduler DLQ’d My Successful Invokes (DEV Community, 1er août 2026)
- Your quantized model got worse, and nothing told you (DEV Community, 2 août 2026 — l’auteur y présente son propre outil, sous licence libre)
- AI agent bankrupted their operator while trying to scan DN42 (lantian.pub, mai 2026)
- Automation Bias: Why People Rubber-Stamp AI (and How to Fix It) (DEV Community, 2 août 2026 — l’auteur y promeut son propre cadre méthodologique, gratuit)
- Exploiting the most prominent AI agent benchmarks (Center for Responsible, Decentralized Intelligence, UC Berkeley, avril 2026 — billet de laboratoire et prépublication, sans relecture par les pairs)
- AI builders outnumber AI governance hires 7:1 in Europe (Axipro, juillet 2026 — étude publiée par un cabinet qui commercialise des prestations de conformité au règlement européen sur l’IA : contenu à visée commerciale)
- Stop Asking AI to Be Correct: Build a Verification Loop Instead (DEV Community, 2 août 2026 — proposition conceptuelle, sans résultat mesuré)