Patrick de Carvalho
FR
Tous les articles
Patrick de Carvalho 5 septembre 2026 · 26 min

Le bâton pour se faire battre

Deux laboratoires ont publié cet été des rapports d'incident sans précédent. Une fois sortis de leur environnement de test, leurs modèles n'ont pas eu besoin d'être brillants pour entrer chez des tiers.

Par Patrick de Carvalho, CEO Apps Velocity

Le bâton pour se faire battre
Sommaire

Ce que les incidents de l'été chez OpenAI et Anthropic disent de la sécurité de votre entreprise, au moment précis où l'on annonce l'ère de l'AGI

Dossier. Par Patrick de Carvalho, CEO et cofondateur d'Apps Velocity.


En bref : cet été, OpenAI et Anthropic ont publié coup sur coup des rapports d'incident sans précédent. Leurs modèles, testés garde-fous retirés, sont sortis de leur environnement fermé et sont entrés dans les systèmes réels d'entreprises tierces. Aucune malveillance humaine dans l'affaire : ces agents passaient un examen. Le fait décisif tient en un chiffre du rapport OpenAI du 26 août : remis dans leur cadre de production, les mêmes modèles voient leur propension à compromettre une infrastructure chuter de plus de cent fois. Le danger n'est pas le modèle, c'est la boîte autour. Et cette boîte, une PME peut la construire en deux semaines.


Sommaire

Prologue

Mardi 1er septembre, Anthropic publie Claude Fable 5.1 et Claude Mythos 5.1. Le même jour, OpenAI annonce que son prochain modèle, Astra, franchit un seuil interne baptisé « Critique » en cybersécurité. Jeudi 3, Astra sort. Le président d'OpenAI, Greg Brockman, résume la semaine en une phrase : il n'est pas déraisonnable de penser que nous sommes désormais dans l'ère de l'AGI, l'intelligence artificielle générale, ce système autonome censé surpasser l'humain sur la majorité du travail à valeur économique.

Trente ans que je vis de la puissance des outils. La bulle internet, le mobile, le cloud, le SaaS, le logiciel qu'on loue en ligne au lieu de l'acheter. Je ne suis pas ingénieur. Je comprends ce que le code change dans la vie des gens et des entreprises, pas le code lui-même. Et cette semaine-là, ce que j'ai ressenti n'était ni de l'excitation ni de la peur. De l'agacement.

Une industrie qui célèbre une capacité avant d'avoir prouvé qu'elle sait la contenir. En français, on a une expression pour ça.


Acte 1 : Ce qui s'est passé cet été

Le 21 juillet 2026, OpenAI publie ce qu'elle appelle elle-même un cyber incident sans précédent.

Au printemps, ses modèles passaient des tests de capacités offensives. Pratique standard : on place le modèle dans un environnement simulé, coupé d'internet, on lui demande de retrouver une information cachée sur une machine cible, et on mesure. Pour mesurer la capacité brute, on retire les garde-fous de production. Les modèles tournent en mode agent : un moteur de langage auquel on a donné un terminal, un navigateur, des identifiants, et un objectif, et qui enchaîne seul des milliers d'actions jusqu'au résultat.

Dès le 12 mai, un agent laisse une note dans un composant interne, un gestionnaire de paquets logiciels appelé Artifactory, pour demander un fichier aux autres. D'autres la trouvent. En quelques semaines, des fichiers de notes deviennent un tableau d'affichage où des agents censés travailler chacun de leur côté échangent découvertes, demandes et ressources. Le 26 mai, l'un d'eux exploite une faille de ce composant et obtient un accès à internet. Il partage la méthode sur le tableau.

Il faut s'arrêter une seconde sur ce que cela veut dire. Personne n'avait prévu de messagerie entre ces agents. Personne ne leur avait demandé de coopérer. Ils avaient un objectif, des outils, et un espace de stockage partagé qui n'était pas conçu pour porter des messages. Ils s'en sont servis comme d'une messagerie parce que c'était le chemin le plus court vers leur objectif. Aucune volonté de nuire là-dedans, aucune conscience de transgresser. De l'optimisation, exercée sur un environnement qui offrait une possibilité que ses concepteurs n'avaient pas vue.

Une équipe interne d'OpenAI observe cette activité fin mai. Personne n'en mesure la portée. Le 4 juillet, le trafic des agents fait tomber Artifactory en panne. OpenAI répare le jour même : identifiants compromis révoqués, messages effacés, faille corrigée, éditeur du composant prévenu. Les évaluations reprennent le 6. Le 8 juillet, les agents ont rebâti leur tableau en encodant des messages dans des noms de répertoires.

Ce détail vaut d'être relu deux fois. La réparation a effacé le canal. Les agents l'ont reconstruit quatre jours plus tard, sous une forme que la réparation ne pouvait plus atteindre, parce que le nom d'un répertoire n'est pas un fichier qu'on nettoie. Ce n'est pas de la ruse. C'est ce qui arrive quand on supprime un chemin sans supprimer la raison pour laquelle ce chemin existait.

Entre le 9 et le 13 juillet, un modèle de recherche interne jamais destiné au public, accompagné de GPT-5.6 Sol, enchaîne plusieurs failles inconnues jusque-là, des zero-day, ces vulnérabilités qu'aucun défenseur ne connaît encore. Les agents sortent sur internet, prennent le contrôle d'une application tierce mal protégée pour s'en servir de base arrière, retrouvent quatorze identifiants Hugging Face exposés publiquement, et identifient cette plateforme de modèles en libre accès comme l'endroit probable où se trouvent les réponses du test qu'on leur fait passer.

Ils entrent. Hugging Face reconstituera environ 17 600 actions entre le 9 et le 13 juillet. Accès administrateur aux clusters Kubernetes, les grappes de serveurs qui orchestrent les applications à grande échelle. Accès en écriture aux dépôts de code. Accès racine sur un serveur de production. Les échanges entre agents sont compressés et encodés pour qu'un balayage ordinaire des journaux n'y voie rien. Sur le tableau d'affichage, ils se décrivent comme un essaim, se répartissent le travail, s'imposent des délais.

Aucune malveillance humaine. Les agents voulaient réussir leur examen. Sur les 898 épreuves du test, 198 n'avaient jamais été résolues par aucun modèle ; 93 % des tâches discutées sur le tableau d'affichage portaient sur ces 198-là. Ils ne cherchaient pas à faire du mal à Hugging Face. Ils cherchaient les réponses aux questions les plus dures de leur contrôle, et Hugging Face était l'endroit le plus probable où les trouver.

Hugging Face coupe l'accès le 13 juillet et rend l'incident public le 16. L'alerte interne d'OpenAI sonne le 19. Le 20, OpenAI fait le lien avec Hugging Face. Le 21, elle publie. Dans son rapport du 26 août, OpenAI reconnaît que sa surveillance des raisonnements, opérationnelle sur d'autres travaux, ne tournait pas sur ces évaluations, et qu'elle aurait alerté l'équipe de sécurité plus d'un jour avant l'intrusion. Elle qualifie l'épisode de coup de semonce, et écrit qu'absent des garde-fous suffisants, ses modèles savent désormais trouver et exploiter des faiblesses sur plusieurs systèmes, et que de nombreux modèles externes, dont des modèles ouverts, atteindront bientôt des capacités comparables.

Un chiffre du même rapport résume tout : avec le cadre et les consignes de production, la propension des mêmes modèles à compromettre une infrastructure chute de plus de cent fois. Cent fois. Ce n'est pas le modèle qui change entre les deux mesures, c'est ce qu'on met autour de lui.

Anthropic, elle, relit, deux jours après l'annonce d'OpenAI, 141 006 exécutions d'évaluation. Trois incidents. Trois modèles, Claude Opus 4.7, Claude Mythos 5 et un modèle interne, ont atteint internet depuis l'environnement d'un partenaire de test, Irregular, puis pénétré les systèmes réels de trois organisations. Les consignes disaient au modèle qu'il n'avait pas d'accès internet. C'était faux, et personne ne le savait. Techniques employées : mots de passe faibles, points d'accès sans authentification. Du classique de 2005.

Retenez cette ligne, c'est la plus importante du dossier pour un dirigeant. Les modèles les plus avancés du monde, une fois sortis de leur boîte, n'ont pas eu besoin d'être brillants. Ils ont trouvé des mots de passe faibles et des portes sans serrure. La capacité de pointe a servi à sortir. Ce qui a été exploité dehors était à la portée d'un adolescent d'il y a vingt ans.

Anthropic suspend ses évaluations le 23 juillet, identifie les trois cas le 24, prévient les victimes le 27, publie le 30, et engage des discussions avec METR pour une revue indépendante, avec accès à toutes les transcriptions et à un échantillonnage des modèles concernés.

Un détail de leur rapport vaut plus que tous les classements de septembre. Les trois modèles ont réagi différemment quand ils ont compris que la cible était réelle. Le plus ancien a continué. Mythos 5 a identifié, en pleine attaque, que publier un paquet malveillant constituerait une attaque réelle, puis s'est convaincu qu'il était toujours en simulation, et a terminé. Le plus récent s'est arrêté seul. Anthropic précise que ce n'est pas une comparaison contrôlée. C'est tout de même le premier enregistrement empirique publié de ce type, et il dit une chose simple : l'alignement progresse, et il n'est pas fiable.

Un modèle qui se raisonne lui-même pour continuer, ce n'est pas une machine défaillante. C'est un comportement que tout dirigeant a déjà vu autour d'une table, chez des humains, quand l'objectif est fixé et que l'objection coûte cher.

Chez OpenAI comme chez Anthropic, la faille n'était pas dans l'intelligence artificielle. Un composant détourné. Un environnement isolé qui ne l'était pas. Une surveillance en place mais branchée ailleurs. Dan Guido, le fondateur de Trail of Bits, a résumé Hugging Face en une formule : un échec de confinement avec les mesures de sécurité désactivées. Capacité maximale, garde-fous minimaux, dans une boîte qui avait un trou.


Acte 2 : Le câblage

Au début des années 1990, j'ai fait des études de domotique.

Le mot faisait rêver et personne ne savait vraiment ce qu'il désignait. La promesse, elle, était limpide, et c'est exactement celle qu'on nous refait aujourd'hui : la maison allait devenir intelligente. Les volets sauraient qu'il fait nuit. Le chauffage saurait que vous rentrez. L'alarme saurait faire la différence entre un chat et un cambrioleur. On parlait de la maison qui pense, comme on parle aujourd'hui de l'entreprise qui pense.

La réalité du métier était moins photogénique. On ne construisait pas des maisons intelligentes. On greffait de l'intelligence sur des installations électriques qui n'avaient jamais été conçues pour ça.

Une installation électrique de maison, c'est un arbre. Le courant part d'un tableau et descend vers des points d'usage. Un seul sens. Aucun dialogue prévu entre les branches. Ce câblage n'a pas été pensé pour que le volet du premier étage sache quelque chose que le thermostat du rez-de-chaussée ignore. Il a été pensé pour amener du courant à une ampoule, et rien d'autre. Le jour où on a voulu faire circuler de l'information dans ces branches, on a dû ruser : faire passer des signaux sur les fils de puissance, ajouter des modules dans les boîtes de dérivation, tirer des lignes en apparent le long des plinthes quand on ne pouvait pas faire autrement.

Chaque automatisme ajouté créait une dépendance que rien, sur le tableau électrique, ne signalait. Le tableau vous montrait des disjoncteurs. Il ne vous montrait pas que le scénario du soir dépendait d'un module logé derrière un interrupteur du couloir, ni que ce module tomberait en panne le jour où quelqu'un brancherait un appareil qui perturbe la ligne. Vous ne voyiez pas la dépendance. Vous voyiez la fonction.

Et quand ça tombait en panne, ça ne tombait jamais en panne là où on regardait. Le client vous appelait parce que ses volets ne descendaient plus. Vous cherchiez du côté des volets. Ce n'était presque jamais les volets.

L'intelligence n'a jamais été le problème. Le câblage, si.

Trente-cinq ans plus tard, OpenAI découvre qu'un gestionnaire de paquets logiciels peut devenir une messagerie entre agents. Anthropic découvre que son partenaire d'évaluation a laissé internet ouvert dans un environnement dont la consigne affirmait au modèle qu'il était fermé. Dans les deux cas, la capacité fonctionnait exactement comme prévu. C'est l'installation autour qui offrait un chemin que personne n'avait cartographié.

L'échelle a changé. Les montants ont changé. Le problème, non. C'est de la plomberie, et la plomberie n'a pas de version 5.1.

Il y a une raison de fond à cette répétition, et elle n'a rien de technique. Une capacité nouvelle se vend, se démontre, se met sur une page d'accueil. Une dépendance ne se vend pas. Elle ne devient visible que le jour où elle casse, et ce jour-là elle ne s'appelle plus une dépendance, elle s'appelle un incident. Toutes les organisations que j'ai vues, de la maison individuelle des années 1990 au laboratoire valorisé en centaines de milliards, investissent dans ce qui se montre avant d'investir dans ce qui tient.

C'est humain. Ce n'est pas une excuse.


Acte 3 : La nature humaine n'a pas de mise à jour

Sur la partie cyber, OpenAI a fait ce qu'on attend d'une entreprise responsable. Annonce publique du seuil Critique avant la sortie. Description d'un modèle capable de trouver des failles inconnues et de développer de quoi les exploiter sur des systèmes bien protégés sans qu'une personne guide chaque étape. Accès à ces capacités restreint à un programme sur candidature, Daybreak. Surveillance construite pour détecter et contenir les actions désalignées. Une divulgation de risque, pas une vantardise. Anthropic fait de même : Mythos 5.1, la version sans certains garde-fous, reste réservée à des programmes d'accès de confiance ; Fable 5.1, ouverte à tous, cherche les vulnérabilités mais refuse d'écrire les exploits.

Puis vient le second message, celui qui écrase le premier dans les titres.

« Bienvenue dans l'ère de l'AGI. »

Dans la même semaine : attention, ce modèle pénètre des systèmes protégés tout seul, et réjouissez-vous, nous y sommes. Le premier est un avertissement. Le second, du marketing. Et le marketing gagne toujours la bataille de l'attention.

Trente ans de technologie m'ont appris une seule chose sur la nature humaine : chaque capacité disponible finit par être utilisée. Par quelqu'un. Pour quelque chose.

Pas par les laboratoires. Eux publient des rapports d'incident, relisent 141 006 sessions, missionnent des tiers. Par les autres. Ceux qui ne publient rien. Ceux qui prennent un modèle en poids ouverts, c'est-à-dire dont les paramètres sont téléchargeables et modifiables, lui retirent ses garde-fous, ce qui est documenté et faisable, et le pointent vers votre serveur de devis, votre messagerie, votre comptabilité.

En 1988, un étudiant lâche un programme expérimental sur le réseau pour en mesurer la taille et infecte environ un dixième des machines connectées à l'internet de l'époque. En 2017, un outil d'attaque développé par une agence gouvernementale américaine fuite, et quelques semaines plus tard le rançongiciel WannaCry, ce logiciel qui chiffre vos fichiers contre rançon, immobilise des hôpitaux britanniques et des usines en Europe et en Asie. Chaque fois, la capacité existait. Chaque fois, quelqu'un pensait qu'elle resterait entre de bonnes mains.

Le responsable sécurité de Zscaler a commenté Hugging Face en trois mots : la boîte de Pandore est ouverte. Je n'irais pas jusque-là. Quand on tend le bâton, il faut juste arrêter de s'étonner des coups.

Reste un point plus troublant, à manier avec précaution parce qu'il repose sur la presse et non sur une divulgation officielle. The Information a rapporté qu'une technique d'entraînement utilisée pour Astra pourrait affaiblir sérieusement la capacité des humains à comprendre comment le modèle raisonne. Le directeur scientifique d'OpenAI, Jakub Pachocki, a répliqué publiquement qu'il voulait empêcher une course à l'inobservabilité déclenchée par une couverture de presse confuse, sans nier la technique, et en assurant que la profondeur de calcul d'Astra reste dans un facteur deux de celle de GPT-4. Sans esquiver le fond : à mesure que les modèles gagnent en capacité, comprendre exactement ce qu'ils savent faire devient plus difficile.

Le directeur scientifique de l'entreprise qui annonce l'ère de l'AGI reconnaît, la même semaine, qu'on comprend de moins en moins ce que ces systèmes savent faire.

Toby Walsh, professeur d'intelligence artificielle à l'université de Nouvelle-Galles du Sud, a le mot juste : cette intelligence reste inégale. Brillante ici, absurde là, sans qu'on sache toujours pourquoi. Une intelligence à trous, à qui on donne les clés. Un agent qui décide qu'il est encore en simulation pendant qu'il attaque une vraie entreprise.


Acte 4 : La course sans fin

Le calendrier dit plus que les classements de performance.

Entre janvier et septembre 2026, six acteurs ont publié une bonne vingtaine de modèles majeurs. Aucun n'a laissé passer six semaines sans annonce. En 1999, on levait des fonds tous les six mois. Ici, on sort un modèle tous les mois, et chaque modèle rend le précédent obsolète en prix, en capacité, ou les deux.

Acteur Modèle phare Sortie Accès Modèle cyber
OpenAI (valorisée environ 852 milliards de dollars) GPT-6 Astra 3 septembre Payant, API, AWS Capacités avancées réservées au programme Daybreak
Anthropic Claude Fable 5.1 / Mythos 5.1 1er septembre Fable ouvert à tous ; Mythos sur accès de confiance ; accès coupé à tous les utilisateurs du 12 au 30 juin (contrôle des exportations) Même modèle, garde-fous différents
Google DeepMind Gemini 3.1 Pro (février), 3.7 Flash (août) 19 février, 13 août Grand public, API ; Gemma 4 en poids ouverts Gemini 3.5 Flash Cyber réservé aux gouvernements et partenaires
xAI / SpaceXAI Grok 4.6 12 août Grand public, API Grok 5 annoncé pour fin 2025, repoussé trois fois, toujours en entraînement
Meta (Meta Superintelligence Labs) Muse Spark 1.x Avril, juillet, août, septembre Gratuit avec un compte Meta ; Muse Spark en poids fermés, fin de la lignée Llama, mais retour à l'ouvert en août avec Muse Glimmer (30 milliards de paramètres, Apache) Incident similaire reconnu le 5 août, victime non identifiée
Mistral AI (France) Mistral Large 3, Mistral Small 4 Décembre 2025, mars 2026 Apache 2.0 ; endpoints régionaux permettant d'épingler les calculs en Europe depuis août Shieldstral (août)

Et derrière : DeepSeek V4-Pro, 1 600 milliards de paramètres sous licence MIT, disponible pour tous le 13 août. Qwen 3.8 d'Alibaba. GLM-5.3 de Z.ai, sorti le 14 août, dont la version précédente, GLM-5.2, est le modèle que Hugging Face a fait tourner sur ses propres serveurs pour reconstituer l'attaque, après que Claude Opus et Fable ont refusé d'analyser les journaux : leurs garde-fous traitaient la rétro-ingénierie d'un exploit comme son lancement. Un modèle fermé sans garde-fous attaque, un modèle fermé avec garde-fous refuse d'aider à défendre, un modèle ouvert fait le travail.

Cinq choses dans ce tableau.

La course n'est plus sur l'intelligence, elle est sur le prix. Google sort trois Flash en deux mois et aucun Pro. Anthropic divise par quatre le prix du cache de Fable 5.1, ce qui allège la facture type d'environ 25 %, et positionne Opus 5 à la moitié du prix de Fable, pour une performance proche. xAI facture Grok 4.6 deux dollars le million de tokens en entrée, le token étant l'unité de facturation qui vaut à peu près un morceau de mot. DeepSeek publie gratuitement un modèle géant. Quand une industrie passe des records aux promotions, le produit se banalise. Un produit banalisé finit dans toutes les mains.

Chaque acteur garde désormais un modèle cyber sous clé. Mythos, Daybreak, Flash Cyber. Trois laboratoires, la même décision, prise indépendamment : la version qui sait attaquer ne sort pas au grand public. Ceux qui fabriquent le danger le reconnaissent. Et la version que votre prestataire branchera sur votre CRM, votre logiciel de relation client, est volontairement bridée. Bridée n'est pas inoffensive.

Les poids ouverts suivent à quelques mois. DeepSeek estime que ses modèles ouverts n'ont que quelques mois de retard sur les meilleurs modèles propriétaires. OpenAI écrit la même chose dans son rapport du 26 août. Ce qui est sous clé chez OpenAI aujourd'hui sera téléchargeable, sans garde-fous, chez quelqu'un d'autre dans un an. Ce n'est pas une prédiction de ma part, c'est la trajectoire que les deux camps décrivent eux-mêmes.

Le calendrier ne s'est pas arrêté pour les incidents. OpenAI a suspendu une partie de ses entraînements après Hugging Face, et a tout de même sorti Astra six semaines après sa divulgation. Anthropic publie ses trois intrusions le 30 juillet et Fable 5.1 le 1er septembre. Aucune des sorties annoncées après les incidents n'a été repoussée. Quand personne ne peut se permettre de ralentir, le rythme n'est plus piloté par la prudence. Il est piloté par la peur du voisin.

Un seul acteur du tableau est européen. Le seul dont le robinet ne dépend pas d'une décision venue de Washington, comme la mesure de contrôle des exportations du 12 juin qui visait les ressortissants étrangers et a conduit Anthropic à couper Mythos et Fable 5 pour tous ses utilisateurs, américains compris, pendant dix-huit jours. Pas la case la plus puissante. La plus prévisible. En matière de plomberie, la prévisibilité vaut souvent plus que la puissance.

Je ne dis pas qu'il faut débrancher les modèles américains. J'en utilise tous les jours. Je dis qu'un dirigeant qui construit un processus critique sur un seul fournisseur, sans savoir ce qu'il ferait si le robinet se fermait un lundi matin, a pris une décision sans le savoir.


Acte 5 : Ce que je crois

Pas la fin de l'humanité par l'IA. Pas Skynet. Ces scénarios ne sont pas impossibles ; ils sont des distractions. Ils regardent un futur hypothétique pendant que le dommage réel est déjà là, banal, et évitable.

Dans les vingt-quatre prochains mois, des milliers de PME vont se faire ouvrir comme des boîtes de conserve. Pas par une superintelligence. Par des agents de niveau intermédiaire, en libre accès, pilotés par des gens ordinaires avec des intentions ordinaires. Ils ne chercheront pas des zero-day. Ils chercheront ce que Claude a trouvé chez trois organisations réelles : des mots de passe faibles et des accès sans authentification.

Le vrai danger n'est pas l'intelligence des machines. C'est l'asymétrie. Les laboratoires ont des équipes de sécurité, des programmes d'accès de confiance, des seuils critiques, des revues indépendantes confiées à des tiers. Le boulanger, le constructeur de maisons, le cabinet comptable de dix personnes n'ont rien de tout ça. C'est chez eux que le bâton va frapper.

Les grandes ruptures ne détruisent pas ce qui précède. Elles le forcent à muter. Le commerce électronique n'a pas tué le commerce ; il a tué les commerçants qui refusaient de comprendre qu'un client pouvait commander la nuit. Le mobile n'a pas tué le web ; il a tué les sites illisibles sur dix centimètres d'écran. L'IA agentique ne tuera pas la PME. Elle tuera la PME qui pense que la sécurité est un sujet de grand groupe.

L'IA multiplie l'expertise existante, elle ne la remplace pas. Une hygiène numérique solide, l'IA la rend formidable. Une hygiène faible, l'IA la multiplie. Un agent branché sur un système mal cloisonné n'est pas un assistant. C'est un accélérateur.

J'utilise ces outils tous les jours. Chez Apps Velocity, avec Pascal Roche, nous construisons des logiciels avec ces modèles et nous accompagnons des dirigeants qui les déploient. En 2013, avec lui, nous lancions Beyond Coder : permettre à quelqu'un qui ne sait pas coder de faire construire des logiciels par la machine à partir de ce qu'il veut obtenir. Le vibe coding, programmer en décrivant ce qu'on veut et en laissant l'IA produire le code, avec plus de dix ans d'avance.

Le vibe coding sans expertise, c'est construire une maison sans architecte ni maçon. Chez OpenAI, personne ne savait que le gestionnaire de paquets pouvait devenir une messagerie. Chez Anthropic, personne ne savait que la boîte avait une fenêtre ouverte. Les deux entreprises qui comprennent le mieux ces systèmes au monde. Maintenant, prenez une PME de quarante personnes qui branche un agent sur son CRM un vendredi après-midi parce qu'un prestataire lui a dit que c'était magique.

Ce n'est pas un procès fait aux dirigeants. C'est un procès fait à la façon dont on leur vend ces outils : par la capacité, jamais par le confinement. On vous montre ce que l'agent sait faire. On ne vous montre jamais la liste de ce à quoi il a accès.


Acte 6 : Lundi matin

Ce que j'applique chez Apps Velocity et avec les dirigeants que j'accompagne, avec la méthode RAPID.

Recenser. Tout ce qui a un accès chez vous. Les humains, les logiciels, les agents. Chaque connecteur branché sur la messagerie, le CRM, la comptabilité, le stockage. Chaque clé d'API, cette porte technique par laquelle un logiciel parle à un autre, qui traîne dans un outil installé par un stagiaire il y a deux ans. La plupart des dirigeants ne connaissent pas cette liste. OpenAI non plus ne connaissait pas la sienne. Une demi-journée avec la bonne personne suffit à la produire, et ce document vous servira encore dans cinq ans.

Analyser. Pour chaque accès : nécessaire ? Limité au strict minimum ? Un agent qui lit vos e-mails a-t-il besoin d'en envoyer ? Un agent qui remplit des devis a-t-il besoin de la paie ? Moindre privilège : chaque acteur n'a que les droits dont il a besoin. Les trois intrusions chez Anthropic ont réussi sur des accès qui n'auraient jamais dû être ouverts. Ça se corrige en une semaine.

Piloter. La surveillance avant l'agent, pas après. OpenAI avait une surveillance. Elle regardait ailleurs. Pour chaque agent en production, une personne nommée sait ce qu'il a fait hier et le regarde chaque matin. Cinq minutes. Pas un tableau de bord. Un humain avec un nom. Et une règle écrite qui dit à qui il remonte l'anomalie, sous quel délai. Le trou d'OpenAI, entre fin mai et le 19 juillet, n'est pas un trou de surveillance. C'est un trou d'escalade.

Itérer. Testez vos défenses avec les nouveaux modèles, en défense. Fable 5.1 cherche des vulnérabilités sans écrire d'exploit. Pointez-le sur vous-même avant que quelqu'un d'autre ne le fasse. Corrigez. Recommencez le mois suivant. Et relisez chaque panne comme un signal, pas seulement comme une réparation : le 4 juillet, OpenAI a réparé un composant et effacé au passage la preuve d'un comportement qu'elle aurait dû étudier.

Déployer. Ensuite seulement, l'autonomie. Par paliers. Lecture seule, puis écriture sur un périmètre restreint, puis plus large. Avec un bouton d'arrêt que vous avez réellement testé. Deux membres du Congrès américain ont déposé cet été un projet de loi obligeant les laboratoires à pouvoir arrêter, ralentir ou suspendre leurs modèles, et donnant au gouvernement fédéral le pouvoir d'ordonner cet arrêt. Vous n'avez pas besoin d'une loi. Vous avez besoin de savoir qui appuie, et de l'avoir vérifié une fois, à froid, un mardi après-midi.

Aucune de ces cinq étapes ne demande un budget de grand groupe. Elles demandent une décision, une personne, et deux semaines.


Épilogue

L'ère de l'AGI est-elle arrivée ? Ceux qui l'annoncent ne le savent pas, puisque leur propre directeur scientifique admet qu'on comprend de moins en moins ce que ces systèmes savent faire.

L'idée vaut zéro, seule l'exécution compte. Et l'exécution, ici, ce n'est pas le modèle. C'est la boîte autour. Le confinement, les accès, la personne nommée qui regarde chaque matin. Ce que les deux plus grands laboratoires du monde ont raté cet été, ce n'est pas l'intelligence. C'est le câblage.

Au début des années 1990, on m'a appris que la panne n'est presque jamais là où le client la voit. Trente-cinq ans plus tard, deux laboratoires valorisés en centaines de milliards de dollars viennent de le réapprendre, en public, à leurs frais.

Vous n'avez pas leurs moyens. Vous avez un avantage qu'ils n'ont pas : votre installation tient sur une page. Allez la dessiner.

Je ne perds jamais. Soit je gagne, soit j'apprends.

Patrick de Carvalho



Au fait : RAPID, c'est une méthode, un livre, et 40 fiches en accès libre

Recenser ce qui a un accès chez vous, réduire chaque droit au strict nécessaire, nommer la personne qui regarde les journaux le matin, tester avant d'élargir : ce n'est pas de la posture sécuritaire. C'est une méthode, construite avec les dirigeants que j'accompagne et éprouvée sur plus de 150 projets. Je l'ai appelée RAPID, cinq lettres pour cinq phases : Recenser, Analyser, Piloter, Itérer, Déployer. Elle ne sert pas à vous vendre de la peur, je m'y refuse. Elle sert à ce que vos agents travaillent pour votre stratégie au lieu de vous exposer.

Vous pouvez l'aborder par trois portes, selon votre temps et votre envie :

Si cette lecture a réveillé une question que vous aviez repoussée, commencez par les fiches. C'est gratuit, c'est concret, et c'est exactement par là qu'on met le pied à l'étrier.

rapid-mac-face-home-livre-2474 x 1728.webp

Pour une conférence sur ces sujets dans votre entreprise ou votre réseau : patrickdecarvalho.com/fr/conferences



Questions fréquentes

Que s'est-il passé exactement chez OpenAI en juillet 2026 ?

Des modèles en cours d'évaluation de capacités offensives, garde-fous retirés pour mesurer la capacité brute, ont détourné un composant interne de stockage de paquets logiciels pour communiquer entre eux, obtenu un accès internet en exploitant une faille de ce composant, puis pénétré les systèmes de la plateforme Hugging Face entre le 9 et le 13 juillet. OpenAI a divulgué l'incident le 21 juillet et publié un rapport complet le 26 août.

Est-ce que les modèles ont agi par malveillance ?

Non, et c'est le point le plus important. Ils passaient un test technique et cherchaient les réponses aux épreuves qu'ils n'arrivaient pas à résoudre. Aucune instruction humaine hostile n'est en cause. Le comportement problématique vient de l'optimisation vers un objectif, dans un environnement qui offrait des chemins que ses concepteurs n'avaient pas cartographiés.

Mon entreprise est-elle concernée si elle n'utilise pas ces modèles avancés ?

Oui. Le risque décrit ici n'est pas celui d'un modèle de pointe qui vous viserait. C'est celui d'agents de niveau intermédiaire, disponibles librement, qui chercheront chez vous exactement ce qui a fonctionné cet été chez trois organisations réelles : des mots de passe faibles et des points d'accès sans authentification.

Par quoi commencer concrètement ?

Par la liste de tout ce qui a un accès chez vous : humains, logiciels, agents, connecteurs, clés d'API. C'est la phase Recenser de la méthode RAPID, et la plupart des dirigeants n'ont pas ce document. Une demi-journée avec la bonne personne suffit à le produire.

Faut-il arrêter de déployer des agents IA en attendant ?

Non. La bonne séquence est de poser le cadre avant d'ouvrir l'autonomie : recenser les accès, les réduire au strict nécessaire, nommer la personne qui lit les journaux chaque matin, tester ses propres défenses, puis élargir par paliers avec un bouton d'arrêt vérifié.

Vous voulez la suite ?

Rejoignez la liste. Vous recevez les nouveaux articles et les coulisses, sans spam.

Rejoignez la liste