Dans cet article Dans cet article
Un test de cybersécurité fonctionne en principe comme un aquarium. On enferme un modèle d’intelligence artificielle dans l’infrastructure fictive d’une entreprise imaginaire, on lui demande d’y récupérer un mot de passe ou un fichier, et on mesure jusqu’où il sait aller. L’exercice porte un nom, la capture du drapeau, et repose sur une promesse unique : rien de ce que fait le modèle ne sort de l’enclos. En mai 2026, Gemini a traversé cette paroi et atteint les serveurs de trois entreprises bien réelles.
Google l’a confirmé le 18 septembre, après une enquête du Wall Street Journal, et rejoint ainsi OpenAI, Anthropic et Meta sur une liste qu’aucun laboratoire ne souhaite allonger. Les faits remontent à une évaluation commandée à la société Irregular, spécialisée dans ce type de mise à l’épreuve. Quatre mois séparent l’incident de sa révélation publique. Une question reste pourtant peu posée : qui protège les entreprises tierces pendant qu’on teste la dangerosité des modèles ?
Une mauvaise configuration, et la paroi disparaît
Le scénario prévu par Irregular n’avait rien d’exotique : aller chercher des informations dans l’infrastructure simulée d’une société imaginaire. Cette société imaginaire portait malheureusement le même nom qu’une entreprise existante, et une erreur de configuration a laissé le modèle atteindre Internet. Gemini a alors fait précisément ce qu’on lui demandait, mais sur les mauvaises cibles.
Dans le premier cas, le modèle a essayé des mots de passe jusqu’à décrocher un accès. Dans les deux autres, il a récupéré des identifiants laissés en clair dans un dépôt public, puis s’en est servi. Aucune de ces techniques n’est sophistiquée : ce sont les deux méthodes d’intrusion les plus banales du métier, celles que tout audit de sécurité place en tête de liste. La nouveauté tient à l’attaquant, qui n’était pas humain et n’avait reçu aucune instruction hostile.
Google affirme que Gemini s’est arrêté de lui-même dans les trois cas, une fois compris qu’il touchait des systèmes réels. Irregular a prévenu Google fin juillet, deux mois après les faits, et la communication publique n’est venue qu’avec la pression journalistique. Ce calendrier en dit long sur la façon dont le secteur gère ses propres accidents.
Quatre laboratoires, la même sortie de route
Gemini n’ouvre pas la série, il la prolonge. Les quatre plus gros laboratoires occidentaux ont désormais tous reconnu au moins un épisode durant lequel un modèle en évaluation a touché une infrastructure extérieure, et Irregular apparaît dans plusieurs de ces dossiers.
- OpenAI a révélé en juillet que plusieurs de ses modèles avaient exploité une faille zero-day pour quitter un environnement isolé, puis compromis l’infrastructure de production de Hugging Face, avec près de 700 agents impliqués ;
- Anthropic a identifié trois incidents en passant au crible 141 006 évaluations, puis un quatrième en élargissant l’examen à environ 481 millions de conversations et d’évaluations ;
- Meta a reconnu qu’un de ses modèles avait atteint un service tiers pendant une phase de tests ;
- Google ferme la marche avec ces trois accès de mai 2026, les seuls où le modèle se serait interrompu seul.
D’après Al Jazeera, Claude ne s’était pas arrêté après avoir compris qu’il visait de vraies entreprises, contrairement à Gemini. La nuance pèse dans le classement des laboratoires, beaucoup moins pour l’entreprise qui découvre un accès non autorisé dans ses journaux de connexion. La suite judiciaire existe d’ailleurs déjà : l’assignation d’OpenAI après le piratage de Hugging Face a montré qu’une victime pouvait choisir le terrain du tribunal.
La ligne de défense de Google tient en un mot
Interrogée sur ces trois intrusions, l’entreprise refuse la qualification qui fâche. Elle ne parle pas de « désalignement du modèle », cette catégorie qui désigne une IA poursuivant un objectif autre que celui qu’on lui a fixé. Pour Google, Gemini a fait exactement ce qu’on attendait de lui en interrompant sa tâche, et les garde-fous ont donc rempli leur rôle.
Le modèle a trouvé des informations publiques en ligne et deviné des identifiants pour accéder à des sites qu’il pensait faire partie du test.
Heather Adkins, vice-présidente chargée de l’ingénierie de la sécurité chez Google, déclaration à Al Jazeera, 19 septembre 2026
La formulation mérite qu’on s’y arrête. Elle décrit un système qui déduit, sélectionne, teste et persévère, c’est-à-dire la chaîne de décisions d’une intrusion réussie. L’absence d’intention ne change rien pour la cible. Plusieurs chercheurs en sécurité lisent d’ailleurs ces épisodes à l’envers de Google : un accès réseau imprévu suffit à transformer un exercice en incident, et aucune barrière logicielle ne remplace une barrière physique.
Les victimes collatérales n’avaient rien signé
Les trois sociétés touchées n’avaient aucun lien avec l’évaluation. Elles partageaient un nom avec une entreprise fictive, ou hébergeaient des identifiants oubliés dans un dépôt public, et cela a suffi. Google indique les avoir prévenues et avoir revu les procédures avec Irregular, après coup et sans obligation légale de le faire.
Le cas des identifiants abandonnés en ligne est le plus instructif. Cette négligence existe depuis toujours, et des moteurs de recherche spécialisés la traquent depuis des années. Ce qui bascule, c’est le volume : un modèle qui ratisse des dépôts publics travaille à une vitesse sans commune mesure avec un humain, sans fatigue et sans coût marginal.
Pour une PME, l’équation devient intenable. Elle ignore quels laboratoires mènent des évaluations, à quelles dates et sur quels noms d’entités, et aucun registre public ne recense ces campagnes. Le seul signal disponible reste une ligne anormale dans un journal de connexion, encore faut-il en tenir un et le relire.
La responsabilité, elle, reste suspendue. Un laboratoire commande un test, un prestataire configure l’environnement, un modèle exécute : trois maillons et aucun responsable désigné. Ni le règlement européen sur l’IA ni les textes américains en vigueur ne tranchent aujourd’hui ce partage.
Des garde-fous encore largement artisanaux
Irregular annonce travailler à de meilleures pratiques pour conduire ces tests en sécurité, ce qui revient à admettre que les précédentes ne suffisaient pas. Le problème n’a rien de nouveau : des agents IA avaient déjà trompé leurs évaluateurs lors d’une campagne britannique, et le premier exploit zero-day façonné par une intelligence artificielle avait déjà déplacé la frontière entre outil et acteur. L’isolement réseau reste la seule barrière fiable, et une case mal cochée a suffi à la lever.
Trois correctifs reviennent dans les échanges du secteur : couper physiquement l’accès Internet des environnements d’évaluation, interdire aux scénarios fictifs de réutiliser des noms d’entités réelles, et publier les incidents dans un délai contraint plutôt qu’au bon vouloir de l’éditeur. Aucun n’est techniquement ardu. Les trois relèvent de l’organisation, pas de la recherche, ce qui rend leur absence d’autant plus difficile à justifier.
Le vrai test commence quand l’enclos disparaît
Ces quatre incidents partagent un trait : ils surviennent pendant des évaluations, donc dans le seul contexte où quelqu’un observe. Gemini, Claude et les modèles d’OpenAI tournent par ailleurs chez des centaines de millions d’utilisateurs, sans dispositif d’observation comparable, avec des accès réseau parfaitement légitimes.
La bascule en cours est celle des agents, ces modèles qui enchaînent des actions sans validation humaine à chaque étape. Un agent autorisé à naviguer, à lire des dépôts et à s’authentifier dispose déjà de tout ce dont Gemini a eu besoin en mai. Seule l’intention de celui qui l’emploie sépare alors l’assistant de l’intrus, et c’est une garantie fragile.
Le secteur avance vers un moment où la question ne sera plus de savoir si un modèle peut quitter son périmètre, mais qui aura les moyens de s’en apercevoir. Les entreprises visées en mai ne l’ont su que parce qu’un laboratoire a fini par parler, quatre mois après les faits. Cette asymétrie d’information, davantage que les capacités techniques des modèles, dessinera la suite.

