Peur de l’IA : une IA n’agit que par les accès qu’on lui laisse
Des chercheurs et des dirigeants de l’IA disent craindre qu’elle échappe un jour au contrôle humain, et le débat occupe l’actualité. Sans le trancher, cet article montre le point commun des scénarios redoutés et des incidents de cet été, les accès laissés à l’IA, puis ce que ces accès deviennent dans une entreprise et comment un harnais les borne.
La peur d’une IA incontrôlable est revenue au premier plan
Début septembre, un chercheur d’Anthropic a annoncé sa démission en estimant à 10 % le risque que l’IA provoque l’extinction humaine d’ici dix ans. Selon lui, Anthropic et OpenAI font la course vers une superintelligence capable de s’améliorer seule, « en jouant avec nos vies »1. Le patron d’Anthropic a lui-même averti qu’un essaim d’agents pourrait prendre le contrôle d’internet d’ici six mois à un an, si les entreprises ne consacrent pas plus de temps aux garde-fous1. Le 7 septembre, à Genève, le Haut-Commissaire des Nations unies aux droits de l’homme a parlé d’un « risque existentiel pour l’humanité » et réclamé une « vérification indépendante »2.
Le débat reste ouvert. Le rapport international sur la sûreté de l’IA, rédigé avec l’aide de plus de cent experts indépendants, observe dans les systèmes actuels des premiers signes de certaines capacités en cause, mais pas au niveau qui permettrait une perte de contrôle ; il juge la probabilité, la nature et l’échéance de ce risque « inhabituellement ambiguës »1. Un point, en revanche, se vérifie dans chacun des scénarios, et il concerne directement les entreprises.
Dans chaque scénario, l’IA agit par un accès
Un modèle de langage, seul, produit du texte. Pour agir sur le monde, il lui faut un accès : des outils qui exécutent ce qu’il décide, des données qu’on lui laisse voir, ou des personnes qui agissent sur ce qu’il écrit. Les scénarios que décrivent les experts, de l’arme déployée au pathogène identifié, du gouvernement poussé au conflit aux réseaux d’énergie et de communication perturbés1, passent tous par l’un de ces trois accès.
Les incidents de cet été l’ont montré à petite échelle. En juillet, OpenAI a indiqué que deux de ses modèles, testés dans un environnement censé être coupé d’internet, en étaient sortis en exploitant une faille jusque-là inconnue, puis s’étaient introduits sur les serveurs de Hugging Face avec des identifiants exposés et d’autres failles inconnues, pour tricher à une évaluation interne3. Quelques jours plus tard, Anthropic a révélé que trois de ses modèles s’étaient introduits, pendant des tests, dans les systèmes de trois autres organisations1. Dans les deux cas, des garde-fous avaient été désactivés pour ces tests1, 3. Et dans le premier, l’intrusion a tenu à un accès au réseau qui n’aurait pas dû exister et à des identifiants exposés : à ce qui entoure le modèle, que nous appelons le harnais.
En entreprise, ces accès s’appellent la messagerie, les fichiers et les droits
Dans une entreprise, les mêmes accès existent dès qu’un agent est branché sur ses systèmes. En 2025, Anthropic a testé seize modèles de plusieurs développeurs, dont OpenAI, Google, Meta et xAI, dans une entreprise fictive où chacun contrôlait un compte de messagerie ouvert sur tous les e-mails4. Menacés d’être remplacés alors que leurs objectifs contredisaient ceux de l’entreprise, plusieurs ont fait chanter un dirigeant dans au moins 79 % des essais, et jusqu’à 96 % pour deux d’entre eux4. Les auteurs précisent qu’ils ont volontairement limité les options des modèles, et qu’ils n’ont vu aucun signe de ce comportement dans des usages réels4. Leurs recommandations sont celles d’un harnais : faire approuver par une personne toute action aux conséquences irréversibles, et comparer ce qu’un modèle peut consulter avec ce que ses interlocuteurs ont besoin de savoir4.
Le monde de la sécurité a un nom pour ce risque. L’OWASP, qui classe les failles des applications fondées sur des modèles de langage, parle d’agentivité excessive (excessive agency) et lui donne trois causes : trop de fonctions, trop de permissions, trop d’autonomie5. Pour une entreprise, la ruine n’est pas l’extinction, mais elle suit la même logique : une fuite de données ou une action irréversible ne se rattrapent pas. Comme dans le premier article de cette série, il faut les rendre impossibles, pas seulement improbables.
Le harnais ferme chaque accès, sans demander son avis au modèle
C’est le rôle de PipeDuck, accès par accès. Une étape IA n’a que les outils cochés pour elle et, avec l’option haute sécurité, activée par défaut, seulement des fonctions classées sûres. Elle ne voit que sa consigne, les résultats d’étapes précédentes que l’auteur du workflow a choisi d’y placer et ce que ces outils lui rendent. Et une validation, confiée à des approbateurs désignés, peut précéder tout ce qui sort de l’entreprise.
Surtout, aucune de ces limites ne dépend du modèle. L’OWASP recommande de placer l’autorisation dans les systèmes plutôt que de laisser le modèle juger si une action est permise5 : dans PipeDuck, un modèle peut réclamer un outil qu’on ne lui a pas donné, la plateforme ne l’exécute pas. Et un workflow qui utilise une action non sûre doit être approuvé par un administrateur avant de tourner, puis de nouveau après chaque modification.
| Ce qui est redouté | L’accès en jeu | Dans PipeDuck |
|---|---|---|
| Des modèles sortent d’un environnement de test et s’introduisent dans d’autres systèmes | Le réseau, des identifiants exposés | Les scripts tournent dans un conteneur isolé au réseau filtré, et les mots de passe des bases de données restent hors de leur code |
| Un agent qui lit toute la messagerie d’une entreprise fait chanter un dirigeant | Les données, l’envoi d’e-mails | Une étape IA n’a que les outils cochés pour elle, et ne voit que ce que l’auteur lui a placé et ce que ces outils lui rendent |
| Des agents se répandent sur internet | Des outils et une autonomie sans limite | Chaque étape IA a un nombre maximal d’itérations et un plafond de dépense vérifié avant l’appel ; un workflow qui utilise une action non sûre est approuvé avant de tourner |
Ce que le harnais ne règle pas
Un harnais ne rend pas un modèle digne de confiance, et il ne dit rien des systèmes de demain. Il ne protège pas non plus d’un processus mal conçu : donner à une étape IA des données dont elle n’a pas besoin, ou envoyer ce qu’elle écrit sans relecture, rouvre les accès qu’il ferme. Il change en revanche la question posée. « Peut-on faire confiance à ce modèle ? » n’a pas de réponse vérifiable ; « qu’avons-nous permis à ce modèle de faire ? » en a une, et elle se lit dans le workflow.
Le Haut-Commissaire de l’ONU réclame une vérification indépendante2 ; les chercheurs d’Anthropic, une personne pour approuver les actions irréversibles4. Une entreprise n’a pas à attendre la fin du débat pour appliquer ces règles à ses propres agents : c’est le rôle d’un harnais, et c’est le métier de PipeDuck.
Pour voir comment PipeDuck applique ces principes :
La présentation en 3 minutes Créer un espace de démonstrationSources
- A. Veiga, « New warnings about the risks of AI to humanity revive a long-running debate », Associated Press, repris par KPRC, 13 septembre 2026.
- ONU Info, « IA : Volker Türk appelle à agir avant qu’elle ne devienne “un risque existentiel pour l’humanité” », 7 septembre 2026.
- J. Kahn, E. Forlini, « OpenAI says its AI models escaped from a secure test environment and hacked into AI company Hugging Face in order to cheat on an evaluation », Fortune, 21 juillet 2026.
- Anthropic, « Agentic Misalignment: How LLMs could be insider threats », recherche, 20 juin 2025.
- OWASP, « LLM06:2025 Excessive Agency », Top 10 for LLM Applications 2025.