Prompt injection : comprendre la vulnérabilité n°1 des applications LLM
Les applications fondées sur des grands modèles de langage peuvent être détournées par des instructions cachées dans les données qu'elles traitent. Explications et pistes de défense.
La prompt injection consiste à glisser des instructions malveillantes dans le texte traité par un modèle de langage (LLM), afin de lui faire ignorer ses consignes initiales.
Injection directe et indirecte
L'injection directe vient de l'utilisateur lui-même. L'injection indirecte, plus insidieuse, se cache dans un contenu que l'application lit : page web, e-mail, document partagé.
Comment s'en protéger
- Traiter toute donnée externe comme non fiable ;
- Limiter les permissions des outils accessibles au modèle ;
- Exiger une validation humaine pour les actions sensibles ;
- Journaliser et surveiller les comportements anormaux.