Jailbreak
Aussi appelé : Jailbreak LLM · jailbreaking · contournement de sécurité LLM · attaque par prompt malveillant · Débridage d'IA · débridage d'IA · Débridage · débridage · Jailbreak IA
Révisé le
En bref
Le jailbreak d'une IA désigne l'ensemble des techniques de manipulation visant à forcer le modèle à ignorer ses garde-fous de sécurité pour générer du contenu normalement interdit.
📖 Définition
💬 En termes simples
C'est trouver le mot magique qui fait sauter les verrous d'un coffre-fort programmé pour rester scellé.
🎯 Exemple concret
Un service client municipal de Longueuil découvre que son chatbot IA, configuré pour répondre uniquement aux questions sur les déchets, se met à insulter un citoyen après qu'il ait soumis un prompt de jailbreak trouvé en ligne.
💡 Le saviez-vous ?
En 2026, le jailbreak « DAN » (Do Anything Now) et ses dizaines de variantes restaient parmi les outils les plus partagés sur les forums underground IA – la sécurité des LLM est une course sans fin.
❓ Questions fréquentes
À quoi ressemblent ces attaques de jailbreak ?
Pourquoi devriez-vous vous en soucier pour votre chatbot ?
Comment protéger votre image de marque contre ces dérives ?
📚 Sources
- ArXiv - Jailbreaking Black-box LLMs (Liu et al., 2023)
- Wikipedia - Jailbreaking (computer science) (Contributeurs de Wikipédia, 2024)
🔗 Termes liés
🏷️ Catégorie parente
📰 Dans l'actualité
- Contenu sexuel : les garde-fous d'Anthropic cèdent sur ses anciens modèles (il y a 3 semaines)
- Les groupes terroristes exploitent les chatbots IA pour leurs attaques (il y a 2 mois)
- Levée des restrictions sur Claude Fable 5 et Mythos 5 (il y a 2 mois)
- OpenAI lance GPT-5.6 malgré la régulation US (il y a 2 mois)
- Anthropic suspend ses modèles d'IA suite à une directive US (il y a 2 mois)