Interprétabilité mécaniste
Aussi appelé : Mechanistic interpretability · mechanistic-interpretability · analyse de circuits neuronaux · rétro-ingénierie d'IA
En bref
L'interprétabilité mécaniste est une discipline de recherche visant à comprendre les circuits internes des réseaux de neurones pour expliquer comment ils traitent l'information et prennent des décisions.
📖 Définition
💬 En termes simples
C'est dissection neuroanatomique pour IA – au lieu d'observer le comportement, on cartographie les circuits.
🎯 Exemple concret
Une équipe IA d'une banque montréalaise utilise des outils d'interprétabilité mécaniste pour démontrer à l'AMF que son modèle de scoring crédit n'utilise pas le code postal comme proxy discriminatoire – la preuve technique remplace l'explication marketing.
💡 Le saviez-vous ?
En 2026, Anthropic a publié sa cartographie de plus de 30 millions de « features » identifiées dans Claude 3 Sonnet – la première fois qu'on disposait d'un atlas conceptuel d'un grand modèle de production.
❓ Questions fréquentes
Quelle est la différence entre l'interprétabilité mécaniste et l'explicabilité classique ?
Pourquoi devriez-vous vous intéresser à l'interprétabilité mécaniste ?
Quelles sont les méthodes utilisées pour ouvrir cette boîte noire ?
📚 Sources
- Transformer Lens - Mechanistic Interpretability (Neel Nanda, 2024)
- Anthropic Research - Mapping the Mind of a Large Language Model (Anthropic, 2024)
🔗 Termes liés
🏷️ Catégorie parente
📰 Dans l'actualité
- Silico : L'outil révolutionnaire pour comprendre et ajuster les IA (il y a 4 mois)
- Émotions IA : comment Claude les exprime (il y a 5 mois)