Contexte
Les banques doivent justifier leurs décisions de crédit auprès des régulateurs. Un modèle performant mais opaque pose problème. Ce projet de recherche appliquée dissèque les mécanismes de l'octroi de crédit, en comparant approche statistique classique et machine learning.
Méthode
- Tests statistiques : t de Welch, Khi² de Pearson, tailles d'effet et correction de Bonferroni.
- Modèle de référence : régression logistique Ridge.
- Modèles d'ensemble optimisés : Random Forest et XGBoost.
Résultats
- Le score de crédit CIBIL domine tous les autres déterminants, avec une taille d'effet extraordinaire (d = 2,49) et un odds ratio de 68.
- Les classements d'importance des variables des modèles de machine learning convergent presque parfaitement avec le modèle linéaire interprétable (ρ de Spearman = 0,98).
Conclusion : on peut obtenir la performance du machine learning sans renoncer à l'interprétabilité, un atout majeur pour la conformité réglementaire.



