Öz
Kredi kartı dolandırıcılığı veri kümeleri aşırı derecede dengesizdir. Bu çalışmada SMOTE, Borderline-SMOTE, ADASYN ve SMOTE-Tomek yöntemleri; rastgele orman, XGBoost ve LightGBM sınıflandırıcılarıyla birlikte sistematik olarak değerlendirilmiştir. Deneyler 284.807 işlem içeren açık veri kümesinde tabakalı çapraz doğrulama ile yürütülmüştür. SMOTE-Tomek ile birleştirilen XGBoost modeli 0,88 PR-AUC ile en iyi sonucu vermiştir. Aşırı örneklemenin yalnızca eğitim katmanlarında uygulanmasının veri sızıntısını önlemede kritik olduğu gösterilmiştir.
Credit Card Fraud Detection on Imbalanced Datasets Using SMOTE Variants
Credit card fraud datasets are extremely imbalanced. This study systematically evaluates SMOTE, Borderline-SMOTE, ADASYN and SMOTE-Tomek together with random forest, XGBoost and LightGBM classifiers. Experiments were conducted with stratified cross-validation on a public dataset of 284,807 transactions. XGBoost combined with SMOTE-Tomek gave the best result with a PR-AUC of 0.88. Applying oversampling only within training folds was shown to be critical to prevent data leakage.
Tam Metin
Beyanlar
- Etik Kurul Onayı
- This study does not require ethics committee approval.
- Çıkar Çatışması
- The authors declare no conflict of interest.
Kaynakça 6
- Chawla, N. V., Bowyer, K. W., Hall, L. O., & Kegelmeyer, W. P. (2002). SMOTE: Synthetic minority over-sampling technique. Journal of Artificial Intelligence Research, 16, 321–357. https://doi.org/10.1613/jair.953
- Chen, T., & Guestrin, C. (2016). XGBoost: A scalable tree boosting system. In Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (pp. 785–794). https://doi.org/10.1145/2939672.2939785
- Breiman, L. (2001). Random forests. Machine Learning, 45(1), 5–32. https://doi.org/10.1023/A:1010933404324
- Lundberg, S. M., & Lee, S.-I. (2017). A unified approach to interpreting model predictions. Advances in Neural Information Processing Systems, 30.
- Hastie, T., Tibshirani, R., & Friedman, J. (2009). The elements of statistical learning (2nd ed.). Springer. https://doi.org/10.1007/978-0-387-84858-7
- Pedregosa, F., Varoquaux, G., Gramfort, A., Michel, V., Thirion, B., Grisel, O., et al. (2011). Scikit-learn: Machine learning in Python. Journal of Machine Learning Research, 12, 2825–2830.
Atıf Göster
Lisans
© 2024 Merve Şahin, Aigerim Nurlanovna. Bu makale, orijinal eser ve kaynağına uygun atıf yapılması koşuluyla her türlü ortamda sınırsız kullanım, dağıtım ve çoğaltmaya izin veren CC BY 4.0 lisansı altında dağıtılmaktadır. Lisans metni