Perbandingan Decision Tree dan Random Forest untuk Deteksi Dini Diabetes
DOI:
https://doi.org/10.33795/jip.v12i4.10196Keywords:
Decision Tree;, Diabetes Mellitus;, Explainable Artificial Intelligence;, Random Forest;, SHAPAbstract
Diabetes mellitus merupakan gangguan metabolik kronis yang membutuhkan deteksi dini agar komplikasi jangka panjang dapat dicegah sejak awal. Penelitian ini membandingkan kinerja prediktif dua algoritma klasifikasi berbasis pohon, yaitu Decision Tree dan Random Forest, dalam mendeteksi diabetes pada tahap awal menggunakan dataset Pima Indians Diabetes dari UCI Machine Learning Repository. Sebagai pelengkap, penelitian ini juga menerapkan kerangka Explainable Artificial Intelligence lima lapis yang memanfaatkan SHAP guna menghasilkan penjelasan model yang relevan secara klinis, mulai dari kepentingan fitur global hingga validasi terhadap pengetahuan patofisiologi. Rekayasa fitur dilakukan untuk memperluas ruang fitur dari 8 menjadi 14 variabel, sementara tahap praproses meliputi stratified train-test split, imputasi median, winsorizing berbasis IQR, normalisasi Min-Max, dan SMOTE untuk menyeimbangkan distribusi kelas yang tidak proporsional. Optimasi hyperparameter dilakukan melalui GridSearchCV dengan Stratified K-Fold sebanyak lima lipatan, menggunakan F1-Score sebagai kriteria utama. Hasil eksperimen menunjukkan bahwa Random Forest secara konsisten mengungguli Decision Tree pada seluruh metrik evaluasi, dengan F1-Score cross-validation sebesar 0,9002 berbanding 0,8687 dan ROC-AUC pada set pengujian sebesar 80,61% berbanding 70,43%. McNemar Test menunjukkan bahwa perbedaan pola kesalahan klasifikasi antar kedua model tidak signifikan secara statistik pada ukuran sampel yang tersedia, namun pertimbangan multidimensional seperti stabilitas cross-validation dan selisih ROC-AUC tetap mendukung rekomendasi terhadap Random Forest. Analisis SHAP mengonfirmasi bahwa Insulin, Glucose, dan rasio Insulin terhadap Glucose merupakan tiga prediktor paling berpengaruh, sejalan dengan mekanisme patofisiologi diabetes tipe 2 yang telah mapan dalam literatur kedokteran. Penelitian ini juga mengakui keterbatasan generalisabilitas dataset terhadap populasi Indonesia sebagai catatan penting bagi penelitian lanjutan.
Downloads
References
Ahmed, M., Javaid, S., & Saepudin, S. (2025): Cattle Disease Prediction Using Machine Learning Algorithms, Engineering Proceedings, Vol. 107, No. 1, p. 85.
American Diabetes Association. (2024): Classification and Diagnosis of Diabetes: Standards of Medical Care in Diabetes 2024, Diabetes Care, Vol. 47, Suppl. 1, pp. S20-S42.
Apriliah, W., Kurniawan, I., Baydhowi, M., & Haryati, T. (2021): Prediksi Kemungkinan Diabetes pada Tahap Awal Menggunakan Algoritma Klasifikasi Random Forest, Sistemasi: Jurnal Sistem Informasi, Vol. 10, No. 1, pp. 163-171.
Breiman, L. (2001): Random Forests, Machine Learning, Vol. 45, No. 1, pp. 5-32.
Chawla, N. V., Bowyer, K. W., Hall, L. O., & Kegelmeyer, W. P. (2002): SMOTE: Synthetic Minority Over-sampling Technique, Journal of Artificial Intelligence Research, Vol. 16, pp. 321-357.
DeFronzo, R. A., Ferrannini, E., Groop, L., Henry, R. R., Herman, W. H., Holst, J. J., ... & Weiss, R. (2015): Type 2 Diabetes Mellitus, Nature Reviews Disease Primers, Vol. 1, Article 15019.
Fawcett, T. (2006): An Introduction to ROC Analysis, Pattern Recognition Letters, Vol. 27, No. 8, pp. 861-874.
Kahn, S. E., Hull, R. L., & Utzschneider, K. M. (2006): Mechanisms Linking Obesity to Insulin Resistance and Type 2 Diabetes, Nature, Vol. 444, No. 7121, pp. 840-846.
Kementerian Kesehatan Republik Indonesia. (2019): Laporan Nasional Riskesdas 2018, Badan Penelitian dan Pengembangan Kesehatan Kemenkes RI, Jakarta.
Khanam, J. J., & Foo, S. Y. (2021): A Comparison of Machine Learning Algorithms for Diabetes Prediction, ICT Express, Vol. 7, No. 4, pp. 432-439.
Kohavi, R. (1995): A Study of Cross-Validation and Bootstrap for Accuracy Estimation and Model Selection, Proceedings of the 14th International Joint Conference on Artificial Intelligence, Vol. 2, pp. 1137-1143.
Lemaitre, G., Nogueira, F., & Aridas, C. K. (2017): Imbalanced-learn: A Python Toolbox to Tackle the Curse of Imbalanced Datasets in Machine Learning, Journal of Machine Learning Research, Vol. 18, No. 17, pp. 1-5.
Lundberg, S. M., Erion, G., Chen, H., DeGrave, A., Prutkin, J. M., Nair, B., ... & Lee, S.-I. (2020): From Local Explanations to Global Understanding with Explainable AI for Trees, Nature Machine Intelligence, Vol. 2, No. 1, pp. 56-67.
Lundberg, S. M., & Lee, S.-I. (2017): A Unified Approach to Interpreting Model Predictions, Advances in Neural Information Processing Systems, Vol. 30, pp. 4765-4774.
Markus, A. F., Kors, J. A., & Rijnbeek, P. R. (2021): The Role of Explainability in Creating Trustworthy Artificial Intelligence for Health Care: A Comprehensive Survey, Journal of Biomedical Informatics, Vol. 113, p. 103655.
Matthews, D. R., Hosker, J. P., Rudenski, A. S., Naylor, B. A., Treacher, D. F., & Turner, R. C. (1985): Homeostasis Model Assessment: Insulin Resistance and Beta-Cell Function from Fasting Plasma Glucose and Insulin Concentrations in Man, Diabetologia, Vol. 28, No. 7, pp. 412-419.
Nohara, Y., Matsumoto, K., Soejima, H., & Nakashima, N. (2022): Explanation of Machine Learning Models Using Shapley Additive Explanation and Application for Real Data in Hospital, Computers in Biology and Medicine, Vol. 146, p. 105584.
Nurussakinah, N., & Faisal, M. (2023): Klasifikasi Penyakit Diabetes Menggunakan Algoritma Decision Tree, Jurnal Informatika, Vol. 10, No. 2, pp. 143-149.
Pedregosa, F., Varoquaux, G., Gramfort, A., Michel, V., Thirion, B., Grisel, O., ... & Duchesnay, E. (2011): Scikit-learn: Machine Learning in Python, Journal of Machine Learning Research, Vol. 12, pp. 2825-2830.
Smith, J. W., Everhart, J. E., Dickson, W. C., Knowler, W. C., & Johannes, R. S. (1988): Using the ADAP Learning Algorithm to Forecast the Onset of Diabetes Mellitus,
Proceedings of the Annual Symposium on Computer Application in Medical Care, pp. 261-265.
Tasin, I., Nabil, T. U., Islam, S., & Khan, R. (2023): Diabetes Prediction in Healthcare: The Effectiveness of a Fuzzy Multi-Criteria Decision, Healthcare Technology Letters, Vol. 10, No. 1-2, pp. 1-10.
Tjoa, E., & Guan, C. (2021): A Survey on Explainable Artificial Intelligence (XAI): Toward Medical XAI, IEEE Transactions on Neural Networks and Learning Systems, Vol. 32, No. 11, pp. 4793-4813.







