Komparasi Kinerja Algoritma XGBoost dengan Reduksi Dimensi PCA pada Klasifikasi Diabetes
DOI:
https://doi.org/10.70609/jusifor.v4i2.8563Kata Kunci:
PCA, XGBoost, Diabetes, Machine Learning, Klasifikasi, ClassificationAbstrak
Diabetes merupakan salah satu penyakit kronis dengan prevalensi tinggi di dunia dan memerlukan deteksi dini yang akurat untuk mencegah komplikasi jangka panjang. Dalam bidang analisis data medis, penerapan algoritma machine learning seperti XGBoost telah terbukti efektif dalam melakukan klasifikasi risiko penyakit. Penelitian ini bertujuan untuk membandingkan kinerja algoritma XGBoost sebelum dan sesudah penerapan Principal Component Analysis (PCA) dalam klasifikasi risiko diabetes menggunakan Early Stage Diabetes Risk Prediction Dataset. Tahapan penelitian meliputi pra-pemrosesan data pemeriksaan nilai hilang, label encoding, pembersihan outlier, normalisasi, serta penerapan PCA dengan retensi variansi sebesar 90%. Hasil eksperimen menunjukkan bahwa model XGBoost tanpa PCA memperoleh akurasi tertinggi sebesar 99,04%, sedangkan model dengan PCA menghasilkan akurasi 98,08%. Meskipun penerapan PCA sedikit menurunkan akurasi, teknik ini berhasil mengurangi jumlah fitur dari dan meningkatkan efisiensi komputasi tanpa kehilangan informasi penting. Dengan demikian, PCA terbukti efektif dalam menyederhanakan kompleksitas data dan mempertahankan kinerja model secara optimal.
Referensi
[1] I. D. Federation, “IDF Diabetes Atlas, 11th edition Global factsheet,” International Diabetes Federation, 2025. [Daring]. Tersedia pada: http://httpsdiabetesatlas.org
[2] W. H. Organization, “Urgent action needed as global diabetes cases increase four-fold over past decades,” 2024, World Health Organization. [Daring]. Tersedia pada: https://www.who.int/news/item/13-11-2024-urgent-action-needed-as-global-diabetes-cases-increase-four-fold-over-past-decades
[3] W. Li, Y. Peng, dan K. Peng, “Diabetes prediction model based on GA-XGBoost and stacking ensemble algorithm,” PLoS One, vol. 19, no. 9, hlm. e0311222, Sep 2024, [Daring]. Tersedia pada: https://doi.org/10.1371/journal.pone.0311222
[4] D. N. Jawza, M. I. Mazdadi, A. Farmadi, T. H. Saragih, D. Kartini, dan V. Abdullayev, “The Enhancing Diabetes Prediction Accuracy Using Random Forest and XGBoost with PSO and GA-Based Feature Selection ,” Journal of Electronics, Electromedical Engineering, and Medical Informatics, vol. 7, no. 2 SE-Electronics, Feb 2025, doi: 10.35882/jeeemi.v7i2.626.
[5] O. Iparraguirre-Villanueva, K. Espinola-Linares, R. O. Flores Castañeda, dan M. Cabanillas-Carbonell, “Application of Machine Learning Models for Early Detection and Accurate Classification of Type 2 Diabetes,” 2023. doi: 10.3390/diagnostics13142383.
[6] U. C. I. M. L. Repository, “Early Stage Diabetes Risk Prediction Dataset,” 2020, University of California, Irvine. [Daring]. Tersedia pada: https://archive.ics.uci.edu/dataset/529/early%2Bstage%2Bdiabetes%2Brisk%2Bprediction%2Bdataset
[7] U. E. Laila, K. Mahboob, A. W. Khan, F. Khan, dan W. Taekeun, “An Ensemble Approach to Predict Early-Stage Diabetes Risk Using Machine Learning: An Empirical Study,” 2022. doi: 10.3390/s22145247.
[8] M. Tantowen, K. Putra, M. Isnan, dan B. Pardamean, “Principal Component Analysis Implementation on Machine Learning in Diabetes Classification,” Communications in Mathematical Biology and Neuroscience, vol. 2024, hlm. 1–19, 2024, doi: 10.28919/cmbn/8492.
[9] F. Rahman, S. Hossain, J.-J. Tiang, dan A.-A. Nahid, “Diabetes Prediction Using Feature Selection Algorithms and Boosting-Based Machine Learning Classifiers,” 2025. doi: 10.3390/diagnostics15202622.
[10] “Principal Component Analysis for Prediabetes Prediction using Extreme Gradient Boosting (XGBoost),” Scientific Journal of Informatics, vol. 11, no. 3 SE-Articles, hlm. 863–872, doi: 10.15294/sji.v11i3.13416.
[11] R. Abdurrosyid, A. Teguh, dan W. Almais, “JEPIN (Jurnal Edukasi dan Penelitian Informatika) Deteksi Dini Diabetes menggunakan Machine Learning dengan Metode PCA dan XGBoost,” vol. 11, no. 1, hlm. 51–56, 2025.
[12] S. Manjula, N. H. Rajini, dan K. Chokkanathan, “Enhanced chronic kidney disease detection using XGBoost with improved brainstorm optimization for hyperparameter tuning,” Discover Applied Sciences, vol. 7, no. 10, hlm. 1181, 2025, doi: 10.1007/s42452-025-07633-7.
[13] J. Gupta, N. Sharma, dan S. Aggarwal, “Impact of Principal Component Analysis on the Performance of Machine Learning Models for the Prediction of Length of Stay of Patients,” EMITTER International Journal of Engineering Technology, vol. 12, no. 2 SE-Articles, Des 2024, doi: 10.24003/emitter.v12i2.835.
[14] I. T. Jolliffe dan J. Cadima, “Principal component analysis: A review and recent developments,” Philosophical Transactions of the Royal Society A, vol. 374, no. 2065, hlm. 20150202, 2016, doi: 10.1098/rsta.2015.0202.
[15] T. Chen dan C. Guestrin, “XGBoost: A Scalable Tree Boosting System,” Mar 2016, doi: 10.48550/arXiv.1603.02754.
Unduhan
Diterbitkan
Terbitan
Bagian
Lisensi
Hak Cipta (c) 2025 Rivale Belano Nusa, Rina Dewi Indahsari

Artikel ini berlisensiCreative Commons Attribution-ShareAlike 4.0 International License.





