Komparasi Algoritma untuk Klasifikasi Penyakit Jantung
Keywords:
Cross-Validation, Decision Tree, Logistic Regression, Overfitting, Support Vector MachineAbstract
Tingginya angka kematian akibat penyakit jantung diperparah oleh proses diagnosis konvensional yang membutuhkan ketelitian tinggi serta rentan terhadap risiko kesalahan manusia (human error). Penelitian ini bertujuan untuk melakukan analisis komparasi performa algoritma Logistic Regression, Decision Tree, dan Support Vector Machine (SVM) guna mengidentifikasi model klasifikasi risiko penyakit jantung yang paling optimal bagi domain medis. Eksperimen diimplementasikan menggunakan skrip Python interaktif yang menguji 1.025 baris sampel klinis lewat pembagian data 80:20, standardisasi fitur, serta pengujian silang 5-Fold Cross-Validation. Berdasarkan hasil pengujian sistem, algoritma Decision Tree mencatatkan nilai Test Accuracy tertinggi mencapai 98,5%. Namun, pengujian validasi silang mengungkap performa aslinya jatuh di angka 82,2%, yang membuktikan adanya fenomena overfitting parah akibat rekayasa duplikasi data latihan, sehingga model ini dieksklusi dari pemilihan akhir. Sementara itu, algoritma Logistic Regression menunjukkan performa yang cukup stabil dengan nilai Test Accuracy sebesar 81,0% dan CV Mean Accuracy 84,4%. Di sisi lain, algoritma SVM dengan Linear Kernel terbukti menghasilkan stabilitas performa terbaik dengan Test Accuracy 81,5% dan CV Mean Accuracy mencapai 85,6%. Meskipun akurasi globalnya berada di bawah Decision Tree, SVM Linear menjadi model paling unggul karena mencatatkan metrik Recall (sensitivitas) kelas sakit tertinggi sebesar 92,38% yang krusial untuk menekan persentase kesalahan diagnosis fatal berupa False Negative. Dengan demikian, algoritma SVM Linear disimpulkan sebagai instrumen alternatif pendukung keputusan klinis terbaik yang paling andal bagi tim kardiologi.
References
[1] Z. S. Munmun, S. Akter, and C. R. Parvez, “Machine Learning-Based Classification of Coronary Heart Disease : A Comparative Analysis of Logistic Regression , Random Forest , and Support Vector Machine Models,” vol. 12, 2025, doi: 10.4236/oalib.1113054.
[2] A. G. Abiodun et al., “Ingénierie des Systèmes d ’ Information Detection of Heart Disease Using Binary Classification Machine Learning Model,” vol. 30, no. 5, pp. 1111–1122, 2025.
[3] T. Mythili, D. Mukherji, N. Padalia, and A. Naidu, “A Heart Disease Prediction Model using SVM-Decision Trees-Logistic Regression ( SDL ),” vol. 68, no. 16, pp. 11–15, 2013.
[4] A. R. Ramadhan, N. Saefulloh, N. Utami, M. Diana, A. Aji, and P. Utomo, “Comparison of Machine Learning Models for Heart Disease Classification with Web-Based Implementation,” vol. 8, no. 2, pp. 598–604, 2024.
[5] M. Anita et al., “KLASIFIKASI FAKTOR RISIKO PENYAKIT JANTUNG MENGGUNAKAN MACHINE,” vol. 16, no. c, pp. 68–78, 2025.
[6] N. Nasution, F. B. Nasution, and M. A. Hasan, “Predicting Heart Disease Using Machine Learning : An Evaluation of Logistic Regression , Random Forest , SVM , and KNN Models on the UCI Heart Disease Dataset,” vol. 9, no. 2, pp. 140–150, 2025.
[7] A. P. Srivastava, B. Vivekanandam, and M. Khan, “Machine Learning in Cardiovascular Disease Prediction : A Comparative Study of Classification Models,” vol. 1, no. 2025.
[8] C. J. Sakr et al., “Hospitals ’ Collaborations Strengthen Pandemic Preparedness : Lessons Learnt from COVID-19,” pp. 1–19, 2024.
[9] K. T. Aondofa and A. Isa, “Comprehensive Comparative Analysis of Computational Intelligence Models for Heart Disease Prediction Comprehensive Comparative Analysis of Computational Intelligence Models for Heart Disease Prediction,” vol. 30, no. 1, pp. 84–93, 2025.
[10] V. Vardhana et al., A Comprehensive Review on Heart Disease Risk Prediction using Machine Learning and Deep Learning Algorithms, no. 0123456789. Springer Netherlands, 2024. doi: 10.1007/s11831-024-10194-4.
[11] V. Aerranagula and R. Bhukya, “Inflammatory Bowel Disease Detection Using Machine Learning Techniques,” vol. 23, no. 2, pp. 354–374, 2026.
[12] Z. Subhi, M. Hawrami, and M. A. Cengiz, “Addressing Class Imbalance in Fetal Health Classification : Rigorous Benchmarking of Multi-Class Resampling Methods on Cardiotocography Data,” pp. 1–28, 2026.
[13] E. Precision, “Automatization of CT Annotation : Combining AI Efficiency with Expert Precision,” 2024.
[14] G. C. Suguna, S. Shirahatti, S. R. Bangari, and S. T. Veerabhadrappa, “Classification of Atrial Fibrillation using Random Forest Algorithm,” no. May, pp. 89–94, 2023.
[15] C. N. Syahputri and M. S. Hasibuan, “OPTIMASI KLASIFIKASI DECISION TREE DENGAN TEKNIK PRUNING UNTUK MENGURANGI OVERFITTING,” vol. 11, no. 2, pp. 87–96, 2024, doi: 10.30656/jsii.v11i2.9161.
[16] H. Üzen and H. Fırat, “A hybrid approach based on multipath Swin transformer and ConvMixer for white blood cells classification,” Heal. Inf. Sci. Syst., vol. 12, no. 1, pp. 1–19, 2024, doi: 10.1007/s13755-024-00291-w.
[17] B. Tegomoh, “Table of contents,” no. May, 2026.
[18] A. Pangestu, D. W. Astuti, A. S. Putri, A. S. Muarof, and T. W. Kusuma, “Analisis Perbandingan 3 Model Machine Learning Pada Deteksi Penyakit Jantung,” vol. 2, no. 3, pp. 434–442, 2025.
[19] Z. Jin, J. Shang, Q. Zhu, C. Ling, W. Xie, and B. Qiang, “RFRSF: Employee Turnover Prediction Based on Random Forests and Survival Analysis,” Lect. Notes Comput. Sci. (including Subser. Lect. Notes Artif. Intell. Lect. Notes Bioinformatics), vol. 12343 LNCS, pp. 503–515, 2020, doi: 10.1007/978-3-030-62008-0_35.
[20] N. Chidera Egegamuka, N. Ekedebe, A. Kingsley Kelechi, O. C. Raymond Patrick, and O. Chidinma C, “Development of Random Forest Model for Stroke Prediction,” Int. J. Innov. Sci. Res. Technol., no. April, pp. 2783–2795, 2024, doi: 10.38124/ijisrt/ijisrt24apr2566.
[21] H. Wang, M. Zhang, L. Mai, X. Li, A. Bellou, and L. Wu, “An effective multi-step feature selection framework for clinical outcome prediction using electronic medical records,” BMC Med. Inform. Decis. Mak., vol. 25, no. 1, 2025, doi: 10.1186/s12911-025-02922-y.