Perancangan Pipeline Preprocessing dan Segmentasi Audio Batuk Berbasis Energi Adaptif untuk Klasifikasi Batuk Kering dan Berdahak

Authors

  • Desta Rizky Andhika University of Pembangunan Nasional Veteran Jawa Timur image/svg+xml
  • Faisal Muttaqin University of Pembangunan Nasional Veteran Jawa Timur image/svg+xml
  • Fetty Tri Anggraeny University of Pembangunan Nasional Veteran Jawa Timur image/svg+xml

Keywords:

Audio batuk, Preprocessing audio, Segmentasi Energi Adaptif, MFCC, Capsule Network

Abstract

Rekaman audio batuk dari sumber publik umumnya memiliki variasi format, durasi, jumlah kanal, laju sampling, bagian hening, dan gangguan suara latar yang dapat memengaruhi konsistensi masukan pada proses klasifikasi. Penelitian ini bertujuan merancang pipeline preprocessing dan segmentasi audio batuk berbasis energi adaptif untuk menghasilkan audio yang lebih seragam dan relevan bagi klasifikasi batuk kering (dry) dan batuk berdahak (wet). Kebaruan penelitian ini terletak pada integrasi proses seleksi dan audit kualitas data dengan segmentasi event batuk menggunakan ambang energi yang dihitung secara adaptif pada setiap rekaman, sehingga proses segmentasi dapat menyesuaikan variasi intensitas sinyal antarrekaman tanpa menggunakan satu nilai ambang tetap untuk seluruh data. Tahapan penelitian meliputi seleksi label, audit kualitas audio, konversi format WAV, pengubahan kanal menjadi mono, resampling 16 kHz, trimming bagian hening, segmentasi berbasis energi adaptif, serta penyeragaman durasi menjadi 3 detik. Ambang segmentasi ditentukan secara adaptif berdasarkan estimasi noise floor, nilai RMS maksimum, dan margin sensitivitas sebesar 8.0 dB pada setiap rekaman.. Dari 27.550 entri metadata, diperoleh dataset akhir balanced-confident sebanyak 800 audio yang terdiri atas 400 data dry dan 400 data wet. Seluruh audio keluaran memiliki format WAV, kanal mono, laju sampling 16 kHz, dan durasi 3 detik. Hasil segmentasi menunjukkan rata-rata cakupan energi sebesar 84,58% pada kelas dry dan 82,54% pada kelas wet. Validasi fungsional menggunakan MFCC20 dan Capsule Network menghasilkan accuracy sebesar 71,67% dan F1-score sebesar 70,18%. Hasil tersebut menunjukkan bahwa pipeline mampu menghasilkan masukan audio yang konsisten dan dapat diteruskan ke tahap pemodelan klasifikasi.

References

[1] M. Pahar et al., “Automatic Tuberculosis and COVID-19 cough classification using deep learning,” in 2022 International Conference on Electrical, Computer and Energy Technologies (ICECET), Jul. 2022, pp. 1–9. doi: 10.1109/ICECET55527.2022.9873469.

[2] A. Muhammad, M. A. Arserim, and Ö. Türk, “Compare the classification performances of convolutional neural networks and capsule networks on the Coswara dataset,” Dicle University Journal of Engineering, vol. 14, no. 2, pp. 265–271, 2023, doi: 10.24012/dumf.1270429.

[3] A. Ö. Türkçeti̇N, T. Koç, and Ş. Çi̇Lekar, “COUGH SOUND ANALYSIS WITH DEEP LEARNING: THE IMPACT OF DATA AUGMENTATION ON RESPIRATORY DISEASE CLASSIFICATION,” Mühendislik Bilimleri ve Tasarım Dergisi, vol. 13, no. 3, pp. 896–910, 2025, doi: 10.21923/jesd.1672180.

[4] S. B. Davis and P. Mermelstein, “Comparison of Parametric Representations for Monosyllabic Word Recognition in Continuously Spoken Sentences,” IEEE Transactions on Acoustics, Speech, and Signal Processing, vol. 28, no. 4, pp. 357–366, 1980, doi: 10.1109/TASSP.1980.1163420.

[5] S. Sabour, N. Frosst, and G. E. Hinton, “Dynamic Routing Between Capsules,” Nov. 07, 2017, arXiv: arXiv:1710.09829. doi: 10.48550/arXiv.1710.09829.

[6] M. You, W. Wang, Y. Li, J. Liu, X. Xu, and Z. Qiu, “Automatic cough detection from realistic audio recordings using C-BiLSTM with boundary regression,” Biomedical Signal Processing and Control, vol. 72, p. 103304, Feb. 2022, doi: 10.1016/j.bspc.2021.103304.

[7] L. Orlandic, T. Teijeiro, and D. Atienza, “The COUGHVID crowdsourcing dataset, a corpus for the study of large-scale cough analysis algorithms,” Sci Data, vol. 8, no. 1, p. 156, Jun. 2021, doi: 10.1038/s41597-021-00937-4.

[8] C. Ramadhan, V. Atina, and H. Permatasari, “Analisis Perbandingan Model CNN dan IndoBERT Dalam Sentimen Berita Politik Indonesia,” pp. 110–118, 2025, doi: 10.47701/v1r9ka69.

[9] S. Afriza, N. A. C. Pratama, M. A. Aziz, and F. Muttaqin, “Implementation of CNN Method with Otsu Thresholding Preprocessing for Pneumonia Detection,” JITTER: Jurnal Ilmiah Teknologi dan Komputer, vol. 7, no. 1, 2026.

[10] K. M. Rezaul, “Enhancing Audio Classification Through MFCC Feature Extraction and Data Augmentation with CNN and RNN Models,” International Journal of Advanced Computer Science and Applications, vol. 15, no. 7, 2024.

[11] E. P. Mandyartha, F. T. Anggraeny, F. Muttaqin, and F. A. Akbar, “Global and Adaptive Thresholding Technique for White Blood Cell Image Segmentation,” J. Phys.: Conf. Ser., vol. 1569, no. 2, p. 022054, Jul. 2020, doi: 10.1088/1742-6596/1569/2/022054.

[12] S. A. Hicks et al., “On evaluation metrics for medical applications of artificial intelligence,” Sci Rep, vol. 12, no. 1, p. 5979, Apr. 2022, doi: 10.1038/s41598-022-09954-8.

Downloads

Published

2026-07-25