Hastalık tahmininde makine öğrenmesi sınıflandırma algoritmalarının karşılaştırılması ve bootstrap metodu kullanımı
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: İstanbul Ticaret Üniversitesi, Fen Bilimleri Enstitüsü, İSTATİSTİK ANABİLİM DALI, Türkiye
Tezin Onay Tarihi: 2022
Tezin Dili: Türkçe
Öğrenci: GAMZE KABA
Danışman: BAĞDATLI KALKAN SEDA
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Sağlık alanında uzun yıllarca verilerin kayıt altında tutulması ile büyük veri yığınları oluşmaktadır. Veri yığınları makine öğrenmesi yöntemleri kullanılarak sınıflandırılabilir ve daha anlaşılabilir duruma getirilebilir. Bu yöntemler aynı zamanda birçok hastalık tanısının tahmin edilmesine olanak sağlamaktadır. Bu çalışmada, günümüzde küresel olarak ölüm nedenlerinde birinci sırada yer alan Kardiyovasküler Hastalığın erken teşhisi için çeşitli risk faktörleri değerlendirilmiştir. Hastalığın erken tanısı tedavi sürecini hızlandıracağı için sağlık alanında büyük önem taşımaktadır. Bu çalışmada kullanılan veri seti, Kaggle platformu üzerinden elde edilen, "UCI Machine Learning Repository" veri tabanına ait 5 farklı veri setinden 11 ortak özellik altında birleştirilmiş verilerden oluşmaktadır. Çalışmada makine öğrenmesi sınıflandırma algoritmalarından Naive Bayes, Lojistik Regresyon, Rastgele Orman, K-En Yakın Komşu ve Destek Vektör Makineleri olmak üzere beş farklı sınıflandırma yöntemi kullanılarak, oluşturulan modellerin başarı performansları karşılaştırılmıştır. Bu çalışmada, denetimli makine öğrenmesi algoritmaları kullanılarak kalp hastalığı tahminini en iyi yapabilecek modeli belirlemek amaçlanmıştır. Bireylerde kalp hastalığı olma ihtimalini etkileyebilecek olası risk faktörleri incelenmiştir. Çalışmadaki temel hedeflerden biri sınıflandırma yöntemlerinin güvenilirliğini ve tahminsel doğruluğunu arttırmaktır. Bu amaçla veri setine Bootstrap yeniden örnekleme metodu uygulanmıştır. Kullanılan her bir sınıflandırma yönteminin başarısı ham veri ve örneklemler üzerinde model performans ölçütleri ile karşılaştırılmıştır. En başarılı modeli Rastgele Orman algoritmasının oluşturduğu görülmüştür.