Bu proje, Türkçe doğal dil işleme (NLP) alanında metin içerisindeki varlık ve zamirlerin (coreference) birbirleriyle olan anlamsal bağlarını İkili Sınıflandırma (Pairwise Classification) ve Denetimli Kümeleme (Supervised Clustering) yöntemleri kullanarak tespit etmeyi amaçlamaktadır.
Projede, metinlerden TF-IDF ve kelime mesafesi gibi öznitelikler (features) çıkartılarak istatistiksel makine öğrenmesi modellerinden Lojistik Regresyon (Logistic Regression) kullanılmıştır.
Doğal dil verilerinin karakteristik bir problemi olan "Dengesiz Veri" (Imbalanced Data) sorunuyla başa çıkmak için model ağırlıkları dinamik olarak dengelenmiş (class_weight='balanced') ve model başarısı çapraz doğrulama (Cross-Validation) testleriyle güvence altına alınmıştır.
Sistem toplam 421 adet kelime çifti üzerinden eğitilmiş ve test edilmiştir.
| Metrik | Değer |
|---|---|
| Ortalama Doğruluk (Accuracy) | % 82.88 |
| Ortalama F-Measure Skoru | % 57.21 |
Modelin ürettiği Karmaşıklık Matrisi incelendiğinde şu sonuçlar elde edilmiştir:
- True Negative (338): Birbiriyle eşleşmeyen kelimeler yüksek bir isabetle ayrıştırılmıştır.
- True Positive (11): Veri setinde sayıca çok az (sadece 21 adet) bulunan gerçek eşleşmelerin yarısından fazlası (Recall: 0.52) başarıyla yakalanmıştır.
- Akademik Çıkarım: Model, azınlık sınıfını yakalamaya çalışırken 62 adet False Positive (yanlış alarm) üretmiştir. Bu durum; TF-IDF ve kelime mesafesi gibi geleneksel/yüzeysel özniteliklerin, zamir çözümlemesi gibi derin anlamsal (semantic) bağlar gerektiren problemlerde sınırlarına ulaştığını göstermektedir. Bu ampirik bulgu, gelecekteki çalışmalarda bağlamı çift yönlü anlayabilen Transformer tabanlı derin öğrenme modellerinin kullanılması gerektiğine dair güçlü bir temel oluşturmaktadır.
Modelin başarılı eşleşmeleri NetworkX kütüphanesi ile çizge teorisi (graph theory) kullanılarak kümelenmiştir. Sistemin özel bir test cümlesi üzerinde ürettiği ve aynı varlıkları aynı ID (Örn: Türkiye ve Suriye = 2) altında topladığı dinamik CoNLL çıktısı aşağıdadır:
# text = Türkiye ve ABD , Suriye konusunda ortak bir Çalışma başlattı . İstanbul ile Çerkezköy arası seferler arttı . Yeni Zelanda kıyılarındaki Güney Adası ve Farewell Spit sahilinde olaylar yaşandı .
# columns = ID FORM COREF
1 Türkiye (2)
2 ve _
3 ABD (21)
4 , _
5 Suriye (2)
6 konusunda _
7 ortak _
8 bir _
9 Çalışma _
10 başlattı _
11 . _
12 İstanbul (26)
13 ile _
14 Çerkezköy (26)
15 arası _
16 seferler _
17 arttı _
18 . _
19 Yeni Zelanda (32)
20 kıyılarındaki _
21 Güney Adası (32)
22 ve _
23 Farewell Spit (32)
24 sahilinde _
25 olaylar _
26 yaşandı _
27 . _
Projenin yerel ortamda nasıl ayağa kaldırılacağı, gerekli kütüphanelerin kurulum adımları ve kodun adım adım çalıştırılma yönergeleri için aşağıdaki dizinde yer alan teknik kılavuzu inceleyebilirsiniz:
Dogal_Dil_Isleme_Projesi/
│
└── Kod/
└── README.md <-- Çalıştırma talimatları bu dosyadadır