Skip to content

Latest commit

 

History

4 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 

Repository files navigation

Varlık/Zamir Çözümleme ve Denetimli Kümeleme Projesi

Bu proje, Türkçe doğal dil işleme (NLP) alanında metin içerisindeki varlık ve zamirlerin (coreference) birbirleriyle olan anlamsal bağlarını İkili Sınıflandırma (Pairwise Classification) ve Denetimli Kümeleme (Supervised Clustering) yöntemleri kullanarak tespit etmeyi amaçlamaktadır.


1. Proje Mimarisi ve Kullanılan Yöntem

Projede, metinlerden TF-IDF ve kelime mesafesi gibi öznitelikler (features) çıkartılarak istatistiksel makine öğrenmesi modellerinden Lojistik Regresyon (Logistic Regression) kullanılmıştır.

Doğal dil verilerinin karakteristik bir problemi olan "Dengesiz Veri" (Imbalanced Data) sorunuyla başa çıkmak için model ağırlıkları dinamik olarak dengelenmiş (class_weight='balanced') ve model başarısı çapraz doğrulama (Cross-Validation) testleriyle güvence altına alınmıştır.


2. Eğitim Sonuçları ve Çıktıların Analizi

Sistem toplam 421 adet kelime çifti üzerinden eğitilmiş ve test edilmiştir.

Metrik Değer
Ortalama Doğruluk (Accuracy) % 82.88
Ortalama F-Measure Skoru % 57.21

Karmaşıklık Matrisi (Confusion Matrix) Değerlendirmesi

Modelin ürettiği Karmaşıklık Matrisi incelendiğinde şu sonuçlar elde edilmiştir:

  • True Negative (338): Birbiriyle eşleşmeyen kelimeler yüksek bir isabetle ayrıştırılmıştır.
  • True Positive (11): Veri setinde sayıca çok az (sadece 21 adet) bulunan gerçek eşleşmelerin yarısından fazlası (Recall: 0.52) başarıyla yakalanmıştır.
  • Akademik Çıkarım: Model, azınlık sınıfını yakalamaya çalışırken 62 adet False Positive (yanlış alarm) üretmiştir. Bu durum; TF-IDF ve kelime mesafesi gibi geleneksel/yüzeysel özniteliklerin, zamir çözümlemesi gibi derin anlamsal (semantic) bağlar gerektiren problemlerde sınırlarına ulaştığını göstermektedir. Bu ampirik bulgu, gelecekteki çalışmalarda bağlamı çift yönlü anlayabilen Transformer tabanlı derin öğrenme modellerinin kullanılması gerektiğine dair güçlü bir temel oluşturmaktadır.

3. CoNLL Formatı Kümeleme Çıktısı

Modelin başarılı eşleşmeleri NetworkX kütüphanesi ile çizge teorisi (graph theory) kullanılarak kümelenmiştir. Sistemin özel bir test cümlesi üzerinde ürettiği ve aynı varlıkları aynı ID (Örn: Türkiye ve Suriye = 2) altında topladığı dinamik CoNLL çıktısı aşağıdadır:

# text = Türkiye ve ABD , Suriye konusunda ortak bir Çalışma başlattı . İstanbul ile Çerkezköy arası seferler arttı . Yeni Zelanda kıyılarındaki Güney Adası ve Farewell Spit sahilinde olaylar yaşandı .
# columns = ID FORM COREF
1	Türkiye	(2)
2	ve	_
3	ABD	(21)
4	,	_
5	Suriye	(2)
6	konusunda	_
7	ortak	_
8	bir	_
9	Çalışma	_
10	başlattı	_
11	.	_
12	İstanbul	(26)
13	ile	_
14	Çerkezköy	(26)
15	arası	_
16	seferler	_
17	arttı	_
18	.	_
19	Yeni Zelanda	(32)
20	kıyılarındaki	_
21	Güney Adası	(32)
22	ve	_
23	Farewell Spit	(32)
24	sahilinde	_
25	olaylar	_
26	yaşandı	_
27	.	_

4. Çalıştırma Kılavuzu

Projenin yerel ortamda nasıl ayağa kaldırılacağı, gerekli kütüphanelerin kurulum adımları ve kodun adım adım çalıştırılma yönergeleri için aşağıdaki dizinde yer alan teknik kılavuzu inceleyebilirsiniz:

Dogal_Dil_Isleme_Projesi/
│
└── Kod/
    └── README.md  <-- Çalıştırma talimatları bu dosyadadır

About

Varlık/Zamir Çözümleme ve Denetimli Kümeleme Projesi

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages