tag BüyükVeri

Entity Resolution (Varlık Çözümleme)

Bu sayfada BüyükVeri (Entity Resolution (Varlık Çözümleme)) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

Varlık çözümleme (Entity Resolution), farklı veri kaynaklarında yer alan kayıtların aynı gerçek-dünya nesnesine ait olup olmadığını tespit eden ve bu kayıtları birleştiren veri entegrasyon sürecidir. "Record linkage" (kayıt bağlama), "entity matching" (varlık eşleştirme) veya "deduplication" (tekilleştirme) olarak da bilinen bu disiplin, büyük veri yönetimi ile bilgi grafiklerinin temel taşlarından birini oluşturur. Farklı sistemlerden gelen "Ali Veli", "A. Veli" ve "ali.veli@firma.com" gibi kayıtların aynı kişiyi temsil ettiğini, ya da iki ayrı ürün kataloğundaki "iPhone 15 Pro 256GB" ile "Apple iPhone 15Pro" girişlerinin aynı ürünü ifade ettiğini otomatik olarak anlamak, varlık çözümlemenin en yaygın kullanım senaryolarıdır. Süreç üç temel adımda ilerler. İlk adım olan "blocking" (engelleme) aşamasında, tüm olası çift kombinasyonlarını karşılaştırmak yerine yalnızca büyük olasılıkla eşleşecek kayıtlar bir araya getirilir; bu, hesaplama maliyetini dramatik biçimde düşürür. İkinci adımda, seçilen kayıt çiftleri arasındaki benzerlik ölçülür. Bu amaçla Jaccard benzerliği, Levenshtein mesafesi (düzenleme mesafesi) veya makine öğrenimi modelleri kullanılır. Son adımda sınıflandırma yapılarak iki kaydın aynı varlığa mı yoksa farklı varlıklara mı ait olduğu karara bağlanır. Derin öğrenme çağıyla birlikte BERT tabanlı modeller, anlamsal benzerliği değerlendirip yazım hataları, kısaltmalar ve farklı biçimlendirmeler gibi zorluklara karşı çok daha dayanıklı sonuçlar üretmektedir. DeepMatcher, Ditto ve Unicorn bu alanda öne çıkan açık kaynak araçlar arasındadır. Uygulama alanları oldukça geniştir: müşteri veri yönetimi (MDM), sağlık sektöründe hasta kaydı birleştirme, finansal işlemlerde dolandırıcılık tespiti, e-ticarette ürün kataloğu normalizasyonu ve Wikidata gibi bilgi grafiklerinin zenginleştirilmesi bu kapsamda değerlendirilebilir.

link

Entity Resolution (Varlık Çözümleme)

Varlık çözümleme (Entity Resolution), farklı veri kaynaklarında yer alan kayıtların aynı gerçek-dünya nesnesine ait olup olmadığını tespit eden ve bu kayıtları birleştiren veri entegrasyon sürecidir. "Record linkage" (kayıt bağlama), "entity matching" (varlık eşleştirme) veya "deduplication" (tekilleştirme) olarak da bilinen bu disiplin, büyük veri yönetimi ile bilgi grafiklerinin temel taşlarından birini oluşturur. Farklı sistemlerden gelen "Ali Veli", "A. Veli" ve "ali.veli@firma.com" gibi kayıtların aynı kişiyi temsil ettiğini, ya da iki ayrı ürün kataloğundaki "iPhone 15 Pro 256GB" ile "Apple iPhone 15Pro" girişlerinin aynı ürünü ifade ettiğini otomatik olarak anlamak, varlık çözümlemenin en yaygın kullanım senaryolarıdır. Süreç üç temel adımda ilerler. İlk adım olan "blocking" (engelleme) aşamasında, tüm olası çift kombinasyonlarını karşılaştırmak yerine yalnızca büyük olasılıkla eşleşecek kayıtlar bir araya getirilir; bu, hesaplama maliyetini dramatik biçimde düşürür. İkinci adımda, seçilen kayıt çiftleri arasındaki benzerlik ölçülür. Bu amaçla Jaccard benzerliği, Levenshtein mesafesi (düzenleme mesafesi) veya makine öğrenimi modelleri kullanılır. Son adımda sınıflandırma yapılarak iki kaydın aynı varlığa mı yoksa farklı varlıklara mı ait olduğu karara bağlanır. Derin öğrenme çağıyla birlikte BERT tabanlı modeller, anlamsal benzerliği değerlendirip yazım hataları, kısaltmalar ve farklı biçimlendirmeler gibi zorluklara karşı çok daha dayanıklı sonuçlar üretmektedir. DeepMatcher, Ditto ve Unicorn bu alanda öne çıkan açık kaynak araçlar arasındadır. Uygulama alanları oldukça geniştir: müşteri veri yönetimi (MDM), sağlık sektöründe hasta kaydı birleştirme, finansal işlemlerde dolandırıcılık tespiti, e-ticarette ürün kataloğu normalizasyonu ve Wikidata gibi bilgi grafiklerinin zenginleştirilmesi bu kapsamda değerlendirilebilir.

arrow_forward
insights

Predictive Analytics (Öngörüsel Analitik)

Tahmine dayalı analitik (predictive analytics), istatistiksel modeller, makine öğrenmesi algoritmaları ve geçmiş verileri kullanarak gelecekteki olayları, eğilimleri veya davranışları tahmin eden veri bilimi disiplinidir. Geriye dönük tanımlayıcı analitiğin ötesine geçerek 'ne olabilir?' sorusuna olasılıksal yanıtlar üretir. Tahmine dayalı analitiğin en yaygın uygulaması müşteri davranışı tahminidir. E-ticaret platformları satın alma olasılığını tahmin ederek kişiselleştirilmiş öneriler sunar; bankalar kredi temerrüt olasılığını modelleyerek risk yönetimi yapar; sigorta şirketleri poliçe başvurusu alınmadan önce kaza olasılığını hesaplar. Bu modeller lojistik regresyon, karar ağaçları, rastgele orman veya gradient boosting gibi algoritmalar üzerine inşa edilebilir. Sağlık sektöründe tahmine dayalı analitik erken tanı için kritik değer taşır. Hasta taburculuk sonrası hastaneye yeniden kabul olasılığını, sepsis riskini veya ilaç uyumsuzluğunu öngören modeller klinik kararları destekler. IBM Watson Health ve Optum gibi platformlar bu kapasiteleri ölçeklenebilir biçimde sunmaktadır. Tedarik zinciri ve üretimde kestirimci bakım (predictive maintenance), ekipman arızasını önceden tespit ederek plansız duruş sürelerini ve bakım maliyetlerini azaltır. Sensör verileri, titreşim analizi ve sıcaklık örüntüleri makine sağlığını sürekli izlemek için kullanılır. Model geliştirme sürecinde özellik seçimi, eğitim-test bölmeleme, zaman serisi kayması (temporal leakage) ve sınıf dengesizliği gibi zorluklarla dikkatli biçimde başa çıkmak gerekir. Tahmin modeli doğruluğu kadar açıklanabilirliği ve adilliği de giderek daha fazla ön plana çıkmaktadır.

arrow_forward