tag MaketSepetAnalizi

Frequent Pattern Mining (Sık Kalıp Madenciliği)

Bu sayfada MaketSepetAnalizi (Frequent Pattern Mining (Sık Kalıp Madenciliği)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Sık Kalıp Madenciliği (Frequent Pattern Mining), büyük veri kümelerinde birlikte sıklıkla ortaya çıkan öğe gruplarını, dizisel kalıpları veya yapısal örüntüleri belirlemeyi hedefleyen temel bir veri madenciliği tekniğidir. "Sık" (frequent) kavramı, bir kalıbın belirli bir minimum destek eşiğini (minimum support threshold) aşması anlamına gelir; yani o kalıbın, tüm işlemlerin (transaction) en az belirlenen yüzdesinde bulunması gerekir. En yaygın kullanım senaryosu birliktelik kuralı madenciliğidir (association rule mining). Süpermarket sepet analizinde "ekmek alan müşteri yüzde seksen olasılıkla tereyağı da alır" türünden kurallar bu yöntemle keşfedilir. Amazon ve Netflix'in öneri sistemleri, kredi kartı dolandırıcılık tespiti ve ağ güvenliği anomali analizi de sık kalıp madenciliğini yoğun biçimde kullanır. Alandaki ilk ve en yaygın algoritma, 1994'te Agrawal ve Srikant tarafından önerilen Apriori'dir. Aday öğe seti üretimi ve budama (candidate generation and pruning) prensibiyle çalışır; her adımda veritabanını yeniden tarar. Bu tarama maliyeti büyük veri setlerinde belirgin bir darboğaz oluşturduğundan, 2000 yılında Jiawei Han ve arkadaşları FP-Growth (Frequent Pattern Growth) algoritmasını geliştirdi. FP-Growth, veriyi kompakt bir FP-Tree yapısına sıkıştırır ve tekrarlı veritabanı taramasını ortadan kaldırarak Apriori'den genellikle 10 ila 100 kat daha hızlı çalışır. Kalıpların değerini belirleyen üç temel ölçüt vardır: destek (support), güven (confidence) ve lift. Destek, bir kalıbın tüm işlemler içindeki görülme oranıdır. Güven, A → B kuralında A'nın geçtiği işlemlerin ne kadarında B'nin de geçtiğini gösterir. Lift ise A ve B'nin bağımsız rastlantısına kıyasla birlikte görülme oranını ölçer; 1'den büyük lift pozitif ilişkiye işaret eder. Bu üçlü, anlamlı ve uygulanabilir kuralları önemsiz korelasyonlardan ayırt etmek için birlikte kullanılır. Günümüzde sık kalıp madenciliği yalnızca kural keşfiyle sınırlı değildir; özellik mühendisliğinde anlamlı özellik kombinasyonlarını bulmak için denetimsiz ön analiz adımı olarak da kullanılır. Python'da mlxtend kütüphanesi apriori() ve fpgrowth() fonksiyonlarıyla, Apache Spark'ta ise MLlib'in FPGrowth modülüyle ölçeklenebilir uygulamalar hayata geçirilebilir.

code_blocks

Frequent Pattern Mining (Sık Kalıp Madenciliği)

Sık Kalıp Madenciliği (Frequent Pattern Mining), büyük veri kümelerinde birlikte sıklıkla ortaya çıkan öğe gruplarını, dizisel kalıpları veya yapısal örüntüleri belirlemeyi hedefleyen temel bir veri madenciliği tekniğidir. "Sık" (frequent) kavramı, bir kalıbın belirli bir minimum destek eşiğini (minimum support threshold) aşması anlamına gelir; yani o kalıbın, tüm işlemlerin (transaction) en az belirlenen yüzdesinde bulunması gerekir. En yaygın kullanım senaryosu birliktelik kuralı madenciliğidir (association rule mining). Süpermarket sepet analizinde "ekmek alan müşteri yüzde seksen olasılıkla tereyağı da alır" türünden kurallar bu yöntemle keşfedilir. Amazon ve Netflix'in öneri sistemleri, kredi kartı dolandırıcılık tespiti ve ağ güvenliği anomali analizi de sık kalıp madenciliğini yoğun biçimde kullanır. Alandaki ilk ve en yaygın algoritma, 1994'te Agrawal ve Srikant tarafından önerilen Apriori'dir. Aday öğe seti üretimi ve budama (candidate generation and pruning) prensibiyle çalışır; her adımda veritabanını yeniden tarar. Bu tarama maliyeti büyük veri setlerinde belirgin bir darboğaz oluşturduğundan, 2000 yılında Jiawei Han ve arkadaşları FP-Growth (Frequent Pattern Growth) algoritmasını geliştirdi. FP-Growth, veriyi kompakt bir FP-Tree yapısına sıkıştırır ve tekrarlı veritabanı taramasını ortadan kaldırarak Apriori'den genellikle 10 ila 100 kat daha hızlı çalışır. Kalıpların değerini belirleyen üç temel ölçüt vardır: destek (support), güven (confidence) ve lift. Destek, bir kalıbın tüm işlemler içindeki görülme oranıdır. Güven, A → B kuralında A'nın geçtiği işlemlerin ne kadarında B'nin de geçtiğini gösterir. Lift ise A ve B'nin bağımsız rastlantısına kıyasla birlikte görülme oranını ölçer; 1'den büyük lift pozitif ilişkiye işaret eder. Bu üçlü, anlamlı ve uygulanabilir kuralları önemsiz korelasyonlardan ayırt etmek için birlikte kullanılır. Günümüzde sık kalıp madenciliği yalnızca kural keşfiyle sınırlı değildir; özellik mühendisliğinde anlamlı özellik kombinasyonlarını bulmak için denetimsiz ön analiz adımı olarak da kullanılır. Python'da mlxtend kütüphanesi apriori() ve fpgrowth() fonksiyonlarıyla, Apache Spark'ta ise MLlib'in FPGrowth modülüyle ölçeklenebilir uygulamalar hayata geçirilebilir.

arrow_forward