A B C D E F G H I J K L M N O P Q R S T U V W X Y Z menu_book Tüm terimler tek sayfada

F Harfi ile Başlayan Terimler

blur_on

Fuzzy Logic (Bulanık Mantık)

Bulanık mantık (fuzzy logic), 1965 yılında Lotfi Zadeh tarafından geliştirilen ve klasik Aristoteles mantığının ikili (doğru/yanlış) sınıflandırmasını sürekli bir üyelik derecesine genişleten matematiksel bir çerçevedir. Klasik küme teorisinde bir eleman ya kümeye aittir ya da değildir; bulanık kümede ise 0 ile 1 arasında herhangi bir üyelik derecesi alabilir. Bulanık mantığın temel kavramı bulanık kümeler ve üyelik fonksiyonlarıdır. 'Yüksek sıcaklık' gibi dilsel bir değişken için üçgen veya trapezoid biçimli bir üyelik fonksiyonu tanımlanır; örneğin 35°C 'yüksek sıcaklık' kümesine 0.7, 'çok yüksek sıcaklık' kümesine 0.3 derecesiyle üye olabilir. Bu belirsiz sınırlar gerçek dünyanın muğlak kavramlarını daha doğal biçimde modeller. Bulanık çıkarım sistemi üç aşamadan oluşur: bulanıklaştırma (fuzzification) kesin girdileri üyelik derecelerine dönüştürür; bulanık kural tabanı dilsel kurallarla ('EĞER sıcaklık yüksek VE nem çok fazla İSE fan hızı yüksek') çıkarım yapar; berraklaştırma (defuzzification) ise bulanık çıktıyı ağırlıklı ortalama gibi yöntemlerle kesin bir sayıya dönüştürür. Bulanık mantık, özellikle kesin matematiksel model kurmanın güç olduğu kontrol sistemlerinde güçlüdür. Çamaşır makinesi, klima, kamera otofokus ve metro sistemleri bulanık mantık kontrolörü kullanan yaygın ürünlere örnek verilebilir. Makine öğrenmesi öncesinde endüstriyel otomasyon ve karar destek sistemlerinde standart bir teknolojiydi. Günümüzde bulanık mantık, nöro-bulanık sistemler (neuro-fuzzy) aracılığıyla derin öğrenmeyle birleştirilmektedir. ANFIS (Adaptive Neuro-Fuzzy Inference System) gibi modeller hem yorumlanabilir kural tabanını hem de veriden öğrenme kapasitesini bir arada tutar. Python'da scikit-fuzzy kütüphanesi, MATLAB'da ise Fuzzy Logic Toolbox bu sistemi uygulamak için en yaygın araçlardır. Açıklanabilir yapay zeka (XAI) tartışmalarında bulanık mantığın şeffaf karar yapısı yeniden ilgi görmekte; tıbbi teşhis, finans riski ve gömülü kontrol sistemleri gibi alanlarda etkin biçimde kullanılmaktadır.

arrow_forward
foundation

Foundation Model (Temel Model)

Foundation model (temel model), trilyonlarca token metin, görüntü, ses ve kod verisi üzerinde öz denetimli öğrenme (self-supervised learning) ile önceden eğitilen ve prompt mühendisliği, ince ayar (fine-tuning) veya RAG ile çok sayıda farklı göreve uyarlanabilen büyük ölçekli yapay zeka modelidir. Terimi 2021'de Stanford HAI (Institute for Human-Centered AI) ortaya attı; bugün GPT-5, Claude Opus 4.5, Gemini 3, Llama 4 ve DeepSeek-R1 gibi modeller bu kategorinin güncel örnekleridir. Foundation model yaklaşımından önce her görev için ayrı model eğitilirdi: çeviri için ayrı, duygu analizi için ayrı, görüntü sınıflandırma için ayrı. Temel model bu parçalı yapıyı tersine çevirdi. Tek bir model, devasa ve çeşitli veriyle bir kez eğitilir; ardından tıp, hukuk, yazılım geliştirme veya müşteri hizmetleri gibi alanlara birkaç örnekle (few-shot) ya da küçük bir ek eğitimle uyarlanır. "Bir kez eğit, binlerce göreve uyarla" ilkesi, modern üretken yapay zekanın ekonomik temelini oluşturur. Ölçek bu tanımın merkezindedir. Güncel sınır modelleri yüz milyarlarca ile trilyonlarca parametre taşır; eğitim maliyeti tek model için 100 milyon doları aşabilir (Epoch AI, Gemini Ultra eğitimini ~190M USD hesaplama maliyetiyle tahmin eder). Ölçek büyüdükçe çok adımlı akıl yürütme, kod üretimi ve az örnekle öğrenme gibi "emergent" yetenekler gözlenir — kimi araştırmacılar bunun ölçüm metriğine bağlı bir görünüm olduğunu savunsa da pratik etkisi tartışmasızdır. Kavram LLM ile eş anlamlı değildir: her büyük dil modeli bir foundation model'dir, ancak CLIP (görüntü-metin), Whisper (ses), AlphaFold 3 (protein yapısı) ve SAM 2 (görüntü segmentasyonu) gibi dil dışı temel modeller de vardır. 2026 itibarıyla sınır, metin-görüntü-ses-videoyu tek modelde işleyen natively multimodal mimarilere kaydı; Gemini 3 ve GPT-5 bu sınıfın örnekleridir. Düzenleyici çerçeve de bu kavram üzerine kuruludur: AB Yapay Zeka Yasası, foundation model'leri "genel amaçlı yapay zeka modeli" (GPAI) olarak tanımlar ve Ağustos 2025'ten itibaren eğitim verisi özeti, telif uyumu ve 10^25 FLOP üzeri modeller için sistemik risk yükümlülükleri getirir. Kurumsal tarafta seçim genellikle kapalı API (GPT-5, Claude, Gemini) ile kendi sunucunda çalıştırılabilen açık ağırlıklı model (Llama 4, Qwen3, Mistral, DeepSeek) arasında maliyet, gizlilik ve KVKK/GDPR uyumu ekseninde yapılır.

arrow_forward
code_blocks

Flux (Flux (Görüntü Üretim Modeli))

Flux, Black Forest Labs tarafından 2024 yılında geliştirilen ve metin tabanlı görüntü üretiminde endüstri standardını yeniden belirleyen açık ağırlıklı bir yapay zeka modelidir. Stable Diffusion'ın kurucu ekibi tarafından kurulan Black Forest Labs, Flux ile özellikle prompt uyumu, fotorealistik portre kalitesi ve metin render doğruluğu alanlarında önceki nesil modellerin önüne geçti. Flux ailesi birden fazla sürümden oluşur: Flux.1 Schnell (MIT lisansı, hızlı üretim, ticari kullanıma açık), Flux.1 Dev (açık ağırlıklar, ticari olmayan araştırma), Flux.1 Pro (kapalı API, en yüksek kalite). 2025 sonunda tanıtılan FLUX 2 Pro, 32 milyar parametreyle 4 megapiksel çözünürlüğe kadar görüntü üretebilmekte; karakter tutarlılığı ve renk eşleştirme özellikleriyle öne çıkmaktadır. Flux'un temel teknik farkı Flow Matching mimarisinden kaynaklanır. Diffusion modellerinin Gaussian gürültü ekleme/giderme döngüsü yerine, Flow Matching gürültü alanını görüntü alanına daha verimli bir eğri üzerinden eşler; bu yaklaşım daha az çıkarım adımında yüksek kaliteli görüntü üretilmesine olanak tanır. Flux.1 Schnell yalnızca 4 inference adımıyla ticari düzeyde görseller üretebilir; bu hız Stable Diffusion XL'in 50 adımına kıyasla dramatik bir verimlilik farkıdır. Rekabetçi kıyaslamalarda Flux 1.1 Pro, Midjourney 6.1, Ideogram v2 ve DALL-E 3'ün önünde yer almaktadır. İnsan anatomisi tutarlılığı, el detayları ve tipografi render konusundaki zayıflıklar yıllar içinde büyük ölçüde giderildi. Flux.1 Schnell; Replicate, Hugging Face Spaces, Fal.ai ve ComfyUI aracılığıyla yerel ve bulut ortamlarında erişilebilir durumdadır. Ekosistem açısından Flux, ControlNet, IP-Adapter ve LoRA ince ayar (fine-tuning) gibi araçlarla entegre çalışabilmektedir. Bu entegrasyon; stil transferi, karakter tutarlılığı ve referans görsel tabanlı üretimi mümkün kılar. Yerel çalıştırma için 12 GB VRAM yeterlidir; Schnell sürümü 4-bit niceleme ile daha kısıtlı donanımda da kullanılabilir. İçerik güvenlik filtreleri Pro ve Dev sürümlerinde aktifken Schnell'de kullanıcının tercihine bırakılmıştır.

arrow_forward
psychology_alt

Few-Shot Learning (Az Örnekle Öğrenme)

Few-Shot Learning (Az Örnekle Öğrenme), bir yapay zeka modelinin çok az sayıda etiketli örnek kullanarak yeni bir görevi başarıyla öğrenebilme yeteneğini inceleyen makine öğrenimi paradigmasıdır. Geleneksel denetimli öğrenme algoritmaları güvenilir sonuçlar üretmek için binlerce hatta milyonlarca etiketli veri örneğine ihtiyaç duyarken, few-shot learning yalnızca birkaç örnekle (genellikle 2-10 arası) doğru tahminler yapabilmeyi hedefler. Bu yaklaşım özellikle etiketli veri toplamak için uzman insan emeği gerektiren tıbbi görüntü analizi, nadir dil çiftleri için otomatik çeviri ve yeni ürün kategorizasyonu gibi alanlarda kritik öneme sahiptir. Few-shot learning; model-agnostik meta-öğrenme (MAML), prototipal ağlar, ilişkisel ağlar ve eşleşme ağları gibi tekniklerle hayata geçirilir. Modern büyük dil modellerinde (LLM) few-shot yaklaşım, prompt içine birkaç girdi-çıktı çifti yerleştirerek modelin görevi bağlamdan çıkarmasını sağlar; bu tekniğe in-context few-shot prompting adı verilir. GPT-4, Claude ve Gemini gibi modeller, herhangi bir parametre güncellemesi gerektirmeden yalnızca birkaç örnek ile yeni görevlerde yüksek başarı oranlarına ulaşabilmektedir. Few-shot learning paradigmaları genellikle N-way K-shot formatında tanımlanır: N farklı sınıf, her sınıftan K eğitim örneği. 5-way 1-shot sınıflandırması, 5 yeni kategoriden her birinde yalnızca 1 örnek görerek doğru sınıflandırma yapmak demektir. Bu format, modelin genelleştirme kapasitesini standart ve ölçülebilir biçimde değerlendirmek için yaygın bir kıyaslama standardı hâline gelmiştir. Episodic training (bölümlü eğitim) yaklaşımında her eğitim döngüsü, destek kümesi ve sorgu kümesinden oluşan küçük bir mini görev simüle eder; bu yapı modelin görülmemiş sınıflara hızlı uyum becerisini doğrudan pekiştirir. Pratik kullanımda destek örneklerinin seçim kalitesi, sınıf temsili dengesi ve veri kaynaklı gürültü, few-shot sistem başarısını doğrudan etkileyen başlıca faktörler arasında yer alır. Kavram; hiç örnek gerektirmeyen zero-shot learning ile yüzlerce-binlerce örneğe ihtiyaç duyan fine-tuning arasında pratik bir orta yol sunar. Büyük ön-eğitimli modellerin yaygınlaşmasıyla birlikte few-shot yetenekler giderek artan önem kazanmaktadır.

arrow_forward
inventory_2

Feature Store (Özellik Deposu)

Özellik Deposu (Feature Store), makine öğrenmesi projelerinde özellik mühendisliği sürecini merkezi olarak yöneten, özelliklerin hesaplanmasını, saklanmasını, paylaşılmasını ve yeniden kullanılmasını sağlayan veri yönetim platformudur. Kısaca, ML modelleri için 'tek gerçek kaynak' işlevi görür. Tipik bir makine öğrenmesi iş akışında veri bilimciler zamanlarının büyük kısmını ham veriden özellik üretmeye harcar. Aynı özellikler farklı ekipler tarafından bağımsız biçimde yeniden hesaplanır, bu da hem hesaplama kaynağını israf eder hem de tutarsızlıklara yol açar. Üstelik eğitim ortamında hesaplanan özellikler ile servis (inference) ortamında hesaplanan özellikler arasında farklar oluşabilir — buna 'training-serving skew' denir ve model performansını ciddi ölçüde düşürebilir. Özellik deposu bu sorunları tek bir merkezi platform altında çözer. Modern bir özellik deposunun temel bileşenleri şunlardır: Çevrimdışı Mağaza (Offline Store), tarihsel özellik verilerini toplu işleme ve model eğitimi için saklar; bu katman genellikle bir veri ambarına (BigQuery, Snowflake) veya veri gölüne (S3, GCS) bağlanır. Çevrimiçi Mağaza (Online Store), düşük gecikmeli servis için anlık özellik değerlerini Redis, Cassandra veya DynamoDB gibi anahtar-değer depolarında tutar. Özellik Kayıt Defteri (Feature Registry), hangi özelliklerin kim tarafından tanımlandığını, nasıl hesaplandığını ve hangi modeller tarafından kullanıldığını belgeleyen katalog katmanıdır. Özellik Boru Hattı (Feature Pipeline), ham veriden özellik değerlerine ulaşan ETL/ELT süreçlerini otomatikleştirir ve özellik güncelliğini (freshness) yönetir. Özellik deposu kullanmanın temel faydaları şunlardır: Kod tekrarını önler ve hesaplama maliyetini azaltır; training-serving skew sorununu ortadan kaldırır; model yeniden üretebilirliğini (reproducibility) artırır; özellik keşfini kolaylaştırır ve veri bilimciler arasındaki iş birliğini güçlendirir. Popüler açık kaynak seçenekler arasında Feast ve Hopsworks yer alır. Bulut sağlayıcılar da bu alana girmiştir: AWS SageMaker Feature Store, Google Vertex AI Feature Store ve Databricks Feature Engineering en yaygın kullanılan yönetilen hizmetlerdir.

arrow_forward
vpn_lock

Federated Learning (Birleştirilmiş Öğrenme)

Federated learning (federe öğrenme), makine öğrenmesi modellerinin ham verileri merkezi bir sunucuya göndermek yerine, verilerin bulunduğu cihazlar üzerinde doğrudan eğitilmesini mümkün kılan gizlilik odaklı bir dağıtık öğrenme paradigmasıdır. Google tarafından 2017'de tanıtılan bu yaklaşım, her istemci cihazın kendi yerel verisiyle bir model güncellemesi (gradient veya model ağırlığı değişikliği) hesaplamasını ve yalnızca bu güncellemeyi merkezi bir koordinatöre göndermesini esas alır. Geleneksel makine öğrenmesinde tüm eğitim verisi tek bir merkezi sunucuda toplanır; bu durum hem gizlilik hem de veri sızıntısı riskleri doğurur. Federated learning ise bu problemi yapısal olarak çözer: ham veri hiçbir zaman cihazı terk etmez. Koordinatör sunucu yalnızca anonim gradyanları veya model parametrelerini alır, bunları FedAvg (Federated Averaging) gibi bir toplama algoritmasıyla birleştirir ve güncellenmiş global modeli tüm istemcilere dağıtır. Federated learning'in iki temel çeşidi vardır: yatay federated learning (aynı özellik uzayı, farklı veri örnekleri — örneğin farklı hastanelerden gelen aynı formattaki hasta kayıtları) ve dikey federated learning (farklı özellik uzayları, aynı kullanıcılar — örneğin bir bankanın işlem geçmişi ile bir e-ticaret sitesinin satın alma geçmişinin birleştirilmesi). Bu yapı, GDPR ve HIPAA gibi veri koruma düzenlemelerine uyumu kolaylaştırır. Pratik uygulamalar arasında Google'ın Android klavye tahmini (Gboard), Apple'ın Siri ses tanıma kalitesi iyileştirmesi ve hastane ağlarında tıbbi görüntü analizi öne çıkar. İletişim verimliliği, heterojenik cihaz kapasiteleri (sistem heterojenliği) ve model zehirleme (model poisoning) saldırılarına karşı dayanıklılık, alanın aktif araştırma konularıdır. Diferansiyel gizlilik ve güvenli çok taraflı hesaplama teknikleri ile federated learning'in gizlilik garantisi daha da güçlendirilebilir. Bu kombinasyon, hassas sektörlerde (finans, sağlık, savunma) veri paylaşımı gerektirmeden yüksek kaliteli ortak modeller geliştirmeyi olanaklı kılmakta ve merkezileşme olmaksızın ölçeklenebilir yapay zeka ekosistemlerinin temelini atmaktadır.

arrow_forward
science

Feature Selection (Özellik Seçimi)

Ozellik secimi (feature selection), bir makine ogrenimi modelinin egitiminde kullanilacak en bilgilendirici ve gercek anlam tasiyan ozellik alt kumesini belirlemek amaciyla gereksiz, tekrarli veya alakasiz ozelliklerin elenme surecidir. Cok sayida ozellik her zaman daha iyi model anlamina gelmez; aksine fazla ozellik overfitting riskini arttirir, egitim suresini uzatir ve modelin yorumlanmasini guclestirir. Ozellik secimi uc ana kategoride incelenir. Filter yontemleri, model egitiminden bagimsiz olarak ozellikleri istatistiksel kriterlerle puanlar ve siralar. Chi-squared test, mutual information ve Pearson korelasyon katsayisi bu kategorinin temsil ornekleridir. Uygulamasi hizlidir ve overfitting riski tasimaz; ancak ozellikler arasindaki etkilesimi dikkate almaz. Wrapper yontemleri, secilen ozellik alt kumesini dogrudan bir model uzerinde dener ve performansa gore degerlendirme yapar. Recursive Feature Elimination (RFE), ozellik sayisini katlanarak azaltip her adimda modeli yeniden egiterek en kotu ozelligi eler; bu surec hedef ozellik sayisina ulasana kadar devam eder. Wrapper yontemleri genellikle filter yontemlerine kiyasla daha iyi ozellik alt kumesi bulur ancak hesaplama maliyeti cok yuksektir. Embedded yontemler ozellik secimini model egitim surecininin icine gommus sistemlerdir. LASSO (L1 duzenlemesi) bazi ozellik agirliklarini sifira indirerek otomatik secim saglar. Random Forest ve XGBoost gibi agac tabanli modeller egitim sirasinda her ozelligin onemi hesaplar; bu skorlar dusuk onemli ozellikleri elemede kullanilir. Boyutsallak laneti (curse of dimensionality), yuksek ozellikli uzaylarda orneklerin birbirinden uzaklasip mesafe bazli algoritmalarin anlamsizlasmasi olgusunu ifade eder. Ozellik secimi bu problemi dogrudan adreste. Ek olarak secimlerin yorumlanabilirligi saglar: hangi ozelliklerin modeli surdurup surdurmediginin anlasilmasi, hem ayiklama hem de alan uzmanlarindan geri bildirim alma acisindan kritik oneme sahiptir. **Sik Sorulan Sorular** **Ozellik secimi ile boyut indirgeme (PCA gibi) arasindaki fark nedir?** Ozellik secimi mevcut ozelliklerin bir alt kumesini tutar; orijinal ozellikler yorumlanabilirligini korur. PCA gibi boyut indirgeme yontemleri yeni, yapay ozellikler olusturur; yorumlanabilirlik kaybolur ama bazen daha iyi genelleme saglar. **Kac ozellik yeterlidir?** Genel kural yoktur; veri boyutuna, ornek sayisina ve modele bagimlidir. Cross-validation ile farkli ozellik sayilari denenerek elbow noktasi belirlenir. **Ozellik secimi her zaman gerekli midir?** Sinirli ornek sayisi veya yuksek boyutlu veri durumunda buyuk fayda saglar. Derin ogrenme modelleri ozellik muhendisligini buyuk olcude otomatiklestirebilir; bu durumda acik ozellik secimi daha az kritik olabilir. **Kategorik ozellikler icin hangi yontem kullanilir?** Chi-squared test veya mutual information filter yontemleri kategorik ozellikler icin uygundur. Tree-based modellerin onem skorlari ise kategorik ve sayisal ozelliklerin karisik oldugu veri kumelerinde pratik bir embedded yontemdir.

arrow_forward
memory

Float16 / BFloat16 (Float16 / BFloat16)

Float16 (FP16 veya yarı duyarlıklı kayan nokta), IEEE 754 standardında tanımlanan ve 16 bit (1 işaret + 5 üs + 10 mantis) kullanarak gerçek sayıları temsil eden sayı biçimidir. Standart Float32'ye (32 bit, tekli duyarlık) kıyasla bellek kullanımını yarıya indirir ve modern GPU'ların tensör çekirdeği (tensor core) donanımıyla çok daha yüksek hesaplama verimi sağlar. Derin öğrenmede Float16'nın önemi büyüktür. GPU belleği (VRAM) model eğitimindeki en sık karşılaşılan darboğazlardan biridir; modelin ağırlıklarını ve aktivasyonlarını FP16'da tutmak aynı GPU'da iki kat daha büyük modeller ya da iki kat daha büyük batch boyutları çalıştırmayı mümkün kılar. NVIDIA'nın 2018'de tanıttığı Tensor Core teknolojisi, FP16 matris çarpımlarını FP32 karşısında 4-8× hızlandırmaktadır. Ancak FP16'nın sayı aralığı (yaklaşık ±65504) ve duyarlığı FP32'den çok daha kısıtlıdır. Bu nedenle eğitimde "karma duyarlık" (mixed precision) yaklaşımı tercih edilir: ileri geçiş (forward pass) ve geri yayılım (backward pass) FP16'da, ağırlık güncellemeleri ve kayıp ölçekleme (loss scaling) ise FP32'de tutulur. PyTorch'ta torch.cuda.amp.autocast() ve TensorFlow'da tf.keras.mixed_precision API'si bu işlemi otomatik yönetir. BF16 (Brain Float16), Google tarafından geliştirilen alternatif bir 16-bit formattır: 8 üs biti kullanarak FP32 ile aynı sayı aralığını korur ancak mantis duyarlığı FP16'dan düşüktür. TPU ve NVIDIA Ampere/Hopper GPU'lar BF16'yı doğal olarak destekler; büyük dil modeli eğitiminde BF16, FP16'nın yerini giderek almaktadır. INT8 ve INT4 niceleme, model çıkarım aşamasında daha da küçük bit genişlikleri kullanarak VRAM tasarrufunu daha da ileri götürür. GPTQ, AWQ ve bitsandbytes kütüphaneleri tüketici GPU'larında büyük dil modellerini çalıştırmak için INT4 nicelemeyi yaygınlaştırmıştır. Niceleme miktarı arttıkça modelin doğruluğu düşebilir; bu ödünleşimi ölçmek için perplexity metriği kullanılır. Türkiye'de LLM araştırmacıları ve açık kaynak topluluk üyeleri, sınırlı VRAM'e sahip tüketici GPU'larında Llama ve Mistral modellerini çalıştırmak için bu tekniklere sıklıkla başvurmaktadır.

arrow_forward
tune

Feature Engineering (Öznitelik / Özellik Mühendisliği)

Özellik mühendisliği (feature engineering), ham veriden makine öğrenmesi modellerinin daha iyi öğrenebileceği bilgilendirici özellikler türetme sürecidir. Algoritmalar veriyi olduğu gibi değil, sunulan özellikler aracılığıyla öğrenir; bu nedenle hangi özelliğin nasıl temsil edildiği model performansını doğrudan belirler. Özellik mühendisliği birçok alt görevden oluşur. Özellik oluşturma, mevcut sütunları birleştirerek veya dönüştürerek yeni değişkenler üretir: bir e-ticaret veri setinde kullanıcının gün içi sipariş yoğunluğu 'sabah', 'öğleden sonra', 'gece' gibi zaman dilimi etiketlerine dönüştürülebilir. Özellik seçimi ise gürültülü veya gereksiz değişkenleri elemek için korelasyon analizi, karşılıklı bilgi skoru veya özellik önem skorlarını kullanır. Kategorik değişkenlerin sayısal temsillere dönüştürülmesi temel mühendislik adımlarından biridir. One-hot encoding ikili sütunlar üretirken, hedef kodlama (target encoding) kategorileri hedef değişkenin ortalamasıyla temsil eder. Yüksek kardinaliteli sütunlarda embedding tabanlı yaklaşımlar bilgiyi daha kompakt biçimde saklar. Sayısal özellikler için normalizasyon (min-max ölçekleme) ve standardizasyon (z-skoru dönüşümü) kritik ön işleme adımlarıdır. Mesafe tabanlı algoritmalar (k-NN, SVM) bu ölçeklemeye duyarlıdır; ölçekleme yapılmadan büyük değer aralıklı özellikler küçük aralıklıları gölgede bırakır. Zaman serisi verisinde gecikme özellikleri (lag features), hareketli ortalama ve mevsimsel bileşenler gibi mühendislik dönüşümleri modellerin zamansal örüntüleri kavramasını sağlar. Metin verisinde TF-IDF ve n-gram özellikleri, görüntü verisinde ise histogram eşitleme ve kenar çıkarımı klasik özellik mühendisliği adımlarıdır. Derin öğrenme bu adımların bir kısmını otomasyona taşımış olsa da yapısal ve tablolu veri içeren birçok endüstriyel görevde manuel özellik mühendisliği, model performansını belirleyici biçimde etkileyen kritik ayrımcı etken olmayı sürdürmektedir. Kaggle gibi rekabetçi veri bilimi platformlarında üst sıralardaki çözümlerin ortak özelliği, algoritma seçiminden çok üretken ve yenilikçi özellik mühendisliği stratejisine dayanmalarıdır. Featuretools gibi otomatik mühendislik kütüphaneleri süreci hızlandırırken, alan uzmanlığı en değerli özellik kaynaklarını belirleme konusunda belirleyici rolünü korur.

arrow_forward
face_retouching_natural

Facial Recognition (Yüz Tanıma Teknolojisi)

Yüz tanıma (Facial Recognition), dijital fotoğraf veya video karelerindeki insan yüzlerini otomatik olarak algılayan, analiz eden ve kimliklerini doğrulayan bir biyometrik yapay zeka teknolojisidir. 2012 sonrasında derin öğrenmenin yaygınlaşmasıyla birlikte bu teknoloji, önceki yöntemlere kıyasla çok daha yüksek doğruluk oranlarına ulaşmış ve gündelik hayatın birçok alanına girmiştir. Teknik süreç genellikle beş adımdan oluşur: (1) Yüz Algılama — görüntüde insan yüzü içeren bölge tespit edilir; (2) Hizalama — gözler, burun ve ağız gibi referans noktaları kullanılarak yüz standart bir konuma getirilir; (3) Özellik Çıkarma — derin evrişimli sinir ağları (CNN) veya Vision Transformer mimarileri yüzü 128–512 boyutlu yoğun bir vektöre, yani "yüz izine" (faceprint) dönüştürür; (4) Eşleştirme — bu vektör veritabanındaki kayıtlarla öklid veya kosinüs mesafesi kullanılarak karşılaştırılır; (5) Karar — belirlenen bir eşik değeri aşılırsa kimlik onaylanır. ArcFace, FaceNet ve DeepFace gibi mimariler bu alanda referans kabul edilmektedir. Kullanım senaryoları iki kategoriye ayrılır: 1:1 doğrulama (ör. akıllı telefon kilidi açma, pasaport kontrolü) ve 1:N tanıma (ör. kalabalık içinde kayıp kişi arama, konser bilet doğrulama). Bankacılık KYC süreçleri, mağaza güvenlik sistemleri ve sınır kapıları bu teknolojinin en yaygın ticari uygulama alanlarıdır. Ancak yüz tanıma ciddi etik ve hukuki sorunları da beraberinde getirmektedir. NIST'in FRVT raporları, birçok sistemin Siyah ve Kadın bireylerde hata oranının beyaz erkeklere göre 10–100 kat daha yüksek olduğunu göstermektedir. AB Yapay Zeka Yasası (2024), kamuya açık alanlarda gerçek zamanlı biyometrik tanımayı yüksek riskli yapay zeka sistemleri kapsamına almış ve çok sıkı istisnalar dışında yasaklamıştır. GDPR ise yüz verisini "özel kategori kişisel veri" olarak tanımlamaktadır. Deepfake ve GAN tabanlı sahte yüzlere karşı anti-spoofing katmanları sistemlerin vazgeçilmez bir bileşeni hâline gelmiştir.

arrow_forward
record_voice_over

Fonem (Phoneme)

Fonem (İng. phoneme), bir dilde anlam ayırt etme işlevi gören en küçük soyut ses birimidir. 'Bal' ve 'kal' sözcüklerini birbirinden ayıran /b/ ve /k/ birer fonemdir: bu seslerden birinin değişmesi doğrudan anlam değişikliği yaratır. Fonem soyut bir kavramdır; fiziksel olarak üretilen somut sesler ise **allofon** adını alır. Türkçedeki /l/ fonemi 'lale' sözcüğünde ön damakta, 'al' sözcüğünde arka damakta üretilir, ancak bu fark anlam ayırt etmediği için ikisi de aynı fonemin allofonu sayılır. Bir dilin fonem envanteri, o dildeki tüm anlam ayırt edici seslerin kümesidir. Türkçede bu küme yaklaşık 29 fonemden oluşur (8 ünlü + 21 ünsüz); İngilizcede aksana göre ~44, Hawaii dilinde 13, Güney Afrika'daki !Xũ dilinde ise 141 fonem vardır. Fonemleri evrensel biçimde yazıya dökmek için 1888'den beri kullanılan Uluslararası Fonetik Alfabe (IPA) standarttır: Türkçe 'şeker' sözcüğü IPA ile /ˈʃe.ceɾ/ olarak gösterilir. Yapay zeka açısından fonem, konuşma teknolojilerinin ortak paydasıdır. Otomatik konuşma tanıma (ASR) sistemleri ham ses dalgasını önce mel spektrogram gibi akustik özelliklere, ardından fonem dizilerine, son adımda sözcüklere dönüştürür. Metin-ses (TTS) sistemleri ters yönde çalışır: metin, grafem-fonem (G2P) dönüşümüyle fonem dizisine, oradan akustik özelliklere ve ses dalgasına çevrilir. VITS, FastSpeech 2 ve StyleTTS 2 gibi modern sinirsel TTS modelleri girdilerini fonem dizisi olarak alır; bu yaklaşım homograf belirsizliklerini büyük ölçüde ortadan kaldırır. Whisper large-v3 veya Seamless gibi uçtan uca modeller açık bir fonem katmanı üretmese de, fonemik ayrımları gizli temsillerinde örtük olarak öğrendikleri sonda (probing) çalışmalarıyla gösterilmiştir. Türkçe gibi eklemeli dillerde tek bir kök yüzlerce farklı kelime formu üretebildiğinden, sözcük tabanlı modeller sözlük patlaması yaşar. Sabit ve küçük bir küme olan fonemler (~29 birim) üzerinden modelleme, Türkçe ASR ve TTS sistemlerinde bu yüzden özellikle verimlidir. Mozilla Common Voice'un Türkçe alt kümesi ve OpenSLR veri setleri, fonemik hizalamadan geçirilerek akustik model eğitiminde kullanılır.

arrow_forward
code_blocks

Feature Importance (Özellik Önemi)

Feature importance (özellik önemi), makine öğrenmesi modellerinde her bir girdi özelliğinin tahmin çıktısı üzerindeki etkisini ölçen ve modellerine yorumlanabilirlik kazandıran temel bir tekniktir. On farklı değişken kullanan bir modelde, hangi değişkenlerin tahmini en çok şekillendirdiğini sayısal olarak ortaya koyar; böylece kara kutu modeller daha anlaşılır hale gelir. Bu analiz üç temel yöntemle gerçekleştirilir. Gini/MDI (Mean Decrease Impurity) yöntemi, karar ağacı tabanlı modellerde her özelliğin düğümlerdeki safsızlık azalmasına katkısını hesaplar; hızlı ve yerleşik bir yaklaşım olmakla birlikte yüksek kardinaliteli özelliklere karşı önyargılı olabilir. Permutation Importance yöntemi, bir özelliğin değerlerini test verisi üzerinde rastgele karıştırır ve modelin doğruluğundaki düşüşü ölçer; herhangi bir modelde çalışan model-bağımsız bir tekniktir. SHAP (SHapley Additive exPlanations) değerleri ise kooperatif oyun teorisinden türetilmiş matematiksel bir çerçevedir; her tahmin için her özelliğin bireysel katkısını tutarlı ve adil biçimde hesaplar ve günümüzde endüstri standardı kabul edilmektedir. SHAP'ın avantajı tutarlılık garantisidir: bir özellik modelin tahminini ne kadar etkilerse SHAP değeri de o kadar büyük olur. SHAP değerleri hem global (hangi özellik genel olarak en önemli?) hem de lokal (bu spesifik tahmin için hangi özellik belirleyici oldu?) yorumlama yapar. LIME (Local Interpretable Model-agnostic Explanations) ise karmaşık modeli lokal olarak basit bir doğrusal modelle yaklaşık olarak temsil ederek bireysel tahminler için açıklama üretir. Feature importance analizinin pratik yararları şunlardır: gereksiz özellikleri eleme yoluyla boyut azaltma, modelin paydaşlara anlaşılır biçimde açıklanması, veri toplama maliyetlerinin düşürülmesi ve modeldeki olası önyargı kaynaklarının tespiti. AB Yapay Zeka Yasası ve GDPR, otomatik kararların açıklanmasını zorunlu kılmakta; bu nedenle feature importance, açıklanabilir yapay zeka (XAI) ekosisteminin temel taşlarından birini oluşturmaktadır. Araç desteği açısından Scikit-learn, XGBoost ve LightGBM gibi kütüphaneler yerleşik importance hesapları sunarken, SHAP ve LIME kütüphaneleri herhangi bir kara kutu model için yorumlanabilir açıklamalar üretir. Random forest ve gradient boosting gibi topluluk yöntemleri, özellik önemini ortalama doğruluk kaybı üzerinden doğal biçimde hesaplar. Finans sektöründe kredi kararları, sağlık alanında tanı modelleri ve hukuki süreçlerde yapay zeka kararlarını açıklamak giderek zorunlu hale gelmektedir.

arrow_forward
rocket_launch

FastAPI (Python Web Çerçevesi)

FastAPI, Python geliştiricilerinin yüksek performanslı REST API'leri hızla geliştirmesine olanak tanıyan modern bir web çerçevesidir. Sebastián Ramírez tarafından 2018 yılında yayımlanan bu çerçeve, Python'un standart tip açıklamaları (type hints) üzerine kurulu olup Pydantic ve Starlette kütüphanelerini temel alır. FastAPI, Starlette adlı ASGI tabanlı web çerçevesi üzerine inşa edilmiştir. Bir endpoint tanımlandığında Pydantic kütüphanesi gelen istekleri otomatik doğrular; Swagger UI ve ReDoc arayüzleri ekstra çaba gerekmeksizin interaktif API dokümantasyonu oluşturur. İstek gövdesi, sorgu parametreleri ve path değişkenleri fonksiyon imzasındaki tip açıklamalarından okunur; hatalı veri gönderildiğinde çerçeve otomatik olarak 422 hata yanıtı döner ve hangi alanın neden geçersiz olduğunu açıklar. Async/await desteğiyle aynı anda binlerce isteği yönetebilir; I/O ağırlıklı işlerde —veritabanı sorgusu, harici LLM API çağrısı— event loop bloklanmadan diğer istekler işlenmeye devam eder. Yapay zeka projeleri için FastAPI, modeli bir kez belleğe yükleyip her istek için yeniden yüklemeden çıkarım yapan lifespan olaylarını destekler. Streaming yanıtlar (StreamingResponse), büyük dil modellerinin token token çıktısını HTTP üzerinden gerçek zamanlı aktarmak için özellikle uygundur. Background tasks mekanizması, tahmin sonuçlarını veritabanına kaydetme veya günlük tutma gibi ikincil işlemleri ana yanıtı geciktirmeden yürütür. Performans açısından FastAPI, ASGI ve async/await mimarisiyle yüksek eşzamanlılık sunar; bağımsız kıyaslamalarda Python çerçeveleri arasında en hızlılardan biri olup Node.js ile kıyaslanabilir sonuçlar verir. Flask ve Django REST Framework ile karşılaştırıldığında, tip doğrulama ve otomatik belgeleme geliştirici deneyimini belirgin biçimde iyileştirirken üretim yüklerinde gecikmeyi düşürür. Büyük yapay zeka sistemlerinde FastAPI tipik olarak şu roller üstlenir: LLM veya görüntü modellerinin çıkarım uç noktası, RAG boru hattının orkestra katmanı, model izleme ve geri bildirim toplama API'si. Gunicorn + Uvicorn ikili, Docker ve Kubernetes ortamlarında ölçeklenebilir dağıtım için endüstri standardı haline gelmiştir.

arrow_forward
code_blocks

Frequent Pattern Mining (Sık Kalıp Madenciliği)

Sık Kalıp Madenciliği (Frequent Pattern Mining), büyük veri kümelerinde birlikte sıklıkla ortaya çıkan öğe gruplarını, dizisel kalıpları veya yapısal örüntüleri belirlemeyi hedefleyen temel bir veri madenciliği tekniğidir. "Sık" (frequent) kavramı, bir kalıbın belirli bir minimum destek eşiğini (minimum support threshold) aşması anlamına gelir; yani o kalıbın, tüm işlemlerin (transaction) en az belirlenen yüzdesinde bulunması gerekir. En yaygın kullanım senaryosu birliktelik kuralı madenciliğidir (association rule mining). Süpermarket sepet analizinde "ekmek alan müşteri yüzde seksen olasılıkla tereyağı da alır" türünden kurallar bu yöntemle keşfedilir. Amazon ve Netflix'in öneri sistemleri, kredi kartı dolandırıcılık tespiti ve ağ güvenliği anomali analizi de sık kalıp madenciliğini yoğun biçimde kullanır. Alandaki ilk ve en yaygın algoritma, 1994'te Agrawal ve Srikant tarafından önerilen Apriori'dir. Aday öğe seti üretimi ve budama (candidate generation and pruning) prensibiyle çalışır; her adımda veritabanını yeniden tarar. Bu tarama maliyeti büyük veri setlerinde belirgin bir darboğaz oluşturduğundan, 2000 yılında Jiawei Han ve arkadaşları FP-Growth (Frequent Pattern Growth) algoritmasını geliştirdi. FP-Growth, veriyi kompakt bir FP-Tree yapısına sıkıştırır ve tekrarlı veritabanı taramasını ortadan kaldırarak Apriori'den genellikle 10 ila 100 kat daha hızlı çalışır. Kalıpların değerini belirleyen üç temel ölçüt vardır: destek (support), güven (confidence) ve lift. Destek, bir kalıbın tüm işlemler içindeki görülme oranıdır. Güven, A → B kuralında A'nın geçtiği işlemlerin ne kadarında B'nin de geçtiğini gösterir. Lift ise A ve B'nin bağımsız rastlantısına kıyasla birlikte görülme oranını ölçer; 1'den büyük lift pozitif ilişkiye işaret eder. Bu üçlü, anlamlı ve uygulanabilir kuralları önemsiz korelasyonlardan ayırt etmek için birlikte kullanılır. Günümüzde sık kalıp madenciliği yalnızca kural keşfiyle sınırlı değildir; özellik mühendisliğinde anlamlı özellik kombinasyonlarını bulmak için denetimsiz ön analiz adımı olarak da kullanılır. Python'da mlxtend kütüphanesi apriori() ve fpgrowth() fonksiyonlarıyla, Apache Spark'ta ise MLlib'in FPGrowth modülüyle ölçeklenebilir uygulamalar hayata geçirilebilir.

arrow_forward
build

Fine-Tuning (İnce Ayar)

Fine-tuning (ince ayar), genel amaçlı büyük bir modeli, belirli bir görev veya alan için özelleştirmek amacıyla ek veriyle yeniden eğitme sürecidir. Temel modeller (foundation models), devasa metin ya da görüntü külliyatlarıyla ön eğitimden geçirilir; bu sayede dilin gramerini, mantığını ve genel bilgiyi kodlarlar. Ancak bir şirketin müşteri hizmetleri tonunu benimseyen, belgelerini hep aynı JSON şemasında döndüren ya da tıbbi terminolojiyi hatasız kullanan özel bir modele ihtiyaç duyulduğunda sıfırdan eğitim hem maliyetli hem de veri açısından olanaksız olabilir. İnce ayar, bu boşluğu doldurur: mevcut ağırlıkları başlangıç noktası olarak kullanır ve yeni veriye göre hafifçe güncelleyerek modelin davranışını, biçimini ve üslubunu kalıcı biçimde özelleştirir. Fine-tuning yöntemleri hesaplama maliyeti ve adaptasyon derinliği açısından farklılaşır. Tam ince ayar (full fine-tuning), modelin tüm parametrelerini günceller; maksimum adaptasyon gücü sunarken çok yüksek GPU belleği ve uzun eğitim süresi gerektirir. Catastrophic forgetting (felaketi unutma) da önemli bir risktir: model yeni bilgiyi öğrenirken eski bilgilerini yitirebilir. PEFT (Parameter-Efficient Fine-Tuning) yöntemleri bu sorunu çözmek için parametrelerin büyük çoğunluğunu dondurur ve yalnızca küçük bir alt kümeyi günceller. LoRA (Low-Rank Adaptation), katmanlar arasına düşük sıralı ek matrisler yerleştirerek orijinal ağırlıklara dokunmadan öğrenmeyi mümkün kılar. QLoRA ise temel modeli 4-bit'e kuantize edip üzerine LoRA uygulayarak 65 milyar parametreli modelleri bile tek bir tüketici sınıfı GPU'da eğitmeye elverişli hale getirir. İnce ayarın avantajları net ve ölçülebilirdir: prompt'la her istekte yeniden tarif edilmesi gereken kurallar modelin doğal davranışı haline gelir; bu hem token maliyetini düşürür hem de çıktı tutarlılığını artırır. Kurumsal kullanımda açık kaynak modeller kendi sunucularda ince ayardan geçirilerek hassas veriler üçüncü taraf API'lere aktarılmadan uzman model elde edilir. Eğitim verisi kalitesi ve miktarı, ince ayarın başarısını doğrudan belirleyen en kritik etkenlerdir.

arrow_forward
memory

FPGA (Yeniden Programlanabilir Kapı Dizisi)

FPGA (Field-Programmable Gate Array — Yeniden Programlanabilir Kapı Dizisi), üretim sonrasında yeniden yapılandırılabilen entegre devrelerdir. Yapay zeka uygulamalarında FPGA'lar; CPU'ların genel amaçlı esnekliğini GPU'ların yüksek paralelliğiyle birleştiren hibrit bir alternatif sunar ve özellikle çıkarım (inference) aşamasında belirgin avantajlar ortaya koyar. FPGA, temelinde binlerce veya milyonlarca programlanabilir mantık bloku (CLB — Configurable Logic Block), flip-flop, DSP dilimleri ve bellek blokları (BRAM) içerir. Bunlar, SRAM tabanlı bir yapılandırma belleği (configuration memory) aracılığıyla kullanıcı tanımlı bir devre topolojisine bağlanır. Yapay zeka iş yükleri için kritik olan DSP dilimleri, çarpma-toplama (multiply-accumulate — MAC) işlemlerini yüksek hızda ve düşük güçle yürütür; bu işlem, sinir ağı çıkarımının temel hesaplama adımıdır. GPU'larla karşılaştırıldığında FPGA'nın belirgin üstünlükleri şunlardır: birincisi, belirleyici ve ultra düşük gecikme (deterministic low latency) — FPGA, pipeline mimarisinde veriyi kayan bant hattı gibi işlediğinden tutarsız öbek (batch) bekleme süreleri ortadan kalkar; ikincisi, yüksek enerji verimliliği — Microsoft'un Brainwave projesinde tanıtılan FPGA tabanlı çıkarım sistemi, aynı performans için GPU'ya kıyasla enerji tüketimini önemli ölçüde düşürmüştür; üçüncüsü, doğrudan bellek erişimi — özel veri yolları aracılığıyla bant genişliği darboğazları azalır. Edge AI (kenar yapay zekası) senaryolarında FPGA'lar özellikle ön plana çıkar. Otonom araçlarda sensör füzyonu, tıbbi görüntülemede gerçek zamanlı sınıflandırma, endüstriyel denetimde görüntü işleme ve 5G baz istasyonlarında sinyal işleme bu kullanım alanlarının başında gelir. Xilinx (AMD) ve Intel (Altera) piyasadaki iki ana FPGA üreticisidir; her iki şirket de Vitis AI (AMD) ve OpenVINO (Intel) gibi yapay zeka geliştirme ortamları sunarak yazılım geliştiricilerin FPGA programlamasına erişimini kolaylaştırmaktadır. Quantization (niceleme) ve model pruning (budama) teknikleriyle küçültülmüş modeller FPGA üzerinde özellikle verimli çalışır; INT8 veya INT4 aritmetiği, kaynak kullanımını FP32'ye kıyasla dramatik biçimde azaltır. FPGA'ların yeniden programlanabilirlik özelliği, standart değişikliklerinin sık yaşandığı iletişim ve savunma gibi sektörlerde donanım tasarımı maliyetlerini düşürür.

arrow_forward
data_object

Function Calling (Fonksiyon Çağırma)

Fonksiyon çağırma (function calling), büyük dil modellerinin (LLM) doğal dil yanıtı üretmek yerine önceden tanımlanmış bir aracı veya API-yi çağırabilen yapılandırılmış bir çıktı üretmesi özelliğidir. Bu mekanizma, LLM-leri pasif metin üreticilerinden aktif ajanlara dönüştürmektedir. Fonksiyon çağırma tipik olarak şu şekilde işler: geliştirici, modele hangi fonksiyonların mevcut olduğunu JSON Schema formatında tanımlar. Kullanıcının isteği bu araçların kullanımını gerektiriyorsa model doğal dil yanıtı yerine araç adı ve parametrelerini JSON olarak döner. Uygulama bu JSON-u alır, ilgili fonksiyonu çalıştırır, sonucu modele gönderir ve model nihai yanıtı üretir. OpenAI, bu özelliği GPT-4-te function calling olarak tanıttı; daha sonra tool use adıyla yeniden yapılandırdı. Anthropic Claude-un tool use özelliği, AWS Lambda veya harici API-ler gibi araçlarla entegrasyon için aynı prensibi kullanır. Bu yapılandırma, paralel çağrılar (parallel tool use) ile birden fazla aracı aynı anda çağırmayı da olanaklı kılar. Fonksiyon çağırma; hava durumu sorgulama, veritabanı okuma ve yazma, takvim yönetimi, kod yürütme ve web arama gibi ajanlar için temel bir bileşendir. ReAct (Reason + Act) çerçevesi ve AutoGPT gibi ajan mimarileri bu özelliği sıklıkla kullanmaktadır. MCP (Model Context Protocol), Anthropic-in standartlaştırdığı bir protokoldür; sunucular araçları MCP formatında tanımlayarak herhangi bir MCP destekli modelin bu araçları kullanabilmesini mümkün kılar. Bu sayede uygulamalar, LLM sağlayıcısından bağımsız olarak yeniden kullanılabilir araç kütüphaneleri oluşturabilir. Cursor, Zed ve diğer modern IDE-ler MCP entegrasyonuyla gelişmiş yapay zeka ajan özellikleri sunmaktadır. Fonksiyon çağırma, dil modellerini gerçek dünya sistemleriyle bütünleştiren en önemli mimari yeniliklerden biri olarak değerlendirilmektedir. Yapısal olarak basit görünse de paralel çağrım, hata yönetimi ve araç güvenliği gibi konular üretim sistemlerinde dikkatle ele alınması gereken mühendislik sorunlarıdır. Güvenlik açısından fonksiyon çağırmanın dikkat gerektiren yönleri vardır: prompt enjeksiyonu, modelin meşru bir kullanıcı gibi görünen kötü amaçlı komutlar aracılığıyla beklenmedik araç çağrılarına yönlendirilmesidir. Bu nedenle araç izinleri en az yetki prensibiyle tasarlanmalı, geri alınamaz işlemler (ödeme, silme) için insan onayı mekanizmaları eklenmelidir. Structured Outputs özelliğiyle birleştirildiğinde fonksiyon çağırma, yalnızca JSON şemasına uyan yanıtlar garantilediğinden üretim ortamı güvenilirliğini artırır.

arrow_forward
code_blocks

F1 Skoru (F1 Skoru)

F1 skoru, bir sınıflandırma modelinin başarımını tek bir sayıyla ifade eden temel değerlendirme metriğidir. Kesinlik (precision) ve duyarlılık (recall) olmak üzere iki kritik ölçütü harmonik ortalama yoluyla birleştirir: F1 = 2 × (Precision × Recall) / (Precision + Recall). Kesinlik, modelin "pozitif" olarak tahmin ettiği örneklerin gerçekten pozitif olanlarının oranıdır (TP / (TP + FP)); yanlış alarma (false positive) duyarlılığı ölçer. Duyarlılık ise gerçekte pozitif olan tüm örnekler arasında modelin doğru tespit ettiklerinin oranıdır (TP / (TP + FN)); kaçırılan vakaları (false negative) yansıtır. Bu iki metrik çoğunlukla ters yönde hareket eder: kesinliği artırmak duyarlılığı düşürebilir. Harmonik ortalama, düşük olan değeri daha fazla aşağıya çektiği için her iki metrik de yüksek olmadıkça F1 yükselemez. Örneğin Precision = 1.0, Recall = 0.1 iken aritmetik ortalama 0.55 verirken F1 yalnızca 0.182 olur; bu sayede model, iki metrikteki dengeyi korumak zorunda kalır. Dengesiz veri setlerinde—spam tespiti, kredi kartı dolandırıcılığı, nadir hastalık teşhisi gibi problemlerde—ham doğruluk oranı (accuracy) yanıltıcıdır. Binde biri pozitif olan bir veri setinde tüm örnekleri negatif tahmin eden model %99.9 doğruluk elde eder; ancak F1 skoru sıfır olur. F1, bu tür görevlerde azınlık sınıfının gerçek başarımını yansıtan birincil metriktir. Çok sınıflı problemlerde tek bir F1 değeri üç yöntemle hesaplanır: makro F1 (her sınıfa eşit ağırlık), mikro F1 (global TP/FP/FN toplamlarından) ve ağırlıklı F1 (sınıf büyüklüğüne orantılı ağırlık). Hangi varyantın seçileceği, problemin iş gereksinimlerine ve sınıf dengesizliğine göre belirlenir.

arrow_forward
bolt

Flash Attention (Flash Attention)

Flash Attention, Transformer modellerinin dikkat mekanizmasını GPU yüksek bant genişliği belleğine (HBM - High Bandwidth Memory) erişimleri en aza indirecek şekilde yeniden düzenleyen IO-bilinçli bir hesaplama yöntemidir. Standart dikkat algoritmasının O(n²) bellek karmaşıklığı yerine O(n) bellek kullanımı sağlar; bu fark özellikle uzun bağlam pencerelerinde dramatik bir verimlilik artışı anlamına gelir. Standart dikkat hesaplamasında Q, K, V (sorgu, anahtar, değer) matrislerinin tam NxN boyutundaki dikkat matrisi GPU HBM'e yazılır ve tekrar okunur. N token sayısı arttıkça bu matris için gereken bellek ve HBM erişim sayısı karesiyle büyür; bu hem yavaş hem bellek yoğun bir yaklaşımdır. Flash Attention'ın çözümü tiling (karo) tekniğidir. Giriş matrisleri küçük bloklara (tile) ayrılan bu yaklaşımda her blok GPU'nun hızlı SRAM ön belleğine yüklenir ve dikkat hesaplaması orada tamamlanır. SRAM HBM'den çok daha hızlı ve daha küçük; Flash Attention, HBM yazma/okuma sayısını agresif şekilde azaltarak hesaplamanın belleğe bağlı (memory-bound) darboğazını ortadan kaldırır. Yeniden hesaplama (recomputation) tekniği geri yayılım sırasındaki bellek ihtiyacını yönetir. İleri geçişte ara sonuçlar kaydedilmez; geri yayılım sırasında gerektiğinde yeniden hesaplanır. Bu, bellek tasarrufunu sağlarken ekstra hesaplama maliyeti getirir; ancak bu denge çok küçük bir maliyet olarak kalmaktadır. Tri Dao ve ekibi tarafından geliştirilmiş olan FlashAttention-1 2022'de yayımlanmış; FlashAttention-2 daha iyi iş bölümü ve paralelleştirme ile belirgin hızlanma sağlamıştır. FlashAttention-3, NVIDIA Hopper mimarisinin asenkron boru hatlarını ve FP8 desteğiyle daha da yüksek verimlilik sunmaktadır. PyTorch'un scaled_dot_product_attention API'si Flash Attention'ı varsayılan uygulama olarak entegre etmiştir; bu nedenle günümüzde çok sayıda Transformer uygulaması Flash Attention'dan dolayı, bunu fark etmeden yararlanmaktadır. **Sık Sorulan Sorular** **Flash Attention kullanmak için ne yapmam gerekir?** PyTorch >= 2.0'da torch.nn.functional.scaled_dot_product_attention kullanan herhangi bir model Flash Attention'dan otomatik olarak yararlanır. flash-attn paketini kurarak HuggingFace Transformers ve diğer çerçevedeki modellere Flash Attention 2/3 entegre edilebilir. **Flash Attention hangi GPU'larda çalışır?** FlashAttention-2 NVIDIA Ampere (A100) ve Hopper (H100) GPU'larında en iyi performansı gösterir; RTX serisi tüketici GPU'larında da çalışır. FlashAttention-3 Hopper mimarisine özelleştirilmiştir. **Flash Attention çıktıyı değiştirir mi?** Hayır. Flash Attention standart dikkat ile matematiksel olarak aynı sonucu üretir; fark yalnızca hesaplama verimliliğindedir. **Uzun bağlam neden Flash Attention olmadan bu kadar zorlayıcıdır?** 128K token için standart dikkat n²=16.4 milyar eleman boyutunda bir matris gerektirir; bu GPU belleğini tamamen aşabilir. Flash Attention bu sorunu tiling ile çözerek pratik uzun bağlam işlemesini mümkün kılar.

arrow_forward