tag icerk-politikasi
Bu sayfada icerk-politikasi etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
Guardrails (AI Koruyucuları), bir yapay zeka sisteminin çıktısını denetleyerek zararlı, yanıltıcı, önyargılı veya hizmet politikasıyla çelişen içerikleri engellemeye ya da yönlendirmeye yarayan teknik ve süreçsel kontrol mekanizmalarıdır. Büyük dil modellerinin giderek daha geniş kullanıcı kitlesine ulaşmasıyla birlikte bu mekanizmalar yapay zeka güvenliğinin temel yapı taşı haline gelmiştir. Guardrails, uygulama katmanına göre farklı biçimler alır. Giriş guardrails (input guardrails), kullanıcının gönderdiği prompt'u modele iletilmeden önce denetler; nefret söylemi, kişisel veri sızıntısı veya prompt injection girişimlerini erken aşamada filtreler. Çıkış guardrails (output guardrails), modelin ürettiği metni kullanıcıya gösterilmeden önce inceler ve politika ihlalleri için yanıtı engeller, değiştirir ya da uyarıyla işaretler. Teknik uygulamada guardrails farklı yöntemlerle hayata geçirilir. Kural tabanlı filtreler, yasak kelime listeleri ve düzenli ifade kalıpları aracılığıyla çalışır; hızlı ve deterministiktir ancak bağlam duyarsızdır. Model tabanlı guardrails ise bir sınıflandırıcı veya başka bir dil modeli kullanarak içeriği değerlendirir; bağlamı dikkate alır fakat ek gecikme ve maliyet getirir. OpenAI'nin Moderation API'si ve Meta'nın Llama Guard modeli bu kategorinin örnekleridir. Açık kaynak çerçeveler de bu alanda öne çıkmaktadır. NVIDIA NeMo Guardrails ve Guardrails AI (RAIL spesifikasyonu) konu kontrolü, dil şablonu ve olgusallık doğrulama gibi gelişmiş politika katmanları ekler. Amazon Bedrock ve Azure OpenAI gibi kurumsal platformlar ise guardrails özelliklerini yönetilen hizmet olarak sunar. Guardrails yalnızca içerik politikasıyla sınırlı değildir. Kurumsal uygulamalarda kapsam dışı konular (topic filtering), telif hakkı koruması, kişisel verilerin maskelenmesi (PII masking) ve çıktı formatının doğrulanması (structured output validation) da guardrails kapsamında ele alınır. Doğru bir guardrails mimarisi, kullanıcı deneyimini bozmadan model güvenliğini ve uyum gerekliliklerini karşılamalıdır.