Whisper (OpenAI Konuşma Tanıma)

Whisper, OpenAI'nin 680.000 saatlik ses verisiyle eğittiği, 99 dil destekli açık kaynaklı otomatik konuşma tanıma modelidir.

Whisper, OpenAI tarafından Eylül 2022 tarihinde açık kaynak olarak yayımlanan bir otomatik konuşma tanıma modelidir. Sistem, ASR yani Automatic Speech Recognition alanında önemli bir referans nokta haline gelmiştir. İnternetin en kapsamlı çok dilli ses derlemlerinden biri üzerinde eğitilen model 680.000 saatlik denetimli ses verisini kullanmaktadır. Bu geniş eğitim kümesi modelin yüksek gürültü ortamlarında farklı aksan ve lehçelerde ve teknik jargon içeren konuşmalarda dahi güçlü performans sergilemesini mümkün kılmaktadır. Model ham ses dosyasını otuz saniyelik parçalara böler ve her parçayı log-mel spektrogramına dönüştürür. Konvolüsyonel katmanlardan oluşan bir kodlayıcı bu spektrogramdan anlam taşıyan özellikler çıkarır; Transformer tabanlı çözücü ise bu özellikleri kelime parçalarına yani token'lara dönüştürür. Whisper transkripsiyon yabancı dilden İngilizceye çeviri ve dil tanımlama görevlerini tek bir model çatısı altında yürütür. Ses segmentasyonu otomatik gerçekleştiğinden uzun kayıtlar ek ön işlem gerektirmeksizin doğrudan işlenebilir. Tiny Base Small Medium ve Large-v3 olmak üzere beş boyutta sunulan model kaynak kısıtlı uç cihazlardan büyük veri merkezlerine kadar geniş bir kullanım yelpazesine hitap eder. Açık kaynak yapısı araştırmacı ve geliştiricilerin modeli kendi veri setleriyle ince ayar yaparak alana özgü terminolojiye veya daha önce desteklenmeyen dillere uyarlamasına olanak tanır. Türkçe dahil doksan dokuz dili destekleyen Whisper; medya arşivleme toplantı transkripti oluşturma erişilebilirlik çözümleri ve tıbbi dikte uygulamalarında yaygın biçimde kullanılmaktadır. Faster-whisper gibi topluluk kütüphaneleri CTranslate2 motoru üzerinde çalışarak çıkarım hızını ve bellek verimliliğini önemli ölçüde iyileştirir; bu da düşük gecikmeli ve gerçek zamanlı transkripsiyon senaryolarını mümkün kılar. Large-v3 modeli yaklaşık on gigabayt GPU belleği gerektirirken float16 hassasiyeti veya sekiz bitlik niceleme bu gereksinimi belirgin biçimde azaltır. Model başarımı kelime hata oranı yani WER metriği ile ölçülür ve popüler akademik kıyaslamalarda sektörün önde gelen sistemlerini geride bırakmaktadır.

Whisper Nasıl Çalışır?

Whisper, ham ses dosyasını 30 saniyelik parçalara böler ve her parçayı log-mel spektrogramına dönüştürür. Konvolüsyonel katmanlardan oluşan bir kodlayıcı bu spektrogramdan anlam taşıyan özellikler çıkarır; Transformer tabanlı çözücü ise bu özellikleri kelime parçalarına (token) dönüştürür. Model, konuşulan dili otomatik algılar ve gerektiğinde direk İngilizceye çeviri yapabilir. Ses segmentasyonu otomatik olduğundan, uzun kayıtlar ek ön işlem gerektirmeden doğrudan işlenebilir.

Model Boyutları ve Performans

  • check_circle Tiny (39M parametre): En hafif model; uç cihazlar ve gerçek zamanlı uygulamalar için uygundur. İngilizce WER yaklaşık %15.
  • check_circle Base (74M parametre): Tiny'ye kıyasla belirgin doğruluk artışı, hâlâ düşük kaynak tüketimi. Mobil uygulamalar için dengeli seçim.
  • check_circle Small (244M parametre): Çok dilli görevlerde güçlü performans; API servis olarak kullanım için popüler boyut.
  • check_circle Medium (769M parametre): Yüksek doğruluk gerektiren iş uygulamaları için tercih edilir.
  • check_circle Large-v3 (1.55B parametre): En yüksek doğruluk; veri merkezlerinde toplu transkripsiyon işleri için idealdir.

Uygulama Alanları

  • check_circle Medya ve Yayıncılık: Haber arşivleri, podcast bölümleri ve video içerikler için otomatik altyazı üretimi.
  • check_circle Kurumsal Toplantı Transkripti: Video konferans kayıtlarının metin formatına dönüştürülmesi ve arama yapılabilir hale getirilmesi.
  • check_circle Erişilebilirlik: İşitme engelli bireyler için gerçek zamanlı altyazı uygulamaları.
  • check_circle Tıbbi Dikte: Klinisyenlerin sesli notlarını yapılandırılmış tıbbi belgeye dönüştürme; tıbbi terminoloji desteğiyle fine-tuning yapılabilir.
  • check_circle Dil Öğrenimi: Öğrencilerin telaffuzunu analiz eden ve geri bildirim veren eğitim uygulamaları.

Sık Sorulan Sorular

  • check_circle Whisper gerçek zamanlı transkripsiyon yapabilir mi?: Resmi model gerçek zamanlı için optimize edilmemiştir; ancak faster-whisper gibi topluluk kütüphaneleri akış tabanlı kullanım için düşük gecikme sunar.
  • check_circle Whisper'ı Türkçe için nasıl ince ayar yaparım?: Hugging Face Trainer veya OpenAI fine-tuning API'si ile Türkçe ses-metin çiftleri kullanılarak fine-tuning yapılır; böylece alan spesifik jargon ve aksanlar için doğruluk artırılır.
  • check_circle Whisper hangi ses formatlarını destekler?: MP3, WAV, FLAC, OGG ve M4A başlıca desteklenen formatlardır. ffmpeg kurulu olduğunda çok daha geniş format yelpazesi otomatik dönüştürülür.
  • check_circle Large modeli çalıştırmak için ne kadar GPU belleği gerekir?: Large-v3 modeli yaklaşık 10 GB VRAM gerektirir. float16 hassasiyetiyle bu ihtiyaç azaltılabilir; 8-bit quantization ile 6 GB altında çalıştırmak mümkündür.