newspaper Haber edit_note yapayzekasozluk.tr Haber Masası schedule 28 Temmuz 2026 · 16:29 timer 4 dk okuma

Fish Audio, Yaratıcılar ve Şirketler İçin 50 Milyon Dolar Yatırım Aldı

Yapay zeka ses modeli girişimi Fish Audio, 50 milyon dolar tohum yatırımı aldı. 8 milyondan fazla kullanıcısı ve 21 milyon dolar yıllık yinelenen geliri bulunan şirket, açık kaynak ve ticari ses modelleriyle dikkat çekiyor.

50 Milyon Dolarlık Tohum Yatırımı

Yapay zeka destekli ses modeli geliştiren Fish Audio, 50 milyon dolar tohum yatırımı aldığını duyurdu. Palo Alto merkezli girişim, yaratıcılar ve kurumsal müşteriler için 15 binden fazla doğal dil kontrolü sunan ses kütüphanesiyle öne çıkıyor. Geçen yıl piyasaya sürülen şirket, bugün 8 milyondan fazla kullanıcıya ulaşırken, yıllık yinelenen geliri (ARR) 21 milyon dolara yükseldi. Bu gelirin büyük kısmı, ücretli API ve kurumsal aboneliklerden geliyor; açık kaynak sürüm ise topluluk tarafından benimsendi.

Yatırım turuna Coreline Ventures ve Capital Today öncülük etti. Tura 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners ve HF0 da katıldı. Fish Audio, bu kaynakla daha gelişmiş modeller geliştirmeyi ve kurumsal müşterilere yönelik hizmetlerini genişletmeyi planlıyor. Şirket, daha önce açık kaynak proje olarak verimli çalıştığını ancak ileri modeller ve kurumsal talepler için sermaye arayışına girdiğini belirtiyor.

Ses Modelleri ve Açık Kaynak Stratejisi

Fish Audio, eski NVIDIA araştırmacısı Shijia Liao tarafından kuruldu. Liao, piyasadaki yapay seslerin ifadesizliğinden rahatsız olarak tek bir grafik işlemci (GPU) üzerinde ses üretim modeli eğitti ve bunu açık kaynak olarak yayınladı. Fish Speech deposu GitHub'da 31 binden fazla yıldız aldı ve bağımsız geliştiriciler, video oyun tasarımcıları ve içerik üreticileri tarafından kullanılıyor. Model, düşük kaynak gereksinimi sayesinde küçük ekiplerin bile yüksek kaliteli ses sentezlemesine olanak tanıyor.

Şirket geçen yıl dört konuşma üretim modeli ve bir konuşmadan metne (speech-to-text) modeli olmak üzere toplam beş model çıkardı. Üç konuşma üretim modelini açık kaynak olarak sunarken, en yeni S2.1 Pro modeli yalnızca ücretli API üzerinden kullanılabiliyor. Fish Audio, yaratıcılar ve ekipler için aylık planlar sunuyor; bu planlar belirli dakikalarda ses üretimi ve ses klonlama özellikleri içeriyor. Örneğin, temel plan ayda 30 dakika üretim sunarken, profesyonel plan 300 dakikaya kadar çıkabiliyor.

Kurumsal Çözümler ve Kullanım Alanları

Fish Audio, kurumsal müşteriler için özel API ve platform sürümleri de sunuyor. HeyGen, Sanas ve Plaud gibi şirketler bu hizmeti kullanıyor. CEO ve kurucu ortak Rissa Cao, her kuruluşun farklı ihtiyaçları olduğunu belirtiyor: "HeyGen gibi yapay zeka avatarları için ses kullanan şirketler gerçekçilik isterken, oyun stüdyoları karakterler için ifade gücü yüksek sesler arıyor. LiveKit gibi ses ajanı şirketleri ise doğal ve düşük gecikmeli, aramalarda yeterince ifade edici sesler istiyor." Fish Audio'nun 15 bin doğal dil kontrolü, bu farklı talepleri karşılamak için tasarlandı. Örneğin, bir oyun karakteri için 'kızgın', 'mutlu' veya 'fısıltı' gibi tonlamalar kolayca ayarlanabiliyor.

Şirket, ses kütüphanesini oluşturmak için kullanıcılardan kendi seslerini göndermelerini istiyor ve kullanılan sesler için tazminat ödüyor. Ancak bu yöntem, bazı yaratıcıların seslerinin izinsiz yüklendiği iddialarıyla sorun yarattı. Fish Audio, DMCA kapsamında içerik kaldırma sürecini otomatikleştirdiğini ve artık seslerin 3 dakikadan kısa sürede platformdan kaldırılabildiğini belirtiyor. Yine de, bir sanatçının sesinin bilgisi dışında yüklenmesini engellemek mümkün değil; bu durumda sanatçı şikayet edene kadar ses platformda kalıyor. Coreline Ventures ortağı Oskue Honda, topluluk odaklı bir modelin ancak güvenle çalışabileceğini vurguluyor: "Onay, şeffaflık ve atıf, ürüne sonradan eklenen değil, baştan inşa edilen özellikler olmalı." Honda, sektörün doğrulanmış ses sahipliği, net lisanslama ve gelir paylaşımı modellerine yönelmesi gerektiğini söylüyor.

Gelecek Planları ve Rekabet

Fish Audio, bu yıl bir ses anlama modeli (audio understanding model) ve bir konuşmadan konuşmaya (speech-to-speech) modeli çıkarmayı planlıyor. Ses üretim pazarı ElevenLabs, WellSaid, Cartesia, Speechify, Async ve Krisp gibi şirketlerle rekabet halinde. 359 Capital ortağı Rico Mallozzi, Fish Audio'nun geliştiricilere sunduğu ince ayar kontrolleri ve maliyet etkin model eğitimi sayesinde büyük yapay zeka laboratuvarlarıyla rekabet edebileceğini düşünüyor. Mallozzi, "Ekipleriyle, diğer iyi finanse edilmiş laboratuvarlara kıyasla son teknoloji modeller geliştirmeleri, yapay ve insan sesi arasındaki farkı kapatmadaki teknik becerilerini gösteriyor" diyor. Fish Audio'nun açık kaynak stratejisi, topluluk katkılarıyla model kalitesini artırırken, ticari ürünlerle gelir elde etmesini sağlıyor.

Neden Önemli?

Fish Audio'nun başarısı, yapay zeka ses modellerinin hem yaratıcı hem de kurumsal alanda ne kadar hızlı benimsendiğini gösteriyor. Türkiye'de de sesli asistanlar, oyun geliştirme ve müşteri hizmetleri gibi alanlarda benzer çözümlere talep artıyor. Özellikle Türkçe ses modelleri geliştiren yerel girişimler, Fish Audio'nun açık kaynak yaklaşımından ilham alabilir. Ancak ses klonlama teknolojisinin izinsiz kullanımı ve telif hakları konusu, özellikle içerik üreticileri için kritik bir sorun. Fish Audio'nun otomatik kaldırma süreci ve şeffaflık çabaları, sektörde güven oluşturmak için önemli adımlar. Türk girişimciler ve geliştiriciler, bu tür modelleri yerelleştirerek veya benzer çözümler geliştirerek pazarda yer alabilir. Ayrıca, düşük maliyetli eğitim ve ince ayar kontrolleri, kaynak kısıtı olan ekipler için büyük avantaj sağlıyor. Fish Audio'nun 21 milyon dolar ARR'si, bu pazarın ne kadar hızlı büyüdüğünün bir göstergesi.

link Kaynak: TechCrunch AI
tag Fish Audio tag yapay zeka ses modeli tag girişim yatırımı tag açık kaynak tag ses klonlama tag kurumsal yapay zeka

İlgili Terimler

3 terim