Yapay zeka destekli ses teknolojileri geliştiren ElevenLabs, yeni nesil metinden sese modelleri Eleven v4 ve Eleven v4 Turbo'yu tanıttı. Şirketin bugüne kadarki en duygu odaklı ses modeli olarak konumlandırdığı Eleven v4, tonlama, konuşma temposu, duygu, karakter ve bağlamı metinden yorumlayarak daha doğal sesler üretmeye odaklanıyor. Eleven v4 Turbo ise özellikle sesli yapay zeka ajanları ve gerçek zamanlı uygulamalar için düşük gecikme süresiyle çalışacak şekilde geliştirildi. ElevenLabs, yeni nesil modellerde tamamen yeni bir mimariye geçtiğini belirtiyor. Eleven v4, uzun metinlerde konuşmacının ses kimliğini daha tutarlı bir şekilde korurken metnin bağlamını da dikkate alarak seslendirme biçimini değiştirebiliyor. Böylece dramatik, acil, komik veya gündelik konuşma gibi farklı anlatım biçimlerinin üretilebilmesi hedefleniyor. Model ayrıca bir konuşmada daha önce söylenenleri dikkate alarak sonraki repliklerin tonlamasını buna göre ayarlayabiliyor.Ses üretiminde daha fazla kontrol Hatırlarsanız ElevenLabs, Eleven v3 ile birlikte kullanıcıların seslendirme üzerindeki kontrolünü artırmak için satır içi ses etiketlerini kullanıma sunmuştu. Eleven v4 ile bu sistem genişletiliyor. Kullanıcılar birden fazla etiketi aynı komutta bir araya getirerek modelin bunları belirlenen sırayla uygulamasını sağlayabiliyor. Doğal dil kullanılarak kahkaha, öfkeli konuşma, belirli bir aksan, hafif yağmur veya telefon titreşimi gibi ses ve konuşma talimatları da metnin içine eklenebiliyor. Ayrıca ElevenLabs, özel kelime ve isimlerin telaffuzu için kullanılan International Phonetic Alphabet (IPA) desteğini de geliştirdiğini belirtiyor.Yeni modelin öne çıkan özelliklerinden biri de ses klonlama tarafında karşımıza çıkıyor. ElevenLabs'e göre Eleven v4, yalnızca 10 saniyelik bir ses kaydından kişinin sesini klonlayabiliyor. Şirket ayrıca Eleven v3'te desteklenmeyen Professional Voice Clone özelliğini yeni modelle yeniden kullanıma sunuyor. Eleven v4 ve v4 Turbo, 90'dan fazla dili destekliyor. Bir önceki Eleven v3 yaklaşık 70 dili destekliyordu. ElevenLabs, yeni sürümle özellikle Japonca, Brezilya Portekizcesi, Mandarin ve Kantonca tarafında önemli kalite artışları elde ettiğini ifade ediyor. Şirket, bir dilde oluşturulan ses klonlarının başka dillerde konuşurken de daha doğal bir yerel aksan kullanabildiğini belirtiyor. Eleven v4 Turbo gerçek zamanlı yapay zeka ajanlarını hedefliyor ElevenLabs'in duyurduğu ikinci model Eleven v4 Turbo, özellikle çağrı merkezleri ve sesli yapay zeka ajanları gibi gecikme süresinin kritik olduğu kullanım alanlarına odaklanıyor. Model çift yönlü streaming desteği sayesinde bir cümle tamamen oluşturulmadan ses üretmeye başlayabiliyor. Şirketin paylaştığı testlere göre Eleven v4 Turbo'nun ilk sesi üretmeye başlama süresinin medyanı yaklaşık 150 milisaniye seviyesinde. ElevenLabs ayrıca Turbo'nun medyan çıkarım (inference) gecikmesini yaklaşık 100 milisaniye olarak açıklıyor. Bu değerlerin şirket tarafından gerçekleştirilen testlere dayandığını belirtmekte fayda var. ElevenLabs, yeni modelin müşteri hizmetleri senaryolarında karşılıklı konuşmaları daha akıcı hale getirdiğini de belirtiyor. Model; görüşme sırasında yaşanan anlaşmazlıklar, konunun başka bir temsilciye aktarılması veya kullanıcının beklemeye alınması gibi durumları farklı biçimlerde seslendirebiliyor. Ayrıca ses üretimi, arka plandaki büyük dil modeli yanıtını tamamen tamamlamadan başlayabiliyor. Uzun içerikler tarafında da geliştirmeler bulunuyor. Eleven v4 tek seferde 10 bin karaktere kadar içerik üretebilirken farklı ses üretimlerini birbirine bağlayan sistem, uzun metinlerde konuşma temposunun ve tonlamanın korunmasını amaçlıyor. Bu özellik özellikle sesli kitap, podcast, reklam ve ElevenLabs Reader gibi uzun formatlı içeriklerde önem kazanıyor. Eleven v4 ve Eleven v4 Turbo; ElevenAgents, ElevenCreative ve ElevenAPI üzerinden kullanıma sunuldu. Modeller ücretsiz hesaplarla da denenebiliyor. ElevenLabs'in ücretsiz planı aylık 10 bin kredi içerirken ücretli paketler aylık 6 dolardan başlıyor.Bu yılın başında Sequoia liderliğinde 500 milyon dolar yatırım alarak 11 milyar dolar değerlemeye ulaşan ElevenLabs'in yıllıklandırılmış gelirinin 330 milyon dolardan 600 milyon doların üzerine çıktığı belirtiliyor. ElevenLabs'in yeni modelleri ile Cartesia, Deepgram, Fish Audio, Boson ve WellSaid Labs gibi girişimlerin yanı sıra Google ve OpenAI'ın da ses üretimi modelleriyle rekabetteki konumunu güçlendiriyor.