Geçtiğimiz günlerde FixThePhoto projesi için en iyi yapay zeka destekli kadın sesi oluşturucuya ihtiyacım oldu ve kısa sürede doğal tınlayan seslerin tek önemli şey olmadığını fark ettim.
FixThePhoto projemiz için, eğitim videoları, tanıtım videoları ve kısa sosyal medya gönderileri için yapay zeka tarafından oluşturulmuş bir kadın sesine ihtiyacım vardı. Her senaryoyu kendimiz kaydetmekten kaçınmak istedik, ancak farklı formatlarda iyi çalışan bir ses bulmak beklediğimden daha zordu. Doğal ve etkileyici olmalıydı, alışılmış bilgisayar tarafından üretilen konuşma gibi olmamalıydı.
Araçları karşılaştırırken, seslerin ne kadar hoş geldiğine bakmaktan daha fazlasını yaptım. Net telaffuza, doğal duraklamalara, ton değişikliklerine ve her sesin duyguyu ne kadar iyi aktardığına çok dikkat ettim. Bu önemliydi çünkü senaryolarımız basit adım adım talimatlardan daha canlı tanıtım içeriklerine kadar çeşitlilik gösteriyordu.
Ayrıca ses çeşitliliğini, mevcut aksan ve dilleri, düzenleme seçeneklerini, ses kalitesini ve her aracın ne kadar hızlı ses üretebildiğini karşılaştırdım. Ses tonunu ve konuşma hızını kontrol edebilme imkanım olup olmadığını da inceledim. Kayıtlar profesyonel FixThePhoto projeleri için tasarlandığından, ticari kullanım için lisanslama, fiyatlandırma ve son ses dosyalarını ne kadar kolay kaydedebileceğime de baktım.
Test için, karşılaştırmanın adil olması amacıyla her kadın sesi oluşturucuyla aynı senaryoları kullandım. Senaryolar arasında kısa bir kullanım kılavuzu, ürün tanıtımı, rahat bir sosyal medya paylaşımı ve sayılar ile teknik terimler içeren daha uzun bir metin yer alıyordu. Bu, her sesin farklı içerik türlerinde ne kadar iyi çalıştığını görmeme yardımcı oldu.
Her sesin telaffuz, nefes alma, duraklamalar ve ton değişikliklerini nasıl ele aldığına dikkat ettim. Mümkün olduğunca, sonuçların tutarlı olup olmadığını kontrol etmek için aynı senaryoyu birkaç kez çalıştırdım. Bu, hangi araçların olağanüstü iyi bir kayıt yerine güvenilir sonuçlar verdiğini belirlemeyi kolaylaştırdı.
FixThePhoto ekibi meslektaşlarımla birlikte, kadın yapay zekâ sesleri oluşturmak için en popüler araçlardan bazılarını seçtik. Kriterlerimiz ve test planımız hazır olduğunda, zaman kaybetmeden seçenekleri karşılaştırabilmek için hemen işe koyulduk.
Temiz bir metinle başlayın. Gereksiz sembolleri çıkarın, garip kısaltmalardan kaçının ve cümleleri kısa ve kolay telaffuz edilebilir tutun. Metin konuşulduğunda doğal gelmelidir.
İçeriğe uygun bir ses tonu seçin. Nazik ve güven verici bir ton, öğretici videolar için uygundur; canlı bir anlatım ise reklamları ve kısa gönderileri daha çekici hale getirebilir.
Konuşmayı kontrol etmek için noktalama işaretlerini kullanın. Noktalama işaretleri ve boşluklar, sesin daha akıcı olmasına yardımcı olabilir. Araç destekliyorsa, teknik kelimelerin veya önemli noktaların etrafına satır sonu ekleyin.
Hızı ve perdeyi dikkatlice ayarlayın. Her şeyi birden değiştirmek yerine küçük ayarlamalar yapın. Önce orijinal sesi koruyun, sonra sonuç doğru gelene kadar azar azar ayarlayın.
Duygu ve vurgu ekleyin. Yapay zeka ses üreteci duygu veya seslendirme tarzını ayarlamanıza izin veriyorsa, sesi düz tutmak yerine farklı seçenekleri deneyin. Anahtar kelimelere ekstra vurgu yapmak, reklamların ve gündelik içeriklerin daha canlı görünmesini sağlayabilir.
Zor kelimeleri ayrı ayrı test edin. Yapay zekâ sesleri genellikle rakamlar, özel isimler, kısaltılmış terimler, şirket isimleri ve sektöre özgü kelimelerle zorlanır. Tam ses kaydını oluşturmadan önce birkaç satırı test edin ve yanlış telaffuzları düzeltin.
Birkaç farklı versiyon oluşturun. Ayarlar aynı olsa bile, sonuçlar hız ve ton açısından biraz farklılık gösterebilir. Genellikle birkaç versiyon oluşturup karşılaştırıyorum ve en doğal gelenini saklıyorum.
Adobe Firefly ile başladım çünkü FixThePhoto videoları için profesyonel bir kadın sesi oluşturup oluşturamayacağını, süreci çok karmaşık hale getirmeden test etmek istedim. Generate Speech'te aynı eğitim ve tanıtım metinlerini kullandım, birkaç kadın sesi denedim ve telaffuzlarını, duraklamalarını, tonlamalarını ve genel sunumlarını karşılaştırdım.
İlk beğendiğim şey, ses tonunu şekillendirmenin ne kadar kolay olmasıydı. Firefly, hızı, perdeyi, duraklamaları, telaffuzu ve tonu değiştirmenize olanak tanıyor. Hatta tüm senaryoyu tekrar çalıştırmak zorunda kalmadan belirli kelimeleri veya ifadeleri bile değiştirebilirsiniz.
Bu yapay zeka kadın sesi oluşturucusunun sunduğu çeşitli kadın seslerini de beğendim. Tipik yapay zeka seslerinden birini almak yerine, farklı yaş ve stillerden seçim yapabiliyordum. Firefly Konuşma çalışma alanı ayrıca ElevenLabs Multilingual v2 gibi ortak sesler de içeriyor ve bana daha da fazla seçenek sunuyor.
Bu sayede, sakin eğitim videolarından daha neşeli tanıtım içeriklerine kadar her video türüne uygun bir ses seçmek daha kolay oldu. FixThePhoto içeriği uluslararası bir kitleye yönelik olduğu için birkaç dil de denedim. Firefly 20'den fazla dili destekliyor ve çeşitli aksan seçenekleri sunuyor.
Benim için en faydalı kısım, tek tek kelimeleri ve ifadeleri ince ayar yapabilme olanağıydı. Teknik bir terim kulağa tam olarak doğru gelmiyorsa, baştan başlamak yerine sadece o kısmı düzeltebiliyordum. Ayrıca, sunumu daha doğal hale getirmek için duygu katabiliyor veya duraklamalar ekleyebiliyordum.
Ses dosyasını WAV olarak dışa aktarmadan önce sonucu önizleyebilmem de hoşuma gitti. Bundan sonra, Premiere Pro veya After Effects gibi diğer ücretsiz Adobe uygulamaları kolayca kullanabiliyordum. Bu, Firefly sadece basit bir yapay zeka kadın sesi oluşturucu olmaktan ziyade, daha büyük bir düzenleme sürecinin parçası gibi hissettirdi.
Beni en çok etkileyen şey, Firefly normal anlatımı ne kadar iyi ele aldığıydı. Farklı senaryoları denedikten sonra, karakter tarzı seslerden ziyade net, düzgün kadın seslendirmeleri için daha iyi çalıştığını fark ettim. Ses tonu, hız ve telaffuz kontrolleri kullanışlıydı ve farklı diller ve Adobe uygulamaları desteği tüm süreci kolaylaştırdı. Genel olarak, karmaşık ayarlarla uğraşmak zorunda kalmadan iyi bir kontrol elde ettim.
Profesyonel projeler için kullanım haklarına da dikkat ettim. Adobe, Firefly Speech modelleriyle oluşturulan konuşmaların ticari kullanım için güvenli olduğunu belirtiyor. Eğitim videoları, tanıtım videoları ve öğretici içerikler üzerinde çalıştığım için, bu da Firefly genel olarak daha iyi seçeneklerden biri yapan bir diğer nedendi.
Voicemod test ettiğim diğer yapay zeka kadın sesi oluşturucularından biraz farklıydı çünkü metni anlatıma dönüştürmek yerine konuşurken sesinizi değiştiriyordu. Diğer oluşturucular için kullandığım aynı kısa satırları okudum ve her bir yapay zeka sesinin kaydımı nasıl değiştirdiğini dinledim. Ardından, değişikliklerin ne kadar doğal geldiğini görmek için sonuçları orijinal sesimle karşılaştırdım.
Hemen fark ettiğim şey, Voicemod sadece temel bir efekt eklemek yerine sesin kendisini değiştirmesiydi. Değişiklikler siz konuşurken gerçekleştiği için, doğal zamanlamanızı ve enerjinizi korumak istediğiniz yayınlar, sohbetler ve sunumlar gibi canlı içerikler için çok iyi çalışıyor.
Kadın sesleri için, standart anlatıma bağlı kalmak yerine çeşitli karakter tarzı seçenekleri denedim. Bu Yapay zeka aksan üreteci 200'den fazla ses içeriyor ve ayrıca Voicelab'ı kullanarak sesler oluşturabilir veya ayarlayabilirim. Topluluk tarafından paylaşılan ek seçenekler de var, bu da denemek için daha da fazla ses seçeneği sağladı.
Bunun, iş odaklı seslendirmelerden ziyade yaratıcı içerikler için daha uygun olduğunu fark ettim. Farklı kişilikler ve karakter sesleriyle oynayarak en iyi sonucu vereni bulabiliyordum. Sese bağlı olarak, perdeyi, yankıyı ve hızı da ayarlayabiliyordum.
Kayıt kalitesinin gerçekten fark yarattığını fark ettim. Voicemod net konuştuğunuzda ve arka plan gürültüsünü minimumda tuttuğunuzda en iyi sonucu veriyor. İngilizce de bana en iyi sonuçları verdi, bu da mantıklı çünkü yapay zeka esas olarak profesyonel İngilizce konuşan sesler üzerinde eğitilmiş. Hem temiz bir kayıt hem de daha rahat bir kayıt denedim ve ses değişikliğinden sonra temiz versiyon çok daha iyi geldi.
FixThePhoto projelerim için, zaten doğal bir kaydım olduğunda ve ona farklı bir ses vermek istediğimde Voicemod tercih ederdim. Yazılı bir metni eksiksiz bir seslendirmeye dönüştürmem gerektiğinde ise ilk tercihim olmazdı.
Genel olarak, Voicemod en çok doğal konuşma tarzımı kaybetmeden sesimi değiştirmek istediğimde faydalı buldum. Özellikle canlı iletişim, yayıncılık, oyun ve karakter tabanlı içeriklerde çok iyi çalıştı. Standart bir metinden sese dönüştürme aracıyla karşılaştırıldığında, farklı sesler ve stillerle deneme yapmam için de daha fazla alan sağladı.
Uzun eğitim videoları için özel bir metin okuma aracı yerine bunu tercih etmezdim. Ancak kısa sosyal videolar için harika bir seçim olabilir. Gerçek zamanlı ses değişiklikleri, içeriğe daha fazla kişilik katarken kendi konuşma tarzınızı korumanızı kolaylaştırır.
VoiceAI metni konuşmaya dönüştürmek yerine mevcut bir sesi değiştirebildiği için ilgi çekiciydi. Diğer jeneratörlerde kullandığım aynı kısa ifadeleri kullanarak hem canlı ses değiştiriciyi hem de çevrimiçi ses araçlarını denedim.
Yapay zeka ses tasarımcısı Voice Universe'deki binlerce sese erişmemi sağlıyor; bunlar arasında diğer kullanıcılar tarafından oluşturulmuş kadın sesleri de bulunuyor. Ayrıca yeni sesler oluşturabilir veya mevcut sesleri kopyalayabilirim. Denenebilecek bu kadar çok seçenekle, tipik bir ses değiştiriciye göre çok daha fazla özgürlük sunuyor.
Kütüphaneden bir kadın sesi seçip net bir kayıtta kullandım. Ardından ses tonunu değiştirdim ve sonuçları karşılaştırmak için farklı bir ses denedim. Voice.ai'nin en sevdiğim yanı, metinle sıfırdan başlamak yerine, zamanlamayı ve orijinal seslendirme tarzının büyük bir kısmını korumasıydı.
Çevrimiçi dönüştürücü ayrıca kısa bir MP3 veya WAV dosyasını yüklemenize, bir ses seçmenize, perdeyi ayarlamanıza ve doğrudan tarayıcıda dönüştürmenize olanak tanır. Bu, mevcut ses dosyalarıyla farklı sesleri hızlıca test etmek için kullanışlı hale getirir.
En çok beğendiğim şey Ses Evreni oldu. Diğer kullanıcılar tarafından oluşturulanlar da dahil olmak üzere, aralarından seçim yapabileceğim çok sayıda ses vardı. Farklı kadın seslerini denemek ve üzerinde çalıştığım içerik türüne uygun olanı seçmek çok kolaydı.
VoiceAI ayrıca bir ses örneğinden ses oluşturmanıza da olanak tanır. Klonlama özelliği, tipik genç bir kadın anlatıcı yerine daha spesifik bir sese ihtiyacım olduğunda faydalı oldu.
Önceden üzerinde çalışabileceğim bir kaydım olduğunda veya sesi canlı olarak değiştirmem gerektiğinde, uzun bir metinden seslendirme oluşturmak yerine bu kadın sesi oluşturucuyu tercih ederim. Özellikle kadın karakter sesleri, sosyal medya klipleri, yayınlar ve gündelik konuşmalar için çok iyi sonuç verdi.
Ayrıca Discord, Zoom, oyunlar ve diğer iletişim platformları gibi uygulamalarla gerçek zamanlı olarak çalışır, bu nedenle temel bir metinden sese dönüştürme aracından daha fazlasını sunar. Ancak, daha kaliteli FixThePhoto eğitimleri için, bana senaryo üzerinde daha iyi kontrol sağladıkları için normal metinden sese dönüştürme araçlarını tercih ettim.
EaseUS VoiceWave standart bir yapay zeka kadın sesi oluşturucu olarak değil, daha çok ses değiştirici olarak test ettim. Sadece metin girmek yerine, birkaç kısa ses kaydı yaptım ve konuşurken farklı kadın sesi efektlerini denedim.
VoiceWave, 100'den fazla gerçek zamanlı ses değiştirme efektini destekliyor ve ayrıca önceden kaydedilmiş video ve ses dosyalarını da değiştirebiliyor. Bu sayede, karmaşık bir ses düzenleme iş akışı kurmadan farklı kadın sesi dönüşümlerini karşılaştırmak benim için kolaylaştı.
En çok hoşuma giden şeylerden biri, sesimi kaydedip aynı uygulamada değiştirebilmemdi. Ses tonunu ve hızını ayarlayabiliyor, sonucu MP3 olarak kaydedebiliyor ve yapay zeka tabanlı gürültü azaltma özelliğiyle arka plan gürültüsü olan kayıtları temizleyebiliyordum. Kısa sosyal medya klipleri ve gündelik seslendirmeler için tüm bu araçların tek bir yerde olması süreci çok daha hızlandırdı.
Ayrıca ses panosunu da denedim ve bu da VoiceWave'i Firefly veya ElevenLabs gibi araçlardan oldukça farklı kıldı. Yüzlerce ses ön ayarı ve efekti var, bu sayede kadın sesine ekstra sesler ekleyip daha eğlenceli içerikler için farklı kombinasyonlar deneyebildim.
Bu efektleri ciddi bir FixThePhoto eğitim videosu için seçmezdim, ancak sosyal medya paylaşımları, oyun videoları, memler veya sadece farklı bir şey denemek için uygun olabilirler. Program esas olarak Windows ve canlı ses değişiklikleri için tasarlandığından, kullanım alanları da sınırlıdır.
Narakeet kullanmak çok kolaydı. Sadece metnimi yapıştırdım, bir ses seçtim, dinledim ve sonucu beğenmezsem başka birini denedim. Diğer araçlarda kullandığım aynı eğitim videosunu, ürün tanıtımını, sosyal medya gönderisini ve teknik metni test ettim. Bu, hangi kadın seslerinin sayılar, teknik kelimeler ve uzun cümlelerle iyi uyum sağladığını hızlıca bulmama yardımcı oldu.
Bu gerçekçi kadın yapay zeka ses üretecisinin en çok beğendiğim özelliklerinden biri de geniş ses yelpazesiydi. 100'den fazla dilde 900'den fazla ses içeriyor, bu yüzden aralarından seçim yapabileceğim ve karşılaştırabileceğim çok sayıda kadın sesi vardı.
Sadece bazı seslerin belirli kelimeleri diğerlerinden çok daha iyi telaffuz etmesi nedeniyle ilk beğendiğim sesi seçmedim. Yapay zekâ ses efekti oluşturucu özellikle teknik terimler, marka isimleri veya alışılmadık telaffuzlarla çalışırken birkaç seçeneği denemenizi öneriyor. Bu, test sırasında fark ettiğim şeyle örtüşüyordu.
Narakeet bana sadece ses ayarlarını değiştirmekle kalmayıp, senaryo üzerinde daha fazla kontrol imkanı vermesini de beğendim. Sahne yönergelerini kullanarak sesleri değiştirebiliyor, telaffuzu ayarlayabiliyor veya diyalog oluşturabiliyordum. Konuşma hızı ve ses seviyesi için de ayrı kontroller vardı.
Ayrıca, seslendirmede duraklamalar ve farklı okuma hızlarıyla da denemeler yaptım, çünkü tempodaki küçük değişiklikler bile aynı kadın sesinin daha doğal gelmesini sağlayabilir veya sunumunu tamamen değiştirebilirdi. Daha uzun metinler için, metnin tamamını editöre yapıştırmak yerine Word veya metin dosyasını yükleyebilmem hoşuma gitti.
AI Dubbing biraz farklı bir şekilde test ettim çünkü bu özellik metinden seslendirme oluşturmak yerine mevcut videolarla çalışıyor. Kısa bir konuşan kafa videosu yükledim, başka bir dil seçtim ve seslendirilmiş versiyonu orijinaliyle karşılaştırarak ne kadar doğal geldiğini inceledim.
Süreç oldukça basitti: Videoyu yükledim, bir dil seçtim ve gerisini araca bıraktım. Görmek istediğim şey, yeni kadın sesinin orijinal konuşmacının zamanlamasına uyup uymayacağı ve jenerik bir seslendirmeye dönüşmek yerine aynı kişi gibi duyulup duyulmayacağıydı.
En çok beğendiğim şey sesin korunmasıydı. Bu yapay zeka seslendirme yazılımı tarafından sunulan çevrilmiş versiyon, konuşmacının ses karakterini koruyor ve ağız hareketlerini takip ediyor, bu nedenle orijinal kayda çok daha yakın hissettiriyor.
Yaptığım testlerde, bu durum geniş bir kadın sesi kütüphanesine sahip olmaktan daha önemliydi. Asıl avantaj, sunucudan videoyu baştan kaydetmesini istemeden mevcut bir videoyu yeni bir kitleye uyarlayabilmekti. Bunu özellikle eğitim videoları, öğretici videolar ve birden fazla dilde yayınlanması gereken sosyal medya gönderileri için çok faydalı buldum.
Ayrıca bu kurulumun profesyonel bir içerik iş akışına ne kadar iyi uyacağını da inceledim. Senaryoyu, ses seçimini, kaydı ve senkronizasyonu ayrı adımlar olarak ele almak yerine, araç çeviriyi ve yeni ses parçasını tek bir işlemde birleştiriyor.
Bu aynı zamanda çok dilli bir proje için daha az düzenleme işi anlamına geliyordu. Yine de, öncelikle plan sınırlarını ve videonun uzunluğunu kontrol etmenizi öneririm, çünkü bunlar neleri kullanabileceğinizi ve ne kadar içerik işleyebileceğinizi etkileyebilir.
ElevenLabs en çok zaman geçirdiğim yapay zeka destekli kadın sesi üreticilerinden biriydi. Kadın seslerinin farklı içerik türlerini ne kadar iyi işleyebildiğini görmek istedim, bu yüzden aynı senaryoları birkaç farklı seçenek üzerinde test ettim. Bazı sesler, özellikle senaryo duygu, sayı veya teknik terimler içerdiğinde, diğerlerine göre çok daha doğal geliyordu.
Ayrıca, eğitim videoları için sakin bir ses tonundan, tanıtım içerikleri için daha enerjik bir konuşma tarzına kadar farklı konuşma stilleri denedim. Bu Yapay zekâ ses klonlama yazılımı web ve mobil için metinden sese dönüştürme araçlarının yanı sıra, iş akışının daha sonra otomatikleştirilmesi gerektiğinde faydalı olabilecek API'ler ve SDK'lar sunuyor.
Ayrıca ses özelleştirme özelliğini de test ettim. ElevenLabs geniş bir ses yelpazesi sunuyor ve Anında Ses Klonlama özelliğini kullanarak kısa bir ses örneğinden dijital bir ses kopyası oluşturabiliyordum. Bu, mevcut seçenekler arasından seçim yapmak yerine belirli bir sesle çalışma imkanı sağladı.
Birden fazla video oluştururken tutarlılık özellikle faydalıdır. Farklı projelerde aynı kadın anlatıcıyı kullanmak, bir web sitesi, YouTube kanalı veya eğitim serisi için tanıdık bir ses oluşturmaya yardımcı olabilir.
FixThePhoto içeriğinin farklı dillerde de sunulması gerekebileceğinden, çok dilli çalışmalar için ElevenLabs da denedim. Seslendirme özelliği, konuşmacının duygusunu, zamanlamasını, tonunu ve kimliğini koruyarak ses ve videoyu 90'dan fazla dile çevirebiliyor.
Dubbing v2, test ettiğim en ilginç özelliklerden biriydi çünkü sadece yazılı metinden değil, orijinal kayıttan yola çıkarak çalışıyor. Çeviriyi, ses klonlamayı, dublajı ve zamanlamayı otomatik olarak hallederken, orijinal performansın havasını da koruyor. Bu da sonucu standart bir kadın seslendirmesiyle yapılan çeviriden oldukça farklı kılıyor.
HeyGen sadece seslendirme için kullanmak yerine, video iş akışının bir parçası olarak test ettim. Birkaç kısa senaryo oluşturdum ve tanıtım, eğitim ve konuşma metinlerinde farklı kadın seslerini denedim.
Bu çevrimiçi kadın sesi oluşturucu, tonu, hızı, vurguyu ve tonlamayı ayarlamama olanak tanıyarak, her satırın nasıl söyleneceğini ince ayar yapmamı sağladı; böylece aynı okumayı baştan sona kullanmak zorunda kalmadım. Bu, bir reklam için daha enerjik bir kadın sesine ve bir eğitim videosu için daha sakin bir söyleme ihtiyacım olduğunda faydalı oldu.
Ses klonlama da denemek istediğim bir diğer özellikti. HeyGen kısa bir örnekten ses klonu oluşturabiliyor ve bunu videolar, kurslar ve podcast'ler boyunca aynı anlatıcı olarak kullanabiliyor. Bu, FixThePhoto iş akışı için faydalı görünüyordu; çünkü bir seride tek bir ses kullanmak, içeriğin daha tutarlı görünmesini sağlayabilir. Her proje için farklı bir kadın yapay zeka sesi kullanmak yerine, tanınabilir bir ses seçip bunu birden fazla videoda tekrar kullanabilirim.
HeyGen öne çıkaran şey, ses özelliklerinin video oluşturmayla ne kadar yakından bağlantılı olmasıydı. Oluşturulan sesi, görseller, altyazılar ve diğer öğelerle birlikte doğrudan Yapay zekâ video düzenleyici ekleyebiliyordum. Bu, bir video oluştururken birçok farklı araç arasında geçiş yapmak zorunda kalmadığım anlamına geliyordu.
Ayrıca, yapay zeka destekli seslendirme ve dudak senkronizasyonu özelliklerini de içeren, 177'den fazla dil ve lehçeyi destekleyen çok dilli seslendirme özelliğini de test ettim. Uluslararası kampanyalar için, içeriği çevirebilmek, yeni sesi oluşturabilmek ve videoyla aynı yerde senkronize edebilmek tüm süreci çok daha hızlı hale getirebilir.
Voicebooking seslendirme işine daha uygulamalı bir yaklaşım getirmesiyle öne çıktı. Senaryolarımı eklemek, farklı sesler denemek ve hangilerinin tempo ve genel his açısından en iyi sonucu verdiğini görmek için ücretsiz yapay zeka ses oluşturucusunu kullandım.
Platformda 55'ten fazla dilde 575'ten fazla ses seçeneği bulunuyor; hem kadın hem de erkek seslendirmeleri mevcut. Bu kadar çok seçenek olması, çeşitli sesleri denemeyi ve her videoya uygun olanı bulmayı kolaylaştırdı.
Ses tonunu ne kadar değiştirebileceğime de baktım. Voicebooking ücretli planları, okumayı daha canlı hale getirmeye yardımcı olan duraklamalar ve vurgulama seçenekleri sunuyor. Aynı tanıtım metnini bu ayarlarla ve bu ayarlar olmadan test ettim ve duraklamalardaki küçük değişikliklerin bile okumayı iyileştirebileceğini gördüm. Ayrıca, her satırı elle düzenlemeden daha fazla vurgu eklemeyi kolaylaştıran efektler de mevcut.
Ayrıca, prodüksiyona başlamadan önce seslendirme senaryolarını test etmenizi sağladığı için Voicebooking de ekledim. Bu jeneratör, videolarda, test projelerinde ve storyboard'larda zamanlamayı ve impact kontrol etmek için tasarlanmıştır; bu da FixThePhoto değerlendirmesi sırasında kontrol etmek istediğim ana noktalardan biriyle örtüşüyordu.
Ücretsiz sürüm, ilk projenizde kütüphanedeki sesleri denemenize olanak tanır, ancak karakter, proje ve indirme konusunda sınırlamalar getirir. Bu sayede senaryonun çok uzun olup olmadığını, kadın sesinin konuya uygun olup olmadığını ve temposunun doğru olup olmadığını kontrol etmek kolaylaştı.
Kısa bir fotoğraf düzenleme eğitimiyle başladık ve her sesin talimatları, sayıları, yazılım adlarını ve teknik terimleri nasıl ele aldığını test ettik. Tetiana Kostylieva, telaffuza odaklanarak, garip duraklamaları, tuhaf vurguları veya sesin çok fazla bilgisayar sesi gibi duyulmasına neden olan kelimeleri not aldı.
Kate Debela, sesin bir senaryoda sakin ve bilgilendirici, tanıtım amaçlı bir senaryoda ise daha canlı olup olmadığını kontrol ederek duygusal aktarıma odaklandı. Vadym Antypenko ise üretim hızı, ses kalitesi, dil seçenekleri, dışa aktarma seçenekleri ve kayıtların iş akışımıza ne kadar kolay entegre edilebileceği gibi teknik yönlere baktı.
Ayrıca, sadece kısa bir paragrafı kontrol etmek yerine birkaç daha zorlu test de kullandık. Örneğin, jeneratörlere kısa, konuşma diline yakın cümleler içeren bir sosyal medya metni verdik. Ardından, yüzdeler, tarihler, ürün adları ve fotoğrafçılık terimleri içeren daha uzun bir metin denedik.
Başka bir test için iki farklı ses tonu kullandık: bir reklam için sıcak, neşeli bir ses ve bir eğitim videosu için daha nötr bir ses. Daha kısa metinler çoğu araçta iyi sonuç verdi, ancak daha uzun metinlerde belirgin bir fark ortaya çıktı. Bazı sesler doğallığını kaybederken, diğerleri baştan sona istikrarlı ve net kaldı.
Bundan sonra, her bir yapay zeka kadın sesi oluşturucusunda bulunan özelleştirme özelliklerini test ettik. Bir kadın sesinin farklı FixThePhoto içerik türleri için ne kadar kolay kullanılabileceğini görmek için hızı, tonu, duraklamaları, duyguyu, vurguyu ve sunum tarzını değiştirdim. Dil desteği ve ses klonlama özelliğine sahip araçlar için, aynı sesin farklı videolar ve dillerde tutarlı kalıp kalamayacağını kontrol etmek için bu seçenekleri de test ettim.
Yaptığımız testler, seslendirme sanatçısının metni okuma biçimini şekillendirecek yeterli ayar olmadığı sürece, geniş bir ses kütüphanesinin pek bir anlam ifade etmediğini gösterdi.
Sonuç olarak, beklediğimiz gibi olmadı. ElevenLabs ve Adobe Firefly profesyonel seslendirmeler için en güçlü sonuçlardan bazılarını verdi. Telaffuz ve duraklamaları iyi işlediler ve konuşmanın nasıl duyulduğu konusunda bize daha fazla kontrol sağladılar.
Kazananı sadece ses kütüphanesinin büyüklüğüne veya demo kalitesine göre seçmedik. Her araçtan aynı pratik senaryoları geçirdik ve telaffuz, kontrol, zor kelimelerdeki performans ve son sesin profesyonel video çalışmaları için yeterince iyi olup olmadığına baktık.
Her bir jeneratörün ne kadar hızlı çalıştığını, ses kalitesinin ne kadar iyi olduğunu, hangi dilleri desteklediğini, maliyetini ve lisansının neleri kapsadığını da kontrol ettik. Bu unsurlar, araçları gerçekten kullandığımızda büyük fark yarattı. Sonuç olarak, sadece en iyi seçimimizi değil, aynı zamanda eğitim videoları, reklamlar, sosyal medya, çok dilli videolar ve daha yaratıcı projeler için en iyi çalışan jeneratörleri de bulduk.