Bir insanın sesini taklit etmek için eskiden saatlerce stüdyo kaydı, profesyonel ekipman ve çok sayıda örnek gerekiyordu. Bugün ise yapay zeka destekli ses klonlama teknolojileri, bazı sistemlerde yalnızca birkaç saniyelik temiz bir konuşma kaydından kişinin ses özelliklerini analiz ederek yeni cümleleri benzer bir sesle üretebiliyor. Kişinin daha önce hiç söylemediği bir cümle, dijital olarak onun sesini andıracak biçimde oluşturulabiliyor.
Sistem yalnızca sesin kalın veya ince olmasını öğrenmiyor. Konuşma temposu, vurgu biçimi, ses rengi, kelimeler arasındaki duraklamalar ve telaffuza ilişkin birçok özellik matematiksel bir temsile dönüştürülüyor. Modern yapay zeka modelleri bu kısa örnekten konuşmacıya ait bir tür ses profili çıkarıyor. Ardından verilen metin, bu özelliklere benzeyen sentetik konuşmaya çevriliyor. Buna genellikle zero-shot veya few-shot voice cloning adı veriliyor.
Teknolojinin en dikkat çekici tarafı, kayıt miktarının giderek azalması. Ancak birkaç saniyelik kayıtla oluşturulan her klon kusursuz değildir. Kayıt kalitesi, arka plan gürültüsü, kullanılan model, dil ve konuşmanın duygusal yapısı sonucu ciddi biçimde etkileyebilir. Daha uzun ve çeşitli kayıtlar genellikle kişinin doğal konuşma özelliklerinin daha iyi yakalanmasını sağlar. Bu nedenle birkaç saniyede ses klonlama mümkün olsa da bunu gerçek insan sesinden her koşulda ayırt edilemez hale gelmiş bir teknoloji olarak anlatmak doğru olmaz.
Ses klonlamanın son derece yararlı kullanım alanları da bulunuyor. Hastalık veya ameliyat nedeniyle konuşma yetisini kaybetme riski bulunan kişilerin kendi seslerine benzeyen dijital bir ses oluşturması mümkün hale geliyor. Film ve oyunlarda dublaj, farklı dillere uyarlama, erişilebilirlik uygulamaları ve kişiselleştirilmiş dijital asistanlar da teknolojinin kullanım alanları arasında. Gelecekte bir insanın dijital ortamda yalnızca yüzünün değil, kendine özgü sesinin de korunabilmesi mümkün olabilir.
Fakat aynı özellik teknolojinin en tehlikeli tarafını oluşturuyor. İnternette yayımlanmış kısa bir video, telefon konuşması veya sosyal medya kaydı kötüye kullanım için ses örneğine dönüşebilir. Sahte telefon görüşmeleri, dolandırıcılık girişimleri ve gerçekte söylenmemiş sözlerin bir kişinin ağzından söylenmiş gibi sunulması, ses deepfake teknolojisinin önemli riskleri arasında. Bu nedenle yalnızca sesini duyduğumuz bir kişinin gerçekten o kişi olduğundan emin olmak giderek zorlaşıyor.
Belki de ses klonlamanın yarattığı en büyük değişim teknik değil, psikolojik. Fotoğrafın ve videonun ardından ses de tek başına gerçeğin kanıtı olmaktan uzaklaşıyor. Yakın geleceğin sorusu yapay zekanın bir insanın sesini ne kadar iyi taklit edebileceğinden çok, duyduğumuz şeyin gerçekten o insan tarafından söylenip söylenmediğini nasıl anlayacağımız olabilir.