Türkçe sesleri neden kendimiz eğittik
Büyük seslendirme servislerinin dil listesinde Türkçe var. Teknik olarak doğru: metni veriyorsunuz, Türkçe ses çıkıyor. Ama o sesi bir telefon konuşmasının içine koyduğunuzda, karşıdaki insan ilk cümlede bir tuhaflık sezer.
Türkçe'nin seslendirmeyi zorlayan tarafı
Türkçe sondan eklemeli bir dil. Bir kelime, aldığı eklerle uzadıkça vurgunun yeri değişir. "Ev", "evde", "evdeki", "evdekiler" — dördü de farklı vurgulanır. Türkçe'yi çok dilli bir modelin bir dili olarak öğrenen sistemler bu kaymayı çoğu zaman yakalayamaz; vurguyu kelimenin kökünde bırakır.
İkinci sorun soru cümlelerinde. Türkçe'de soru, tonlamayla değil soru ekiyle kurulur ama tonlama yine de değişir. "Randevunuz var mı" cümlesindeki ton, İngilizce bir soru cümlesinin tonundan farklıdır. Yanlış tonlanan bir soru, telefonda konuşan kişiye kendisine soru sorulduğunu hissettirmez.
Üçüncüsü ve telefonda en can sıkıcı olanı: özel isimler, adresler ve sayılar. Türkçe bir adresi doğru okumak, kısaltmaları açmayı, sokak isimlerindeki tamlamaları doğru bölmeyi ve sayıları bağlama göre okumayı gerektirir. "5" bazen "beş", bazen "beşinci", bazen tek tek okunacak bir rakamdır.
Ne yaptık
Türkçe için kendi seslerimizi eğittik. Bu, hazır bir modele Türkçe metin vermek değil; profesyonel seslendirme sanatçılarının kayıtlarından yola çıkarak telefon konuşması için ses üretmek. Telefon konuşması ayrı bir alan: dar bant, gürültülü ortam, karşıdaki kişinin ekranı yok, tek ipucu ses.
Buna ek olarak telaffuz düzeltmeleri (pronunciation override) katmanı çalışıyor. Marka isimleri, sektöre özel terimler, kısaltmalar — bunların nasıl okunacağı ajan bazında tanımlanabiliyor ve karşılama, kapanış, sık sorulan soru ve hatırlatma akışlarının hepsinde aynı şekilde uygulanıyor.
Ölçmediğimiz şeyi iddia etmiyoruz
Türkçe seslendirme kalitesini rakiplerle karşılaştıran yayınlanmış bir ölçümümüz yok. Böyle bir ölçüm yapmak istiyoruz ve yöntemini hazırlıyoruz; ama ölçmeden "en iyisi biziz" demek, bu yazıda anlattığımız sorunun kendisine katkıda bulunmak olurdu.
Şimdilik önerimiz basit: kendi senaryonuzu, kendi marka isminizi, kendi adres bilginizi yazın ve dinleyin. Türkçe seslendirmede fark, kataloglarda değil, gerçek bir cümlenin içinde duyulur.
Diğer yazılar
Telefon altyapısını neden kendimiz işletiyoruz
Sesli AI platformlarının çoğu telefoniyi hazır bir sağlayıcıya bırakır. Biz sinyalleşme ve ses katmanını kendimiz işletiyoruz — çünkü Türkiye şebekesi hazır davranışla çalışmıyor.
Gecikme sayılarımız: ABD'de 0,45 sn, Avrupa'da 0,6 sn, Türkiye'de 0,8 sn
Sesli AI'da tek bir gecikme rakamı vermek yanıltıcıdır. Coğrafyaya göre değişir. Kendi ölçtüğümüz sayıları ve bu sayıların neyi kapsadığını paylaşıyoruz.