Vocoder nasıl çalışır?
Ses bir filtre bankasıyla frekans bantlarına ayrılır. Her bandın zarfı, yani yavaş genlik değişimi
çıkarılır; aynı bandın ince zamansal yapısı atılır. Zarf bir taşıyıcıyı modüle eder ve kanallar toplanır.
Koklear implant işlemcileri de sesi bantlara ayırıp her elektrotta zarfı bir darbe dizisine taşıdığı için
vocoder, implantın aktardığı bilginin normal işiten kulakla dinlenebilir bir benzetimidir (Shannon ve ark., 1995).
Kanal sayısı neden bu kadar önemli?
Shannon ve ark. (1995) sessiz ortamda üç bantla bile cümlelerin büyük ölçüde anlaşıldığını gösterdi.
Gürültüde tablo değişir: Friesen ve ark. (2001) normal işitenlerin vocoder ile en az 20 kanala kadar gelişmeye
devam ettiğini, implant kullanıcılarının ünlü ve ünsüz tanımada ise yaklaşık 7-8 elektrottan sonra
ilerlemediğini buldu. Sözcük ve cümlede sınır 7-10 elektrottu. Yani 22 elektrot, 22 bağımsız kanal demek değildir.
Taşıyıcı seçimi
Sinüs zarfı sadık taşır ama yayılımı taklit edemez ve tonal duyulur. Gürültü yayılımı daha iyi temsil
eder, ama implantta olmayan rastgele dalgalanmalar ekler. PSHC, darbe hızı her bant için işitsel filtre
çıkışında zarf en düz kalacak şekilde seçilen bir harmonik komplekstir (Hilkhuysen ve Macherey, 2014).
Mesnildrey ve ark. (2016) gürültüde anlaşılırlık eşiklerini sinüs 1,5 dB, PSHC 3,8 dB, gürültü 4,9 dB SNR olarak buldu.
Gerçek implant sesine ne kadar benziyor?
Tek taraflı çok ileri derecede işitme kaybı nedeniyle implant kullanan kişiler iki kulağı karşılaştırabildiği için bu
soruyu yanıtlayabilir. Karoui ve ark. (2019) dokuz kullanıcıda PSHC'nin sinüs ve gürültüden daha benzer
bulunduğunu, sinüs ile gürültü arasında ise fark olmadığını bildirdi. Kopsch, Plontke ve Rahne (2025) on beş
kullanıcıda sinüsü gürültüden daha benzer buldu (medyan 5,9 ve 3,6); ilk taramada basit alçak, yüksek ve bant
geçiren filtreler vocoder'lardan da benzer bulundu. Bireysel ayarla benzerlik 10 üzerinden 9,7'ye çıktı, ama
gereken ayar kişiden kişiye çok farklıydı. Kısacası vocoder, implant sesinin değil implantın aktardığı
bilginin benzetimidir.
Yerleştirme derinliği ve uyum
Elektrot dizisi yaklaşık 35 mm'lik koklearın genelde 22-30 mm'sine girer. Sığ yerleştirmede alçak frekanslar bazale,
daha yüksek frekans yerlerine taşınır; örneğin 500 ve 1200 Hz'teki tepeler yaklaşık 900 ve 2000 Hz'e kayar
(Cychosz ve ark., 2024). Kullanıcılar bu kaymaya zamanla alışabilir; Karoui ve ark.'nın dokuz kullanıcısından yalnız
birinde tam, ikisinde kısmi uyum görüldü. Normal işiten bir dinleyicinin birkaç dakikalık dinlemesi bu uyumu taklit edemez.
Elektrik-akustik uyarım (EAS)
Dorman ve ark. (2005) 500 Hz altını akustik bırakıp üstünü beş kanallı sinüs vocoder ile verdi. Aradaki boşluk
0,5 kHz olduğunda cümle tanıma %90, 1 kHz'te %80, 1,5 kHz'te %58, 2,2 kHz'te %45 oldu; yalnız akustik kısım
%17'de kaldı. Gürültüde birleşik puan, iki kısmın ayrı puanlarının toplamından yüksekti.
Bu araç neyi taklit etmez?
Cychosz ve ark. (2024) vocoder'ların "gerçek implant simülasyonu" sayılmaması gerektiğini vurgular. Taklit
edilemeyenler: elektriksel uyarımın çok dar dinamik aralığı ve sinir liflerindeki yüksek eşzamanlılık,
yayılımın apekste bazdan daha geniş olması, elektrot-nöron arayüzünün kişiden kişiye değişmesi ve implant
kullanıcılarının özellikle ilk 6-12 ayda gösterdiği alışma ve öğrenme. Greenwood haritası Corti organındaki
yerlere dayanır; elektrotların uyardığı spiral gangliyon hücrelerinin frekans haritası özellikle apekse doğru
bundan ayrışır.
Bu araçta nasıl hesaplanıyor?
Bantlar Greenwood haritasına göre eşit koklear uzaklıkta yerleştirilir (A = 165,4, a = 2,1, k = 0,88, 35 mm).
Filtreler sıfır fazlı Butterworth'tür. Akım yayılımı, Oxenham ve Kreft'in (2014) yöntemiyle, yoğunluk zarflarının
taşıyıcı merkezleri arasındaki oktav uzaklığına göre dB/oktav ağırlıkla toplanmasıdır. PSHC fazları Hilkhuysen ve
Macherey'nin denklemleriyle, darbe hızları Mesnildrey ve ark.'nın formülüyle (37 + 151x + 0,17x², x: kHz) üretilir.
Hesabın tamamı 72 ölçümden oluşan bir test paketiyle doğrulanmıştır: filtre eğimleri, Greenwood dönüşümü, zarf doğruluğu, PSHC darbe hızı ve tepe faktörü, yayılım ağırlıkları, SNR ve düzey eşitleme.
Kaynaklar
- Cychosz, M., Winn, M. B., & Goupell, M. J. (2024). How to vocode: Using channel vocoders for cochlear-implant research. The Journal of the Acoustical Society of America, 155(4), 2407-2437. doi:10.1121/10.0025274
- Dorman, M. F., Spahr, A. J., Loizou, P. C., Dana, C. J., & Schmidt, J. S. (2005). Acoustic simulations of combined electric and acoustic hearing (EAS). Ear and Hearing, 26(4), 371-380.
- Dudley, H. (1939). The automatic synthesis of speech. Proceedings of the National Academy of Sciences of the United States of America, 25(7), 377-383. doi:10.1073/pnas.25.7.377
- Friesen, L. M., Shannon, R. V., Başkent, D., & Wang, X. (2001). Speech recognition in noise as a function of the number of spectral channels: Comparison of acoustic hearing and cochlear implants. The Journal of the Acoustical Society of America, 110(2), 1150-1163. doi:10.1121/1.1381538
- Greenwood, D. D. (1990). A cochlear frequency-position function for several species: 29 years later. The Journal of the Acoustical Society of America, 87(6), 2592-2605.
- Hilkhuysen, G., & Macherey, O. (2014). Optimizing pulse-spreading harmonic complexes to minimize intrinsic modulations after auditory filtering. The Journal of the Acoustical Society of America, 136(3), 1281-1294. doi:10.1121/1.4890642
- Karoui, C., James, C., Barone, P., Bakhos, D., Marx, M., & Macherey, O. (2019). Searching for the sound of a cochlear implant: Evaluation of different vocoder parameters by cochlear implant users with single-sided deafness. Trends in Hearing, 23, 1-15. doi:10.1177/2331216519866029
- Kopsch, A. C., Plontke, S. K., & Rahne, T. (2025). Acoustic simulation of cochlear implant sound to approximate the perceptual experience of electric hearing. Scientific Reports, 15, 38997. doi:10.1038/s41598-025-25711-z
- Mesnildrey, Q., Hilkhuysen, G., & Macherey, O. (2016). Pulse-spreading harmonic complex as an alternative carrier for vocoder simulations of cochlear implants. The Journal of the Acoustical Society of America, 139(2), 986-991. doi:10.1121/1.4941451
- Oxenham, A. J., & Kreft, H. A. (2014). Speech perception in tones and noise via cochlear implants reveals influence of spectral resolution on temporal processing. Trends in Hearing, 18, 2331216514553783. doi:10.1177/2331216514553783
- Shannon, R. V., Zeng, F.-G., Kamath, V., Wygonski, J., & Ekelid, M. (1995). Speech recognition with primarily temporal cues. Science, 270(5234), 303-304. doi:10.1126/science.270.5234.303
Konuşma örnekleri: Mozilla Common Voice Türkçe veri setinden (sürüm 13.0, CC0 kamu malı) üç
konuşmacı; kalabalık gürültüsü aynı setten altı başka konuşmacının üst üste bindirilmesiyle hazırlandı. Kayıtlar
kırpıldı ve aynı etkin düzeye getirildi. Melodi (Ah vous dirai-je, maman) ve müzik (Menuet G majör,
BWV Anh. 114, iki sesli basit düzenleme) kamu malı ezgilerden bu sayfada sentezlenir.