Speechify dışındaki iki test, SpeechifyAI'nin Simba 3.2 modelinin ilk ses süresini Eylül 2026'da ölçtü. Coval, 24 Eylül 2026'ya kadar olan 24 saatte ortanca 106 ms kaydetti. Voice Arena ise aynı gün, ABD İngilizcesi panosunda 123 ms ile ölçülen 14 model arasında en düşük ortalamayı bildirdi. Bu yazıda bu rakamların neyi ölçtüğünü, neden ilk ses süresinin en anlamlı gecikme metriği olduğunu ve bunu kendi kodunuzdan nasıl ölçeceğinizi anlatıyoruz.
Rakamlar
İki bağımsız ölçüm, ağ gecikmesini ve sesin başındaki sessizliği de kapsadığı için kendi değerlendirmemizden daha yüksek çıkıyor. Her biri, kendi testinin o tarihteki sonucunu yansıtıyor. Her iki pano da testlerini güncel tutuyor; en güncel sonuçlar için doğrudan panoları kontrol edin.
Voice Arena'nın ABD İngilizcesi panosu, 24 Eyl 2026
Kaynak: Voice Arena, 24 Eyl 2026'da görüntülendi. Panoda 14 model ölçüldü; burada en hızlı altı model yer alıyor.
Neden en doğru kıyas metriği ilk ses süresidir?
Bir sesli asistan yanıt verdiğinde veya bir uygulama metni seslendirdiğinde, dinleyici metnin gönderildiği andan ilk sesi duyana kadar bekler. İşte bu bekleme süresi, ilk ses süresidir.
- İlk bayt süresi, gerçekte duyulandan daha kısa görünebilir.
- Akış sessizlikle başlayabilir ve dinleyici ilk duyulur örneğe kadar hiçbir şey işitmez. İlk ses süresi, bu sessizliği de hesaba katar.
- Toplam üretim süresi, son bayta kadar geçen süredir.
- Bu, bir dosya kaydederken önemlidir; gerçek zamanlı dinlemede değil.
- Sohbetlerde tolerans düşüktür.
- İnsanlar genelde birkaç yüz milisaniye içinde yanıt verir. Bir sesli asistanın konuşma tanıma, dil modeli ve konuşma sentezini bu dar aralığa sığdırması gerekir; bu yüzden her milisaniye diğer işlemlerden zaman çalar.
Simba 3.2 modeli küçülmeden nasıl hızlandı?
Coval verilerine göre Simba 3.2'nin günlük ortancası, 13 Eyl 2026'da 379 ms iken 18 Eyl 2026'da 116 ms'ye düştü; yani beş günde yaklaşık %70 azaldı.
Model değişmedi. Aynı ağırlıklar kullanıldı; damıtma, kuantizasyon ya da "turbo" gibi küçültülmüş bir varyant yoktu. Süre, modelin etrafındaki sunum katmanında kısaltıldı:
- Düşük seviyeli çıkarım optimizasyonlarına sahip farklı bir GPU sınıfında yeni bir sunucu kurulumu yapıldı; böylece ses daha erken gelmeye başladı.
- Paket, izin ve oran limitleri için yapılan kontroller, ilk bayttan önce canlı sorgu yerine önbellekten çözümleniyor.
- API geçidi, GPU'larla aynı bölgede sürekli açık bağlantılar üzerinden çalışıyor.
- Yaklaşık 100 ms'lik baştaki sessizlik kaldırıldı. Coval’in Simba 3.2 için ölçtüğü baştaki sessizlik 14 Eyl'de 102 ms'den 13 ms'ye indi.
Kalite korundu. Artificial Analysis metinden sese sıralamasında Simba 3.2, 23 Eyl 2026 itibarıyla Elo 1.237 (±14) ile 92 sağlayıcı sesi arasında ilk beşte yer alıyordu ve üstündeki her model daha pahalıydı.
Uygulamanızda en düşük gecikmeye nasıl ulaşırsınız?
- Akış kullanın.
- Üretilirken çalınacak sesler için
- POST /v1/audio/stream
- çağrısını kullanın.
- POST /v1/audio/speech
- ise ancak tüm klip oluşturulduktan sonra yanıt verir.
- Simba 3.2 isteyin.
- İngilizce için
- model
- değerini
- simba-3.2
- olarak ayarlayın.
- model
- verilmezse API
- simba-3.0
- kullanır.
- Aynı bağlantıyı yeniden kullanın.
- Bir HTTP istemcisi oluşturun, bağlantıyı başta açın ve tüm isteklerde açık tutun; böylece TCP, TLS el sıkışmaları ve DNS sorguları ek gecikme yaratmaz.
- Cümleleri hazır olur olmaz gönderin.
- Önde bir dil modeli varsa, tamamlanan her cümleyi hemen gönderin ve akışları sırayla oynatın.
- Çalıcıya uygun formatı seçin.
- 24 kHz'de
- audio/pcm
- kodlama gerektirmez. Bant genişliği önemliyse MP3 veya Ogg Opus kullanın.
- API'ye yakın çalışın.
- API, ABD Doğu merkezli hizmet verir. Sunucunuz bu bölgede veya yakınındaysa ağ gecikmesi en aza iner.
LiveKit Agents ile mi çalışıyorsunuz? Bu rehber, Speechify eklentisiyle dil modeli her cümleyi oluşturdukça aktarım yapan bir sesli asistan kurmanıza yardımcı olur. Her adımın mantığını ve kodlarını, gecikme dokümantasyonunda bulabilirsiniz.
Kendi ölçümünüzü yapın
Akış yanıtının ilk parçasına kadar geçen süreyi, kodunuzun çalıştığı yerden ölçün. Adil bir ölçüm için:
- İlk bir iki isteği hariç tutun. Bunlar bağlantı kurulumu süresini içerir.
- Gerçek trafiğinizde olduğu gibi, istekler arasında metni değiştirin.
- İstekleri paralel değil, art arda gönderin.
- En az 20 istek gönderin ve ortanca (p50) ile p90'ı raporlayın; ortalamayı veya tek bir en iyi denemeyi değil.
- Ölçümü PCM formatıyla yapın. Ogg'da ilk baytlar ses yerine başlık bilgisi olur.
Her akış yanıtında Server-Timing başlığındaki ttfb değeri, bizim taraftaki bekleme süresini gösterir; kalan kısım ağ ve kendi yazılımınızdan kaynaklanır. Gecikme dokümantasyonunda bunun için Python ve TypeScript betikleri bulabilirsiniz.
Sıkça sorulan sorular
SpeechifyAI'nin Simba 3.2 modeli, 15 Eyl 2026'da ABD Doğu bölgesindeki üretim trafiğinde ilk ses baytını ortanca 56 ms, p90'da ise 102 ms'de gönderdi. Bağımsız testlerdeyse ortanca ilk ses süreleri 106 ms (Coval, 24 Eyl 2026'ya kadar olan 24 saat) ve 123 ms (Voice Arena, 24 Eyl 2026) olarak ölçüldü; bu ölçümlere ağ gecikmesi ve sesin başındaki sessizlik de dahildir.
24 Eyl 2026'da Voice Arena'nın ABD İngilizcesi panosunda, SpeechifyAI'nin Simba 3.2 modeli ölçülen 14 model arasında ortanca ilk ses süresinde en düşük değere sahipti: 123 ms. Inworld Realtime TTS 2 Araştırma Önizlemesi ise 168,5 ms ile ikinci sıradaydı. Kıyaslamalar sürekli yenilendiği için, sonuca güvenmeden önce tarihi kontrol edin.
Evet. POST /v1/audio/stream, ses üretildikçe HTTP üzerinden PCM, MP3, Ogg Opus veya AAC olarak iletir. PCM, kodlama gerektirmediği için en düşük gecikmeyi sağlar.
Hayır. SpeechifyAI, Speechify'ın geliştirici API'sidir ve Speechify okuma uygulamasından ayrı faturalandırılır; Reader aboneliği API kullanımını kapsamaz. API planları aylıktır, yıllık taahhüt yoktur: ayda 500.000 karakterlik ücretsiz plan (kart gerekmez), Starter ayda $10 + ek kullanımda milyon karakter başına $10, Pro $99 + $8 ve Scale $499 + $6'dır.
Simba 3.2'yi SpeechifyAI üzerinde deneyin: ücretsiz bir API anahtarı oluşturun ve ilk isteğinizi yukarıdaki sonuçlarla karşılaştırın.

