Speechify oferuje ograniczoną liczbę modeli syntezy mowy (text-to-speech). Wybór właściwego modelu to kwestia kompromisu między opóźnieniem, liczbą obsługiwanych języków i jakością głosu. Ten przewodnik przypisuje każdy model do odpowiednich zastosowań, więc nie musisz testować wszystkich opcji.
Posty na speechify.ai szczegółowo opisują każde wydanie. W zapowiedzi Simba 3.2 wyjaśniono, dlaczego jest to obecnie rekomendowany model.
Jakie modele oferuje Speechify?
Dwa aktualne modele oraz para starszych modeli w trakcie wycofywania.
- Simba 3.2: rekomendowany model dla języka angielskiego. Obsługuje streaming, ma najniższe opóźnienie i starannie dobrane angielskie głosy. Najlepiej sprawdza się w zastosowaniach interaktywnych.
- Simba 3.0: domyślny model w API. Obsługuje streaming i wiele języków: angielski, niemiecki, hiszpański, francuski, włoski oraz brazylijski portugalski. Ma nieco wyższe opóźnienie niż 3.2, ale szerszy zakres języków.
- Modele starsze (simba-english, simba-multilingual): para modeli Simba 1.6. Wycofane z API od wersji 2026-09-21, wyłączane 2026-11-21. Używaj ich tylko wtedy, gdy integracja wymaga konkretnego starszego głosu lub języka, i już teraz zaplanuj migrację.
Który model jest najszybszy?
Simba 3.2. Dzięki streamingowi najszybciej generuje pierwsze dźwięki. Dla anglojęzycznych asystentów głosowych to najlepszy domyślny wybór.
Simba 3.0 jest tylko nieznacznie wolniejszy, ale obsługuje więcej języków. Starsze modele są najwolniejsze i tam, gdzie to możliwe, warto z nich zrezygnować.
Który model obsługuje najwięcej języków?
Simba 3.0. Oficjalnie obsługuje angielski, niemiecki, hiszpański (Hiszpania, Meksyk), francuski, włoski i brazylijski portugalski. Ustaw parametr language w POST /v1/audio/speech, aby wybrać lokalizację — otrzymasz natywny głos dla danego języka. Starszy simba-multilingual obejmuje ponad 30 lokalizacji, ale jest wycofywany od wersji API 2026-09-21 i wyłączany 2026-11-21.
Jeśli Twój produkt działa w jednym języku, Simba 3.2 wygrywa pod względem szybkości i jakości. Jeśli obsługuje kilka języków, obecnie Simba 3.0 ma najszerszy zakres.
Dowiedz się więcej o obsłudze języków w naszej dokumentacji.
Który model brzmi najlepiej?
Jakość idzie w parze z generacją modelu. Simba 3.2 wyróżnia się najbardziej naturalnym angielskim. Simba 3.0 dobrze radzi sobie we wszystkich obsługiwanych językach. Starsze modele to najstarsza i najbardziej mechanicznie brzmiąca opcja.
Do kontaktu z klientami wybierz Simba 3.2 lub Simba 3.0.
Jak sprawdzić dostępne głosy?
Wywołaj GET /v1/voices. Filtrowanie według typu, lokalizacji, płci i modelu pozwala znaleźć odpowiedni głos przed syntezą. Posty o głosach i modelach na speechify.ai pokazują, jak wygląda odpowiedź.
Streaming czy plik?
Oba modele Simba 3 obsługują streaming. Użyj POST /v1/audio/stream do odtwarzania na żywo, POST /v1/audio/stream/with-timestamps do dźwięku na żywo ze znacznikami czasowymi na poziomie słów (speech marks) lub POST /v1/audio/speech do wygenerowania pliku audio. Wybór modelu nie zależy od sposobu dostarczania.
FAQ
Jaki model TTS Speechify jest rekomendowany?
Simba 3.2. To domyślny wybór do nowych zastosowań: natywny streaming, najszybszy start i najwyższa jakość dla języka angielskiego.
Który model API wykorzystuje domyślnie?
Simba 3.0. Jeśli żądanie nie zawiera parametru model, API używa Simba 3.0. Ustaw model: "simba-3.2", aby wybrać 3.2 dla języka angielskiego.
Czy Speechify TTS obsługuje wiele języków?
Tak. Simba 3.0 przyjmuje parametr language i zwraca natywne głosy w języku angielskim, niemieckim, hiszpańskim (Hiszpania i Meksyk), francuskim, włoskim oraz brazylijskim portugalskim. Simba 3.2 koncentruje się na wybranych głosach angielskich.
Czy nadal warto używać starszych modeli?
Tylko jeśli dotychczasowa integracja wymaga starszego głosu. simba-english i simba-multilingual są wycofywane od wersji API 2026-09-21 i wyłączane 2026-11-21, dlatego przejdź na Simba 3.2 lub Simba 3.0 przed tymi datami.
Który model wybrać do agenta głosowego?
Wybierz Simba 3.2 — zapewnia najkrótszy czas do pierwszego dźwięku i pozwala strumieniować wynik na żywo.

