Speechify oferuje niewielki wybór modeli text-to-speech. Wybór odpowiedniego modelu to kompromis między opóźnieniem, obsługą języków i jakością głosu. Ten przewodnik przyporządkowuje każdy model do konkretnych zastosowań, aby ułatwić Ci wybór bez żmudnych testów.
Wpisy o modelach na speechify.ai szerzej omawiają każde wydanie. Ogłoszenie Simba 3.2 wyjaśnia, dlaczego jest to obecnie rekomendowany model.
Więcej o integracji z Speechify Text-to-Speech API znajdziesz w naszym przewodniku szybkiego startu.
Jakie modele oferuje Speechify?
Trzy rodziny modeli.
- Simba 3.2: rekomendowany model dla języka angielskiego. Oparty na streamingu, z najniższym opóźnieniem i wyselekcjonowanymi głosami. Najlepiej sprawdza się w zastosowaniach interaktywnych.
- Simba 3.0: domyślny model w API. Oparty na streamingu, obsługuje wiele języków: angielski, niemiecki, hiszpański, francuski, włoski i portugalski brazylijski. Ma nieco wyższe opóźnienie niż 3.2, ale szerszy zasięg.
- Starsze modele (simba-english, simba-multilingual): para modeli Simba 1.6. Wycofywane od API 2026-09-21, wyłączone 2026-11-21. Używaj ich tylko wtedy, gdy integracja wymaga starszego głosu lub języka, i już teraz zaplanuj migrację.
Który model jest najszybszy?
Simba 3.2. Został zaprojektowany do streamingu i najszybciej generuje pierwszy dźwięk. Dla anglojęzycznych agentów głosowych to domyślny wybór.
Simba 3.0 jest tylko nieznacznie wolniejszy, ale obsługuje więcej języków. Starsze modele są najwolniejsze i warto z nich zrezygnować, jeśli to możliwe.
Który model obsługuje najwięcej języków?
Simba 3.0. Oficjalnie obsługuje angielski, niemiecki, hiszpański (Hiszpania i Meksyk), francuski, włoski oraz portugalski brazylijski. Przekaż parametr language w POST /v1/audio/speech, a otrzymasz głos natywny dla danego języka. Starszy simba-multilingual obsługiwał ponad 30 lokalizacji, ale będzie wycofywany od wersji API 2026-09-21 i wyłączony 2026-11-21.
Jeśli Twój produkt obsługuje jeden język, Simba 3.2 zapewnia najwyższą szybkość i jakość. Jeśli obsługujesz wiele języków, lepszym wyborem jest obecnie Simba 3.0.
Więcej informacji o obsłudze języków znajdziesz w naszej dokumentacji.
Który model brzmi najlepiej?
Jakość rośnie z każdą kolejną generacją. Simba 3.2 oferuje najbardziej naturalny angielski. Simba 3.0 bardzo dobrze wypada w wielu językach. Starsze modele brzmią najbardziej mechanicznie.
Do kontaktu z klientami wybierz Simba 3.2 lub Simba 3.0.
Jak sprawdzić dostępne głosy?
Wywołaj GET /v1/voices. Filtruj według typu, języka, płci i modelu, aby dobrać odpowiedni głos przed syntezą. Wpisy o głosach na speechify.ai pokazują strukturę odpowiedzi.
Streaming czy plik?
Oba modele Simba 3 obsługują streaming. Użyj POST /v1/audio/stream do odtwarzania na żywo, POST /v1/audio/stream/with-timestamps do dźwięku ze znacznikami czasu i synchronizacją słów lub POST /v1/audio/speech do wygenerowania pojedynczego pliku. Wybór modelu nie zależy od sposobu dostarczania dźwięku.
FAQ
Jaki model TTS Speechify jest zalecany?
Simba 3.2. To rekomendowany wybór dla nowych projektów: oparty na streamingu, z najszybszym startem audio i najwyższą jakością w języku angielskim.
Simba 3.2 do angielskiego: oparty na streamingu, z najszybszym startem audio i najwyższą jakością w tym języku. Domyślnie API ustawia Simba 3.0, jeśli nie podasz model, więc ustaw model: "simba-3.2", aby go wybrać.
Tak. Simba 3.0 przyjmuje parametr języka i zwraca natywne głosy dla wielu lokalizacji. Simba 3.2 koncentruje się na wyselekcjonowanym języku angielskim.
Tak. Simba 3.0 przyjmuje parametr języka i obsługuje angielski oraz sześć języków europejskich. Simba 3.2 koncentruje się na wyselekcjonowanym języku angielskim.
Tylko wtedy, gdy obecna integracja wymaga konkretnego starszego głosu. W przeciwnym razie wybierz Simba 3.2 lub Simba 3.0.
Tylko wtedy, gdy obecna integracja wymaga starszego głosu. Modele są wycofywane w API od 2026-09-21 i zostaną wyłączone 2026-11-21, więc wcześniej przejdź na Simba 3.2 lub Simba 3.0.
Wybierz Simba 3.2, jeśli zależy Ci na najkrótszym czasie do pierwszego bajtu. Strumieniuj dźwięk na żywo.

