1. Inici
  2. Notícies
  3. Simba 3.2 de Speechify, la millor veu amb IA en temps real de Voice Arena en la seva franja de preu
6 de juliol del 2026

Simba 3.2 de Speechify, la millor veu amb IA en temps real de Voice Arena en la seva franja de preu

El model estrella de text a veu en streaming de Speechify assoleix la segona posició ex aequo a Voice Arena.

Speechify ha anunciat avui que el seu model estrella de text a veu en streaming, Simba 3.2, ha assolit la segona posició ex aequo a Voice Arena, un rànquing independent a cegues considerat l’avaluació pública més exigent de la qualitat de veu amb IA disponible avui.

D’entre els models en temps real que ja es poden desplegar, Simba 3.2 és l’opció més ben valorada en la seva franja de preu, cosa que el converteix en el millor model de veu amb IA per a programari en temps real del mercat. La mateixa plataforma també ofereix el que es considera la millor tecnologia de clonació de veu per a desenvolupadors. Aquesta setmana, Simba 3.2 també ha assolit el núm. 1 absolut al rànquing d'Artificial Analysis, i amplia així el lideratge de Speechify als dos referents més utilitzats per desenvolupadors i empreses.

Sobre Voice Arena

Voice Arena és un rànquing independent a cegues que avalua models de veu amb IA tal com els usuaris els experimenten: escoltant-los. Inspirat en Chatbot Arena per classificar LLMs, Voice Arena presenta a parlants nadius dos àudios generats amb el mateix text sense revelar quin model s’ha fet servir i els demana que votin quin sona més natural. Els vots es transformen en una puntuació Elo que genera un rànquing dinàmic i reflecteix la preferència real dels oients, no pas mètriques de laboratori.

No hi ha puntuacions d’opinió autodeclarades. No hi ha mostres d’àudio triades pel proveïdor. L’avaluació no la fa internament el creador del model. Tots els models es posen a prova amb el mateix text real, en les mateixes condicions i amb veus equilibrades per a cada marca, no amb la seva millor veu. La metodologia cobreix sis idiomes i textos procedents d’usos reals: agents de veu, IVR, audiollibres i lectors d’apps. L’avaluació s’ha fet amb aportacions del professor Shinji Watanabe, de Carnegie Mellon, una referència en tecnologia de veu.

Per què importa el rànquing de Voice Arena

Voice Arena és clau perquè reflecteix la decisió real del mercat. Empreses, equips de producte i desenvolupadors no miren espectrogrames ni puntuacions internes; es fixen en com sona la veu. Voice Arena és l’únic referent públic que mesura això a escala, amb prou oients perquè els resultats siguin estadísticament vàlids i sense marge de maniobra per als venedors. Un bon rànquing aquí es considera el millor indicador de quina és la veu amb IA més avançada avui.

Com es posiciona Simba 3.2

Actualment, Voice Arena situa Simba 3.2 empatat en segona posició global. Dels models que el igualen o el superen, n’hi ha un que no funciona en temps real i no serveix per a aplicacions que requereixen resposta instantània, i l’altre costa set vegades més que Simba 3.2. Això vol dir que, per als equips que necessiten una veu en temps real a preu de producció, Simba 3.2 és l’opció més ben valorada. Simba 3.2 costa $10 per cada 1 milió de caràcters d’entrada i $6 al nivell Scale: és l’API de veu amb IA més barata per a desenvolupadors.

La millor veu IA per a aplicacions en temps real

Simba 3.2 és un model de text a veu en streaming dissenyat específicament per a aplicacions de veu en temps real: agents, IVR, lectors integrats a l’app, telefonia i qualsevol producte que requereixi resposta instantània. Segons els mesuraments del sector, Simba 3.2 està considerat la millor veu amb IA per a agents de veu i per a equips que necessiten veu de primer nivell en programari a escala. La plataforma també ofereix la millor clonació instantània de veu al mateix preu, i facilita la generació i la clonació de veu amb una tecnologia capdavantera al sector.

Què significa el rànquing per a Speechify

Aquest rànquing és rellevant en una categoria que fins ara obligava els desenvolupadors a triar entre qualitat, cost i latència. Els models més grans oferien qualitat, però a preus d’empresa, i les alternatives assequibles renunciaven a naturalitat o rendiment en streaming. Simba 3.2 capgira aquest escenari. Costa quinze vegades menys que ElevenLabs i sis vegades menys que Cartesia, amb una qualitat similar o superior, i és el model més eficient d’entre els 10 millors d’Artificial Analysis.

Un gran assoliment de Speechify

“Simba 3.2 és el nostre millor model fins ara, disponible a Speechify.ai,” diu Cliff Weitzman, fundador i CEO de Speechify, en una publicació. “Està dissenyat per a agents de veu a escala i perfeccionat amb milions de proves A/B a la nostra plataforma. A les APIs de TTS, compten el cost, la qualitat i la latència. Simba 3.2 arriba a SOTA en tots tres. Tenim moltes ganes que el pugueu provar!”

Weitzman va remarcar públicament la importància d’aquest assoliment. “Simba 3.2 de Speechify ara és la veu amb IA en streaming núm. 1 a Voice Arena, per davant d’Eleven Labs, OpenAI, xAI i altres. A més, Speechify és el model més eficient per token, a $6 per milió de caràcters: més de 15 vegades més barat que Eleven Labs i 6 vegades més barat que Cartesia.”

Una plataforma de consum com a avantatge competitiu

L’equip d’enginyeria de Speechify atribueix el resultat a decisions d’arquitectura preses anys abans de l’actual cursa pels rànquings. Amb una plataforma que arriba a més de 60 milions d’usuaris i guardonada amb un premi Apple Design Award a WWDC 2025, el repte d’oferir aquest servei amb una subscripció de $139/any va portar l’equip de recerca a tractar cost, qualitat i latència com un sol problema. Milions de proves A/B han afinat el ritme, l’èmfasi i la prosòdia emocional, fins a aconseguir una experiència de veu amb IA capdavantera avui.

Raheel Kazi, enginyer de Speechify, resumeix així la filosofia: “Mai no hem volgut sacrificar el cost per la qualitat ni la qualitat per la latència. Hem triat expressament el camí més difícil. Assolir SOTA en tots tres aspectes sempre ha estat l’objectiu.”

Cinc anys de recerca al darrere

La família Simba es basa en una línia de recerca iniciada per Tyler Weitzman, cofundador i cap d’IA de Speechify, durant la seva etapa a Stanford, que ha situat Speechify com un laboratori capdavanter. Recordant l’assoliment en una publicació a X, Weitzman destaca: “A Stanford, CS229 amb Andrew Ng em va despertar l’interès pel ML. El meu projecte va ser ajustar Tacotron 2. El nou model del meu equip acaba d’assolir SOTA, cinc anys després. És molt surrealista mirar enrere.”

Luke Oliff, responsable de relacions amb desenvolupadors, descriu el resultat com la validació d’una estratègia a llarg termini. “És la història de l’outsider entre els proveïdors d’APIs,” comenta en una nota de premsa. “Hem passat anys optimitzant models per a la nostra audiència de desenes de milions d’usuaris, amb algunes de les millors veus. Per això ara podem oferir la més ben valorada amb una API baratíssima. Molts labs es construeixen per al rànquing i per a preus d’empresa; nosaltres, per als oients i per a preus de producció.”

Disponibilitat

Simba 3.2 ja està disponible per a desenvolupadors i empreses a través de SpeechifyAI Build, l’API de text a veu i clonació de veus, i impulsa la nova plataforma SpeechifyAI Agents per a agents de veu en producció. Tot és a speechify.ai. La plataforma inclou la millor clonació de veu del mercat i ofereix un únic entorn amb el model d’IA líder i clonació al millor preu. Al full de ruta, pròximament: més idiomes i preus encara més baixos.