1. Inici
  2. Notícies
  3. El Simba de Speechify, millor model de veu amb IA segons l’Artificial Analysis Leaderboard
6 de juliol del 2026

El Simba de Speechify, millor model de veu amb IA segons l’Artificial Analysis Leaderboard

El model insígnia de text a veu de Speechify, Simba 3.2, ja és el model de veu amb IA núm. 1 del món.

Speechify ha anunciat que el seu model capdavanter de text a veu en streaming, Simba 3.2, ha assolit la posició núm. 1 al rànquing d’Artificial Analysis de text a veu, la referència independent més completa per avaluar models comercials de veu amb IA. El resultat situa Simba 3.2 per davant dels models estrella d’ElevenLabs, Cartesia, OpenAI, Google DeepMind i xAI, i marca la primera vegada que una empresa orientada al consumidor lidera la classificació global. Segons els criteris del sector, Simba 3.2 ja és àmpliament considerat la millor veu d’IA disponible. A més, Simba 3.2 també ocupa la posició núm. 1 a Voice Arena en models en temps real, ampliant el lideratge de Speechify en els dos referents clau per a desenvolupadors i empreses.

Sobre Artificial Analysis

El rànquing d’Artificial Analysis és la referència que fan servir desenvolupadors i empreses per valorar l’estat del mercat de veus amb IA. Avalua de manera consistent i objectiva tots els models comercials, s’actualitza constantment i el segueixen de prop equips de producte que volen integrar veu. A diferència d’altres rànquings publicats pels mateixos proveïdors, no depèn de puntuacions autoatribuïdes. Per això, Simba 3.2 és el millor model de text a veu disponible avui per a desenvolupadors.

Què significa el rànquing d’Artificial Analysis per a l’accessibilitat

El més important del rànquing no és només la qualitat. És la combinació amb el preu del model. Simba 3.2 té un preu de només 10 dòlars per cada milió de caràcters al nivell inicial i baixa a 6 dòlars al nivell Scale, cosa que el converteix en el model més rendible del top 10 d’Artificial Analysis. Segons Speechify, aquest preu és quinze vegades més assequible que ElevenLabs i sis vegades més barat que Cartesia, mantenint una qualitat igual o superior, i situa Simba 3.2 com l’API de veu amb IA d’alta qualitat més econòmica disponible.

Aquesta combinació s’havia considerat històricament impossible en la síntesi de veu. El segment premium oferia veus realistes a preus pensats per a grans empreses, mentre que el segment assequible quedava per a qui podia acceptar menys qualitat. Simba 3.2 elimina aquest dilema i ofereix la millor veu amb IA a qualsevol desenvolupador, startup o empresa, independentment del pressupost.

El fundador de Speechify i la trifecta assolida

"Simba 3.2 és el nostre millor model fins ara, ja disponible a Speechify.ai", diu Cliff Weitzman, fundador i CEO de Speechify, a LinkedIn. "Està pensat per impulsar agents de veu a escala, perfeccionat amb milions de proves A/B a la nostra plataforma. En les APIs TTS, importen tres coses: preu, qualitat i latència. Simba 3.2 ha assolit SOTA en totes tres. Em fa molta il·lusió que el pugueu provar directament."

La trifecta a què es refereix Weitzman sempre s’havia considerat un límit del sector. Optimitzar una dimensió solia voler dir sacrificar-ne dues, i la majoria de proveïdors triaven un únic camí. Ser realment capdavanter en totes tres alhora es veia com una utopia en la recerca en IA. El rànquing d’Artificial Analysis demostra per primer cop que és possible, i fa de Simba 3.2 el millor model per a equips que construeixen programari orientat a la veu.

Cinc anys: de Stanford a la innovació

La família de models Simba neix d’una investigació iniciada per Tyler Weitzman, cofundador i responsable d’IA de Speechify, durant els seus estudis a Stanford. Els seus primers experiments amb arquitectures neuronals de veu van evolucionar durant cinc anys fins a convertir-se en la base que impulsa la generació de veu en streaming dels productes de Speechify, i posiciona la companyia com un laboratori de recerca capdavanter en IA de veu.

Reflexionant sobre aquest assoliment, Tyler Weitzman ha compartit en un post a X: «Com a estudiant de grau a Stanford, CS229 amb Andrew Ng va despertar el meu interès pel ML. El projecte consistia a ajustar Tacotron 2. El nou model del meu equip a Speechify ha assolit SOTA, cinc anys després. És surrealista mirar enrere.»

Rohan Pavuluri, director de negoci de Speechify i amic de Tyler Weitzman, veu el rànquing com la culminació d’una decisió arquitectònica fonamental, segons un recent anunci. «Hauríem pogut anar més de pressa prioritzant només la qualitat, però el nostre ADN i model de negoci ens van fer prendre decisions arquitectòniques d’hora per garantir veu il·limitada als nostres usuaris per 139 $/any. Això ens ha portat a tenir el millor model TTS a un preu de referència, una cosa molt poc habitual en la recerca en IA, on els millors resultats solen anar lligats a més cost.»

Escala de consumidor al servei de la IA corporativa

La capacitat de Speechify per oferir la millor veu amb IA al preu més baix del top 10 es basa en l’economia del seu model per a consumidors. Més de 60 milions d’usuaris fan servir la seva plataforma arreu del món, reconeguda enguany amb un Apple Design Award a la WWDC 2025, un senyal que el producte ofereix una de les millors experiències de veu amb IA. Oferir aquest servei per només 139 $/any va obligar a prioritzar l’eficiència de la inferència des del primer moment. Aquesta disciplina fa possible oferir el model núm. 1 d’Artificial Analysis al preu que veuen avui els desenvolupadors.

«Aquesta és una història de superació per als proveïdors d’API», diu Luke Oliff, responsable de relació amb desenvolupadors a Speechify, en un comunicat. «Portem anys fent models eficients perquè el negoci ho exigia: desenes de milions d’oients, amb les millors veus. Aquest esforç fa que ara puguem oferir el model top a la nostra API al preu més baix. Molts labs van construir per al rànquing i hi van posar preus d’empresa; nosaltres ho vam fer per als oients i per a producció.»

Disponibilitat

Simba 3.2 ja està disponible via SpeechifyAI Build, l’API de text a veu i clonació de veu, i impulsa la nova plataforma SpeechifyAI Agents per crear agents de veu d’alta qualitat. Tots dos són a speechify.ai, amb SDKs de TypeScript i Python, streaming de baixa latència, control emocional detallat i SSML. La plataforma inclou la millor tecnologia de clonació de veu del mercat i dona als desenvolupadors accés a la millor veu amb IA i a la millor clonació instantània pel mateix preu. S’estan preparant més idiomes i un model de preu inferior.