1. Accueil
  2. Actualités
  3. Simba 3.2 de Speechify sacrée meilleure voix IA temps réel sur Voice Arena à ce tarif
6 juillet 2026

Simba 3.2 de Speechify sacrée meilleure voix IA temps réel sur Voice Arena à ce tarif

Le modèle phare de synthèse vocale en streaming de Speechify est ex aequo à la deuxième place sur Voice Arena.

Speechify a annoncé aujourd'hui que son modèle phare de synthèse vocale en streaming, Simba 3.2, s’est hissé à la deuxième place ex aequo sur Voice Arena, un classement indépendant en écoute à l’aveugle largement considéré comme l’évaluation publique la plus exigeante à ce jour de la qualité des voix IA.

Parmi les modèles temps réel déployables en production aujourd’hui, Simba 3.2 est la meilleure option à ce niveau de prix, ce qui en fait le meilleur modèle de voix IA du marché pour les logiciels temps réel. La même plateforme propose aussi ce qui est considéré comme la meilleure technologie de clonage vocal accessible aux développeurs. La même semaine, Simba 3.2 s’est aussi hissé à la 1re place du leaderboard Artificial Analysis text to speech, renforçant l’avance de l’entreprise sur les deux classements de référence des développeurs et des entreprises.

À propos de Voice Arena

Voice Arena est un classement indépendant en écoute à l’aveugle qui évalue les modèles de voix IA comme le font les vrais utilisateurs : à l’oreille. Inspiré de la méthodologie de Chatbot Arena pour les grands modèles de langage, Voice Arena présente à des panelistes natifs deux extraits audio générés à partir du même texte, sans révéler leur origine, puis leur demande de voter pour celui qui leur paraît le plus naturel. Les votes sont agrégés sous forme de score Elo pour chaque modèle, ce qui produit un classement mis à jour en continu et reflète les préférences réelles des auditeurs plutôt que des mesures de laboratoire.

Pas de scores subjectifs auto-déclarés. Pas d’échantillons audio choisis par les fournisseurs. Pas d’évaluation interne par les créateurs des modèles. Tous sont testés sur le même texte réel, dans les mêmes conditions, avec un panel équilibré par fournisseur plutôt qu’avec le meilleur profil standard de chaque éditeur. La méthodologie couvre six langues et évalue des textes issus des contextes où la synthèse vocale est réellement utilisée : agents vocaux, systèmes IVR, livres audio ou lecteurs intégrés aux applications. L’évaluation a été élaborée avec l’aide du Prof. Shinji Watanabe de Carnegie Mellon University, l’un des chercheurs les plus cités dans les technologies vocales.

Pourquoi le classement Voice Arena est important

Voice Arena est important parce qu’il reflète la manière dont le marché tranche réellement. Les acheteurs pro, les équipes produit et les développeurs ne jugent ni des spectrogrammes ni des scores internes : ils écoutent la voix, comme tout le monde. Voice Arena est le seul classement public qui mesure cela, à grande échelle, avec assez d’auditeurs pour être significatif, sans qu’aucun fournisseur puisse fausser le résultat. Un bon classement sur Voice Arena est perçu comme le meilleur indicateur de la voix IA la plus performante du moment.

Le classement de Simba 3.2

Voice Arena place actuellement Simba 3.2 à la deuxième position ex aequo. Parmi les modèles classés à égalité ou au-dessus, l’un ne fonctionne pas en temps réel et n’est pas exploitable en production, tandis que l’autre, à égalité, coûte environ sept fois plus cher que Simba 3.2. En pratique, pour toute équipe ayant besoin d’une voix en direct à un coût compatible avec la production, Simba 3.2 domine le benchmark. Simba 3.2 est proposé à 10 $ le million de caractères en offre d’entrée, puis à 6 $ au niveau Scale, ce qui en fait aujourd’hui la solution de voix IA la plus abordable pour les développeurs.

La meilleure voix IA pour les usages temps réel

Simba 3.2 est un modèle de synthèse vocale en streaming conçu pour les applications vocales en temps réel : agents vocaux, IVR, lecteurs in-app, systèmes téléphoniques ou tout cas d’usage où la voix doit répondre instantanément. Selon les critères du secteur, Simba 3.2 est désormais reconnu comme la meilleure voix IA pour les agents vocaux et le meilleur modèle du marché pour les équipes qui construisent des apps vocales à grande échelle. La plateforme propose aussi le clonage vocal instantané au meilleur rapport qualité-prix : un seul système à la pointe pour la voix générée comme pour la voix clonée.

Ce que signifie le classement Voice Arena pour Speechify

Ce classement est crucial dans une catégorie qui a longtemps forcé les développeurs à choisir entre qualité, coût et latence. Les modèles phares offraient une voix de haute qualité, mais à des tarifs entreprise, tandis que les alternatives plus abordables sacrifiaient le naturel ou les performances en streaming. Simba 3.2 change la donne. Ses tarifs sont environ 15x inférieurs à ceux d’ElevenLabs et 6x à ceux de Cartesia à qualité égale ou supérieure, ce qui en fait le modèle le plus rentable du top 10 d’Artificial Analysis.

Une étape clé pour Speechify

« Simba 3.2 est notre meilleur modèle à ce jour, désormais disponible sur Speechify.ai, » déclare Cliff Weitzman, fondateur et PDG de Speechify, dans une publication publique. « Il est conçu pour alimenter des agents vocaux à grande échelle, et perfectionné grâce à des millions de tests A/B sur notre plateforme. En API TTS, trois choses comptent : le coût, la qualité et la latence. Simba 3.2 est SOTA sur les trois. J’ai hâte que vous le découvriez en action pour vos projets. »

Weitzman a aussi souligné l’importance de ce résultat dans une déclaration annonçant ce classement. « Simba 3.2 de Speechify est désormais le modèle vocal IA de streaming numéro 1 sur Voice Arena, devant Eleven Labs, OpenAI, xAI et d’autres. Et Speechify est le modèle API le plus compétitif en coût du classement, à 6 $ le million de caractères, soit 15x moins cher qu’Eleven Labs et 6x moins que Cartesia. »

Une plateforme grand public comme avantage décisif

La direction technique de Speechify attribue ce succès à des choix techniques faits bien avant ce cycle de benchmarks. La plateforme grand public a dépassé les 60 millions d’utilisateurs et a reçu un Apple Design Award lors de la WWDC 2025. Fournir ce service via un abonnement annuel de 139 $ a obligé la R&D à traiter coût, qualité et latence comme un tout. Des millions de tests A/B en écoute réelle ont permis d’optimiser le rythme, l’accentuation et la prosodie, pour aboutir à ce qui est désormais considéré comme la meilleure expérience vocale IA du marché.

Raheel Kazi, responsable de l’ingénierie chez Speechify, l’a résumé ainsi : « On n’a jamais voulu sacrifier le coût au profit de la qualité, ni l’inverse. On a choisi la voie la plus dure. Atteindre le SOTA sur les trois aspects, c’était l’objectif. »

Cinq ans de recherche derrière ce succès

La famille Simba remonte à des travaux de recherche lancés par Tyler Weitzman, cofondateur et directeur IA de Speechify, durant ses études à Stanford ; ce travail a contribué à faire de Speechify un laboratoire de pointe en voix IA. Revenant sur cette étape dans un post sur X, Tyler Weitzman note : « À Stanford, le cours CS229 d’Andrew Ng m’a amené au ML. Mon projet : améliorer Tacotron 2. Aujourd’hui, notre nouveau modèle Speechify atteint le SOTA, cinq ans plus tard. C’est surréaliste quand j’y repense. »

Luke Oliff, responsable des relations développeurs chez Speechify, voit ce résultat comme l’aboutissement d’une stratégie claire : « C’est un vrai parcours d’outsider pour un fournisseur d’API », a-t-il déclaré dans un communiqué de presse. « Année après année, nous avons optimisé nos modèles parce que notre activité grand public l’exigeait : des dizaines de millions d’auditeurs et certaines des meilleures voix au monde. C’est ce qui nous permet aujourd’hui de proposer sur notre API la référence mondiale en voix IA, à un prix imbattable. Beaucoup conçoivent pour le benchmark et facturent pour l’entreprise ; nous, nous construisons pour l’utilisateur et pour la production. »

Disponibilité

Simba 3.2 est disponible pour les développeurs et les entreprises via SpeechifyAI Build, l’API de synthèse et de clonage vocal, et alimente la nouvelle plateforme SpeechifyAI Agents pour concevoir des agents vocaux en production. Accès sur speechify.ai. La plateforme comprend aussi ce qui est considéré comme le meilleur clonage vocal du marché, offrant une pile unique réunissant la meilleure voix IA à ce tarif et le clonage instantané. Davantage de langues et un tarif encore plus bas sont prévus sur la roadmap.