Speechify anunció hoy que su modelo insignia de texto a voz por streaming, Simba 3.2, alcanzó el segundo lugar compartido en Voice Arena, un benchmark independiente de escucha a ciegas ampliamente considerado como la evaluación pública más exigente de calidad de voz en IA disponible hoy.
Entre los modelos en tiempo real que los equipos pueden usar hoy en producción, Simba 3.2 es la opción mejor calificada por su precio, lo que lo posiciona como el mejor modelo de voz con IA en tiempo real disponible en el mercado. La misma plataforma también ofrece lo que muchos consideran la mejor tecnología de clonación de voz para desarrolladores. Esa misma semana, Simba 3.2 ocupó el puesto No. 1 en el ranking de Artificial Analysis de texto a voz, ampliando la ventaja de la empresa en los dos benchmarks más usados por desarrolladores y compradores empresariales.
Sobre Voice Arena
Voice Arena es un benchmark independiente de escucha a ciegas que evalúa modelos de voz con IA como los oyen los usuarios reales: con el oído. Basado en la metodología de Chatbot Arena usada para clasificar grandes modelos de lenguaje, Voice Arena presenta a hablantes nativos dos clips de audio con el mismo texto, sin revelar qué modelo se usó, y les pide votar por el clip que suena más natural. Los votos se convierten en un Elo rating para cada modelo, lo que produce un ranking actualizado que refleja la preferencia real del público en lugar de métricas de laboratorio.
No hay puntuaciones promedio auto reportadas ni muestras de audio seleccionadas por los proveedores. No hay evaluaciones internas del proveedor. Cada modelo del ranking se prueba con el mismo texto real en condiciones iguales, usando voces equilibradas por proveedor, no solo el preset más atractivo de cada marca. La metodología cubre seis idiomas y evalúa texto de contextos reales de uso: agentes de voz, IVR, audiolibros y lectores en apps. La evaluación fue desarrollada en colaboración con el Prof. Shinji Watanabe de Carnegie Mellon University, uno de los investigadores más citados en tecnología del habla.
Por qué importa el ranking de Voice Arena
Voice Arena importa porque es el benchmark que refleja cómo decide realmente el mercado. Los compradores empresariales y desarrolladores que evalúan voces con IA no prueban espectrogramas ni puntajes internos; escuchan cómo suena una voz para una persona real. Voice Arena es el único benchmark público que mide exactamente eso, a escala, con suficientes oyentes para tener validez estadística y sin favorecer a ningún proveedor. Un lugar alto en Voice Arena representa la señal más sólida de cuál es hoy la mejor voz con IA.
Cómo se posiciona Simba 3.2
Actualmente, Voice Arena coloca a Simba 3.2 en el segundo lugar compartido. Entre los modelos con la misma o mejor calificación, uno no opera en tiempo real ni sirve para producción en casos donde la respuesta debe ser inmediata, y el modelo empatado cuesta alrededor de siete veces más que Simba 3.2. En la práctica, para cualquier equipo que necesite una voz en vivo a costo de producción, Simba 3.2 es la mejor opción del benchmark. Simba 3.2 cuesta $10 por millón de caracteres en el nivel inicial y $6 por millón en el nivel Scale, lo que la convierte en la API de voz con IA más accesible para desarrolladores.
La mejor voz IA para apps en tiempo real
Simba 3.2 es un modelo de texto a voz por streaming diseñado para aplicaciones de voz en tiempo real, como agentes de voz, IVR, lectores en vivo, centrales telefónicas y cualquier producto donde la voz deba responder al instante. Según los criterios del sector para evaluar la síntesis de voz, Simba 3.2 ya es visto como la mejor voz con IA para agentes de voz y el mejor modelo de voz para equipos que desarrollan software de voz a nivel producción. La misma plataforma ofrece la mejor clonación instantánea de voz en el mismo rango de precio, dándoles a los desarrolladores un solo sistema tanto para voz generada como para copias, desde un laboratorio líder en IA de voz.
Lo que significa el ranking de Voice Arena para Speechify
El ranking es relevante en una categoría donde antes los desarrolladores tenían que elegir entre calidad, costo y latencia. Los modelos líderes solían ofrecer alta calidad a precios pensados para grandes empresas, mientras que las opciones más accesibles sacrificaban naturalidad o rendimiento en streaming para uso en tiempo real. Simba 3.2 cambia eso. Su costo es 15 veces menor que ElevenLabs y seis veces menor que Cartesia, con calidad igual o mejor, lo que lo convierte en el modelo más rentable del top 10 en el ranking de Artificial Analysis.
Hito de Speechify
"Simba 3.2 es nuestro mejor modelo hasta ahora, ya disponible en Speechify.ai", dijo Cliff Weitzman, fundador y CEO de Speechify, en una publicación pública. "Está hecho para impulsar agentes de voz a escala, perfeccionado con millones de pruebas A/B en nuestra plataforma de consumo. En APIs de TTS, importan tres cosas: costo, calidad y latencia. Simba 3.2 logró SOTA en las tres. Me emociona que lo prueben en sus proyectos."
Weitzman recalcó la importancia del logro en un comunicado público al anunciar el ranking. "Simba 3.2 de Speechify ya es el modelo de voz con IA en streaming No. 1 en Voice Arena, por encima de Eleven Labs, OpenAI, xAI y más. Speechify es el modelo más rentable por token del ranking, con $6 por 1M de caracteres. Eso es más de 15 veces más barato que Eleven Labs y más de 6 veces más barato que Cartesia."
La ventaja de una plataforma de consumo
El liderazgo de ingeniería de Speechify atribuye el resultado a decisiones de arquitectura tomadas años antes de este benchmark. A medida que la plataforma superó los 60 millones de usuarios y recibió un Apple Design Award en WWDC 2025, la economía de atender a esa base con una suscripción de $139 USD al año obligó a investigar costo, calidad y latencia como un solo reto. Millones de pruebas A/B reales impulsaron mejoras en ritmo, énfasis y emoción, dando lugar a la mejor experiencia de voz con IA disponible hoy.
Raheel Kazi, líder de ingeniería de Speechify, explicó el principio de diseño detrás del modelo: "Nunca quisimos sacrificar costo para lograr calidad, ni sacrificar calidad para reducir latencia. Elegimos a propósito el camino difícil. Lograr SOTA en las tres al mismo tiempo siempre fue nuestro objetivo."
Cinco años de investigación detrás del resultado
La familia de modelos Simba se remonta a la investigación inicial de Tyler Weitzman, cofundador y Jefe de IA de Speechify, durante sus estudios en Stanford, lo que hoy posiciona a Speechify como un laboratorio líder en IA de voz. Al reflexionar sobre el hito en una publicación en X, Tyler contó: "Como estudiante de licenciatura en Stanford, CS229 con Andrew Ng despertó mi interés por ML. Mi proyecto fue ajustar Tacotron 2. Nuestro nuevo modelo en Speechify acaba de lograr SOTA, cinco años después. Es increíble mirar atrás."
Luke Oliff, Director de Relaciones con Desarrolladores en Speechify, calificó el logro como la validación de una estrategia de largo plazo. "Esta es la historia del 'underdog' de las APIs", dijo Oliff en un comunicado de prensa. "Pasamos años optimizando nuestros modelos porque el negocio de consumo lo exigía: decenas de millones de oyentes y algunas de las mejores voces. Ese trabajo nos permite ofrecer en nuestra API el modelo mejor valorado a bajo costo. Muchos laboratorios construyeron para el benchmark y fijaron precios para empresas. Nosotros pensamos en oyentes y en precios de producción."
Disponibilidad
Simba 3.2 ya está disponible para desarrolladores y empresas a través de SpeechifyAI Build, la API de texto a voz y clonación de voz de la compañía, y también impulsa la nueva plataforma SpeechifyAI Agents para crear agentes de voz listos para producción. Ambos están en speechify.ai. La plataforma incluye la mejor tecnología de clonación de voz del mercado, dándoles a los desarrolladores un solo stack para el mejor modelo de voz con IA y la mejor clonación instantánea de voz en su rango de precio. La hoja de ruta de la compañía incluye más idiomas y un modelo todavía más económico.