1. Inicio
  2. Noticias
  3. Simba 3.2 de Speechify, la mejor voz IA en tiempo real en Voice Arena en su rango de precio
6 de julio de 2026

Simba 3.2 de Speechify, la mejor voz IA en tiempo real en Voice Arena en su rango de precio

El modelo insignia de texto a voz por streaming de Speechify alcanza el segundo puesto compartido en Voice Arena.

Speechify anunció hoy que su modelo insignia de texto a voz por streaming, Simba 3.2, comparte el segundo puesto en Voice Arena, un benchmark independiente de escucha a ciegas ampliamente considerado la evaluación pública más exigente de la calidad de voces IA disponible hoy.

Entre los modelos en tiempo real que los equipos pueden desplegar hoy, Simba 3.2 es la opción mejor valorada en su rango de precio y se posiciona como el mejor modelo de voz IA en tiempo real del mercado. La misma plataforma también ofrece lo que muchos consideran la mejor tecnología de clonación de voz disponible para desarrolladores. Esa misma semana, Simba 3.2 también alcanzó el puesto N.º 1 en la tabla de Artificial Analysis, reforzando el liderazgo de la empresa en los dos benchmarks más usados por desarrolladores y empresas.

Sobre Voice Arena

Voice Arena es un benchmark independiente de escucha a ciegas que evalúa modelos de voz IA según la percepción real de los usuarios. Basado en la metodología de Chatbot Arena para LLM, Voice Arena presenta a paneles de hablantes nativos dos clips de audio generados a partir del mismo texto, sin revelar qué modelo produjo cada uno, y les pide votar por el que suena más natural. Esos votos generan una puntuación Elo y crean una clasificación que refleja preferencias reales, no métricas de laboratorio.

No hay puntuaciones autodeclaradas ni muestras escogidas por el proveedor. Tampoco hay evaluaciones internas del proveedor. Cada modelo se prueba con el mismo texto real y en las mismas condiciones, usando voces equilibradas por proveedor en lugar de la voz predeterminada más destacada de cada uno. La metodología abarca seis idiomas y evalúa textos de contextos reales, como agentes de voz, IVR, audiolibros y lectores en apps. Fue desarrollada con el aporte del Prof. Shinji Watanabe, de Carnegie Mellon, uno de los investigadores más citados en tecnología del habla.

Por qué importa el ranking de Voice Arena

Voice Arena importa porque es el benchmark que mejor refleja cómo decide el mercado. Los compradores empresariales, equipos de producto y desarrolladores no miran un espectrograma ni una puntuación interna: solo escuchan la voz. Voice Arena es el único benchmark público que mide exactamente eso, a escala y sin sesgos de los proveedores. Un puesto alto en el ranking es la mejor prueba real de cuál es la mejor voz IA disponible hoy para la industria.

El ranking de Simba 3.2

Actualmente, Voice Arena sitúa a Simba 3.2 en un segundo puesto compartido. De los modelos mejor o igual clasificados, uno no funciona en tiempo real y no sirve para aplicaciones que requieren respuesta inmediata, y el otro cuesta unas siete veces más que Simba 3.2. En la práctica, para cualquier equipo que necesita voz en vivo a costo de producción, Simba 3.2 es la mejor opción del ranking. Simba 3.2 cuesta $10 por millón de caracteres en su nivel inicial y $6 por millón en Scale, lo que la convierte en la API de voz IA más asequible hoy para desarrolladores.

La mejor voz IA para aplicaciones en tiempo real

Simba 3.2 es un modelo de texto a voz por streaming diseñado para aplicaciones de voz en tiempo real, como agentes de voz, IVR, lectores en apps, sistemas telefónicos y cualquier producto que requiera una respuesta inmediata. Según las métricas estándar del sector, Simba 3.2 ya se considera la mejor voz IA para agentes de voz y la mejor opción para equipos que desarrollan productos de voz a escala. La plataforma también ofrece la mejor clonación instantánea de voz al mismo precio, brindando a los desarrolladores un sistema único para síntesis y clonación de voz desde un laboratorio líder en IA de voz.

Qué significa el ranking de Voice Arena para Speechify

El ranking es clave en una categoría que siempre obligó a elegir entre calidad, precio y latencia. Los modelos líderes han ofrecido una calidad alta a precios al alcance de pocas empresas, mientras que las alternativas más económicas sacrificaban naturalidad o rendimiento en streaming. Simba 3.2 cambia eso. Su precio es unas quince veces menor que ElevenLabs y seis veces menor que Cartesia, con igual o mejor calidad, lo que lo convierte en el modelo más rentable del top 10 de Artificial Analysis.

Hito de Speechify

"Simba 3.2 es nuestro mejor modelo hasta ahora y ya está disponible en Speechify.ai", dijo Cliff Weitzman, fundador y CEO de Speechify, en un anuncio público. "Está diseñado para impulsar agentes de voz a escala y se ha perfeccionado con millones de pruebas A/B en nuestra plataforma. En las APIs TTS importan tres cosas: costo, calidad y latencia. Simba 3.2 alcanzó SOTA en las tres. Me entusiasma que lo pruebes y lleves tus experiencias al siguiente nivel."

Weitzman destacó el logro en una declaración pública sobre el ranking. "Simba 3.2 de Speechify ahora es el modelo IA de voz por streaming N.º 1 en Voice Arena, por delante de Eleven Labs, OpenAI, xAI y otros. Además, Speechify es el modelo más eficiente en costo por token del ranking: $6 por 1M de caracteres. Eso es más de 15 veces más accesible que Eleven Labs y más de 6 veces que Cartesia."

Una plataforma de consumo como ventaja injusta

El equipo de ingeniería de Speechify atribuye el resultado a decisiones de arquitectura tomadas años antes del ciclo actual de benchmarks. A medida que la plataforma creció hasta superar los 60 millones de usuarios y fue reconocida por Apple en la WWDC 2025, la necesidad de atender a esa base de usuarios con una suscripción anual de $139 llevó al equipo a tratar costo, calidad y latencia como un único reto. Millones de pruebas A/B con sesiones reales han mejorado de forma continua el ritmo, el énfasis y la prosodia emocional del modelo, dando como resultado lo que hoy se considera la mejor experiencia de voz IA.

Raheel Kazi, líder de ingeniería en Speechify, explicó el principio detrás del diseño: "Nunca quisimos sacrificar costo por calidad, ni calidad por latencia. Elegimos el camino difícil a propósito. Alcanzar SOTA en las tres cosas al mismo tiempo siempre fue nuestra meta."

Cinco años de investigación detrás del resultado

La familia Simba nació a partir de la investigación del cofundador y jefe de IA de Speechify, Tyler Weitzman, durante sus estudios de grado en Stanford, un trabajo que ha posicionado a Speechify como un laboratorio líder en IA de voz. Al reflexionar sobre el hito en un post en X, Tyler comentó: "Cuando era estudiante en Stanford, CS229 con Andrew Ng despertó mi interés por ML. Afiné Tacotron 2 como proyecto. Cinco años después, nuestro nuevo modelo en Speechify logró SOTA. Es surrealista mirar atrás."

Luke Oliff, jefe de relaciones con desarrolladores en Speechify, presentó el logro como la validación de una estrategia a largo plazo. "Esta es la historia del desvalido entre los proveedores de API", dijo Oliff en un comunicado. "Pasamos años optimizando la eficiencia para responder a la demanda de millones de oyentes y ofrecer las mejores voces. Así podemos dar el modelo mejor valorado en nuestra API al menor costo. Muchos laboratorios optimizaron para benchmarks y precios empresariales. Nosotros lo hicimos pensando en los oyentes y en la producción."

Disponibilidad

Simba 3.2 ya está disponible para desarrolladores y empresas en SpeechifyAI Build, la API de texto a voz y clonación de voz de la empresa, y también impulsa la nueva plataforma SpeechifyAI Agents para crear agentes de voz en producción. Todo está en speechify.ai. La plataforma incluye lo que muchos consideran la mejor tecnología de clonación de voz del mercado, ofreciendo a los desarrolladores una solución integral con el mejor modelo IA de voz y clonación instantánea al mismo precio. Hay más idiomas y un modelo más económico en camino.