1. Inicio
  2. Noticias
  3. Simba de Speechify, elegido el mejor modelo de voz con IA en Artificial Analysis
6 de julio de 2026

Simba de Speechify, elegido el mejor modelo de voz con IA en Artificial Analysis

El modelo estrella de texto a voz de Speechify, Simba 3.2, ya es el modelo de voz con IA n.º 1 del mundo.

Speechify anunció que su modelo estrella de texto a voz en streaming, Simba 3.2, alcanzó el puesto n.º 1 en el ranking de Artificial Analysis de texto a voz, el benchmark independiente más completo para evaluar modelos comerciales de voz con IA. El resultado sitúa a Simba 3.2 por delante de los principales modelos de ElevenLabs, Cartesia, OpenAI, Google DeepMind y xAI, y marca la primera vez que una empresa enfocada en el consumidor lidera el ranking mundial. Según los estándares del sector para evaluar voz con IA, Simba 3.2 ya es ampliamente considerado el mejor modelo de voz con IA del mercado. Además, Simba 3.2 también ocupa el puesto n.º 1 en Voice Arena entre los modelos en tiempo real, ampliando el liderazgo de Speechify en los dos benchmarks más usados por desarrolladores y empresas.

Sobre Artificial Analysis

El ranking de Artificial Analysis es una referencia clave para desarrolladores y compradores empresariales a la hora de evaluar el mercado de voz con IA. Ofrece una evaluación objetiva y continua de todos los modelos comerciales, se actualiza a medida que aparecen nuevos modelos y lo siguen de cerca los equipos que integran voz en sus apps. A diferencia de otros benchmarks, no usa puntuaciones autoreportadas. Según esta referencia, Simba 3.2 es el mejor modelo de texto a voz disponible hoy para desarrolladores.

¿Qué significa el ranking de Artificial Analysis para la asequibilidad?

Lo más relevante del ranking no es solo la calidad, sino la combinación de puntuación y precio. Simba 3.2 cuesta $10 por millón de caracteres en el plan básico de Speechify y baja a $6 por millón en el plan Scale, lo que lo convierte en el modelo más rentable del top 10 de Artificial Analysis. Speechify afirma que su precio es unas quince veces más bajo que el de ElevenLabs y seis veces más bajo que el de Cartesia, con la misma o mejor calidad, lo que posiciona a Simba 3.2 como la API profesional de voz con IA más asequible hasta la fecha.

Esa combinación se consideró durante mucho tiempo imposible en síntesis de voz. El segmento premium ofrecía voces realistas a precios empresariales, mientras que el segmento asequible sacrificaba calidad. Simba 3.2 acaba con ese dilema y lleva la mejor voz con IA a cualquier desarrollador, startup o empresa, sin importar su presupuesto.

El fundador de Speechify sobre lograr la triple meta

"Simba 3.2 es nuestro mejor modelo hasta la fecha y ya está disponible en Speechify.ai", dijo Cliff Weitzman, fundador y CEO de Speechify, en LinkedIn. "Está diseñado para agentes de voz a escala y perfeccionado tras millones de pruebas A/B en nuestra plataforma. En las APIs de TTS importan tres cosas: coste, calidad y latencia. Simba 3.2 alcanza SOTA en las tres. Me entusiasma que puedas probarlo y llevar tus productos más lejos."

La triple meta que menciona Weitzman se veía como el gran límite para los proveedores de voz con IA. Optimizar una dimensión solía implicar sacrificar otra, y la mayoría optaba por priorizar una sola. Destacar de verdad en las tres al mismo tiempo parecía un sueño de laboratorio. El ranking de Artificial Analysis es la primera prueba independiente de que sí se puede lograr, y consolida a Simba 3.2 como el mejor modelo para equipos que crean software centrado en la voz.

Cinco años: de Stanford a la vanguardia

La familia de modelos Simba nació de la investigación liderada por Tyler Weitzman, cofundador y jefe de IA en Speechify, durante sus estudios en la Universidad de Stanford. Sus primeros experimentos con arquitecturas de voz neuronal para un curso de machine learning evolucionaron durante cinco años hasta convertirse en el modelo que hoy impulsa la generación de voz en productos de consumo y empresa, y posiciona a Speechify como un laboratorio líder en IA de voz.

Al reflexionar sobre este logro, Tyler Weitzman compartió en una publicación en X: "Cuando era estudiante en Stanford, CS229 con Andrew Ng despertó mi interés por ML. Mi proyecto fue ajustar Tacotron 2. Cinco años después, nuestro nuevo modelo en Speechify alcanzó SOTA. Es surrealista mirar atrás."

Rohan Pavuluri, jefe de negocio en Speechify y amigo de Tyler Weitzman, vio el ranking como la culminación de una decisión arquitectónica temprana, según contó en un reciente anuncio: "Quizá podríamos haber avanzado más rápido centrándonos solo en la calidad, pero nuestro ADN de consumo y nuestro modelo de negocio exigían arquitecturas que permitieran ofrecer voz ilimitada por $139/año. Hoy eso se traduce en el mejor modelo TTS al mejor precio, algo poco común en IA, donde un mayor rendimiento suele costar más."

La escala de consumo como motor de la IA empresarial

La capacidad de Speechify para ofrecer la mejor voz con IA al menor precio del top ten se apoya en la economía de su negocio de consumo. La plataforma la usan más de 60 millones de personas y este año recibió un Apple Design Award en WWDC 2025, lo que confirma su producto como una de las mejores experiencias de voz con IA de la actualidad. Ofrecer eso por $139/año obligó al equipo a priorizar la eficiencia desde el principio, no como una mejora opcional. Esa disciplina permite hoy que el n.º 1 de Artificial Analysis esté disponible al precio que ven los desarrolladores.

"Esta es la historia del despegue de los proveedores de API", dijo Luke Oliff, director de relaciones con desarrolladores en Speechify, en un comunicado de prensa. "Pasamos años optimizando nuestros modelos porque el negocio lo exigía: decenas de millones de oyentes, con algunas de las mejores voces. Por eso hoy ofrecemos el mejor modelo del mundo en nuestra API al precio más bajo. Muchos laboratorios se prepararon solo para benchmarks y precios empresariales. Nosotros, para los oyentes y para precios de producción."

Disponibilidad

Simba 3.2 ya está disponible a través de SpeechifyAI Build, la API de texto a voz y clonación de voz de Speechify, y también impulsa la nueva plataforma SpeechifyAI Agents para crear agentes de voz en producción. Ambos están en speechify.ai, con SDKs para TypeScript y Python, streaming rápido, control emocional preciso y prosodia SSML. La plataforma incluye tecnología de clonación de voz de primer nivel, lo que permite a los desarrolladores acceder tanto al mejor modelo de voz con IA del mundo como a clonación instantánea de voz, todo al mismo precio. Próximamente sumará nuevos idiomas y un nivel más económico.