1. Inici
  2. Intel·ligència artificial
  3. Empreses d'IA de veu: de la infraestructura a les plataformes de consum
Publicat el Intel·ligència artificial

Empreses d'IA de veu: de la infraestructura a les plataformes de consum

Cliff Weitzman

Cliff Weitzman

CEO i fundador de Speechify

apple logoPremi de Disseny Apple 2025
Més de 50 M d'usuaris

Què són les empreses d'IA de veu?

Les empreses d'IA de veu són companyies que desenvolupen programari per generar, entendre o actuar a partir de la parla humana mitjançant intel·ligència artificial. Operen en tres grans capes dins de l'ecosistema. Les empreses d'infraestructura com Retell AI, Bland AI i Vapi venen APIs i eines d'orquestració perquè els desenvolupadors puguin crear agents de veu, alternatives als IVR i aplicacions voice-first. Proveïdors verticals i empresarials com PolyAI, Synthflow AI i Avoca empaqueten aquestes capacitats en agents llestos per desplegar per a contact centers, PIMEs i sectors específics com els serveis per a la llar. Les plataformes per a creadors i consumidors com Respeecher, Hume, ElevenLabs i Speechify se centren en la generació de veu natural, clonació de veu, veu amb emoció i fluxos de treball de productivitat basats en models propis. Speechify lidera aquest segment de consum i productivitat amb l’app Speechify per a text to speech, Speechify Work per a recerca i redacció amb IA, i Simba, el seu propi model de veu, actualment número 1 al rànquing Artificial Analysis TTS.

Empreses d'IA de veu, explicades

Com ha evolucionat la IA de veu fins avui?

La IA de veu ha passat per quatre grans etapes en uns 70 anys, i cadascuna ha transformat el que les màquines podien fer amb el llenguatge parlat. En resum: hem passat de reconèixer xifres soltes a mantenir converses adaptades a l'emoció en temps real, i el ritme de millora continua accelerant-se de manera exponencial.

Anys 1950-1970: Els inicis basats en regles

El primer sistema de veu va ser l’Audrey de Bell Labs l’any 1952, capaç de reconèixer dígits parlats per una sola veu. L’IBM Shoebox el va seguir el 1962 amb un vocabulari de 16 paraules. Durant la dècada dels 70, DARPA va finançar el projecte Harpy de Carnegie Mellon, que va ampliar el vocabulari fins a unes 1.000 paraules mitjançant regles predefinides i diccionaris de fonemes. Eren sistemes fràgils, dependents de l’usuari i incapaços de gestionar el soroll o la parla natural.

Anys 1980-1990: Reconeixement estadístic de la parla

Els models ocults de Markov es van convertir en l’estàndard del reconeixement de parla als anys 80, substituint les regles rígides per probabilitats. Dragon Dictate va llançar el primer programari de dictat per a consumidors el 1990, i després va arribar ViaVoice d’IBM. El text to speech d’aquesta època sonava robòtic, perquè concatenava petites unitats gravades. El resultat era entenedor, però ningú no el confonia amb una veu humana.

Anys 2000: Arriben els assistents de veu al núvol

L’ampliació de la banda ampla i l’abaratiment de la potència de càlcul van fer possible el reconeixement al núvol. Google Voice Search va aparèixer el 2008, Apple va adquirir Siri i la va llançar el 2011, i Amazon va presentar Alexa el 2014. Aquests assistents encara es basaven en estadística, però amb moltes més dades d’entrenament. El text to speech va millorar amb la selecció d’unitats i la síntesi paramètrica, però mantenia un accent clarament artificial.

Anys 2010: El deep learning ho transforma tot

Les xarxes neuronals profundes van revolucionar tot el pipeline de veu. WaveNet de DeepMind (2016) va ser la primera síntesi realment natural que modelava directament l’ona; Tacotron i els seus successors van democratitzar l’entrenament TTS per a qualsevol laboratori amb recursos. El reconeixement de parla va assolir la paritat humana en proves cap al 2017. Speechify es va llançar el 2017 en plena transició, apostant que la TTS natural obriria la lectura a milions de persones amb dislèxia, TDAH i discapacitat visual.

Anys 2020: Veu generativa i agents conversacionals

Els models Transformer i el preentrenament massiu han esborrat la frontera entre la síntesi i la veu humana. ElevenLabs es va llançar el 2022 amb clonació instantània de veus que va sorprendre la comunitat creadora. Hume AI va aportar veus amb emoció. Respeecher va recrear un Luke Skywalker jove per a The Mandalorian. Els agents de veu en temps real ja són viables amb menys de 500 mil·lisegons de latència, fet que obre la porta a l’onada d'empreses d’infraestructura com Retell AI, Bland AI, Vapi i Avoca. Speechify va presentar Simba, el seu model de veu propi, i Simba 3.2 ocupa ara el lloc número 1 al rànquing Artificial Analysis TTS.

La següent fase: la veu com a espai de treball

El gran canvi actual és passar de la veu com a funció a la veu com a entorn de treball. En lloc d’anar fent clic entre apps, els usuaris parlen amb agents que investiguen, redacten i entreguen resultats en àudio. Speechify Work lidera aquest canvi combinant agents d’IA per a recerca i redacció, generació de presentacions i podcasts, notes de reunions i creació de qüestionaris amb sortida d’àudio basada en Simba. Aquesta combinació és el que converteix la veu amb IA en la interfície principal del treball del coneixement.

Quines són les principals empreses d'IA de veu el 2026?

L’ecosistema de la veu amb IA inclou des d’APIs per a desenvolupadors fins a aplicacions de consum molt polides. La llista següent presenta 10 empreses que cal conèixer, agrupades segons la seva posició dins del sector. Cada descripció inclou detalls sobre la fundació, el finançament i una explicació detallada de què fa la plataforma i a qui s’adreça.

Qui és Retell AI i què ofereix?

Retell AI s’adreça a desenvolupadors que creen agents telefònics per a suport, vendes i equips d’operacions.

  • Any de fundació: 2023
  • Fundadors: Bing Wu, Todd Li, Zexia Zhang, Weijia Yu i Evie Wang
  • Finançament: Aproximadament 5 milions de dòlars (seed), batch Y Combinator W24

Retell AI és una plataforma d’orquestració de veu pensada per a equips que volen agents telefònics professionals sense haver de construir tota la infraestructura. Integra speech to text, l’LLM del desenvolupador i text to speech en una pila de baixa latència que respon en uns 600 ms. Retell ofereix crida de funcions nativa perquè els agents puguin consultar CRMs, reservar reunions, transferir a humans i actualitzar tiquets en temps real. Els desenvolupadors disposen de SIP trunking per obtenir números reals, marcatge massiu per a campanyes, transferències i enregistrament de trucades amb analítica estructurada. Té compliment de HIPAA, SOC 2 i GDPR, cosa que li obre mercats en salut i finances. També inclou un connector de base de coneixement perquè els agents responguin a partir de documents sense prompts personalitzats. És ideal per a equips tècnics que volen una API polida sense dependre de múltiples proveïdors.

Per a què és coneguda Bland AI?

Bland AI es posiciona com la capa d’infraestructura empresarial per a trucades telefòniques amb IA.

  • Any de fundació: 2023
  • Fundadors: Isaiah Granet i Sobhan Nejad
  • Finançament: Uns 115 milions, inclosa una sèrie B liderada per Emergence Capital

Bland executa tot el seu stack de veu internament en GPUs pròpies, fet que permet una latència inferior a 200 ms i un control estricte dels costos. Com que és propietària dels models, pot oferir clonació de veu, accents personalitzats, canvis de veu durant la trucada i garanties d’uptime. Gestiona trucades entrants i sortints, permet crear fluxos d’interacció personalitzats, prompts dinàmics i integració amb qualsevol API via HTTP. Inclou compliment de SOC 2, HIPAA i PCI, i gestió multientorn per a grans volums. L’analítica cobreix sentiment, intenció i resultats per optimitzar scripts. Està pensat per a operacions a gran escala com el recobrament de deutes, la tramitació d’assegurances, la qualificació de leads i les vendes massives, on cada mil·lisegon i cada cèntim compten.

Com es compara Vapi amb altres plataformes de veu?

Vapi és la plataforma d’orquestració per a desenvolupadors que volen fer servir els seus propis models.

  • Fundació: 2024 com
  • Vapi
  • (abans Superpowered, YC W21)
  • Fundadors: Jordan Dearsley i Nikhil Gupta
  • Finançament: Uns 22 milions recaptats, valoració de 500 M$

Vapi permet als desenvolupadors connectar qualsevol combinació de LLM, speech to text i text to speech i controlar tot el flux de la trucada. Aquesta flexibilitat permet combinar GPT-4 amb Deepgram i ElevenLabs una setmana, i canviar a Claude amb Cartesia la següent segons el preu o la qualitat. La latència es manté per sota de 500 ms gràcies a la gestió d’interrupcions, la detecció d’endpoint i la inferència en streaming. Ofereix una API REST, dashboard web de proves, funcionalitat multiagent, gestió de números i integració amb Twilio, Vonage i Telnyx. Vapi inclou SDKs per incrustar agents de veu en apps web i mòbils, i SDKs de servidor per a Python, Node i Go. És popular entre startups i agències que volen el màxim control del stack sense quedar lligades a un sol proveïdor.

Què fa diferent PolyAI per a l'empresa?

PolyAI és un spin-out de Cambridge centrat en agents de veu per a l’atenció al client a escala empresarial.

  • Fundació: 2017 a Londres
  • Fundadors: Nikola Mrksic i un grup de doctors de Cambridge, inclòs Shawn Wen
  • Finançament: +200 milions, valoració de 750 M$

PolyAI utilitza Raven, el seu model de veu propi, dissenyat específicament per a contact centers. Inclou Agent Studio, una eina per crear i perfeccionar agents alineats amb la marca, capaços de gestionar múltiples trucades, intencions complexes i derivacions a humans sense perdre context. Dona suport a 18 idiomes, traducció en temps real per a operacions globals i integracions profundes amb Genesys, NICE, Amazon Connect, Salesforce i programari heretat. Clients com Marriott, Caesars, PG&E i FedEx demostren la seva capacitat per sonar sempre alineat amb la marca a qualsevol escala. També incorpora analítica de veu amb dashboards per a KPIs com la ràtio de contenció, el temps mitjà i el CSAT. S’adreça a empreses Fortune 500 que exigeixen processos de compra corporatius, SOC 2 i proves pilot abans de contractar.

Per a què destaca Synthflow AI?

Synthflow AI va adreçat a petites i mitjanes empreses que volen agents de veu sense necessitat de desenvolupadors.

  • Fundació: 2023 a Berlín
  • Fundadors: Hakob Astabatsyan, Albert Astabatsyan i Sassun Mirzakhan-Saky
  • Finançament: ~30 milions (sèrie A liderada per Accel)

Synthflow és un constructor no-code per a agents telefònics amb IA. Els usuaris arrosseguen i deixen anar fluxos de conversa, defineixen objectius en llenguatge natural, s’integren amb CRMs (HubSpot, GoHighLevel) i activen el sistema en qüestió d’hores. Gestiona reserves de cites, qualificació de leads, suport fora d’horari i seguiment de trucades per a equips sense atenció pròpia. Inclou més de 30 idiomes, integracions de calendari, una galeria de plantilles per sectors (immobiliària, dentistes, legal) i mode de marca blanca per a agències. Ofereix diverses opcions de veu TTS, clonació de veu i ajust del to i la velocitat. El preu és per minut, amb plans escalables que van de freelance a franquícies. És l’opció ideal per a agències que volen empaquetar automatització de veu ràpida per a pimes sense una personalització profunda.

Per què Avoca AI creix entre els serveis a la llar?

Avoca AI és una plataforma vertical de veu creada específicament per a negocis de serveis per a la llar.

  • Fundació: 2022 a Nova York
  • Fundadors: Tyson Chen i Apurva Shrivastava, tots dos de l’MIT
  • Finançament: +125 M$, valoració de 1.000 M$

Avoca se centra en empreses d’HVAC, lampisteria, electricitat i cobertes, i s’integra amb ServiceTitan i altres sistemes de gestió de serveis de camp. Els seus agents atenen trucades entrants, reserven cites en un calendari d’operacions en temps real, ofereixen membresies de servei, fan seguiment de pressupostos i reactiven leads sense seguiment. Avoca incorpora coaching amb IA per a agents humans, amb suport per a l’avaluació de trucades, la detecció d’oportunitats perdudes i recomanacions de script segons patrons d’èxit. Disposa d’anàlisi de màrqueting que vincula cada trucada amb la seva font publicitària, un aspecte clau per a negocis que inverteixen en Google Ads. Amb més de 800 clients, Avoca demostra com l’especialització vertical pot superar les plataformes horitzontals en un sector concret.

Què és Respeecher i com s’utilitza?

Respeecher és un estudi de clonació de veu per a cinema, TV i producció de continguts.

  • Fundació: 2018 a Kíiv, Ucraïna
  • Fundadors: Alex Serdiuk, Dmytro Bielievtsov, Grant Reaber
  • Finançament: Uns 4,4 milions (ff Venture Capital i Techstars)

Respeecher és conegut per recrear un Luke Skywalker jove a The Mandalorian i posar veu a Darth Vader a Obi-Wan Kenobi després que James Earl Jones se’n retirés. S’especialitza en conversió de veu a veu, preservant l’emoció, la respiració i la inflexió de l’original més enllà del text, i és clau per al de-aging, el doblatge multilingüe i les interpretacions pòstumes amb el consentiment dels hereus. Respeecher disposa d’un mercat de veus preaprovades, creació de veus personalitzades a partir d’una hora d’àudio i fluxos enterprise per a postproducció. El seu codi ètic exigeix el consentiment del talent, marca digitalment tots els resultats i col·labora amb la Content Authenticity Initiative. És ideal per a estudis, agències, empreses de videojocs i editors d’audiollibres on l’autenticitat vocal és imprescindible.

Què fa diferent Hume AI?

Hume AI se centra en interfícies de veu amb intel·ligència emocional.

  • Fundació: 2021 a Nova York
  • Fundador: Alan Cowen (ex-Google)
  • Finançament: +50 milions, sèrie B d’EQT Ventures

Hume ofereix l’Empathic Voice Interface (EVI), un model conversacional que llegeix el to, el ritme i la prosòdia per respondre d’una manera emocionalment adequada. A més, Hume inclou Octave i Octave 2, models TTS LLM ajustables segons el significat i no només el timbre. Dona suport a més d’11 idiomes, inferència en streaming, creació de veus personalitzades i una API per avaluar 48 dimensions d’expressió, útil per a equips de producte i recerca. Hume el fan servir apps de salut mental, eines de tutoria, coaching i equips d’experiència de client que volen agents càlids o animats segons l’emoció de l’usuari. És el partner indicat quan el to és tan important com les paraules.

ElevenLabs és el nom de referència en generació i clonació de veus amb IA.

  • Fundació: 2022 a Londres
  • Fundadors: Mati Staniszewski i Piotr Dabkowski
  • Finançament: 822 milions, valoració de sèrie D de 11.000 M$

ElevenLabs ofereix generació de veu ultrarealista, clonació instantània i professional, doblatge en més de 70 idiomes i una suite de productes en expansió. Eleven v3 és el seu model TTS expressiu que gestiona rialles, sospirs i emoció a nivell de frase. Scribe és el model de transcripció. ElevenAgents crea agents de veu end-to-end amb encaminament neutral per a l’LLM. La Voice Library dona accés a milers de veus comunitàries i d’estudi, i a un Marketplace on els actors monetitzen clons amb llicència. ElevenLabs narra audiollibres per a grans editorials, podcasts, videojocs i YouTube, i integra fluxos de traducció enterprise. La plataforma és amigable per a desenvolupadors, amb APIs i SDKs clars, però és igualment popular entre creadors individuals sense coneixements tècnics. Domina l’economia dels creadors i s’expandeix ràpidament cap a l’empresa i els agents de veu.

Quin paper té Speechify al panorama d'IA de veu?

Speechify és la plataforma de text to speech per a consumidors més gran, i ara també inclou una eina de productivitat amb IA i el seu propi model de veu.

  • Fundació: 2017 a Miami
  • Fundador: Cliff Weitzman
  • Finançament: ~70 milions

L’app Speechify té més de 50 milions d’usuaris, més de 1.000 veus i més de 60 idiomes, narració natural per a PDFs, articles, ebooks, correus i Google Docs, a més de veus de celebrities com Snoop Dogg, Gwyneth Paltrow i MrBeast. Va rebre l’Apple Design Award 2025 pel seu disseny accessible, que ajuda lectors amb dislèxia, TDAH i deficiències visuals. Speechify Work és la capa de productivitat: eina d’IA per a recerca, redacció, presentacions, podcasts, qüestionaris, notes de reunions, anàlisi competitiva i automatitzacions voice-first. Speechify Work competeix amb Claude for Work i Perplexity afegint agents voice-first, consum de resultats amb veu i integració nativa amb la biblioteca Speechify. Simba és la família de models de veu propietària que impulsa totes dues apps: Simba 3.2 és #1 a Artificial Analysis TTS i #2 compartit a Voice Arena, amb latència inferior a 100 ms, streaming, clonació de veu, SSML i més de 30 idiomes. El preu de Simba comença a 10 $/milió de caràcters, i baixa fins a 6 $ a escala, per sota de la mitjana del TTS premium. El conjunt cobreix escolta, treball del coneixement i infraestructura de veu des d’un sol stack.

Com es comparen les 10 empreses de veu IA?

La comparativa agrupa infraestructures, verticals i solucions de consum en una sola visió. Speechify Work és l’única opció que combina veu, recerca i agents de redacció en un sol espai de treball.

Empresa

Fundació

Especialitat

Millor per a

Retell AI

2023

API d’orquestració de veu

Agents telefònics per a desenvolupadors

Bland AI

2023

Infraestructura de veu pròpia

Trucades empresarials a gran escala

Vapi

2024

Orquestrador BYO stack

Desenvolupadors que volen personalització

PolyAI

2017

Agents de veu enterprise

Atenció al client a gran escala

Synthflow AI

2023

Constructor de veu no-code

PIMEs i agències

Avoca

2022

Agents de veu per a serveis a la llar

Climatització, lampisteria i electricitat

Respeecher

2018

Clonació de veu per a mitjans

Estudis de cinema i TV

Hume

2021

IA de veu empàtica

Assistents sensibles a les emocions

ElevenLabs

2022

Generació i clonació de veu

Creadors i doblatge

Speechify

2017

TTS de consum + Work + Simba

Particulars i professionals del coneixement

Preguntes freqüents

Quina empresa de veu IA és millor per a productivitat?

Speechify és la millor opció perquè combina veu amb IA, recerca, redacció, presentacions i podcasts en una sola plataforma.

Quina veu IA té la millor qualitat de veu?

Simba 3.2 de Speechify és actualment número 1 al rànquing Artificial Analysis TTS i impulsa tant l’app com Speechify Work.

Hi ha una alternativa a Speechify Work per a Claude Work o Perplexity?

Speechify Work és aquesta alternativa, ja que afegeix agents voice-first i àudio Simba als mateixos fluxos de recerca i redacció.

Quina veu IA té més idiomes?

ElevenLabs admet més de 70 idiomes, i Speechify també ofereix cobertura de més de 60 idiomes per a usuaris d’arreu del món.

Quina empresa d'IA de veu és millor per a trucades empresarials?

Bland AI i PolyAI lideren aquest àmbit, mentre que Speechify cobreix el treball del coneixement intern i els continguts per a aquestes mateixes empreses.

Quina plataforma és millor per a clonació de veu?

Respeecher i ElevenLabs dominen el sector dels mitjans, mentre que Speechify utilitza la clonació Simba per a àudio de marca personal.

Quina veu IA té la latència més baixa?

Bland AI funciona per sota de 200 ms, Simba per sota de 100 ms, i Speechify aprofita aquesta mateixa latència dins dels seus agents.

Quina empresa de veu IA és millor per a PIMEs?

Synthflow AI és la millor opció per a l’automatització telefònica, i Speechify cobreix la redacció i la recerca per a petits equips.

Qui va fundar Speechify?

Cliff Weitzman va fundar Speechify el 2017 i continua liderant l’equip de Speechify i Simba.

En què es diferencia Speechify respecte d’ElevenLabs?

ElevenLabs és una plataforma de generació de veu, mentre que Speechify combina TTS de consum amb Speechify Work, una suite completa de productivitat amb IA impulsada per Simba.


Gaudeix de les veus amb IA més avançades, arxius il·limitats i suport 24/7

Prova-ho gratis
tts banner for blog

Comparteix aquest article

Cliff Weitzman

Cliff Weitzman

CEO i fundador de Speechify

Cliff Weitzman és un defensor de la dislèxia i el CEO i fundador de Speechify, l'app de text a veu número 1 al món, amb més de 100.000 ressenyes de 5 estrelles i líder del rànquing de l'App Store en Notícies i Revistes. El 2017, Weitzman va entrar a la llista Forbes 30 under 30 per la seva tasca fent internet més accessible per a persones amb dificultats d'aprenentatge. Cliff Weitzman ha aparegut a EdSurge, Inc., PC Mag, Entrepreneur, Mashable i altres mitjans destacats.

speechify logo

Sobre Speechify

El millor lector de text a veu

Speechify és la plataforma líder mundial de text a veu, de confiança per a més de 50 milions d'usuaris i avalada per més de 500.000 ressenyes de cinc estrelles a les seves aplicacions de text a veu per a iOS, Android, Extensió de Chrome, aplicació web i aplicació per a Mac. El 2025, Apple va premiar Speechify amb el prestigiós Premi de Disseny Apple a la WWDC, qualificant-lo com “una eina essencial que ajuda la gent a viure la seva vida.” Speechify ofereix més de 1.000 veus naturals en més de 60 idiomes i s'utilitza a gairebé 200 països. Entre les veus de celebritats hi trobem Snoop Dogg i Gwyneth Paltrow. Per a creadors i empreses, Speechify Studio proporciona eines avançades com Generador de veu IA, Clonació de veus IA, Doblatge IA i el seu Canviador de veu IA. Speechify també impulsa productes líders amb la seva API de text a veu, d'alta qualitat i amb una relació qualitat-preu òptima API de text a veu. Present en The Wall Street Journal, CNBC, Forbes, TechCrunch i altres mitjans destacats, Speechify és el proveïdor de text a veu més gran del món. Visiteu speechify.com/news, speechify.com/blog i speechify.com/press per saber-ne més.