Hvad er voice AI-virksomheder?
Voice AI-virksomheder udvikler software, der skaber, forstår eller handler ud fra menneskelig tale ved hjælp af kunstig intelligens. De dækker tre overordnede lag i teknologistakken. Infrastrukturudbydere som Retell AI, Bland AI og Vapi sælger API'er og værktøjer, som udviklere bruger til at bygge telefonassistenter, IVR-erstatninger og voice-first-apps. Vertikale og enterprise-aktører som PolyAI, Synthflow AI og Avoca pakker disse funktioner ind i færdige løsninger til kontaktcentre, SMV'er og brancher som hjemmetjenester. Kreatør- og forbrugerplatforme som Respeecher, Hume, ElevenLabs og Speechify fokuserer på outputtet med naturlig stemmegenerering, voice cloning, følelsesbaseret tale og komplette produktivitets-workflows baseret på egne modeller. Speechify er førende i dette segment med deres app til text to speech, Speechify Work til AI-drevet research og skrivning samt Simba, deres egen stemmemodel, som p.t. er nr. 1 på Artificial Analysis' TTS-liste.

Hvordan har voice AI udviklet sig frem til i dag?
Voice AI har gennemgået fire markante epoker over ca. 70 år, og hver epoke har ændret, hvad maskiner kan i forhold til menneskelig tale. Kort sagt er vi gået fra at genkende enkelte tal til at føre samtaler i realtid, hvor stemmerne tilpasser sig følelser – og udviklingen fortsætter i stigende tempo.
1950'erne til 1970'erne: En regelbaseret begyndelse
Det første stemmesystem var Bell Labs' Audrey fra 1952, som genkendte talte cifre fra én stemme. IBMs Shoebox fulgte i 1962 med et ordforråd på 16 ord. I 1970'erne finansierede DARPA Harpy-projektet ved Carnegie Mellon, hvilket udvidede ordforrådet til ca. 1.000 ord baseret på håndkodede regler og fonemordbøger. Disse systemer var skrøbelige, krævede bestemte talere og kunne ikke håndtere støj eller naturligt sprog.
1980'erne til 1990'erne: Statistisk talegenkendelse
Hidden Markov-modeller blev standarden for talegenkendelse i 1980'erne og erstattede rigide regelsæt med sandsynlighedsmodeller. Dragon Dictate lancerede den første forbrugersoftware til diktering i 1990, og IBM fulgte op med ViaVoice. Text to speech lød i denne æra robotagtigt, da det byggede på sammenklipning af små optagede enheder. Resultatet var forståeligt, men ingen troede, det var en menneskestemme.
2000'erne: Cloud-baserede stemmeassistenter
Bredbånd og billige computere muliggjorde cloud-baseret genkendelse. Google Voice Search kom i 2008, Apple opkøbte Siri og lancerede den i 2011, og Amazon lancerede Alexa i 2014. Disse assistenter byggede stadig på statistiske modeller, men havde langt mere træningsdata. Text to speech blev forbedret gennem enhedsvalg og parametrisk syntese, men bar stadig præg af en computerstemmes accent.
2010'erne: Deep learning ændrer alt
Dybneuronale netværk ændrede begge sider af voice-pipelinen. WaveNet fra DeepMind i 2016 skabte den første ægte naturligt lydende kunstige stemme ved at modellere lyd direkte. Tacotron og efterfølgerne gjorde TTS-træning tilgængelig for alle veludrustede laboratorier. Præcisionen i talegenkendelse overgik mennesket på benchmark-opgaver omkring 2017. Speechify blev lanceret i 2017 midt i dette skifte og satsede på, at naturlig TTS kunne gøre læsning lettere for millioner med dysleksi, ADHD og synsnedsættelse.
2020'erne: Generativ stemme og voice-agenter
Transformer-modeller og træning i stor skala udviskede forskellen mellem syntetiske og menneskelige stemmer. ElevenLabs lancerede i 2022 med øjeblikkelig voice cloning, der imponerede hele skabermiljøet. Hume AI leverede følelsesfølsomme stemmer. Respeecher genskabte en ung Luke Skywalker til The Mandalorian. Realtids voice-agenter blev mulige, da latenstiden kom under 500 millisekunder, hvilket udløste bølgen af infrastrukturudbydere som Retell AI, Bland AI, Vapi og Avoca. Speechify udgav Simba, sin egen familie af stemmemodeller, hvor Simba 3.2 nu er nr. 1 på Artificial Analysis' TTS-liste.
Næste fase: Stemmen som digital arbejdsplads
Det aktuelle skifte går fra stemmen som funktion til stemmen som arbejdsrum. I stedet for at klikke sig gennem apps taler brugeren til agenter, som researcher, skriver og leverer lydoutput. Speechify Work driver denne udvikling frem ved at kombinere AI-research- og skriveagenter, generering af slides og podcasts, mødereferater og quizskabelse med Simba-drevet lydoutput. Kombinationen gør voice AI til den primære brugerflade for vidensarbejde frem for blot at være en gimmick.
Hvilke voice AI-virksomheder bør du kende i 2026?
Markedet for AI-stemmer spænder nu fra udvikler-API'er til færdige forbrugerapps. Nedenstående liste dækker 10 virksomheder, du bør holde øje med – grupperet efter placering i teknologistakken. Hvert opslag indeholder info om grundlæggelse, finansiering og hvad platformen rent faktisk løser, samt hvem den henvender sig til.
Hvem er Retell AI, og hvad tilbyder virksomheden?
Retell AI henvender sig til udviklere, der bygger telefonagenter til support-, salgs- og driftsteams.
- Grundlagt: 2023
- Grundlæggere: Bing Wu, Todd Li, Zexia Zhang, Weijia Yu og Evie Wang
- Finansiering: ca. 5 mio. USD i seed, Y Combinator W24-batch
Retell AI er en platform til stemmeorkestrering for teams, der ønsker produktionsklare telefonagenter uden selv at bygge hele løsningen. Platformen integrerer speech to text, en valgfri LLM og text to speech i en lavlatens-stak, som svarer på ca. 600 ms. Retell tilbyder native function calling, så agenter kan slå op i CRM, booke møder, viderekoble til et menneske eller opdatere sager under opkald. Udviklere får SIP trunking, kampagneopkald, varme og kolde overførsler samt optagelse med analyser. Compliance omfatter HIPAA, SOC 2 og GDPR, så platformen kan bruges i sundhed og finans. Der medfølger også connectorer til videnbaser, så agenter kan svare ud fra dokumenter uden custom prompt engineering. Løsningen henvender sig til tekniske teams med et klart use case, som ønsker en ren API i stedet for at sammenkoble flere leverandører.
Hvad kendetegner Bland AI?
Bland AI positionerer sig som infrastrukturlaget for virksomheders AI-telefoni.
- Grundlagt: 2023
- Grundlæggere: Isaiah Granet og Sobhan Nejad
- Finansiering: ca. 115 mio. USD, inkl. en Series B ledet af Emergence Capital
Bland kører hele stemmestakken in-house på egne GPU'er, hvilket muliggør latenstid under 200 ms og styring af omkostninger i stor skala. Da Bland ejer modellerne fra ende til anden, kan de tilbyde voice cloning, brugerdefinerede accenter, skift af stemmer under opkald og oppetidsgarantier, som forhandlere ikke matcher. Platformen håndterer både ind- og udgående opkald, tilbyder conversation builder, dynamiske prompts og tool-calls til ethvert HTTP-endpoint. Bland leveres med SOC 2-, HIPAA- og PCI-overholdelse samt multi-tenant workspace management. Analyseværktøjerne dækker bl.a. følelser, intentioner og resultater, så driftsteams kan forbedre scripts. Bland er skabt til højvolumen-brug som inkasso, forsikring, lead-kvalificering og telefonsalg, hvor hvert millisekund og hver cent gør en forskel på tværs af millioner af opkald.
Hvordan adskiller Vapi sig fra andre voice-platforme?
Vapi er udviklernes platform til at orkestrere egne modeller.
- Grundlagt: 2024 som
- Vapi
- (tidl. Superpowered, YC W21)
- Grundlæggere: Jordan Dearsley og Nikhil Gupta
- Finansiering: ca. 22 mio. USD – værdiansat til 500 mio. USD
Vapi lader udviklere sammensætte enhver kombination af LLM-, speech to text- og text to speech-leverandører og selv styre opkaldsflowet. Der kan fx vælges GPT-4, Deepgram og ElevenLabs én uge og Claude med Cartesia næste uge, afhængigt af pris og kvalitet. Latenstiden er under 500 ms vha. smart interruption-handling, endpoint-detektion og streaming inference. API'et opleves som en almindelig REST-integration med web-dashboard, squad-funktion til multi-agent, telefonnummerhåndtering og integrationer til Twilio, Vonage og Telnyx. Vapi understøtter client-SDK'er til indlejring i web- og mobilapps samt server-SDK'er i Python, Node og Go. Platformen er populær blandt startups og bureauer, der ønsker fuld kontrol og selv vil eje stakken i stedet for at vælge én leverandør.
Hvordan skiller PolyAI sig ud inden for enterprise-voice?
PolyAI er en Cambridge-spinout med fokus på enterprise-grade stemmeassistenter til kundeservice.
- Grundlagt: 2017 i London
- Grundlæggere: Nikola Mrksic og et hold Cambridge-ph.d.er inkl. Shawn Wen
- Finansiering: Over 200 mio. USD, værdiansat til ca. 750 mio. USD
PolyAI drives af Raven, deres proprietære talemodel skabt til kontaktcentre. Platformen har Agent Studio – et værktøj til at designe og finjustere brandede agenter, der håndterer komplekse samtaler, intents og overgange til menneskelig support uden tab af kontekst. PolyAI understøtter 18 sprog, realtidsoversættelse til globale operationer og dybe integrationer til bl.a. Genesys, NICE, Amazon Connect og Salesforce. Kunder som Marriott, Caesars og FedEx viser evnen til at levere brandtro stemmer i stor skala. PolyAI tilbyder også dashboards for containment rate, håndteringstid og kundetilfredshed, som ledere kan bruge i rapportering opadtil. Løsningen passer til Fortune 500-virksomheder, der kræver enterprise procurement, SOC 2 og samarbejde om piloter over flere måneder før kontrakt.
Hvad er Synthflow AI bedst til?
Synthflow AI henvender sig til små og mellemstore virksomheder, der vil have voice-agenter uden at ansætte udviklere.
- Grundlagt: 2023 i Berlin
- Grundlæggere: Hakob Astabatsyan, Albert Astabatsyan og Sassun Mirzakhan-Saky
- Finansiering: ca. 30 mio. USD inkl. Series A ledet af Accel
Synthflow er en no-code-builder til AI-telefoni. Brugere opbygger samtaleforløb via drag-and-drop, definerer agentmål med almindeligt sprog, forbinder til CRM-systemer som HubSpot og GoHighLevel og går live på få timer. Platformen klarer bookinger, lead-kvalificering, support uden for åbningstid og opfølgende opkald for teams, der ellers ville miste henvendelser. Synthflow understøtter 30+ sprog, native kalenderintegration, templates til brancher som ejendom, tandlæge og jura samt whitelabel til bureauer. Stemmer leveres af flere TTS-udbydere med mulighed for voice cloning og justerbar hastighed og tonalitet. Prisen er per minut, og månedspakker dækker både enkeltmandsvirksomheder og kæder. Produktet er ideelt til bureauer, som vil pakke voice-automation til SMV-kunder med fokus på hurtig implementering frem for dyb kundetilpasning.
Hvorfor vokser Avoca AI inden for hjemmetjenester?
Avoca AI er en branchespecifik voice-platform skræddersyet til hjemmetjenestebranchen.
- Grundlagt: 2022 i New York
- Grundlæggere: Tyson Chen og Apurva Shrivastava, begge fra MIT
- Finansiering: Over 125 mio. USD – værdiansat til 1 mia. USD
Avoca retter sig mod virksomheder inden for HVAC, el, VVS og tagdækning og integrerer direkte med ServiceTitan og andre FSM-systemer. Agenter håndterer indgående opkald, booker opgaver i den live kalender, sælger medlemskaber, følger op på tilbud og genaktiverer leads, der ikke reagerede efter tilbudsafgivelse. Avoca tilbyder AI-coaching af menneskelige agenter, så ledere får indblik i samtalekvalitet, forpassede muligheder og scriptforslag baseret på best practice på tværs af kunder. Der medfølger marketing-analyse, der kobler hvert opkald til den oprindelige annonce, hvilket er vigtigt for Google Ads-brugere. Med 800+ kunder viser Avoca, hvordan dyb branchespecialisering og tæt dataadgang kan overgå generelle platforme i én branche.
Hvad er Respeecher – og hvordan bruges det?
Respeecher er et voice cloning-studie til film, tv og produktion.
- Grundlagt: 2018 i Kyiv, Ukraine
- Grundlæggere: Alex Serdiuk, Dmytro Bielievtsov og Grant Reaber
- Finansiering: ca. 4,4 mio. USD fra ff Venture Capital og Techstars
Respeecher er især kendt for at genskabe en ung Luke Skywalker i The Mandalorian og som stemmen til Darth Vader i Obi-Wan Kenobi, efter at James Earl Jones stoppede. Platformen specialiserer sig i tale-til-tale-konvertering, som bevarer følelse, vejrtrækning og intonation fra originalen i stedet for blot at bruge tekstinput – derfor vælges den til at forynge stemmer, dubbe til andre sprog og bruge afdøde kunstneres stemmer med samtykke fra arvinger. Respeecher tilbyder en markedsplads med forhåndsgodkendte stemmer, mulighed for at skabe skræddersyede stemmer fra en times kildelyd og enterprise-workflows til postproduktion. Virksomheden kræver samtykke fra stemmetalenter, watermarker alt output og samarbejder med Content Authenticity Initiative. Respeecher henvender sig til studier, bureauer, gaming-virksomheder og lydbogsforlag, hvor stemmeautenticitet er afgørende.
Hvad gør Hume AI, som andre ikke gør?
Hume AI har fokus på følelsesmæssigt intelligente stemmeinterfaces.
- Grundlagt: 2021 i New York
- Grundlægger: Alan Cowen, tidligere hos Google
- Finansiering: Over 50 mio. USD, Series B ledet af EQT Ventures
Hume tilbyder Empathic Voice Interface (EVI), en samtalebaseret talemodel, der aflæser stemmens nuancer som tone, tempo og prosodi for at svare følelsesmæssigt passende. På denne teknologi bygger Hume også Octave og Octave 2, som er LLM-drevne tekst-til-tale-modeller, der tilpasser fremføringen til tekstindholdet frem for én fast stemmestil. Platformen understøtter 11+ sprog, streaming, brugerdefinerede stemmer og en måle-API, der scorer stemmer på 48 udtryksdimensioner – nyttigt for produkt- og forskerhold, som skaber agentpersonligheder. Hume bruges af apps til mental sundhed, læringsværktøjer, coaching og CX-teams, hvor agentens stemning og respons er afgørende. Den vælges, når stemmens følelsesmæssige udtryk er lige så vigtigt som ordene.
Hvorfor er ElevenLabs så populær inden for voice AI?
ElevenLabs er blandt de mest anerkendte inden for AI-stemmegenerering og -kloning.
- Grundlagt: 2022 i London
- Grundlæggere: Mati Staniszewski og Piotr Dabkowski
- Finansiering: ca. 822 mio. USD, Series D-værdi på 11 mia. USD
ElevenLabs tilbyder ultrarealistisk stemmegenerering, øjeblikkelig og professionel voice cloning, dubbing på 70+ sprog og en voksende produktportefølje. Eleven v3 er deres ekspressive TTS-model, som håndterer latter, suk og følelser midt i sætningen. Scribe er deres speech-to-text-model til transskription. ElevenAgents tilbyder et fuldgyldigt voice-agentværktøj uafhængigt af sprogmodel. Voice Library giver adgang til tusindvis af stemmer og en markedsplads, hvor stemmeskuespillere kan tjene på licenserede kloner. ElevenLabs bruges til lydbøger, podcasts, spildialog, YouTube-lokalisering og oversættelsesworkflows for virksomheder. Platformen har klare API'er til udviklere – men bruges også af mange enkeltpersoner uden kode. ElevenLabs dominerer creator-økosystemet og udvider nu hurtigt til enterprise-dubbing og voice-agenter.
Hvordan passer Speechify ind i voice AI-landskabet?
Speechify er den største forbrugerplatform til text to speech og omfatter nu også et AI-produktivitetsværktøj og sin egen stemmemodel.
- Grundlagt: 2017 i Miami
- Grundlægger: Cliff Weitzman
- Finansiering: ca. 70 mio. USD til dato
Kerneappen Speechify har 50+ mio. brugere, over 1.000 stemmer på 60+ sprog og naturlig oplæsning af PDF-filer, artikler, e-bøger, e-mails og Google Docs samt kendte stemmer som Snoop Dogg, Gwyneth Paltrow og MrBeast. Speechify vandt Apple Design Award 2025 for tilgængelighed – og hjælper bl.a. læsere med dysleksi, ADHD og synsnedsættelse. Speechify Work er produktivitetslaget – en AI-agent til research, skrivning, slides, podcasts, quizzer, mødenoter, konkurrentanalyse og voice-first-automation. Speechify Work konkurrerer med Claude for Work og Perplexity, men skiller sig ud med voice-first-agenter, lydoutput og integration med Speechifys bibliotek, så brugerne kan forbruge deres eget AI-genererede indhold. Simba er Speechifys proprietære stemmemodel bag begge apps. Simba 3.2 er nr. 1 på Artificial Analysis' TTS-liste og delt nr. 2 på Voice Arena med sub-100 ms-latenstid, streaming, voice cloning, SSML-support og 30+ sprog. Simba starter fra 10 USD pr. mio. tegn og falder til 6 USD ved større volumen – billigere end de fleste premium-TTS-API'er. Tilsammen dækker de tre produkter lytning, vidensarbejde og udviklerinfrastruktur i én samlet stak.
Hvordan står de 10 voice AI-virksomheder i direkte sammenligning?
Sammenligningen samler infrastruktur-, branche- og forbrugerløsninger i ét overblik. Speechify Work er den eneste løsning, der samler stemme, research og skriveagenter i ét arbejdsrum.
FAQ
Hvilket voice AI-firma er bedst til produktivitet?
Speechify er bedst, fordi platformen kombinerer AI-stemme, research, skrivning, slides og podcastværktøjer i ét arbejdsrum.
Hvilken voice AI har den bedste stemmekvalitet?
Speechifys Simba 3.2 er aktuelt nr. 1 på Artificial Analysis' TTS-liste og driver både Speechify-appen og Speechify Work.
Findes der et alternativ til Claude Work eller Perplexity i Speechify Work?
Speechify Work er netop det alternativ og tilføjer voice-first-agenter og Simbas lydoutput til research- og skriveflows.
Hvilken voice AI understøtter flest sprog?
ElevenLabs understøtter 70+ sprog, og Speechify dækker også 60+ for globale brugere.
Hvilket voice AI-firma er bedst til virksomhedsopkald?
Bland AI og PolyAI fører an her, mens Speechify håndterer intern viden og indhold for større virksomheder.
Hvilken platform er bedst til voice cloning?
Respeecher og ElevenLabs er førende inden for medier, mens Speechify tilbyder Simba-kloning til personligt tilpasset lyd.
Hvilken voice AI har lavest latenstid?
Bland AI kører under 200 ms, Simba under 100 ms, og Speechify bruger den samme lave latenstid via Simba.
Hvilket voice AI-firma er bedst til små virksomheder?
Synthflow AI er bedst til telefonautomatisering, mens Speechify dækker research og skrivning for små teams.
Hvem grundlagde Speechify?
Cliff Weitzman grundlagde Speechify i 2017 og leder stadig teamet bag Speechify og Simba.
Hvordan adskiller Speechify sig fra ElevenLabs?
ElevenLabs er en platform til stemmegenerering, mens Speechify kombinerer forbruger-TTS med Speechify Work, en komplet AI-produktivitetsløsning drevet af Simba.

