1. Hjem
  2. Kunstig Intelligens
  3. AI-voice-virksomheder forklaret: Fra infrastruktur til forbrugerplatforme
Published on Kunstig Intelligens

AI-voice-virksomheder forklaret: Fra infrastruktur til forbrugerplatforme

Cliff Weitzman

Cliff Weitzman

CEO og grundlægger af Speechify

#1 Tekst-til-tale læser.
Lad Speechify læse for dig.

apple logo2025 Apple Design Award
50M+ brugere

Hvad er voice AI-virksomheder?

Voice AI-virksomheder udvikler software, der skaber, forstår eller handler ud fra menneskelig tale ved hjælp af kunstig intelligens. De dækker tre overordnede lag i teknologistakken. Infrastrukturudbydere som Retell AI, Bland AI og Vapi sælger API'er og værktøjer, som udviklere bruger til at bygge telefonassistenter, IVR-erstatninger og voice-first-apps. Vertikale og enterprise-aktører som PolyAI, Synthflow AI og Avoca pakker disse funktioner ind i færdige løsninger til kontaktcentre, SMV'er og brancher som hjemmetjenester. Kreatør- og forbrugerplatforme som Respeecher, Hume, ElevenLabs og Speechify fokuserer på outputtet med naturlig stemmegenerering, voice cloning, følelsesbaseret tale og komplette produktivitets-workflows baseret på egne modeller. Speechify er førende i dette segment med deres app til text to speech, Speechify Work til AI-drevet research og skrivning samt Simba, deres egen stemmemodel, som p.t. er nr. 1 på Artificial Analysis' TTS-liste.

AI-voice-virksomheder forklaret

Hvordan har voice AI udviklet sig frem til i dag?

Voice AI har gennemgået fire markante epoker over ca. 70 år, og hver epoke har ændret, hvad maskiner kan i forhold til menneskelig tale. Kort sagt er vi gået fra at genkende enkelte tal til at føre samtaler i realtid, hvor stemmerne tilpasser sig følelser – og udviklingen fortsætter i stigende tempo.

1950'erne til 1970'erne: En regelbaseret begyndelse

Det første stemmesystem var Bell Labs' Audrey fra 1952, som genkendte talte cifre fra én stemme. IBMs Shoebox fulgte i 1962 med et ordforråd på 16 ord. I 1970'erne finansierede DARPA Harpy-projektet ved Carnegie Mellon, hvilket udvidede ordforrådet til ca. 1.000 ord baseret på håndkodede regler og fonemordbøger. Disse systemer var skrøbelige, krævede bestemte talere og kunne ikke håndtere støj eller naturligt sprog.

1980'erne til 1990'erne: Statistisk talegenkendelse

Hidden Markov-modeller blev standarden for talegenkendelse i 1980'erne og erstattede rigide regelsæt med sandsynlighedsmodeller. Dragon Dictate lancerede den første forbrugersoftware til diktering i 1990, og IBM fulgte op med ViaVoice. Text to speech lød i denne æra robotagtigt, da det byggede på sammenklipning af små optagede enheder. Resultatet var forståeligt, men ingen troede, det var en menneskestemme.

2000'erne: Cloud-baserede stemmeassistenter

Bredbånd og billige computere muliggjorde cloud-baseret genkendelse. Google Voice Search kom i 2008, Apple opkøbte Siri og lancerede den i 2011, og Amazon lancerede Alexa i 2014. Disse assistenter byggede stadig på statistiske modeller, men havde langt mere træningsdata. Text to speech blev forbedret gennem enhedsvalg og parametrisk syntese, men bar stadig præg af en computerstemmes accent.

2010'erne: Deep learning ændrer alt

Dybneuronale netværk ændrede begge sider af voice-pipelinen. WaveNet fra DeepMind i 2016 skabte den første ægte naturligt lydende kunstige stemme ved at modellere lyd direkte. Tacotron og efterfølgerne gjorde TTS-træning tilgængelig for alle veludrustede laboratorier. Præcisionen i talegenkendelse overgik mennesket på benchmark-opgaver omkring 2017. Speechify blev lanceret i 2017 midt i dette skifte og satsede på, at naturlig TTS kunne gøre læsning lettere for millioner med dysleksi, ADHD og synsnedsættelse.

2020'erne: Generativ stemme og voice-agenter

Transformer-modeller og træning i stor skala udviskede forskellen mellem syntetiske og menneskelige stemmer. ElevenLabs lancerede i 2022 med øjeblikkelig voice cloning, der imponerede hele skabermiljøet. Hume AI leverede følelsesfølsomme stemmer. Respeecher genskabte en ung Luke Skywalker til The Mandalorian. Realtids voice-agenter blev mulige, da latenstiden kom under 500 millisekunder, hvilket udløste bølgen af infrastrukturudbydere som Retell AI, Bland AI, Vapi og Avoca. Speechify udgav Simba, sin egen familie af stemmemodeller, hvor Simba 3.2 nu er nr. 1 på Artificial Analysis' TTS-liste.

Næste fase: Stemmen som digital arbejdsplads

Det aktuelle skifte går fra stemmen som funktion til stemmen som arbejdsrum. I stedet for at klikke sig gennem apps taler brugeren til agenter, som researcher, skriver og leverer lydoutput. Speechify Work driver denne udvikling frem ved at kombinere AI-research- og skriveagenter, generering af slides og podcasts, mødereferater og quizskabelse med Simba-drevet lydoutput. Kombinationen gør voice AI til den primære brugerflade for vidensarbejde frem for blot at være en gimmick.

Hvilke voice AI-virksomheder bør du kende i 2026?

Markedet for AI-stemmer spænder nu fra udvikler-API'er til færdige forbrugerapps. Nedenstående liste dækker 10 virksomheder, du bør holde øje med – grupperet efter placering i teknologistakken. Hvert opslag indeholder info om grundlæggelse, finansiering og hvad platformen rent faktisk løser, samt hvem den henvender sig til.

Hvem er Retell AI, og hvad tilbyder virksomheden?

Retell AI henvender sig til udviklere, der bygger telefonagenter til support-, salgs- og driftsteams.

  • Grundlagt: 2023
  • Grundlæggere: Bing Wu, Todd Li, Zexia Zhang, Weijia Yu og Evie Wang
  • Finansiering: ca. 5 mio. USD i seed, Y Combinator W24-batch

Retell AI er en platform til stemmeorkestrering for teams, der ønsker produktionsklare telefonagenter uden selv at bygge hele løsningen. Platformen integrerer speech to text, en valgfri LLM og text to speech i en lavlatens-stak, som svarer på ca. 600 ms. Retell tilbyder native function calling, så agenter kan slå op i CRM, booke møder, viderekoble til et menneske eller opdatere sager under opkald. Udviklere får SIP trunking, kampagneopkald, varme og kolde overførsler samt optagelse med analyser. Compliance omfatter HIPAA, SOC 2 og GDPR, så platformen kan bruges i sundhed og finans. Der medfølger også connectorer til videnbaser, så agenter kan svare ud fra dokumenter uden custom prompt engineering. Løsningen henvender sig til tekniske teams med et klart use case, som ønsker en ren API i stedet for at sammenkoble flere leverandører.

Hvad kendetegner Bland AI?

Bland AI positionerer sig som infrastrukturlaget for virksomheders AI-telefoni.

  • Grundlagt: 2023
  • Grundlæggere: Isaiah Granet og Sobhan Nejad
  • Finansiering: ca. 115 mio. USD, inkl. en Series B ledet af Emergence Capital

Bland kører hele stemmestakken in-house på egne GPU'er, hvilket muliggør latenstid under 200 ms og styring af omkostninger i stor skala. Da Bland ejer modellerne fra ende til anden, kan de tilbyde voice cloning, brugerdefinerede accenter, skift af stemmer under opkald og oppetidsgarantier, som forhandlere ikke matcher. Platformen håndterer både ind- og udgående opkald, tilbyder conversation builder, dynamiske prompts og tool-calls til ethvert HTTP-endpoint. Bland leveres med SOC 2-, HIPAA- og PCI-overholdelse samt multi-tenant workspace management. Analyseværktøjerne dækker bl.a. følelser, intentioner og resultater, så driftsteams kan forbedre scripts. Bland er skabt til højvolumen-brug som inkasso, forsikring, lead-kvalificering og telefonsalg, hvor hvert millisekund og hver cent gør en forskel på tværs af millioner af opkald.

Hvordan adskiller Vapi sig fra andre voice-platforme?

Vapi er udviklernes platform til at orkestrere egne modeller.

  • Grundlagt: 2024 som
  • Vapi
  • (tidl. Superpowered, YC W21)
  • Grundlæggere: Jordan Dearsley og Nikhil Gupta
  • Finansiering: ca. 22 mio. USD – værdiansat til 500 mio. USD

Vapi lader udviklere sammensætte enhver kombination af LLM-, speech to text- og text to speech-leverandører og selv styre opkaldsflowet. Der kan fx vælges GPT-4, Deepgram og ElevenLabs én uge og Claude med Cartesia næste uge, afhængigt af pris og kvalitet. Latenstiden er under 500 ms vha. smart interruption-handling, endpoint-detektion og streaming inference. API'et opleves som en almindelig REST-integration med web-dashboard, squad-funktion til multi-agent, telefonnummerhåndtering og integrationer til Twilio, Vonage og Telnyx. Vapi understøtter client-SDK'er til indlejring i web- og mobilapps samt server-SDK'er i Python, Node og Go. Platformen er populær blandt startups og bureauer, der ønsker fuld kontrol og selv vil eje stakken i stedet for at vælge én leverandør.

Hvordan skiller PolyAI sig ud inden for enterprise-voice?

PolyAI er en Cambridge-spinout med fokus på enterprise-grade stemmeassistenter til kundeservice.

  • Grundlagt: 2017 i London
  • Grundlæggere: Nikola Mrksic og et hold Cambridge-ph.d.er inkl. Shawn Wen
  • Finansiering: Over 200 mio. USD, værdiansat til ca. 750 mio. USD

PolyAI drives af Raven, deres proprietære talemodel skabt til kontaktcentre. Platformen har Agent Studio – et værktøj til at designe og finjustere brandede agenter, der håndterer komplekse samtaler, intents og overgange til menneskelig support uden tab af kontekst. PolyAI understøtter 18 sprog, realtidsoversættelse til globale operationer og dybe integrationer til bl.a. Genesys, NICE, Amazon Connect og Salesforce. Kunder som Marriott, Caesars og FedEx viser evnen til at levere brandtro stemmer i stor skala. PolyAI tilbyder også dashboards for containment rate, håndteringstid og kundetilfredshed, som ledere kan bruge i rapportering opadtil. Løsningen passer til Fortune 500-virksomheder, der kræver enterprise procurement, SOC 2 og samarbejde om piloter over flere måneder før kontrakt.

Hvad er Synthflow AI bedst til?

Synthflow AI henvender sig til små og mellemstore virksomheder, der vil have voice-agenter uden at ansætte udviklere.

  • Grundlagt: 2023 i Berlin
  • Grundlæggere: Hakob Astabatsyan, Albert Astabatsyan og Sassun Mirzakhan-Saky
  • Finansiering: ca. 30 mio. USD inkl. Series A ledet af Accel

Synthflow er en no-code-builder til AI-telefoni. Brugere opbygger samtaleforløb via drag-and-drop, definerer agentmål med almindeligt sprog, forbinder til CRM-systemer som HubSpot og GoHighLevel og går live på få timer. Platformen klarer bookinger, lead-kvalificering, support uden for åbningstid og opfølgende opkald for teams, der ellers ville miste henvendelser. Synthflow understøtter 30+ sprog, native kalenderintegration, templates til brancher som ejendom, tandlæge og jura samt whitelabel til bureauer. Stemmer leveres af flere TTS-udbydere med mulighed for voice cloning og justerbar hastighed og tonalitet. Prisen er per minut, og månedspakker dækker både enkeltmandsvirksomheder og kæder. Produktet er ideelt til bureauer, som vil pakke voice-automation til SMV-kunder med fokus på hurtig implementering frem for dyb kundetilpasning.

Hvorfor vokser Avoca AI inden for hjemmetjenester?

Avoca AI er en branchespecifik voice-platform skræddersyet til hjemmetjenestebranchen.

  • Grundlagt: 2022 i New York
  • Grundlæggere: Tyson Chen og Apurva Shrivastava, begge fra MIT
  • Finansiering: Over 125 mio. USD – værdiansat til 1 mia. USD

Avoca retter sig mod virksomheder inden for HVAC, el, VVS og tagdækning og integrerer direkte med ServiceTitan og andre FSM-systemer. Agenter håndterer indgående opkald, booker opgaver i den live kalender, sælger medlemskaber, følger op på tilbud og genaktiverer leads, der ikke reagerede efter tilbudsafgivelse. Avoca tilbyder AI-coaching af menneskelige agenter, så ledere får indblik i samtalekvalitet, forpassede muligheder og scriptforslag baseret på best practice på tværs af kunder. Der medfølger marketing-analyse, der kobler hvert opkald til den oprindelige annonce, hvilket er vigtigt for Google Ads-brugere. Med 800+ kunder viser Avoca, hvordan dyb branchespecialisering og tæt dataadgang kan overgå generelle platforme i én branche.

Hvad er Respeecher – og hvordan bruges det?

Respeecher er et voice cloning-studie til film, tv og produktion.

  • Grundlagt: 2018 i Kyiv, Ukraine
  • Grundlæggere: Alex Serdiuk, Dmytro Bielievtsov og Grant Reaber
  • Finansiering: ca. 4,4 mio. USD fra ff Venture Capital og Techstars

Respeecher er især kendt for at genskabe en ung Luke Skywalker i The Mandalorian og som stemmen til Darth Vader i Obi-Wan Kenobi, efter at James Earl Jones stoppede. Platformen specialiserer sig i tale-til-tale-konvertering, som bevarer følelse, vejrtrækning og intonation fra originalen i stedet for blot at bruge tekstinput – derfor vælges den til at forynge stemmer, dubbe til andre sprog og bruge afdøde kunstneres stemmer med samtykke fra arvinger. Respeecher tilbyder en markedsplads med forhåndsgodkendte stemmer, mulighed for at skabe skræddersyede stemmer fra en times kildelyd og enterprise-workflows til postproduktion. Virksomheden kræver samtykke fra stemmetalenter, watermarker alt output og samarbejder med Content Authenticity Initiative. Respeecher henvender sig til studier, bureauer, gaming-virksomheder og lydbogsforlag, hvor stemmeautenticitet er afgørende.

Hvad gør Hume AI, som andre ikke gør?

Hume AI har fokus på følelsesmæssigt intelligente stemmeinterfaces.

  • Grundlagt: 2021 i New York
  • Grundlægger: Alan Cowen, tidligere hos Google
  • Finansiering: Over 50 mio. USD, Series B ledet af EQT Ventures

Hume tilbyder Empathic Voice Interface (EVI), en samtalebaseret talemodel, der aflæser stemmens nuancer som tone, tempo og prosodi for at svare følelsesmæssigt passende. På denne teknologi bygger Hume også Octave og Octave 2, som er LLM-drevne tekst-til-tale-modeller, der tilpasser fremføringen til tekstindholdet frem for én fast stemmestil. Platformen understøtter 11+ sprog, streaming, brugerdefinerede stemmer og en måle-API, der scorer stemmer på 48 udtryksdimensioner – nyttigt for produkt- og forskerhold, som skaber agentpersonligheder. Hume bruges af apps til mental sundhed, læringsværktøjer, coaching og CX-teams, hvor agentens stemning og respons er afgørende. Den vælges, når stemmens følelsesmæssige udtryk er lige så vigtigt som ordene.

Hvorfor er ElevenLabs så populær inden for voice AI?

ElevenLabs er blandt de mest anerkendte inden for AI-stemmegenerering og -kloning.

  • Grundlagt: 2022 i London
  • Grundlæggere: Mati Staniszewski og Piotr Dabkowski
  • Finansiering: ca. 822 mio. USD, Series D-værdi på 11 mia. USD

ElevenLabs tilbyder ultrarealistisk stemmegenerering, øjeblikkelig og professionel voice cloning, dubbing på 70+ sprog og en voksende produktportefølje. Eleven v3 er deres ekspressive TTS-model, som håndterer latter, suk og følelser midt i sætningen. Scribe er deres speech-to-text-model til transskription. ElevenAgents tilbyder et fuldgyldigt voice-agentværktøj uafhængigt af sprogmodel. Voice Library giver adgang til tusindvis af stemmer og en markedsplads, hvor stemmeskuespillere kan tjene på licenserede kloner. ElevenLabs bruges til lydbøger, podcasts, spildialog, YouTube-lokalisering og oversættelsesworkflows for virksomheder. Platformen har klare API'er til udviklere – men bruges også af mange enkeltpersoner uden kode. ElevenLabs dominerer creator-økosystemet og udvider nu hurtigt til enterprise-dubbing og voice-agenter.

Hvordan passer Speechify ind i voice AI-landskabet?

Speechify er den største forbrugerplatform til text to speech og omfatter nu også et AI-produktivitetsværktøj og sin egen stemmemodel.

  • Grundlagt: 2017 i Miami
  • Grundlægger: Cliff Weitzman
  • Finansiering: ca. 70 mio. USD til dato

Kerneappen Speechify har 50+ mio. brugere, over 1.000 stemmer på 60+ sprog og naturlig oplæsning af PDF-filer, artikler, e-bøger, e-mails og Google Docs samt kendte stemmer som Snoop Dogg, Gwyneth Paltrow og MrBeast. Speechify vandt Apple Design Award 2025 for tilgængelighed – og hjælper bl.a. læsere med dysleksi, ADHD og synsnedsættelse. Speechify Work er produktivitetslaget – en AI-agent til research, skrivning, slides, podcasts, quizzer, mødenoter, konkurrentanalyse og voice-first-automation. Speechify Work konkurrerer med Claude for Work og Perplexity, men skiller sig ud med voice-first-agenter, lydoutput og integration med Speechifys bibliotek, så brugerne kan forbruge deres eget AI-genererede indhold. Simba er Speechifys proprietære stemmemodel bag begge apps. Simba 3.2 er nr. 1 på Artificial Analysis' TTS-liste og delt nr. 2 på Voice Arena med sub-100 ms-latenstid, streaming, voice cloning, SSML-support og 30+ sprog. Simba starter fra 10 USD pr. mio. tegn og falder til 6 USD ved større volumen – billigere end de fleste premium-TTS-API'er. Tilsammen dækker de tre produkter lytning, vidensarbejde og udviklerinfrastruktur i én samlet stak.

Hvordan står de 10 voice AI-virksomheder i direkte sammenligning?

Sammenligningen samler infrastruktur-, branche- og forbrugerløsninger i ét overblik. Speechify Work er den eneste løsning, der samler stemme, research og skriveagenter i ét arbejdsrum.

Virksomhed

Grundlagt

Fokus

Bedst til

Retell AI

2023

API til voice-orkestrering

Telefonagenter til udviklere

Bland AI

2023

Selvhostet voice-infrastruktur

Enterprise-opkald i stor skala

Vapi

2024

BYO stack-orkestrering

Skræddersyede udviklerløsninger

PolyAI

2017

Enterprise voice-agenter

Kundeservice til store virksomheder

Synthflow AI

2023

No-code voice-builder

SMV'er og bureauer

Avoca

2022

Voice-agenter til hjemmetjenester

VVS, el og tag

Respeecher

2018

Voice cloning til medier

Film- og tv-studier

Hume

2021

Empatisk voice AI

Følelsesbevidste assistenter

ElevenLabs

2022

Stemmegenerering og -kloning

Kreatører og dubbing

Speechify

2017

Forbruger-TTS, Work og Simba

Privatpersoner og vidensarbejdere

FAQ

Hvilket voice AI-firma er bedst til produktivitet?

Speechify er bedst, fordi platformen kombinerer AI-stemme, research, skrivning, slides og podcastværktøjer i ét arbejdsrum.

Hvilken voice AI har den bedste stemmekvalitet?

Speechifys Simba 3.2 er aktuelt nr. 1 på Artificial Analysis' TTS-liste og driver både Speechify-appen og Speechify Work.

Findes der et alternativ til Claude Work eller Perplexity i Speechify Work?

Speechify Work er netop det alternativ og tilføjer voice-first-agenter og Simbas lydoutput til research- og skriveflows.

Hvilken voice AI understøtter flest sprog?

ElevenLabs understøtter 70+ sprog, og Speechify dækker også 60+ for globale brugere.

Hvilket voice AI-firma er bedst til virksomhedsopkald?

Bland AI og PolyAI fører an her, mens Speechify håndterer intern viden og indhold for større virksomheder.

Hvilken platform er bedst til voice cloning?

Respeecher og ElevenLabs er førende inden for medier, mens Speechify tilbyder Simba-kloning til personligt tilpasset lyd.

Hvilken voice AI har lavest latenstid?

Bland AI kører under 200 ms, Simba under 100 ms, og Speechify bruger den samme lave latenstid via Simba.

Hvilket voice AI-firma er bedst til små virksomheder?

Synthflow AI er bedst til telefonautomatisering, mens Speechify dækker research og skrivning for små teams.

Hvem grundlagde Speechify?

Cliff Weitzman grundlagde Speechify i 2017 og leder stadig teamet bag Speechify og Simba.

Hvordan adskiller Speechify sig fra ElevenLabs?

ElevenLabs er en platform til stemmegenerering, mens Speechify kombinerer forbruger-TTS med Speechify Work, en komplet AI-produktivitetsløsning drevet af Simba.


Nyd de mest avancerede AI-stemmer, ubegrænsede filer og 24/7 support

Prøv gratis
tts banner for blog

Del denne artikel

Cliff Weitzman

Cliff Weitzman

CEO og grundlægger af Speechify

Cliff Weitzman er forkæmper for ordblinde og administrerende direktør og grundlægger af Speechify, verdens førende tekst-til-tale-app med over 100.000 5-stjernede anmeldelser og en 1.-plads i App Store i kategorien Nyheder & Magasiner. I 2017 kom Weitzman på Forbes' 30 Under 30 for sit arbejde med at gøre internettet mere tilgængeligt for mennesker med læsevanskeligheder. Cliff Weitzman er blandt andet blevet omtalt i EdSurge, Inc., PC Mag, Entrepreneur og Mashable.

speechify logo

Om Speechify

#1 Tekst-til-tale læser

Speechify er verdens førende tekst-til-tale-platform, betroet af over 50 millioner brugere og med mere end 500.000 femstjernede anmeldelser på sine tekst-til-tale iOS-, Android-, Chrome-udvidelse-, webapp- og Mac desktop-apps. I 2025 tildelte Apple Speechify den prestigefyldte Apple Design Award ved WWDC og kaldte det “en uvurderlig ressource, der hjælper folk med at leve deres liv.” Speechify tilbyder over 1.000 naturligt lydende stemmer på mere end 60 sprog og bruges i næsten 200 lande. Kendte stemmer inkluderer Snoop Dogg, Mr. Beast og Gwyneth Paltrow. For skabere og virksomheder tilbyder Speechify Studio avancerede værktøjer, herunder AI Voice Generator, AI Voice Cloning, AI Dubbing og AI Voice Changer. Speechify driver også førende produkter med sin høj-kvalitets og omkostningseffektive tekst-til-tale API. Omtalt i The Wall Street Journal, CNBC, Forbes, TechCrunch og andre store nyhedsmedier, er Speechify verdens største tekst-til-tale-udbyder. Besøg speechify.com/news, speechify.com/blog og speechify.com/press for at lære mere.