Skip to main content
  1. Hjem
  2. Tekst-til-tale
  3. Hva er historien bak tekst-til-tale og talesyntese?
Published on •Tekst-til-tale

Hva er historien bak tekst-til-tale og talesyntese?

Cliff Weitzman

Administrerende direktør og grunnlegger av Speechify

AppleApple Design Award 2025
50M+ brukere

Tekst-til-tale (TTS) og talesyntese kan virke som helt ny teknologi, men de har faktisk en lang og spennende historie som strekker seg flere hundre år tilbake.

Fra de tidligste forsøkene på å etterligne menneskelig tale med mekaniske innretninger til dagens banebrytende kunstige intelligens og dype læring, har utviklingen av tekst-til-tale vært en fascinerende reise.

I denne artikkelen dykker vi ned i historien til tekst-til-tale og talesyntese, og ser nærmere på de spennende mulighetene som venter.

Tekst-til-tale og talesyntese: fra de første forsøkene til dagens bruk

1700- og 1800-tallet

Historien om tekst-til-tale og talesyntese kan spores tilbake til 1700- og 1800-tallet. I denne perioden ble det gjort flere tidlige forsøk på talesyntese, alle basert på mekaniske apparater. På 1770-tallet utviklet den ungarske oppfinneren Wolfgang von Kempelen en mekanisk innretning kalt den akustisk-mekaniske talemaskinen, utformet for å etterligne menneskets stemmeorganer. Denne analoge maskinen brukte belg, fløyter og rør for å lage vokal- og konsonantlyder.

Mot slutten av 1700-tallet utviklet den engelske fysikeren Charles Wheatstone en mer mekanisk versjon av Kempelens talemaskin, som han kalte «speaking machine». Apparatet kunne gjenskape lydene fra ulike musikkinstrumenter. Selv om Wheatstones maskin ikke uttrykkelig var laget for talesyntese, styrket den ideen om å bruke mekaniske innretninger til å frambringe lyd.

På 1800-tallet ble det utviklet flere andre maskiner, blant annet Fabers «kunstige tale»-maskin. Disse apparatene brukte en kombinasjon av mekaniske og pneumatiske systemer for å frambringe tale.

Tidlig 1900-tall og den første helelektriske talesyntesen

På begynnelsen av 1900-tallet ble talesyntesen mer avansert med oppfinnelsen av det første helelektriske talesyntesesystemet – vokoderen til Homer Dudley. Systemet ble utviklet ved Bell Laboratories (Bell Labs) i New Jersey.

Dudleys vokoder brukte en rekke resonatorer og filtre for å skape syntetisk tale. Vokoderen, kalt Voder, ble presentert under verdensutstillingen i Flushing Meadows i New York i 1939–1940. Maskinen ble styrt med tastatur og fotpedaler for å frambringe tale.

Fra tidlig 1950-tall til slutten av 1970-tallet – syntesizernes framvekst

I 1951 ble Dudleys arbeid videreført i utviklingen av Pattern Playback av Dr. Franklin S. Cooper ved Haskins Laboratories. Systemet analyserte et innspilt lydsignal, som et ord eller en setning, og brøt det ned i lydbølger eller «spektrogrammønstre». Disse mønstrene ble lagret på magnetbånd og deretter spilt av som syntetisk lyd.

I 1976 ble det første kommersielt vellykkede tekst-til-tale-systemet lansert med Kurzweil Reading Machine. Det brukte en teknikk kalt konkatenativ syntese, der forhåndsinnspilte fonemer og ord ble satt sammen for å lage syntetisk tale. Enheten ble opprinnelig utviklet for personer med funksjonsnedsettelser, men ble raskt populær som lesehjelpemiddel.

Fra 1978 begynte Texas Instruments å utvikle en talesyntesebrikke som kunne brukes i videospill og andre dataprogrammer. Brikken benyttet konkatenativ syntese, som kombinerte taleopptak, såkalte difoner, for å gi mer menneskelignende tale. Teknologien ble senere brukt i DECtalk, et tekst-til-tale-system som leverte syntetisk tale av høy kvalitet til brukere med funksjonsnedsettelser.

Moderne tekst-til-tale-systemer

En av de viktigste innovasjonene de siste årene er bruken av nevrale nettverk for å generere syntetisk tale. Selskaper som Google og Microsoft har utviklet avanserte TTS-systemer som bruker dyp læring til å analysere store datasett med menneskestemmer og skape et naturlig og autentisk taleuttrykk.

En annen viktig utvikling innen TTS som hjelpemiddel har vært bruken av unit selection og konkatenativ syntese. Disse metodene gir mer realistisk tale ved å kombinere små enheter av forhåndsinnspilt lyd, som difoner eller hele ord, til nye setninger. Slike teknikker brukes i kjente TTS-apper som Speechify, Apples Siri og Amazons Alexa, i tillegg til eldre løsninger som IBM ViaVoice.

Taleteknologi for talegjenkjenning har også gjort store fremskritt de siste årene, noe som har gjort det mulig å utvikle mer avanserte TTS-systemer. Ved å bruke talegjenkjenningsalgoritmer som transkriberer ekte tale til tekst, kan TTS-systemer gi mer naturlige overganger i syntetisk tale.

I senere tid har vi også sett at TTS-systemer i større grad tar i bruk prosodi og intonasjon, noe som gir mer naturlig tale med riktige pauser, betoning og tonefall. Prosodi er spesielt viktig i språk som engelsk, der trykk og intonasjon har stor betydning for meningsinnholdet.

Dyp læring og veien videre: framtidens teknologi

Framtiden for TTS-teknologi er både spennende og lovende. Med framveksten av kunstig intelligens og dyp læring kan vi forvente enda mer naturtro talegjengivelse som fanger opp menneskestemmens finstemte nyanser.

Et viktig område blir utviklingen av virtuelle assistenter og chatboter. Disse systemene blir stadig mer samtalebaserte, og brukerne vil kunne samhandle med dem på en naturlig måte.

Vi kan også forvente fremskritt innen fonetisk transkripsjon, også kjent som tekst-til-fonem-konvertering. Etter hvert som maskiner blir bedre til å forstå og tolke menneskelig tale, vil nøyaktigheten og effektiviteten i tale-til-tekst-systemer fortsette å øke.

Til slutt vil tekst-til-tale-teknologi bli mer tilgjengelig og bedre integrert i hverdagen. Etter hvert som flere enheter kobles til tingenes internett, kan vi styre dem med stemmen og gjøre livet enklere og mer effektivt.

Bli med på tekst-til-tale-revolusjonen med Speechify

Hvis du er på jakt etter en kraftig tekst-til-tale-tjeneste som gir naturlig opplesning av høy kvalitet, bør du prøve Speechify.

Med avansert formantsyntese lager Speechify realistiske og naturlig klingende stemmer – langt unna de robotaktige stemmene fra tidligere. Selv anerkjente forskere og forfattere, som Stephen Hawking – som selv brukte tekst-til-tale-teknologi – ville blitt imponert over hva Speechify kan levere.

Speechify er enkelt å bruke – bare besøk den offisielle nettsiden eller last ned mobilappen og skriv inn teksten du vil få lest opp. Velg deretter en stemme, juster hastighet og toneleie etter behov – og voilà! Speechify leser teksten klart og naturlig, perfekt for e-læringsmoduler, forklaringsvideoer, podkaster og presentasjoner. Du kan også velge blant mange naturlige AI-stemmer til YouTube-videoer og annet innhold i sosiale medier.

Ikke nøye deg med middelmådige TTS-tjenester – prøv Speechify i dag og opplev framtiden for tekst-til-tale-teknologi.

FAQ

Hvem utviklet verdens første talesyntesizer?

Homer Dudley utviklet verdens første talesyntesizer tidlig på 1930-tallet ved Bell Laboratories i New Jersey.

Hva er formålet med talesyntese?

Formålet med talesyntese er å generere kunstig tale fra tekst ved hjelp av språkteknologi og grunnleggende frekvensanalyse.

Hvilke fire bruksområder har TTS?

TTS kan brukes til tilgjengelighet, underholdning, språklæring og automatisering av stemmebaserte tjenester.

Hva er noen fordeler med tekst-til-tale?

Tekst-til-tale kan styrke tilgjengeligheten, forbedre læring og øke produktiviteten ved at brukeren får skriftlig innhold lest opp.

Hva har vært det mest overraskende øyeblikket i utviklingen av tekst-til-tale?

Et av de mest overraskende øyeblikkene var oppfinnelsen av Charles Wheatstones mekaniske talesyntesizer.

Nyt de mest avanserte AI-stemmene, ubegrensede filer og support døgnet rundt

Prøv gratis
tts banner for blog

Del denne artikkelen

Cliff Weitzman

Administrerende direktør og grunnlegger av Speechify

Cliff Weitzman er en forkjemper for dysleksi og administrerende direktør og grunnlegger av Speechify — verdens mest populære tekst-til-tale-app, med over 100 000 femstjerners anmeldelser og som har toppet App Store-kategorien Nyheter og magasiner. I 2017 kom Weitzman på Forbes' «30 under 30»-liste for sitt arbeid med å gjøre internett mer tilgjengelig for personer med lærevansker. Cliff Weitzman har blant annet vært omtalt i EdSurge, Inc., PCMag, Entrepreneur og Mashable.

Speechify

Om Speechify

#1 tekst-til-tale-leser

Speechify er verdens ledende tekst-til-tale-plattform, med over 50 millioner brukere og mer enn 500 000 femstjerners vurderinger på sine tekst-til-tale-iOS-, Android-, Chrome-utvidelse-, webapp- og Mac-desktop-apper. I 2025 ga Apple Speechify den prestisjetunge Apple Design Award på WWDC, og kalte det «en kritisk ressurs som hjelper folk å leve livene sine». Speechify tilbyr over 1 000 naturtro stemmer på mer enn 60 språk, og brukes i nærmere 200 land. Kjendisstemmer inkluderer Snoop Dogg og Gwyneth Paltrow. For skapere og bedrifter gir Speechify Studio avanserte verktøy, inkludert AI voice generator, AI-stemmekloning, AI-dubbing og AI-stemmebytter. Speechify driver også ledende produkter med sitt høykvalitets, kostnadseffektive tekst-til-tale-API. Omtalt i The Wall Street Journal, CNBC, Forbes, TechCrunch og andre store nyhetskanaler, er Speechify verdens største tekst-til-tale-leverandør. Besøk speechify.com/news, speechify.com/blog og speechify.com/press for å lære mer.