Tekst-til-tale (TTS) og talesyntese kan virke som helt ny teknologi, men de har faktisk en lang og spennende historie som strekker seg flere hundre år tilbake.
Fra de tidligste forsøkene på å etterligne menneskelig tale med mekaniske innretninger til dagens banebrytende kunstige intelligens og dype læring, har utviklingen av tekst-til-tale vært en fascinerende reise.
I denne artikkelen dykker vi ned i historien til tekst-til-tale og talesyntese, og ser nærmere på de spennende mulighetene som venter.
Tekst-til-tale og talesyntese: fra de første forsøkene til dagens bruk
1700- og 1800-tallet
Historien om tekst-til-tale og talesyntese kan spores tilbake til 1700- og 1800-tallet. I denne perioden ble det gjort flere tidlige forsøk på talesyntese, alle basert på mekaniske apparater. På 1770-tallet utviklet den ungarske oppfinneren Wolfgang von Kempelen en mekanisk innretning kalt den akustisk-mekaniske talemaskinen, utformet for å etterligne menneskets stemmeorganer. Denne analoge maskinen brukte belg, fløyter og rør for å lage vokal- og konsonantlyder.
Mot slutten av 1700-tallet utviklet den engelske fysikeren Charles Wheatstone en mer mekanisk versjon av Kempelens talemaskin, som han kalte «speaking machine». Apparatet kunne gjenskape lydene fra ulike musikkinstrumenter. Selv om Wheatstones maskin ikke uttrykkelig var laget for talesyntese, styrket den ideen om å bruke mekaniske innretninger til å frambringe lyd.
På 1800-tallet ble det utviklet flere andre maskiner, blant annet Fabers «kunstige tale»-maskin. Disse apparatene brukte en kombinasjon av mekaniske og pneumatiske systemer for å frambringe tale.
Tidlig 1900-tall og den første helelektriske talesyntesen
På begynnelsen av 1900-tallet ble talesyntesen mer avansert med oppfinnelsen av det første helelektriske talesyntesesystemet – vokoderen til Homer Dudley. Systemet ble utviklet ved Bell Laboratories (Bell Labs) i New Jersey.
Dudleys vokoder brukte en rekke resonatorer og filtre for å skape syntetisk tale. Vokoderen, kalt Voder, ble presentert under verdensutstillingen i Flushing Meadows i New York i 1939–1940. Maskinen ble styrt med tastatur og fotpedaler for å frambringe tale.
Fra tidlig 1950-tall til slutten av 1970-tallet – syntesizernes framvekst
I 1951 ble Dudleys arbeid videreført i utviklingen av Pattern Playback av Dr. Franklin S. Cooper ved Haskins Laboratories. Systemet analyserte et innspilt lydsignal, som et ord eller en setning, og brøt det ned i lydbølger eller «spektrogrammønstre». Disse mønstrene ble lagret på magnetbånd og deretter spilt av som syntetisk lyd.
I 1976 ble det første kommersielt vellykkede tekst-til-tale-systemet lansert med Kurzweil Reading Machine. Det brukte en teknikk kalt konkatenativ syntese, der forhåndsinnspilte fonemer og ord ble satt sammen for å lage syntetisk tale. Enheten ble opprinnelig utviklet for personer med funksjonsnedsettelser, men ble raskt populær som lesehjelpemiddel.
Fra 1978 begynte Texas Instruments å utvikle en talesyntesebrikke som kunne brukes i videospill og andre dataprogrammer. Brikken benyttet konkatenativ syntese, som kombinerte taleopptak, såkalte difoner, for å gi mer menneskelignende tale. Teknologien ble senere brukt i DECtalk, et tekst-til-tale-system som leverte syntetisk tale av høy kvalitet til brukere med funksjonsnedsettelser.
Moderne tekst-til-tale-systemer
En av de viktigste innovasjonene de siste årene er bruken av nevrale nettverk for å generere syntetisk tale. Selskaper som Google og Microsoft har utviklet avanserte TTS-systemer som bruker dyp læring til å analysere store datasett med menneskestemmer og skape et naturlig og autentisk taleuttrykk.
En annen viktig utvikling innen TTS som hjelpemiddel har vært bruken av unit selection og konkatenativ syntese. Disse metodene gir mer realistisk tale ved å kombinere små enheter av forhåndsinnspilt lyd, som difoner eller hele ord, til nye setninger. Slike teknikker brukes i kjente TTS-apper som Speechify, Apples Siri og Amazons Alexa, i tillegg til eldre løsninger som IBM ViaVoice.
Taleteknologi for talegjenkjenning har også gjort store fremskritt de siste årene, noe som har gjort det mulig å utvikle mer avanserte TTS-systemer. Ved å bruke talegjenkjenningsalgoritmer som transkriberer ekte tale til tekst, kan TTS-systemer gi mer naturlige overganger i syntetisk tale.
I senere tid har vi også sett at TTS-systemer i større grad tar i bruk prosodi og intonasjon, noe som gir mer naturlig tale med riktige pauser, betoning og tonefall. Prosodi er spesielt viktig i språk som engelsk, der trykk og intonasjon har stor betydning for meningsinnholdet.
Dyp læring og veien videre: framtidens teknologi
Framtiden for TTS-teknologi er både spennende og lovende. Med framveksten av kunstig intelligens og dyp læring kan vi forvente enda mer naturtro talegjengivelse som fanger opp menneskestemmens finstemte nyanser.
Et viktig område blir utviklingen av virtuelle assistenter og chatboter. Disse systemene blir stadig mer samtalebaserte, og brukerne vil kunne samhandle med dem på en naturlig måte.
Vi kan også forvente fremskritt innen fonetisk transkripsjon, også kjent som tekst-til-fonem-konvertering. Etter hvert som maskiner blir bedre til å forstå og tolke menneskelig tale, vil nøyaktigheten og effektiviteten i tale-til-tekst-systemer fortsette å øke.
Til slutt vil tekst-til-tale-teknologi bli mer tilgjengelig og bedre integrert i hverdagen. Etter hvert som flere enheter kobles til tingenes internett, kan vi styre dem med stemmen og gjøre livet enklere og mer effektivt.
Bli med på tekst-til-tale-revolusjonen med Speechify
Hvis du er på jakt etter en kraftig tekst-til-tale-tjeneste som gir naturlig opplesning av høy kvalitet, bør du prøve Speechify.
Med avansert formantsyntese lager Speechify realistiske og naturlig klingende stemmer – langt unna de robotaktige stemmene fra tidligere. Selv anerkjente forskere og forfattere, som Stephen Hawking – som selv brukte tekst-til-tale-teknologi – ville blitt imponert over hva Speechify kan levere.
Speechify er enkelt å bruke – bare besøk den offisielle nettsiden eller last ned mobilappen og skriv inn teksten du vil få lest opp. Velg deretter en stemme, juster hastighet og toneleie etter behov – og voilà! Speechify leser teksten klart og naturlig, perfekt for e-læringsmoduler, forklaringsvideoer, podkaster og presentasjoner. Du kan også velge blant mange naturlige AI-stemmer til YouTube-videoer og annet innhold i sosiale medier.
Ikke nøye deg med middelmådige TTS-tjenester – prøv Speechify i dag og opplev framtiden for tekst-til-tale-teknologi.
FAQ
Hvem utviklet verdens første talesyntesizer?
Homer Dudley utviklet verdens første talesyntesizer tidlig på 1930-tallet ved Bell Laboratories i New Jersey.
Hva er formålet med talesyntese?
Formålet med talesyntese er å generere kunstig tale fra tekst ved hjelp av språkteknologi og grunnleggende frekvensanalyse.
Hvilke fire bruksområder har TTS?
TTS kan brukes til tilgjengelighet, underholdning, språklæring og automatisering av stemmebaserte tjenester.
Hva er noen fordeler med tekst-til-tale?
Tekst-til-tale kan styrke tilgjengeligheten, forbedre læring og øke produktiviteten ved at brukeren får skriftlig innhold lest opp.
Hva har vært det mest overraskende øyeblikket i utviklingen av tekst-til-tale?
Et av de mest overraskende øyeblikkene var oppfinnelsen av Charles Wheatstones mekaniske talesyntesizer.

