Text-to-speech (TTS) en spraaksynthese lijken misschien moderne technologieën, maar kennen een rijke geschiedenis die eeuwen teruggaat.
Van de eerste pogingen om menselijke spraak na te bootsen met mechanische apparaten tot de huidige geavanceerde kunstmatige intelligentie en deep-learningmodellen: de ontwikkeling van TTS is een fascinerende reis geweest.
In dit artikel duiken we in de geschiedenis van text-to-speech en spraaksynthese en bekijken we de veelbelovende mogelijkheden voor de toekomst.
Text-to-speech en spraaksynthese: van de eerste ontwikkelingen tot vandaag
18e en 19e eeuw
De geschiedenis van text-to-speech en spraaksynthese gaat terug tot de 18e en 19e eeuw. In die periode werden allerlei vroege pogingen gedaan om spraak te synthetiseren met mechanische apparaten. In de jaren 1770 ontwikkelde Wolfgang von Kempelen, een Hongaarse uitvinder, een mechanisch apparaat dat het menselijke spraakkanaal nabootste. Dit analoge toestel gebruikte blaasbalgen, rieten en pijpen om klinker- en medeklinkergeluiden voort te brengen.
Aan het einde van de 18e eeuw ontwierp de Engelse natuurkundige Charles Wheatstone een verder uitgewerkte mechanische versie van Kempelens apparaat, die hij de "sprekende machine" noemde. Het apparaat kon de klanken van verschillende muziekinstrumenten nabootsen. Hoewel Wheatstones uitvinding niet specifiek bedoeld was voor spraaksynthese, versterkte die wel het idee dat geluiden mechanisch konden worden opgewekt.
In de 19e eeuw werden nog diverse andere apparaten ontwikkeld, waaronder Fabers machine voor "kunstmatige spraak". Die combineerde mechanische en pneumatische systemen om spraakklanken te genereren.
Begin 20e eeuw en de eerste volledig elektrische spraaksynthese
Begin 20e eeuw werd spraaksynthese geavanceerder met de uitvinding van het eerste volledig elektrische spraaksynthesesysteem: de vocoder van Homer Dudley. Dit systeem werd ontwikkeld bij Bell Laboratories (Bell Labs) in New Jersey.
Dudleys vocoder gebruikte resonatoren en filters om synthetische spraak te creëren. Het apparaat, de Voder, werd tijdens de Wereldtentoonstelling van 1939-1940 in Flushing Meadows (New York) gedemonstreerd. Bedieners gebruikten een toetsenbord en voetpedalen om spraak te genereren.
Begin jaren 50 tot eind jaren 70: de opkomst van synthesizers
In 1951 leidde Dudleys werk tot de ontwikkeling van Pattern Playback door dr. Franklin S. Cooper bij Haskins Laboratories. Dit systeem analyseerde opgenomen geluiden, bijvoorbeeld een gesproken woord, en splitste die op in geluidsgolven of "spectrografische patronen". Deze patronen werden op magneetband opgeslagen en als een synthetische versie van het origineel afgespeeld.
In 1976 werd het eerste commercieel succesvolle text-to-speech-systeem geïntroduceerd door Kurzweil Reading Machine. Het systeem maakte gebruik van concatenatieve synthese, waarbij vooraf opgenomen fonemen en woorden werden gecombineerd tot synthetische spraak. Het apparaat was in eerste instantie bedoeld voor mensen met een beperking, maar werd al snel populair als leeshulpmiddel.
Vanaf 1978 begon Texas Instruments met de ontwikkeling van een spraaksynthesechip voor videogames en computertoepassingen. De chip gebruikte concatenatieve synthese van opgenomen spraakfragmenten (difonen) om mensachtig klinkende spraak te produceren. Deze technologie werd later toegepast in DECtalk, een text-to-speech-systeem dat hoogwaardige synthetische spraak bood voor mensen met een beperking.
Moderne text-to-speech-systemen
Een van de belangrijkste innovaties van de afgelopen jaren is het gebruik van neurale netwerken voor het genereren van synthetische spraak. Bedrijven als Google en Microsoft ontwikkelden hoogwaardige TTS-systemen die met deep-learningalgoritmen grote datasets van menselijke stemmen analyseren en natuurlijk klinkende spraak produceren.
Een andere grote ontwikkeling in TTS als ondersteunende technologie is het gebruik van unit selection en concatenatieve synthese. Deze methoden maken realistischer spraak mogelijk door kleine eenheden opgenomen spraak (zoals difonen of hele woorden) te combineren tot nieuwe zinnen. Dit werd toegepast in populaire TTS-apps als Speechify, Apple's Siri en Amazon's Alexa, maar ook in oudere tools zoals IBM ViaVoice.
Ook spraakherkenningstechnologie is de afgelopen jaren sterk verbeterd, wat de ontwikkeling van geavanceerdere TTS-systemen mogelijk maakte. Door spraakherkenningsalgoritmen te gebruiken om menselijke spraak naar tekst om te zetten, kunnen TTS-systemen natuurlijkere overgangen realiseren in gesynthetiseerde spraak.
Onlangs zijn ook prosodie en intonatie geïntegreerd. Daardoor klinkt synthetische spraak natuurlijker, met passende pauzes, nadruk en toonhoogte. Prosodie is vooral belangrijk in talen als Engels, waar klemtoon en intonatie grote invloed hebben op de betekenis.
Deep learning en verder: de toekomst van de technologie
De toekomst van TTS-technologie is veelbelovend. Dankzij kunstmatige intelligentie en deep learning zullen spraaksystemen nog natuurlijker klinken en de nuances van menselijke spraak nog beter benaderen.
Dit zal vooral van grote waarde zijn voor de ontwikkeling van virtuele assistenten en chatbots. Deze systemen worden steeds meer gericht op natuurlijke gesprekken, waardoor gebruikers er op een vanzelfsprekende manier mee kunnen communiceren.
Bovendien wordt vooruitgang geboekt op het gebied van fonetische transcriptie, ook wel text-to-phoneme-conversie genoemd. Naarmate machines menselijke spraak beter herkennen en interpreteren, zullen de nauwkeurigheid en efficiëntie van spraak-naar-tekstsystemen verder toenemen.
Tot slot zal text-to-speech-technologie steeds toegankelijker worden en vaker deel uitmaken van ons dagelijks leven. Met de groei van het Internet of Things zullen we apparaten in realtime met onze stem kunnen bedienen, wat zorgt voor meer gemak en efficiëntie.
Sluit je aan bij de text-to-speech-revolutie van Speechify
Zoek je een krachtige text-to-speech-dienst die natuurgetrouwe stemmen van hoge kwaliteit produceert? Kies dan voor Speechify.
Met geavanceerde formantsynthese creëert Speechify realistische, natuurlijk klinkende stemmen die niet meer doen denken aan ouderwetse robotstemmen. Zelfs bekende auteurs als Stephen Hawking — die text-to-speech-technologie gebruikte — zouden onder de indruk zijn van de mogelijkheden van Speechify.
Speechify is eenvoudig te gebruiken: bezoek de officiële website of download de mobiele app en voer je tekst in. Kies vervolgens een stem, pas zo nodig de snelheid en toonhoogte aan, en klaar. Speechify maakt uitstekende, natuurlijk klinkende voice-overs voor e-learningmodules, uitlegvideo's, podcasts en presentaties. Je kunt ook kiezen uit een ruim aanbod natuurlijke AI-stemmen voor YouTube-video's en content voor sociale media.
Neem geen genoegen met mindere TTS-diensten — probeer Speechify vandaag nog en ervaar de toekomst van text-to-speech-technologie.
FAQ
Wie heeft de eerste spraaksynthesizer ter wereld ontwikkeld?
Homer Dudley ontwierp begin jaren 30 bij Bell Laboratories in New York de eerste spraaksynthesizer ter wereld.
Wat is het doel van spraaksynthese?
Het doel van spraaksynthese is om met taalverwerking en analyse van fundamentele frequenties kunstmatige spraak uit tekst te genereren.
Op welke vier manieren kan TTS worden gebruikt?
TTS kan worden ingezet voor toegankelijkheid, entertainment, taalonderwijs en de automatisering van gesproken diensten.
Wat zijn enkele voordelen van text-to-speech?
Text-to-speech bevordert toegankelijkheid, ondersteunt leren en verhoogt de productiviteit door geschreven inhoud als audio aan te bieden.
Wat was het meest verrassende moment tijdens de ontwikkeling van text-to-speech-synthese?
Een van de opvallendste momenten was de uitvinding van de mechanische spraaksynthesizer van Charles Wheatstone.

