Skip to main content
  1. Pagrindinis
  2. TTS
  3. Kokia yra teksto į kalbą ir balso sintezės istorija?
Paskelbta •TTS

Kokia yra teksto į kalbą ir balso sintezės istorija?

Cliff Weitzman

„Speechify“ generalinis direktorius / įkūrėjas

Apple2025 m. Apple dizaino apdovanojimas
50 mln.+ vartotojų

Teksto į kalbą (TTS) ir balso sintezės technologijos gali atrodyti visai naujos, tačiau jų istorija siekia net kelis šimtmečius.

Nuo ankstyvųjų mėginimų atkartoti žmogaus kalbą mechaniniais įrenginiais iki šiuolaikinių dirbtinio intelekto ir giluminio mokymosi modelių – TTS raida yra įspūdinga kelionė.

Šiame straipsnyje apžvelgsime teksto į kalbą ir balso sintezės istoriją bei aptarsime įdomias ateities galimybes.

Teksto į kalbą ir balso sintezė: nuo ankstyvosios raidos iki šiuolaikinio pritaikymo

XVIII–XIX a.

Teksto į kalbą ir balso sintezės istorija prasideda XVIII–XIX amžiuje. Šiuo laikotarpiu buvo atlikti pirmieji bandymai sukurti kalbos sintezę naudojant mechaninius įrenginius. 1770-aisiais vengrų išradėjas Wolfgangas von Kempelenas sukūrė akustinį-mechaninį kalbos aparatą, skirtą imituoti žmogaus balso taką. Šis analoginis įrenginys naudojo dumples, liežuvėlius ir vamzdžius balsiams bei priebalsiams generuoti.

XVIII a. pabaigoje anglų fizikas Charlesas Wheatstone'as sukūrė mechaninę Kempeleno kalbos aparato versiją, kurią pavadino „kalbančiu įrenginiu“. Šis aparatas galėjo atkurti įvairių muzikos instrumentų garsus. Nors Wheatstone'o prietaisas nebuvo skirtas tiesiogiai kalbos sintezei, jis sustiprino idėją, kad mechanika gali būti naudojama garsui kurti.

XIX a. buvo kuriami ir kiti įrenginiai, tarp jų – Fabero „dirbtinės kalbos“ mašina. Šie aparatai naudojo mechaninių ir pneumatinių sistemų derinį kalbos garsams išgauti.

Ankstyvasis XX a. ir pirmoji visiškai elektrinė kalbos sintezė

XX a. pradžioje kalbos sintezės technologijos tapo pažangesnės – buvo išrasta pirmoji visiškai elektrinė kalbos sintezės sistema – Homerio Dudley sukurtas vokoderis. Ši sistema buvo sukurta Bell laboratorijose (Bell Labs), Naujajame Džersyje.

Dudley vokoderis naudojo rezonatorių ir filtrų seriją sintetiniam balsui kurti. 1939–1940 m. per Pasaulinę parodą Niujorke demonstracijų metu ekspertai jį valdė klaviatūra ir pedalais. Įrenginys buvo vadinamas Voderiu.

1950–1970 m. – sintezatorių iškilimas

1951 m. Dudley darbai įkvėpė dr. Franklino S. Cooperio sukurtą Haskinso laboratorijų Pattern Playback sistemą. Ji analizavo įrašytą garsą (pvz., ištartą žodį ar frazę) ir suskaidė jį į sudėtines garso bangas arba „spektrografinius modelius“. Šie modeliai buvo įrašomi į magnetinę juostą ir atkuriami kaip sintezuota originalaus garso versija.

1976 m. buvo pristatyta pirmoji komerciškai sėkminga teksto į kalbą sistema – Kurzweil Reading Machine. Ji veikė jungiamojo sintezavimo principu: įrašyti fonemai ir žodžiai buvo jungiami kuriant sintetinę kalbą. Įrenginys iš pradžių buvo skirtas žmonėms su negalia, tačiau greitai išpopuliarėjo kaip skaitymo pagalbos priemonė.

Nuo 1978 m. Texas Instruments pradėjo kurti kalbos sintezės mikroschemą, skirtą vaizdo žaidimams ir kitoms kompiuterinėms programoms. Ši mikroschema naudojo jungiamąjį sintezavimą: įrašyti garsai arba difonai buvo jungiami kuriant žmogaus balsą primenančią kalbą. Vėliau ši technologija buvo panaudota DECtalk sistemoje, kuri suteikė kokybišką sintetinę kalbą žmonėms su negalia.

Šiuolaikinės teksto į kalbą sistemos

Pagrindinė pastarųjų metų naujovė – neuroninių tinklų pritaikymas sintetinei kalbai generuoti. Tokios įmonės kaip Google ir Microsoft sukūrė pažangias TTS sistemas, kurios, pasitelkdamos giluminio mokymosi algoritmus, analizuoja didžiulius žmonių balsų duomenų rinkinius ir generuoja natūraliai skambantį garsą.

Kita svarbi TTS raidos kryptis – jungiamasis sintezavimas ir vienetų parinkimo sintezė, leidžiantys sukurti tikroviškesnę kalbą, derinant mažus iš anksto įrašytus kalbos vienetus (difonus ar ištisus žodžius) į naujus sakinius. Šie metodai naudojami populiariose TTS programose, tokiose kaip Speechify, Apple Siri ar Amazon Alexa, taip pat senesniuose įrankiuose, pavyzdžiui, IBM ViaVoice.

Kalbos atpažinimo technologijos per pastaruosius metus taip pat smarkiai patobulėjo, todėl TTS sistemos tapo dar pažangesnės. Naudojant kalbos atpažinimo algoritmus žmogaus kalbai perrašyti į tekstą, TTS sprendimai gali užtikrinti sklandesnį perėjimą į sintezuotą kalbą.

Pastaraisiais metais taip pat pradėtas taikyti prozodijos ir intonacijos modeliavimas, leidžiantis sintezuotai kalbai skambėti natūraliau – su tinkamomis pauzėmis, kirčiu ir intonacija. Prozodija ypač svarbi tokioms kalboms kaip anglų, kur intonacija ir kirčiavimas gali pakeisti sakinio prasmę.

Giluminis mokymasis ir ateities technologijos

TTS technologijų ateitis žada daug galimybių. Plintant dirbtiniam intelektui ir giluminiam mokymuisi, galime tikėtis dar natūraliau skambančios sintezuotos kalbos, perteikiančios žmogaus kalbos niuansus.

Viena didžiausių tokių inovacijų taikymo sričių – virtualieji asistentai ir pokalbių robotai. Šios sistemos taps dar labiau pokalbinės, o naudotojai galės su jomis bendrauti natūraliau.

Taip pat galime tikėtis proveržių fonetinės transkripcijos srityje, dar vadinamoje teksto vertimu į fonemas. Tobulėjant kalbos atpažinimui, sintezuotos kalbos tikslumas ir našumas tik gerės.

Galiausiai tikėtina, kad teksto į kalbą technologijos taps dar prieinamesnės ir bus dar plačiau integruotos į kasdienį gyvenimą. Daugėjant su Daiktų internetu susietų įrenginių, galėsime juos valdyti balsu realiuoju laiku, taip palengvindami ir paspartindami kasdienes užduotis.

Prisijunkite prie teksto į kalbą revoliucijos su Speechify

Ieškote galingos teksto į kalbą paslaugos, galinčios kurti natūralų, kokybišką įgarsinimą? Rinkitės Speechify.

Naudodama pažangią formantų sintezės technologiją, Speechify kuria tikroviškus, natūraliai skambančius balsus, visiškai nepanašius į ankstesnius „robotinius“ balsus. Net tokie žymūs mąstytojai kaip Stephenas Hawkingas, naudojęs teksto į kalbą technologiją, įvertintų Speechify galimybes.

Naudotis Speechify paprasta – tiesiog apsilankykite oficialioje svetainėje arba atsisiųskite mobiliąją programėlę ir įveskite norimą tekstą. Pasirinkite tinkamą balsą, sureguliuokite kalbėjimo greitį ar toną – ir viskas! Speechify sukurs puikų, natūraliai skambantį įgarsinimą, tinkantį e. mokymams, paaiškinamiesiems vaizdo įrašams, tinklalaidėms ar prezentacijoms. Taip pat galima rinktis iš plataus natūraliai skambančių AI balsų asortimento „YouTube“ ar kitam turiniui.

Nesitenkinkite prastesnėmis TTS paslaugomis – išbandykite Speechify jau šiandien ir susipažinkite su teksto į kalbą technologijų ateitimi.

DUK

Kas sukūrė pirmąjį pasaulyje kalbos sintezatorių?

Pirmąjį pasaulyje kalbos sintezatorių XX a. 4-ajame dešimtmetyje Bell laboratorijose sukūrė Homeris Dudley.

Kokia yra kalbos sintezės paskirtis?

Kalbos sintezė iš teksto sukuria dirbtinę kalbą, pasitelkdama kalbos apdorojimą ir pagrindinių dažnių analizę.

Kokiais keturiais būdais galima naudoti TTS?

TTS galima naudoti prieinamumui, pramogoms, kalbų mokymuisi ir balsu valdomų paslaugų automatizavimui.

Kokie yra pagrindiniai teksto į kalbą privalumai?

Teksto į kalbą didina prieinamumą, gerina mokymąsi ir produktyvumą, nes leidžia tekstinę informaciją vartoti garsiniu formatu.

Kuris momentas teksto į kalbą raidoje buvo netikėčiausias?

Vienas netikėčiausių momentų buvo Charleso Wheatstone'o sukurto mechaninio kalbos sintezatoriaus išradimas.

Mėgaukitės pažangiausiais AI balsais, neribotu failų kiekiu ir 24/7 pagalba

Išbandyti nemokamai
tts banner for blog

Pasidalykite šiuo straipsniu

Cliff Weitzman

„Speechify“ generalinis direktorius / įkūrėjas

Cliff Weitzman – disleksijos šalininkas, „Speechify“ vadovas ir įkūrėjas. „Speechify“ – pirmaujanti pasaulyje teksto į kalbą programa, turinti daugiau nei 100 000 penkių žvaigždučių įvertinimų ir lyderiaujanti „App Store“ naujienų ir žurnalų kategorijoje. 2017 m. „Forbes“ jį įtraukė į „30 iki 30“ sąrašą už indėlį didinant interneto prieinamumą žmonėms su mokymosi sutrikimais. Apie jį rašė „EdSurge“, „Inc.“, „PC Mag“, „Entrepreneur“, „Mashable“ ir kt.

Speechify

Apie Speechify

#1 teksto į kalbą skaitytuvas

Speechify yra pirmaujanti pasaulyje teksto į kalbą platforma, kuria pasitiki daugiau nei 50 milijonų vartotojų ir kurią pagrindžia daugiau nei 500 000 penkių žvaigždučių atsiliepimų skirtingose teksto į kalbą iOS, Android, Chrome plėtinio, internetinės programėlės ir Mac darbalaukio programose. 2025 m. Apple apdovanojo Speechify prestižiniu Apple dizaino apdovanojimu per WWDC, pavadindama jį „esminiu ištekliumi, padedančiu žmonėms gyventi visavertį gyvenimą“. Speechify siūlo daugiau nei 1 000 natūraliai skambančių balsų daugiau nei 60 kalbų ir naudojamas beveik 200 šalių. Tarp įžymybių balsų – Snoop Dogg ir Gwyneth Paltrow. Kūrėjams ir verslui Speechify Studio suteikia išplėstinius įrankius, tarp kurių yra AI balso generatorius, AI balso klonavimas, AI dubliavimas ir AI balso keitiklis. Speechify taip pat aprūpina pažangius produktus kokybišku ir ekonomišku teksto į kalbą API. Apie mus rašė The Wall Street Journal, CNBC, Forbes, TechCrunch ir kiti didieji naujienų portalai, todėl Speechify yra didžiausias teksto į kalbą teikėjas pasaulyje. Apsilankykite speechify.com/news, speechify.com/blog ir speechify.com/press ir sužinokite daugiau.