Audio AI ÚTMUTATÓ

Szövegnormalizálás a beszédhez

A szövegnormalizálás az a front-end lépés, amely átírja a nyers írott szöveget teljesen kimondott szavakká, mielőtt a beszédrendszer kimondaná.

2 perc olvasásUtoljára frissítve

Áttekintés

It is what turns '$5' into 'five dollars' and '12/5/2024' into a spoken date, and getting it wrong is one of the most jarring TTS failures.

Mély merülés

Az írott szöveg tele van nem szabványos szavakkal: számokkal, pénznemekkel, dátumokkal, időpontokkal, rövidítésekkel, URL-ekkel és szimbólumokkal, amelyeket senki sem ejt ki szó szerint. A szövegnormalizálás (néha TN front-endnek is nevezik) ezeket verbalizált formájukba terjeszti ki, így a downstream modell tudja, mit mondjon ki – az „5 dollárból” „öt dollár” lesz, a „Dr. a szövegkörnyezettől függően „orvos” vagy „hajtás”, az „IV” pedig „négy”, „intravénás” vagy „I-V” betűk lehetnek. A hagyományos rendszerek kézzel írott szabályokat és súlyozott véges állapotú jelátalakítókat (WFST) használnak, amelyek megbízhatóak és auditálhatók. Az újabb megközelítések neurális szekvencia-szekvencia modelleket használnak, de a tiszta neurális TN veszélyes hibákat produkálhat (rossz számot mond), ezért a termelési rendszerek gyakran használnak hibrid kialakításokat szabályokkal védőkorlátként. A kontextusérzékenység a legnehezebb rész: ugyanaz a token máshogyan verbalizál a környezetétől függően.

Technikai betekintés

A klasszikus normalizálás először szemiotikai osztályba sorolja és osztályozza az egyes tokeneket (bíboros, decimális, dátum, pénz, mérték, rövidítés), majd egy osztályspecifikus verbalizálót alkalmaz, amelyet gyakran súlyozott véges állapotú átalakítóként építenek fel, amely gyors és teljes mértékben ellenőrizhető. A kétértelmű tokenek egyértelművé teszik a helyi kontextus és a beszédrész jelzéseit. A neurális és hibrid rendszerek szöveg-szöveg átírásként fogalmazzák meg, de korlátozzák a kimeneteket – például a nyelvtan lefedését vagy a „címkézést, majd kibontást” –, hogy megakadályozzák az olyan elfogadhatatlan hibákat, mint egy év telefonszámként való kiolvasása.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A szövegnormalizálás jövője a beszédhez

A normalizálás a neurális és szabályhibridek felé irányul, amelyek megőrzik a véges állapotú nyelvtanok biztonságát, miközben tanult modelleket használnak a kontextus feloldására, valamint nagy nyelvi modelleket, amelyek zűrös, valós szöveget és sok nyelvet kezelnek egyszerre. A kutatás a „helyreállíthatatlan” hibák kiküszöbölésére és a többnyelvű TN-re összpontosít, ahol a szám-, dátum- és pénznemkonvenció jelentősen eltér. Mivel a végponttól végpontig terjedő TTS több front-end funkciót nyel el, a normalizálásra számítani kell, hogy továbbra is ellenőrizhető, auditálható szakasz maradjon, éppen azért, mert az itt elkövetett hibák annyira észrevehetők és költségesek.

Valós megvalósítás

„1250,50 dollár” hangosan felolvasása „ezerkétszázötven dollár és ötven cent” néven egy banki hangsegédben.

A rövidítések kiterjesztése, így „St. A navigációs üzenetekben a kontextustól függően „utcaként” vagy „szentként” beszélik.

A dátumok, időpontok és telefonszámok helyes verbalizálása a naptár- és emlékeztetőalkalmazásokban.

Szimbólumok és mértékegységek, például „5 km” vagy „%” átalakítása kimondott szavakká képernyőolvasók és kisegítő lehetőségek számára.

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Text Normalization for Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Text Normalization for Speech?

A szövegnormalizálás az a front-end lépés, amely átírja a nyers írott szöveget teljesen kimondott szavakká, mielőtt a beszédrendszer kimondaná. Ez az, ami „5 dollárból” „öt dollárt”, a „2024. 12. 05.”-t pedig kimondott randevúvá változtat, és a félreértés az egyik legszörnyűbb TTS-kudarc.

Mit jelent elsősorban a szövegnormalizálás a beszédre?

A normalizálás a szintézis előtt kibővíti a nem szabványos tokeneket, például a számokat, dátumokat és rövidítéseket verbalizált beszélt formájukra.

Hogyan kell egy jó rendszernek normalizálnia az „5 dollárt” a beszédért?

A pénznem megköveteli a szimbólum átrendezését és verbalizálását, ezért az „5 dollárt” „öt dollárnak” mondják, nem pedig szó szerint balról jobbra.

Miért normalizálja az olyan tokent, mint a „Dr. vagy "IV" trükkös?

– Dr. lehet „orvos” vagy „hajtás”, a „IV” pedig „négy”, „intravénás” vagy a betűk – a kontextus határozza meg a helyes verbalizációt.

Milyen hagyományos technológiát használnak széles körben megbízható, auditálható normalizálási szabályok létrehozására?

A WFST-k kézzel készített nyelvtanokat kódolnak, amelyek gyorsak és teljes mértékben ellenőrizhetők, így régóta választották az éles TN-hez.

Miért kerülik gyakran a termelési rendszerek a tiszta neurális szövegnormalizálást?

A kötetlen neurális TN magabiztos, de veszélyesen hibás kimeneteket produkálhat (pl. rossz ábra), így a szabályok védőkorlátként működnek a hibrid rendszerekben.