Újszerű térbeli-időbeli folyamatos jelnyelv-felismerés egy figyelmes többfunkciós hálózat segítségével (2)

Jun 01, 2023

3.5. Sorozattanulás

Szekvenciatanulás Miután megkaptuk a térbeli és időbeli jellemzők kivonó eredményeit egy fényes jellemző formájában, egy teljes mondatba kell rendeznünk őket. Ezért szekvencia-tanulást kell használnunk annak biztosítására, hogy a fényesség jó mondatot alkothasson. A jelenlegi kutatásban a legelterjedtebb módszer a kétirányú hosszú távú memória (Bi-LSTM) és a konnekcionista időbeli osztályozás (CTC) [17,23] a CTC segítségével megoldható problémák esetében, és számos újabb munka [17,23] javasolja. A CTC a CSLR teljes körű képzési folyamata.

cistanche extract powder

Cistanche kivonat por

Kattintson ide a Cistanche termékek megtekintéséhez

【Kérjen többet】 E-mail:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

A hosszú rövid távú memória (LSTM) [44] az ismétlődő neurális hálózat (RNN) egy változata, és széles körben használják a szekvencia modellezésben. Az LSTM kiválóan modellezi a hosszú távú függőséget; teljes bemeneti sorozatot képes feldolgozni, és belső állapotukat felhasználni az állapotátmenetek modellezésére. Azonban ezeknek az előremenő RNN-eknek az a hiányossága, hogy a rejtett állapotokat csak egyirányú irányból tanulják meg. Az RNN egy rejtett állapotot hoz létre az alábbi egyenlet szerint, miután bemenetként megkapta a jellemzősorozatot.

ht=RNN(ht−1,ot),

ahol ht a rejtett állapotot jelöli, ahol a kezdeti állapot h0 egy rögzített nulla vektor, t pedig az időlépés. Az RNN-t a térbeli jellemzők sorrendjének bemenete szerinti jelglosszák előrejelzésére használják.

Ráadásul az SL feladatok meglehetősen összetettek. Ezért nemcsak az egyirányú kontextusból kapott jellemzőkre van szüksége, hanem segítségre van szüksége a kétirányú információ használatához is, hogy megtanulja a mondat többi szava előtt és után megjelenő szavak előfordulását. Következésképpen a Bi-LSTM [45] segítségével megtanuljuk a képsorozatok összetett dinamikus függőségeit úgy, hogy azokat térbeli és időbeli reprezentációk segítségével fényes jellemzők sorozataivá alakítjuk át. A korábban elhangzott magyarázat szerint a Bi-LSTM módszer kétirányú munkát végezhet az LSTM módszerrel. Ez azt jelenti, hogy a Bi-LSTM módszer jobban képes osztályozni a szekvenciális adatokat. A kétirányú rejtett állapotokat használó Bi-LSTM számítása az LSTM ismételt számításainak is tekinthető, amelyeket elölről hátra, majd hátulról előre dolgoznak fel. Ezt követően minden egyes időlépés rejtett állapota egy teljesen összekapcsolt rétegen és egy softmax rétegen halad át [17].

cistanche powder

Cistanche por

= W(ht plusz b),

yt,j=e at,j ∑ke at,j ,

ahol b egy torzításvektor és y(t,j) a j címke valószínűségét jelenti a t időpontban. TSL feladatunkban a j címke a mondatból nyert szókincs. A gyakorlatban a Bi-LSTM jelentősen javítja a hálózat által elérhető információk mennyiségét, ami viszont javítja az algoritmusban elérhető információk kontextusát. Az információ tartalmazza annak ismeretét, hogy a mondatjellemző-szekvencia bemenetben melyik szó következik az aktuális keret után vagy előtt.

A Bi-LSTM minden egyes időlépéshez rejtett állapotokat küld kimenetként a CTC rétegnek. Mivel ennek a Bi-LSTM-nek az eredményei nem veszik figyelembe a fényesség elrendezését, a CTC-t használjuk a videoszekvencia-leképezés kezeléséhez o={ot} T 0 t=1 előjel előállításához. gloss szekvencia `={` i} IL =1 (L Kisebb vagy egyenlő, mint T) jobb elrendezéssel. A CTC-t számos területen használják, beleértve a kézírás-felismerést [46], a beszédfelismerést [47] és a jelnyelv-felismerést [17,23]. Ebben a tartományban pontozási függvényként használják a bemeneti és kimeneti szekvenciák összehangolása nélkül. A CSLR-ben a CTC olyan modulként ismert, amelyet olyan végpontok közötti feladatokhoz fejlesztettek ki, amelyek magukban foglalják az időbeli adatok szegmentálás nélküli osztályozását. A dinamikus programozás révén a CSLR meg tudja oldani az igazítási problémát egy üres címke (-) létrehozásával, amely lehetővé teszi a rendszer számára, hogy optimális eredményeket produkáljon olyan adatok megjelenítéséhez, amelyek nem rendelkeznek címkékkel (például epentézis adatok és nem gesztus adatok szegmensei). A CTC egy üres "-" címkét generál a V szókincs kiterjesztésére, ahol V=Vorigin ∪ {-}. Ennek az üres címkének az a célja, hogy ábrázolja az átmenetet, és jelezze egy üres gloss létezését, amely nem ad információt a tanulási folyamathoz, mivel π={πt} T 0 t{{20 }}, ahol πt ∈ V. Ennek eredményeként a CTC képes kezelni a kimeneti paramétereket a térbeli és időbeli jellemzők kivonóból, valamint a Bi-LSTM-et, mint igazítási modult az összes lehetséges útvonal valószínűségének összegzésével. Az összes π igazítási útvonalnak van egy valószínűsége, amely a következőképpen kapja meg a bemeneti szekvenciát [17]:

Cistanche deserticola experiment

Cistanche deserticola kísérlet

p(π| o) {{0}} T 0 ∏ t=1 p(πt|o)=T 0 ∏ t=1 yt, πt

A következő lépésben definiálunk egy több az egyhez leképezési műveletet B, amely eltávolítja az üres helyeket, és megkettőzi a szavakat az igazítási útvonalról. Például B (II-am- -a- -doctor)=I, am, a, doctor. Ennek eredményeként kiszámíthatjuk az l jelfényes sorozat feltételes valószínűségét a B-ből l-re leképező összes útvonal valószínűségeinek összegeként, az alábbiakban leírt módon [17]:

p(π|o) = ∑ π∈B−1 p(π|o)

ahol B −1 (l)={π|B(π)=l} a B inverz művelete. Végül a jellemzősorozat CTC veszteségeit a következőképpen definiáljuk [17]:

Lctc=− ln p(` |o)

A p(π|X) feltételes valószínűség a feltételes függetlenségi feltételezés szerint számítható.

4. Kísérleti eredmények és megbeszélés

cistanche—Improve memory2

Cistanche kiegészítő a közelemben – Javítsa a memóriát

Ebben a részben elmagyarázzuk kísérletünk részleteit a javasolt konfigurációval, az előző részben leírtak szerint.

4.1. Adatkészletek

Ebben a részben bemutatjuk a kísérlet során felhasznált adatkészleteket. Két adatkészletet használtunk, az első a CSL adatkészlet [8,40,41], a második pedig az RWTH-PHOENIX adatkészlet [33,39]. Mindkét adatkészlet folyamatos jelnyelvi adatkészlet, amely bizonyos gesztussorozatok teljes mondattá történő fordítására szolgál.

4.1.1. CSL adatkészlet

A CSL adatkészletet több munka is használta [8,40,41]. Összesen 100 mondat és 178 szó található ebben az adatkészletben, amelyeket gyakran használnak a napi kommunikációban. Ez az adatkészlet átlagosan 5 szót tartalmaz mondatonként. Minden mondatot 50 aláíró 5 alkalommal hajtott végre. Így a videók teljes száma 25,000, így ez az egyik legnagyobb adatkészlet. CSL-modellünk betanításához az adatkészletet felosztottuk adatokra, amelyek 20,{11}} videóval való betanításhoz és 5000 azonos mondatú, de különböző aláírókkal rendelkező videóval való teszteléshez szükségesek.

4.1.2. RWTH-PHOENIX adatkészlet

Az RWTH-PHOENIX adatkészlet [33,39] egy német jelnyelvi adatkészlet, amely a németországi televízióállomások nyilvános időjárási adásainak felvétele. Ezt a videót úgy dolgoztuk fel, hogy mérete 210 × 260 legyen. 6841 különböző mondatot írt alá 9 különböző aláíró. Valamennyi aláíró sötét színű ruhát viselt világos alapon. Összesen 1232 szó van, körülbelül 80,{11}} szóhasználattal. Ez az adatkészlet egy előre meghatározott formátum szerint van felosztva, amely 5672 betanítási mintából, 540 érvényesítési/fejlesztői mintából és 629 tesztmintából áll.

4.2. Adatok előfeldolgozása

Az első dolgunk volt, hogy előfeldolgozzuk az adatkészletünket, hogy illeszkedjen a javasolt modellünkhöz. Átméretezést és vágást végeztünk, a 3. ábra szerint; a bal oldalon láthatjuk, hogy az eredeti adatok full HD vagy 1920 × 1080 felbontásúak voltak. Vágnunk és átméreteznünk kellett 224 × 224 felbontásra, mivel a térbeli modulunk a ResNet50 bemenetével megegyező méretű bemenetet kap. Ezt követően betápláltuk az adatokat a térbeli modellünkbe, amely egyetlen képből állítaná elő a 7 × 7-es tenzort.

Az előfeldolgozott teljes képkockás képet ezután a kulcspont jellemzők létrehozásához használták fel. A HRNet modellt használtuk a 133 kulcspont előrejelzésére ezekből az RGB képekből. A javasolt modellünkben azonban csak a felsőtest 27 kulcspontját használjuk. A kulcspont jellemzők bemeneti mérete 27 × 3, mivel 3-tengely (x, y és z) koordinátaadataink vannak pontonként. A modell bemeneti mérete N × 224 × 224 × 3 a teljes képkocka funkcióhoz és N × 1 × 27 × 3 a kulcspont beviteléhez, ahol N a képkockák száma. Az adatkészlet variációjának fokozása érdekében követjük a [12]-ből származó kiegészítést, beleértve a véletlenszerű kivágást, a vízszintes átfordítást és a véletlenszerű időbeli skálázást. A véletlenszerű kivágást az előfeldolgozási lépés részeként is használják az eredeti kép kivágásához.

cistanche—Improve memory7

Cistanche kiegészítő a közelemben – Javítsa a memóriát

4.3. Értékelési metrika

Javasolt modellünk felismerési teljesítményének értékeléséhez szóhibaarány (WER) metrikát használunk, amely a CSLR-ben általánosan használt mérőszám egy előrejelzett mondat felismerési pontosságának becslésére, amint azt az alábbi egyenlet mutatja [17]:

WER=S plusz I plusz DT=S plusz I plusz DS plus C plus D

ahol S az eredeti szó behelyettesítéseinek száma, I az eredeti mondatban nem szereplő beillesztések száma, D azoknak a törléseknek a száma, amelyeknek az eredeti mondatban kellett volna, C az egyező helyes szavak száma az eredeti mondat, a T pedig a mondatban lévő szavak teljes száma, vagy amely a helyettesítések, törlések és helyes szavak összességéből nyerhető ki. A CSL esetében minden karakter egy szó megjelenítésére szolgál.

4.4. Kísérlet a bemeneti adatfolyamokon

Ez a kísérlet főként az egy- és többfolyamos bemenet összehasonlítására összpontosít a modellünkön. A cél a bemeneti adatfolyam legjobb konfigurációjának megtalálása. Ebben a kísérletben csak az RWTH-PHOENIX adatkészletet használjuk. Modellünk két külön bemenetet kapna, a teljes képkockás és a kulcspontos bemenetet. Az egyfolyamos bemenet csak az RGB funkciót használja a teljes képkockás képből. Két egyfolyamos bemeneti kísérlet létezik. Az első csak a teljes képkocka funkciót használja az RGB-képből, a második pedig a kulcspont-bemenetből származó kulcspont funkciókat. Az általunk javasolt többfolyamos bemenet RGB és kulcspont jellemzőkből áll. Az egyetlen folyam és több adatfolyam összehasonlításának eredményét az 1. táblázat mutatja. Itt láthatjuk, hogy a többfolyamos funkció használatával jobb eredményt kaphatunk, mint egyetlen adatfolyam használatával. A mainstream egy teljes képkockás RGB funkcióból származik, a további adatfolyam pedig a kulcspont funkciókat használja. A kiegészítő kulcspont-folyam segít a modellnek a jobb tanulásban, különösen a kézforma részleteinek rögzítésében.

1. táblázat: WER teljesítmény-összehasonlítás egyetlen adatfolyam és többfolyamos bemenet használatával.

Table 1. WER Performance comparison using single stream and multi-stream input.


4.5. Kísérlet a Figyelem modulon

A kísérlet célja a figyelem modul legjobb konfigurációjának kiválasztása volt. Ebben a kísérletben az előző kísérleti eredmény legjobb eredményének konfigurációját és ugyanazt az adatkészletet használjuk. A térfigyelést úgy jelöljük, mint azt a modellt, amelynek a térbeli modul végén minden jellemzőnél egy önfigyelő réteg található. A korai temporális figyelem az első időbeli összevonás utáni önfigyelem réteg, a késői időbeli figyelem pedig a második időbeli összevonás utáni önfigyelem réteg. Itt összehasonlítjuk az összes fenti konfigurációt, valamint a térbeli és időbeli figyelem kombinációját. Az eredményt a 2. táblázat mutatja. A térbeli figyelem eredménye rosszabb, mint az időbeli figyelemé. A térbeli szint minden egyes képkockához jellemző sorozatot tartalmaz. Ahogy a [20]-ban említettük, az önfigyelem réteg könnyebben megtanulja a rövidebb utat a hosszú függőségek között. Ezért a térbeli figyelem nem csökkenti a WER-t a hosszú sorozat miatt. Másrészt időbeli figyelem felhasználásával jobb eredményt tudtunk elérni, ha a pooling után helyeztük el, így rövidebb sorozathosszat kap. A legrövidebb sorozathosszúságú késői figyelem éri el a legjobb eredményt. Ráadásul a figyelem modul térbeli és időbeli kombinációja rosszabb, mint egyetlen figyelem használata. Ezen eredmények alapján a legjobb konfigurációt alkalmazzuk a további kísérletekhez.

2. táblázat: WER teljesítmény összehasonlítás különböző figyelem konfigurációk használatával

Table 2. WER Performance comparison using different attention configuration


4.6. Ablációs kísérlet a STAMF hálózaton

Ezenkívül egy ablációs kísérletet végzünk ugyanazzal az adatkészlettel és a bemeneti adatfolyam és a figyelem modul legjobb konfigurációjával. A 3. táblázat egy kísérletről, amelyben a késői időbeli figyelmet egyesítették, bizonyítja, hogy a szekvencia hossza befolyásolja a figyelem teljesítményét. A rövidebb sorozathosszúságú pooling rétegeket használó kísérletek jobb eredményeket adnak. A szekvenciatanulás különböző modelljei segítségével ablációs kísérletet is végzünk a teljesítmény megismerésére. A 4. táblázatban látható eredmény azt mutatja, hogy az LSTM használata, amely csak egyirányú információval rendelkezik, alacsonyabb teljesítményű, mint a kétirányú információval rendelkező Bi-LSTM használata.

3. táblázat: WER teljesítmény összehasonlítás különböző késői időbeli figyelem konfigurációk használatával.

Table 3. WER Performance comparison using different late temporal attention configurations.

4. táblázat: WER teljesítmény-összehasonlítás különböző szekvencia-tanulási konfigurációk használatával.

Table 4. WER Performance comparison using different sequence learning confifiguration.


4.7. Kísérlet a STAMF hálózaton

Ebben a részben a spatiotemporális figyelmes többfunkciós (STAMF) nevű javasolt modellünk teljes képzési folyamatát ismertetjük. Ez lefedi, hogyan illesztjük be a bemeneti adatainkat a térbeli modulba, az időbeli modulba és a sorozattanulási modulba lépésről lépésre. Ebben a részben többfolyamos bemenetet és késői időbeli figyelemkonfigurációt használunk.

4.7.1. A megvalósítás részletei

A végpontok közötti betanítást és tesztelést 224 × 224 méretű bemeneti keretekkel végezzük. Az optimalizálóhoz egy Adam optimalizálót használunk, amelynek tanulási sebessége 10-4, és ezt elosztjuk 2-vel a 10. és 15. korszakban a CSL és 30., 40. és 60. korszak az RWTH PHOENIX számára. A kötegméretet 4-re állítjuk, és 80 korszakot hajtunk végre az RWTH-PHOENIX és 20 korszakot a CSL esetében. A képzés és a tesztelés NVIDIA Tesla V100-on és 128G RAM-on futott.

Először a ResNet50 segítségével kinyertük a funkciót az RGB adatfolyamokból, majd a HRNet segítségével megszereztük a kulcspontot, majd a ResNet50 segítségével kinyertük a kulcspont funkciókat. Vegye figyelembe, hogy szekvenciális adatokkal vagy videóval volt dolgunk. Ezért konfigurálnunk kellett a bemeneti méretünket a videó hosszától függően. Technikai okokból az összes adat bemeneti méretének azonosnak kellett lennie egymással. Ezért ismernünk kell az adatkészletünk leghosszabb videóját, majd a bemeneti képkocka hosszát a legnagyobb képkockaszámhoz igazítottuk.

Ezeket a szekvenciálisan kivont funkciókat használta az időbeli modul. Minden szekvenciális adatfolyam két halmozott időbeli összevonáson ment keresztül. Mindegyik időbeli összevonás egy 1-dimenziós konvolúciós hálózatból és egy max pooling rétegből állt, ami a felére csökkentette a szekvenciális hosszát. Az időbeli összevonás mindkét folyamból származó kimenetét ezután a figyelemréteghez kapcsoltuk, és az utolsó időbeli összevonáshoz a figyelemréteg után a végén összefűztük az időbeli modul kimeneteként.

Az időbeli kimenetet a szekvencia-tanuló modul dolgozta fel. A folyamat a CTC-vel összekapcsolt Bi-LSTM réteget használta a végső igazítás eléréséhez és a fényesség végső mondattá történő összeállításához.

4.7.2. Mennyiségi eredmény

Az utolsó mondatokat összehasonlítottuk az alapigazsággal, hogy kvantitatív eredményként kiszámítsuk a WER pontszámot. A CSL esetében az adatkészletet 80 százalékra osztjuk fel a képzési adatokra és 20 százalékra a tesztelési adatokra. Amint az 5. táblázatban látható, az általunk javasolt többfunkciós modellünk (STMF) a teljes képkocka és a kulcspont jellemzők használatával jobb eredményt érhet el, és a WER-t 0,8-ra csökkentheti a csak teljes képkocka funkciót használó modellhez képest [23]. A legjobb eredményt a figyelmi mechanizmust (STAMF) használó javasolt többfunkciós modell érte el, amely 0,7-et ért el a WER-re. A figyelemréteg még mindig némileg javította az eredményt, annak ellenére, hogy a CSL-adatkészletben nem voltak hibás keretek. Ez azt bizonyítja, hogy a figyelemréteg hatással van a modellre. Maga a javasolt többfunkciós modell felülmúlja a legmodernebb módszereket, és a figyelemréteg hozzájárul a CSL-adatkészlet WER-pontszámának csökkenéséhez. A CSL kulcspontja jelentős hatást fejt ki, mert hatékony információt tud adni a másik többfunkciós módszerhez [17] képest, amely kéz-, arc- és testpózt alkalmaz.

Az RWTH-PHOENIX adatkészlet esetében a mesterséges konfigurációt használtuk a képzési és tesztelési adatok felosztására. Az adatkészletet 5672 mintavideóra osztották fel a képzéshez, 540 mintavideóra az önellenőrzéshez és 629 mintavideóra a teszteléshez. Amint a 6. táblázatban látható, a javasolt többfunkciós modell (STMF) eredménye a teljes képkocka és a kulcspont jellemzők használatával 24 százalékos WER, a legjobb eredményünk pedig 20,5 százalék volt, amelyet a figyelmi modult (STAMF) használó javasolt modell kapott. az edzés eredményében. A teszteredmények a második legjobbak a [17]-hez képest, mivel több funkciót használnak bemenetként. A figyelem modul azonban bebizonyosodott, hogy jelentősen hozzájárul az RWTHPHOENIX adatkészlet WER pontszámának csökkentéséhez. A CSL adatkészletre vonatkozó eredményünktől eltérően a javasolt többfolyamos modellünk nem ért el optimális eredményt. Ennek az az oka, hogy az RWTH-PHOENIX adatkészlet sok hibás kerettel rendelkezik; elmosódott részük van, különösen a kéz területén. Ez a keret inkonzisztens kulcspont-információkat ad a hiányzó vagy helytelen kulcspont-pozíció miatt, és kevésbé teszi optimálissá a modellt. Ezt a problémát úgy kezeljük, hogy a javasolt többfunkciós modellünkhöz hozzáadjuk a figyelmi réteget, amely segít a helyes információk kiválasztásában, és jelentős javulást eredményez a javasolt többfunkciós modellhez képest, figyelmen kívül hagyva.

5. táblázat: A WER teljesítményének összehasonlítása a CSL adatkészleten.

Table 5. WER Performance comparison on the CSL dataset.

6. táblázat: A WER teljesítményének összehasonlítása az RWTH-PHOENIX adatkészleten.

Table 6. WER Performance comparison on the RWTH-PHOENIX dataset.


4.7.3. Minőségi eredmény

A modellünk minőségi értékelését is elvégeztük, a felismerés eredményének vizualizálásával. A 8. ábra kvalitatív értékelésünk részleteit mutatja három mondatminta felhasználásával. Az első mondat 10 szóból áll, a keretek száma összesen 220. A második mondat 12 szóból áll, a keretek száma összesen 168. A harmadik mondat 9 szóból áll, a keretek száma összesen 135.

A minta eredménye azt mutatja, hogy egyes fényességeket a modellek nem jósolnak meg megfelelően, és ezt piros jelzéssel jelöljük. Azonban továbbra is képes megjósolni a helyes szavak többségét. A legtöbb hiba az első mondatban található, amely a leghosszabb keretszámmal rendelkezik. Ebben a mondatban a mondat eleje több hibát tartalmaz, mivel a korai szavak több gesztusa csak kissé különbözik, így nehéz megkülönböztetni a határokat. A javasolt többfunkciós és figyelemfelkeltő modell (STAMF) azonban több szót tudott azonosítani, de azokat rosszul címkézték. Sőt, a figyelmes modellkonfiguráció további két mintánál jobb felismerési eredményt ér el, mint a javasolt figyelmesség nélküli modellel.

Figure 8.


8. ábra: A felismerés eredményének kvalitatív kiértékelése az RWTH-PHOENIX adatkészlet eltérő konfigurációjával [33,39]. A rossz előre jelzett fények pirossal vannak jelölve.

5. Következtetések

Ebben a cikkben bemutatunk egy új tér-időbeli figyelmes többfunkciós funkciót (STAMF) CSLR-hez, amelynek célja, hogy megtanulja a tér-időbeli összefüggéseket és a fontos információkat a vizuális jellemzők és kulcspontjellemzők sorozatából a végpontok közötti megközelítésben. A mi keretünkben egy térbeli modult fejlesztettünk ki teljes kerettel az RGB adatokból és a test kulcspontjainak kulcspontjaiból, beleértve a kezeket, mint multifunkciókat. Ezek a többfolyamú funkcióbemenetként használt kombinációk kiváló teljesítményt nyújtottak a korszerű megközelítéshez képest, amely csak teljes keretet használ, vagy a módszerhez képest. 8. ábra A felismerési eredmény kvalitatív értékelése az RWTH eltérő konfigurációjával -PHOENIX adatkészlet [33,39]. A rossz előre jelzett fények pirossal vannak jelölve. 5. Következtetések Ebben a cikkben egy új tér-időbeli figyelmes többfunkciós funkciót (STAMF) mutatunk be CSLR-hez, amelynek célja, hogy megtanulja a tér-időbeli összefüggéseket és a fontos információkat a vizuális jellemzők sorozatából és a kulcspontjellemzők sorozatából a végpontokig. vége megközelítés. A mi keretünkben egy térbeli modult fejlesztettünk ki teljes kerettel az RGB adatokból és a test kulcspontjainak kulcspontjaiból, beleértve a kezeket, mint multifunkciókat. Ezek a többfolyamú szolgáltatásbevitelként használt kombinációk kiváló teljesítményt nyújtottak a korszerű megközelítéshez képest, amely csak teljes keretet használ, vagy összehasonlítva egy másik többfunkciós kombinációt használó módszerrel, különösen a CSL-adatkészlet esetében. Ezután javasolunk egy időbeli modult, amely időbeli összevonásból és időbeli figyelemből áll, hogy rögzítse a fontos információkat az időbeli tartományban. A késői időbeli figyelem kiegészítése képes arra, hogy a hibás információval rendelkező sorozatból megszerezze a fontos jellemzőt, és jelentős javulást ad a javasolt többfunkciós modellhez képest. Ezenkívül segíti a sorozattanulást a jobb tanulásban, és javítja a teljesítményt, mint a CSL-adatkészlet kísérletében. Az általánosan használt adatkészleteken végzett kiterjedt kísérletek bizonyítják, hogy a javasolt modellünk felülmúlja a legmodernebb modellt, mivel a WER pontszámok több mint 50 százalékkal csökkennek a CSL adatkészletnél, és 5 százalékkal csökkennek az RWTH-PHOENIX adatkészletnél. A jövőben a transzfer tanulási technikát tervezzük megvalósítani jelenlegi modellünkkel, valamint a folyamatban lévő munkánkat egy valódi iparágban alkalmazni.

Hivatkozások

1. Dreuw, P.; Rybach, D.; Deselaers, T.; Zahedi, M.; Ney, H. Beszédfelismerési technikák egy jelnyelv-felismerő rendszerhez. In Proceedings of the INTERSPEECH 2007, a Nemzetközi Beszédkommunikációs Szövetség 8. éves konferenciája, Antwerpen, Belgium, 2007. augusztus 27–31.; 2513–2516.

2. Ong, SCW; Ranganath, S. Automatikus jelnyelvi elemzés: Felmérés és a jövő a Lexical Meaningen túl. IEEE Trans. Pattern Anal. Mach. Intell. 2005, 27, 873–891. [CrossRef] [PubMed]

3. Vogler, C.; Metaxas, D. Keretrendszer az amerikai jelnyelv szimultán szempontjainak felismeréséhez. Comput. Vis. Image Underst. 2001, 81, 358–384. [CrossRef]

4. Bowden, R.; Windridge, D.; Kadir, T.; Zisserman, A.; Brady, M. Nyelvi jellemzővektor a jelnyelv vizuális értelmezéséhez. In Proceedings of the European Conference on Computer Vision (ECCV), Prága, Cseh Köztársaság, 2004. május 11–14.; 390–401.

5. Kasukurthi, N.; Rokad, B.; Bidani, S.; Dennisan, DA Amerikai jelnyelvi ábécé felismerése a mélytanulás segítségével. arXiv 2019, arXiv:1905.05487.

6. Koller, O.; Zargaran, S.; Ney, H.; Bowden, R. Deep Sign: Robusztus statisztikai folyamatos jelnyelv-felismerés engedélyezése hibrid CNN-HMM-eken keresztül. Int. J. Comput. Vis. 2018, 126, 1311–1325. [CrossRef]

7. Pu, J.; Zhou, W.; Li, H. Kiterjesztett konvolúciós hálózat iteratív optimalizálással a folyamatos jelnyelv-felismeréshez. In Proceedings of the Twenty-7th International Joint Conference on Artificial Intelligence, Stockholm, Svédország, 2018. július 13–19.; 885–891.

8. Pu, J.; Zhou, W.; Li, H. Iterative Alignment Network for Continuous Sign Language Recognition. In Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Long Beach, CA, USA, 2019. június 15–20.; 4160–4169.

9. Kumar, N. Mozgási pálya alapú emberi arc- és kézkövetés a jelnyelv-felismeréshez. In Proceedings of the 2017 4th IEEE Uttar Pradesh Section International Conference on Electrical, Computer and Electronics, Mathura, India, 2017. október 26–28.; 211–216.

10. Bhuyan, MK; Ghoah, D.; Bora, PK A kézmozdulat-felismerés keretrendszere jelnyelvi alkalmazások segítségével. In Proceedings of the 2006 Annual India Conference, INDICON, Újdelhi, India, 2006. szeptember 15–17.; 1–6.

11. Das, SP; Talukdar, AK; Sarma, KK Jelnyelv-felismerés arckifejezés segítségével. In Proceedings of the Procedia Computer Science, Kerala, India, 2015. augusztus 10–13.; 210–216.

12. Rastgoo, R.; Kiani, K.; Escalera, S.; Sabokrou, M. Jelnyelvi produkció: Szemle. In Proceedings of the 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), Nashville, TN, USA, 2021. június 19–25.; 3446–3456.

13. Dong, S.; Wang, P.; Abbas, K. Felmérés a mély tanulásról és annak alkalmazásairól. Comput. Sci. Rev. 2021, 40, 100379. [CrossRef]

14. Athitsos, V.; Neidle, C.; Claroff, S.; Nash, J.; Stefan, A.; Yuan, Q.; Thangali, A. Az amerikai jelnyelvi lexikon videóadatkészlete. In Proceedings of the IEEE Computer Society 2008 Conference on Computer Vision and Pattern Recognition Workshops, CVPR Workshops, Anchorage, Alaska, 2008. június 23–28.; 1–8.

15. Bungeroth, J.; Stein, D.; Dreuw, P.; Ney, H.; Morrissey, S.; Way, A.; Zijl, LV Az ATIS jelnyelvi korpusz. In Proceedings of the 6th International Conference on Language Resources and Evaluation, LREC 2008, Marrakech, Marokkó, 2008. május 28–30.; 2943–2946.

16. Papastratis, I.; Chatzikonstantinou, C.; Konstantinidis, D.; Dimitropoulos, K.; Daras, P. Mesterséges intelligencia-technológiák a jelnyelvhez. Érzékelők 2021, 21, 5843. [CrossRef] [PubMed]

17. Zhou, H.; Zhou, W.; Zhou, Y.; Li, H. Spatial-temporal Multi-cue Network for Continuous Sign Language Recognition. In Proceedings of the AAAI 2020 – The Thirty44 AAAI Conference on Artificial Intelligence, New York, NY, USA, 2020. február 7–12.; 13009–13016.

18. Gündüz, C.; Polat, H. Többfolyamú adatfúzión alapuló török ​​jelnyelv-felismerés. török ​​J. Elektr. Eng. Comput. Sci. 2021, 29, 1171–1186. [CrossRef]

19. Bohacek, M.; Hruz, M. Jelpóz alapú transzformátor szószintű jelnyelv felismeréshez. In Proceedings of the 2022 IEEE/CVF Winter Conference on Applications of Computer Vision Workshops, WACVW, Waikoloa, HI, USA, 2022. január 4–8.; 182–191.

20. Vaswani, A. A figyelem minden, amire szüksége van. In Proceedings of the Conference on Neural Information Processing Systems, Long Beach, CA, USA, 2017. december 4–9.; 1–11.

21. Zhou, M.; Ng, M.; Cai, Z.; Cheung, KC Öngondoskodáson alapuló, teljesen kezdeti hálózatok a folyamatos jelnyelv-felismeréshez. Elülső. Artif. Intell. Appl. 2020, 325, 2832–2839.

22. Camgöz, NC; Koller, O.; Hadfifield, S.; Bowden, R. Sign Language Transformers: Joint end-to-end jelnyelv felismerés és fordítás. In Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Seattle, WA, USA, 2020. június 14–19.; 10020–10030.

23. Min, Y.; Hao, A.; Chai, X.; Chen, X. Visual Alignment Constraint for Continuous Sign Language Recognition. In Proceedings of the IEEE International Conference on Computer Vision (ICCV), Montreal, BC, Kanada, 2021. október 10–17.; 11542–11551.

24. Guo, D.; Zhou, W.; Wang, M.; Li, H. Adaptív HMM-eken alapuló jelnyelv-felismerés adatkiegészítéssel. In Proceedings of the IEEE International Conference on Image Processing (ICIP), Phoenix, AZ, USA, 2016. szeptember 25–28.; 2876–2880.

25. Huang, J.; Zhou, W.; Li, H.; Li, W. Jelnyelv-felismerés 3D konvolúciós neurális hálózatok segítségével. In Proceedings of the IEEE International Conference on Multimedia and Expo (ICME), Torino, Olaszország, 2015. június 29–július 3.; 1–6.

26. Guo, D.; Zhou, W.; Li, H.; Wang, M. Online korai-késői fúziós adaptív HMM-en alapuló jelnyelv-felismerés. ACM Trans. Multimed. Comput. Commun. Appl. 2017, 14, 1–18. [CrossRef]

27. Al-hammadi, M.; Muhammad, G.; Tag, S. Kézmozdulatok felismerése jelnyelvhez 3DCNN segítségével. IEEE Access 2020, 8, 79491–79509. [CrossRef]

28. Reza, H.; Joze, V. MS-ASL: Nagyszabású adatkészlet és mérce az amerikai jelnyelv megértéséhez. arXiv 2019, arXiv:1812.01053.

29. Li, D.; Opazo, CR; Yu, X.; Li, H. Szószintű mély jelnyelv felismerés videóból: Új nagyszabású adatkészlet és módszerek összehasonlítása. In Proceedings of the 2020 Winter Conference on Applications of Computer Vision, WACV, Snowmass Village, CO, USA, 2020. március 1–5.; 1448–1458.

30. Pu, J.; Zhou, W.; Li, H. Jelnyelv-felismerés multimodális jellemzőkkel. In Proceedings of the Pacific Rim Conference on Multimedia, Xi'an, China, 2016. szeptember 15–16.; 252–261.

31. Jiang, S.; Sun, B.; Wang, L.; Bai, Y.; Li, K.; Fu, Y. Skeleton Aware Multi-modális jelnyelv-felismerés. In Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, Nashville, TN, USA, 2021. június 19–25.; 3408–3418.

32. Sidig, AAI; Luqman, H.; Mahmoud, S.; Mohandes, M. KArSL: Arab jelnyelvi adatbázis. ACM Trans. Ázsiai alacsony fogyasztású. Lang. Inf. Feldolgozás 2021, 20, 1–19. [CrossRef]

33. Koller, O.; Forster, J.; Ney, H. Folyamatos jelnyelv-felismerés: Több aláírót kezelő, nagy szókincsű statisztikai felismerő rendszerek felé. Comput. Vis. Image Underst. 2015, 141, 108–125. [CrossRef]

34. Koller, O.; Camgoz, NC; Ney, H. Gyengén felügyelt tanulás többfolyamos CNN-LSTM-HMM-ekkel a szekvenciális párhuzamosság felfedezéséhez a jelnyelvi videókban. IEEE Trans. Pattern Anal. Mach. Intell. 2020, 42, 2306–2320. [CrossRef] [PubMed]

35. Camgoz, NC; Hadfifield, S.; Koller, O.; Bowden, R. SubUNets: End-to-End Hand Shape and Continuous Sign Language Recognition. In Proceedings of the 2017 IEEE International Conference on Computer Vision (ICCV), Velence, Olaszország, 2017. október 22–29.; 3075–3084.

36. Dong, C.; Loy, CC; Ő, K.; Tang, X. Kép ​​szuperfelbontása mély konvolúciós hálózatokkal. IEEE Trans. Pattern Anal. Mach. Intell. 2014, 38, 295–307. [CrossRef] [PubMed]

37. Bressem, KK; Adams, LC; Erxleben, C.; Hamm, B.; Niehues, SM; Vahldiek, JL Különféle mély tanulási architektúrák összehasonlítása a mellkas röntgenfelvételek osztályozására. Sci. Rep. 2020, 10, 13590. [CrossRef]

38. Sun, K.; Xiao, B.; Liu, D.; Wang, J. Mély, nagy felbontású reprezentáció tanulása az emberi testhelyzet becsléséhez. In Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Long Beach, CA, USA, 2019. június 15–20.; 5686–5696.

39. Koller, O.; Zargaran, S.; Ney, H. Re-Sign: Re-Aligned End-to-End Sequence Modeling with Deep Recurrent CNN-HMMs. Folyamatban a 2017. évi IEEE konferencia a számítógépes látásról és mintafelismerésről (CVPR), Honululu, HI, USA, 2017. július 21–26.; 3416–3424.

40. Zhou, H.; Zhou, W.; Li, H. Dinamikus pszeudocímke dekódolás a folyamatos jelnyelv felismeréshez. In Proceedings of the 2019 IEEE International Conference on Multimedia and Expo (ICME), Sanghaj, Kína, 2019. július 18–21.; 1282–1287.

41. Xiao, Q.; Chang, X.; Zhang, X.; Liu, X. Videó alapú jelnyelv-felismerés időbeli szegmentáció nélkül. In Proceedings of the Thirty-Second AAAI Conference on Artificial Intelligence, New Orleans, LA, USA, 2018. február 2–7.; 2257–2264.

42. Graves, A.; Fernández, S.; Gomez, F.; Schmidhuber, J. Konnekcionista időbeli osztályozás: nem szegmentált szekvenciaadatok címkézése visszatérő neurális hálózatokkal. In Proceedings of the ICML '06: Proceedings of the 23. International Conference on Machine learning, Pittsburgh, PA, USA, 2006. június 25–29.; 369–376.

43. Graves, A.; Liwicki, M.; Fernández, S.; Bertolami, R.; Bunke, H.; Schmidhuber, J. Egy újszerű konnekcionista rendszer a kötetlen kézírás-felismeréshez. IEEE Trans. Pattern Anal. Mach. Intell. 2009, 31, 855–868. [CrossRef]

44. Guo, D.; Zhou, W.; Li, H.; Wang, M. Hierarchikus LSTM jelnyelvi fordításhoz. In Proceedings of the AAAI Conference on Artificial Intelligence, New Orleans, LA, USA, 2018. február 2–7.; 6845–6852.

45. Rahman, MM; Watanobe, Y.; Nakamura, K. Kétirányú LSTM nyelvi modell kódértékeléshez és javításhoz. Symmetry 2021, 13, 247. [CrossRef]

46. ​​Hu, W.; Cai, M.; Chen, K.; Ding, H.; Sun, L.; Liang, S.; Mo, X.; Huo, Q. Sequence Diskriminatív képzés offline kézírás-felismeréshez interpolált CTC-vel és rácsmentes MMI-objektív funkcióval. In Proceedings of the International Conference on Document Analysis and Recognition, ICDAR, Kiotó, Japán, 2017. november 9–15.; 1. kötet, 61–66.

47. Yoshimura, T.; Hayashi, T.; Takeda, K.; Watanabe, S. Végpontok közötti automatikus beszédfelismerés, integrálva a CTC-alapú hangtevékenység-észleléssel. In Proceedings of the ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing, Barcelona, ​​Spain, 2020. május 4–8; 6999–7003.

48. Guo, D.; Wang, S.; Tian, ​​Q.; Wang, M. Dense Temporal Convolution Network for Sign Language Translation. In Proceedings of the Twenty-8th International Joint Conference on Artificial Intelligence (IJCAI-19), Makaó, Kína, 2017. augusztus 10–16.; 744–750.

49. Wang, S.; Guo, D.; Zhou, W.; Zha, Z.; Wang, M. Connectionist Temporal Fusion for Sign Language Translation. In Proceedings of the 26th ACM International Conference on Multimedia, Szöul, Korea, 2018. október 22–26.; 1483–1491.

50. Yang, Z.; Shi, Z. SF-Net: Strukturált szolgáltatáshálózat a folyamatos jelnyelv-felismeréshez. arXiv 2019, arXiv:1908.01341.

51. Cheng, KL; Yang, Z.; Chen, Q.; Tai, Y. Fully Convolutional Networks for Continuous Sign Language Recognition. In Proceedings of the European Conference on Computer Vision, Glasgow, Egyesült Királyság, 2020. augusztus 23–28.; 697–714.

52. Koller, O.; Ney, H.; Bowden, R. Deep Hand: Hogyan neveljünk CNN-t 1 millió kézi képen, ha az adatok folyamatosak és gyengén címkézettek. In Proceedings of the 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Las Vegas, NV, USA, 2016. június 27–30.; 3793–3802.

53. Slimane, FB Kontextus számít: önfigyelem a jelnyelv felismeréséhez. arXiv 2021, arXiv:2101.04632.

54. Niu, Z.; Mak, B. Többállapotú jelfények sztochasztikus finomszemcsés címkézése a folyamatos jelnyelv-felismeréshez. In Proceedings of the European Conference on Computer Vision, Glasgow, Egyesült Királyság, 2020. augusztus 23–28.; 1–16.

55. Cui, R.; Liu, H.; Zhang, C. A Deep Neural Framework for Continuous Sign Language Recognition by Iterative Training. IEEE Trans. Multimed. 2019, 21, 1880–1891. [CrossRef]

56. Pu, J.; Zhou, W.; Hu, H.; Li, H. Folyamatos jelnyelv-felismerés fokozása keresztmodalitásnöveléssel. In Proceedings of the 28th ACM International Conference on Multimedia, Seattle, WA, USA, 2020. október 12–16.; 1497–1505.

Akár ez is tetszhet