Újszerű térbeli-időbeli folyamatos jelnyelv-felismerés egy figyelmes többfunkciós hálózat segítségével (1)

Jun 01, 2023

Absztrakt: Adott videofolyamok esetén a folyamatos jelnyelv-felismeréssel (CSLR) kapcsolatos, szegmentálatlan jelek helyes észlelésére törekszünk. Az ezen a területen javasolt mély tanulási módszerek növekedése ellenére a legtöbbjük csak egy RGB funkció használatára összpontosít, akár a teljes képkockás képre, akár a kéz és az arc részleteire. A CSLR-oktatási folyamathoz szükséges információk szűkössége erősen korlátozza azt a képességet, hogy több funkciót is elsajátíthasson videobemeneti keretek használatával. Ezen túlmenően, ha egy videóban az összes képkockát kihasználják a CSLR-feladathoz, az nem optimális teljesítményhez vezethet, mivel minden egyes képkocka más-más szintű információt tartalmaz, beleértve a zajra vonatkozó következtetések fő jellemzőit. Ezért új, térbeli és időbeli folyamatos jelnyelv-felismerést javasolunk a figyelmes többfunkciós hálózat segítségével, hogy a CSLR-t extra kulcspont funkciók biztosításával fejlesszék. Ezen túlmenően kihasználjuk a térbeli és időbeli modulokban található figyelemréteget, hogy egyszerre több fontos jellemzőt hangsúlyozzunk. Mindkét CSLR-adatkészletből származó kísérleti eredmények azt mutatják, hogy a javasolt módszer jobb teljesítményt ér el a jelenlegi legmodernebb módszerekkel összehasonlítva: 0,76 és 20,56 a WER-pontszám a CSL és a PHOENIX adatkészleteken.

Desert living cistanche

Superman gyógynövények cistanche

Kulcsszavak: folyamatos jelnyelv; térbeli; időbeli; több funkciós; Főbb pontok; önfigyelem

1. Bemutatkozás

A jelnyelv előnyben részesíti a kézmozdulatokat, testbeszédet és ajakmozgásokat használó manuális kommunikációt a hang helyett [1,2]. A jelbeszédet általában siketek vagy nagyothallók használják, de olyan helyzetekben is használható, amikor lehetetlen vagy nehéz hangokat hallani. Ezért szükség van egy jelnyelv-felismerő (SLR) rendszerre, amely segít a nagyothallók és a nem hallók kapcsolatában.

Az elmúlt években a kutatók nagy figyelmet fordítottak az SLR-re, mivel gazdag vizuális információkat nyújt. A legújabb SLR-tanulmányokat általában izolált jelnyelv-felismerés (ISLR) vagy folyamatos jelnyelv-felismerés (CSLR) csoportba sorolják. Számos munka csak az ISLR-rel foglalkozik [3,4], míg mások csak könnyebb feladatokat elemeznek, például statikus gesztusokat az ábécé felismeréséhez [5]. Mindeközben a legújabb módszerek általában bonyolultabbak, mivel CSLR feladatokat oldanak meg [6–8]. Az ISLR-hez képest a CSLR nagyobb kihívást jelent, mivel magában foglalja a mondatok rekonstrukcióját.

Cistanche tea2

Cistanche tea

Kattintson ide a Cistanche deserticola teatermékek megtekintéséhez

【Kérjen többet】 E-mail:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

A CSLR-kutatásra még mindig nagy az igény, mert megvalósítása szorosan összefügg a való világ mindennapi körülményeivel. Ennek a megközelítésnek az a célja, hogy felismerje a videósorozatokban előforduló fényesség-sorozatokat egyértelmű szegmentálás nélkül, vagy akár egyáltalán. Ezenkívül számos gépi tanulási kutatást és az emberi viselkedés alapos megértését foglalja magában. Például magában foglalja az emberi mozgás követését [9], a gesztusfelismerést [10] és az arcfelismerést [11]. Ennek ellenére számos kihívással kell szembenéznie a CSLR-feladatok végrehajtásával.

Először is, az adatgyűjtés és az annotálás költséges a CSLR számára [12]. Talán ez az egyik kihívás a fejlesztés során, mivel a CSLR nagy hálózatban működik, és az adatmennyiség erősen befolyásolja a teljesítményt [13]. Ezen túlmenően a jelnyelvre vonatkozóan számos elérhető adatkészlet gyengén jegyzett [12,14,15]. Ennek a problémának a megoldására számos tanulmány gyengén felügyelt megközelítést alkalmazott, valamint egy igazítási és egy szolgáltatáskivonó modult alkalmaztak a hálózati architektúrára [12].

Másodszor, az ISLR-hez képest a CSLR bonyolultabb. Elegendő információ megszerzése több funkció használatával történik; ez bebizonyosodott, hogy jobb teljesítményt ér el, mint egyetlen funkció használata, amint azt a korábbi munkákban leírták [16–18]. Ez a többszörös jellemző a fő jellemzőből áll, amely a legnagyobb pontosságot elérő testkép, valamint további jellemzőkből, mint például a póz, a fej, a bal kéz és a jobb kéz, amelyek kisebb pontossággal rendelkeznek az egyéni teljesítményhez [17,18]. Egy nagy, nagy mennyiségű adatot tartalmazó hálózat betanítása időigényes [13]. A bemeneti adatfolyam hozzáadása a képzési időt is növeli, míg a további képalapú szolgáltatások használata növeli a költségeket [19]. Ezért fontos jellemzőket kell kiválasztanunk, hogy hatékonyan edzhessünk.

Cistanche deserticola slice (1)

Kínai gyógynövény-cistanche

Harmadszor, a videobemenet nagy számú képet tartalmaz a sorozatban. Egyes képeken a kéz alakja homályos a gyors mozgás miatt, ami téves információhoz vezethet. Ezért a javasolt modellünk a [20] alapján az önfigyelmet használja a fontos információk kiválasztásához. Sőt, a [21,22] által bizonyított önfigyelem hatással van a teljesítmény fokozására.

Ezért az összes probléma kezelésére egy új modellt javasolunk, amelyet az új tér-időbeli figyelmes többfunkciósnak (STAMF) neveznek. Követtük a korábbi munkákat [17,23], amelyek bizonyítottan működnek gyenge annotációs problémákkal rendelkező CSLR-eknél. Három fő komponensből építik fel a modellt: az első a térbeli modul, a második az időbeli modul, a harmadik pedig a sorozattanulási modul. Hatékony és eredményes többfunkciós bevitelt javasolunk a teljes képkocka funkcióval, valamint a kulcspont funkciókkal a CSLR feladatok végrehajtásához. A teljes képkocka funkció a testképet jeleníti meg fő jellemzőként, a kulcspont jellemzőket pedig kiegészítő funkcióként. A legfontosabb jellemző a testpóz, beleértve a kézpóz részletét is. Ez a testpóz a leghatékonyabb kiegészítő funkció, mivel egyes munkákban bizonyítottan ez éri el a legnagyobb pontosságot a teljes képkocka funkció után [17,18]. Használunk egy olyan figyelem modult is, amely a [20] alapján az önfigyelmet használja a fontos jellemzők megragadására, és segíti a sorozattanulást a teljesítmény növelésében.

Ennek a kéziratnak a hozzájárulását a következőképpen foglaljuk össze: • Új időbeli figyelmet vezetünk be a szekvencia modulba, hogy megragadjuk azokat a fontos időpontokat, amelyek hozzájárulnak a végső kimenethez; • Bemutatjuk a többfunkciós funkciót, amely a képkocka RGB értékéből a teljes képkocka jellemzőből áll, mint fő jellemzőből, és a kulcspont jellemzőkből, amelyek a testpózt a kézforma részleteivel kiegészítve a modellfelismerési teljesítmény fokozása érdekében tartalmazzák; • A WER metrikát használjuk annak kimutatására, hogy a javasolt STAMF modellünk a kísérletek során mindkét CSLR benchmark adatkészleten felülmúlja a legmodernebb modelleket.

cistanche—Improve memory4

Cistanche kiegészítő a közelemben – Javítsa a memóriát

2. Kapcsolódó művek

A technológia terén számos előrelépés történt, és sok kutatást végeztek az SLR-rel kapcsolatban. Korábbi tanulmányok [24–27] feltárták az ISLR használatának lehetőségét, amely minden szóhoz szegmentált. Az elmúlt években mély tanuláson alapuló módszereket alkalmaztak a jellemzők kinyerésére konvolúciós hálózatok segítségével, akár 2D-ben [28,29], akár 3D-ben [30,31], erős vizuális megjelenítésük érdekében. A jelnyelv-felismeréssel kapcsolatos korai kutatások többsége a multimodális jellemzőkkel rendelkező ISLR-re összpontosított [30–32], mint például az RGB, a mélységi térképek és a csontvázak, amelyek jobb teljesítményt nyújtanak.

Manapság a CSLR egyre népszerűbb, bár nem tagolták egyértelműen az egyes szavak között. A korai munkák CNN-funkciókivonatot [6,33] és HMM-et [34] használnak a szekvenciacél felépítéséhez. Néhány újabb kutatás a CSLR rendszerekkel kapcsolatban [17,23] három fő lépést tartalmazott a problémafelismerés feladatának végrehajtásában. Először a térbeli jellemzők kinyerését, majd az időbeli szegmentálást, végül a mondatszintézist végezték el nyelvi modellel [35], vagy szekvencia-tanulást alkalmaztak [17,23]. Ez a szekvencia-tanulás Bi-LSTM-et és CTC-t használt a videoszekvenciák jelfényessége közötti kapcsolat meghatározására. Annak ellenére, hogy gyenge annotációt használ, amely szegmentálatlan videoszekvenciákat tartalmaz a jelglosszák meghatározásához, ezek a megközelítések ígéretes eredményeket mutattak.

A legutóbbi kapcsolódó CLSR-tanulmány azonban, amely többfunkciós megközelítést valósított meg [17], öt funkciót használt egyszerre. A többfunkciós megközelítés nehezebb a kevesebb szolgáltatás használatához képest [19]. Ez a megközelítés sem tudja kezelni a zajos képkockákat a videoszekvenciából, amelyek homályos információkat tartalmaznak, például a gyors mozgás miatt elmosódott kézformát. Ezenkívül az RNN-alapú szekvencia-tanulásra támaszkodva problémákba ütközhet a hosszú szekvenciákkal, és elveszítheti a globális kontextust [20].

cistanche—Improve memory3

Cistanche kiegészítő a közelemben – Javítsa a memóriát

A jelenlegi kutatás célja a teljesítmény javítása egy önfigyelő mechanizmus [21,22] hozzáadásával, amely képes hosszabb sorozatok kezelésére a globális kontextus megismerése érdekében. Az önfigyelem korai kutatásokon [20] alapul, amelyek kimutatták, hogy az önfigyelemnek megvan az az előnye, hogy képes kezelni a hosszú távú függőségeket. Ezzel az önfigyeléssel azonban könnyebb megtanulni egy rövidebb utat, mint egy hosszabb utat, ahol hosszú függőségek vannak. A korábbi CLSR munkákban [21,22] az önfigyelés segítheti a hálózatot a funkció hatékonyabb megtanulásában.

Ezért ebben a cikkben egy új, tér-időbeli figyelmes többfunkciós modellt mutatunk be. Ez a javasolt modell hatékonyan kinyeri a fontos jellemzőket, és jobban megtanulja a sorozatot azáltal, hogy fontos információkat ad egy önfigyelő mechanizmus segítségével több funkcióból. Minden folyamat végponttól végpontig való megközelítésben történik.

3. Javasolt módszer

Ez a rész részletezi a CSLR-hez javasolt modellünk alapvető technikáit. Ezért ezt a részt a javasolt modellünk áttekintésének ismertetésével kezdjük. Ezenkívül további részleteket adunk az egyes kulcskomponensekről, beleértve a térbeli modult, az időbeli modult és a sorozattanulási modult. Ezenkívül elmagyarázzuk a javasolt figyelem modulunkat is, hogy segítsük a modellt jobban tanulni. Végül integrálhatjuk a képzési és következtetési keretrendszert a javasolt modellünkbe.

3.1. Keretrendszer áttekintése

Videobemenettel a javasolt modellünk célja a megfelelő jel előrejelzése egy helyes fényes mondattá. Az első modul több térbeli jellemzőt generál, például teljes képkocka és kulcspont jellemzőket a videó minden egyes T képkockájához. Ezután az időbeli modul lehetővé teszi, hogy kivonjuk a térbeli jellemzők időbeli korrelációit a keretek között mindkét folyam esetében. Utolsó lépésként a térbeli és időbeli hálózatokat összekapcsolták a kétirányú hosszú távú memóriával (Bi-LSTM) és a CTC-vel a szekvenciatanulás és a következtetések levonására. Ezután részletesebben és egymás után magyarázzuk el főbb összetevőinket. A javasolt architektúra áttekintése az 1. ábrán látható.

Figure 1


1. ábra. A javasolt módszer általános architektúrája három összetevőből áll: egy térbeli modulból, egy időbeli modulból és egy szekvencia-tanulási modulból. A térbeli modul először a képsorozatot veszi fel a képkockánkénti jellemzők kinyeréséhez, majd az időbeli modult alkalmazza az időbeli jellemzők kinyeréséhez. Ezután az időbeli jellemzők elküldésre kerülnek a szekvencia-tanulási modulba, hogy végrehajtsa a szó előrejelzését, és azt mondattá alakítsa

3.2. Térbeli modul

A térbeli modul egy teljes képkocka szolgáltatást és kulcspont jellemzőket használ ki, amint az a 2. ábrán látható. Ez a modul a 2D-CNN hálózati architektúrát használja gerincként, és a ResNet50 a több funkció rögzítésére. A ResNet50 hatékonyabban használható a legutóbbi ResNet architektúrához képest az idő tekintetében, miközben összehasonlítható eredményt ad [36,37]. Az RGB közvetlenül a ResNet50-et használja, míg a kulcspontot a HRNet [38] nyeri ki a videó keretből, és a ResNet50 segítségével nyeri ki a kulcspont funkciókat.

Figure 2


2. ábra: A térbeli modul architektúrája többfolyamos bemenetet használ. RGB adatfolyam teljes képkocka funkcióként és kulcspontok adatfolyam kulcspont funkcióként.

3.2.1. Teljes képkocka funkció

Az előfeldolgozási lépéseinket az RGB adatokra alkalmaztuk, majd az adatainkat betápláltuk a modellbe. Ezután teljes keretes bemenetként helyezzük el őket az architektúránkban. A 3. ábra az eredeti RGB kép illusztrációját mutatja a bal oldalon, a kivágott képet pedig a jobb oldalon. A kivágott képet a modell bemenetként használja. Ez illusztrálja az előfeldolgozási lépést, amely csökkenti a kép kevésbé fontos részeit, és nagyobb hangsúlyt helyez az aláíróra. Ez a vágás véletlenszerű kivágási módszert használ a [12]-ből az adatkészlet bővítésére. A teljes képkocka funkciót a ResNet50 segítségével a sorozat minden egyes képkockájához kivágott képből nyeri ki.

Figure 3


3. ábra: Teljes képkocka funkció RGB-képet használva, a (bal oldali kép) az eredeti kép, a (jobb oldali kép) pedig a levágott kép, amelyet a javasolt modellhez kell igazítani.

3.2.2. Keypoint funkciók

A térmodulban található kulcspont jellemzőket a videobemenet minden egyes képkockájához tartozó RGB adatból kinyertük. A kulcspont jellemzők minősége fontos szerepet játszik a javasolt modellünkben, ezért olyan robusztus megközelítést kell alkalmaznunk, mint a HRNet [38]. Előre betanított HRNet [38] segítségével becsültük meg mind a 133 test kulcspontját, és az eredmény 133 kulcspontjából 27-et használtunk. Ahogy a 4. ábrán látható, a bal oldal az eredeti felsőtest kulcspontja, a jobb oldal pedig a kiválasztott 27 felsőtest kulcspontja. Ez a 27 kulcspont közé tartozik a csukló, a könyök, a váll, a nyak, a kezek és az ujjak.

Figure 4


4. ábra: A PHOENIX-RWTH adatkészlet kulcspontjellemzői [33,39], (bal oldali kép) kinyerés az RGB képből, és a (jobb oldali kép) a javasolt modell által használt kulcspont.

3.3. Időbeli modul

Az időbeli modul célja a tér-időbeli információk megtanulása a térbeli modulból. Az időbeli modulokat a halmozott Temporal Pooling hozza létre minden egyes adatfolyamhoz. Amint az 5. ábrán látható, az Időbeli összevonási modul egy időbeli konvolúciós rétegből és egy pooling rétegből áll, amelyek a szekvenciális bemenetekből funkciókat vonnak ki.

Figure 5.


5. ábra: Az időbeli modul-architektúra egy halmozott 1D-CNN-ből és egy figyelőmodullal beágyazott pooling rétegből áll. Dolgozzon párhuzamosan a halmozott rétegek végén összefűzött mindkét jellemzőfolyamon, és hozzon létre egyetlen időbeli jellemzőt négyszer kisebb sorozathosszúsággal.

A bemenet az előző szakaszból származó térbeli többfunkciós lista. Az időbeli jellemzőt az időbeli konvolúciós réteg használatával kapjuk meg, amely egyetlen 1D konvolúciós réteg azonos bemeneti és kimeneti hosszúsággal, amelyet egyetlen pooling réteg követ, amely a felére csökkenti a méretet. A korábbi munkák szerint [12] a legjobb konfiguráció ennek a két halmozott temporális pooling rétegnek a használata. Minden egyes időbeli összevonás után beágyazunk egy figyelem modult, amelyet a 3.4. szakaszban részletesen ismertetünk. A végén összefűzzük az időbeli összevonás kimenetét mindkét folyamból.

3.4. Figyelem modul

A videónak több képkockája van, ahol a kép egyes részei néha homályosak. Az RTWH-PHOENIX adatkészlet [33,39] több hibás kerettel rendelkezik, mint a CSL adatkészlet [8,40,41]. Ez akkor fordul elő, ha a mozgás túl gyors, így homályos képet hoz létre, és rossz kulcspontot eredményez. Ez a keret hibásnak tekinthető, és potenciálisan az RGB és a kulcspont jellemzőinek félreértelmezéséhez vezethet. A 6. ábra az RTWH-PHOENIX adatkészlet hibás kereteit mutatja [33]. A probléma megoldása érdekében hozzáadtunk egy figyelemréteget.

Figure 6


6. ábra: Hibás keretek illusztrációja az RWTH-PHOENIX adatkészleten [33,39]. A kéz területének néhány kulcspontja rossz helyzetben van az elmosódott képek miatt.

A CTC algoritmus használatával az útvonal igazítása és címkézése üres címke használatával és az ismétlődő címkék eltávolításával történik. A CTC inkább az üres címkéket részesíti előnyben, mint a fényességhatárokat, amikor nem tudja megkülönböztetni a fényességhatárt, de egyik eredmény sem meggyőző. Ez arra készteti a hálózatot, hogy a CTC-t használja, hogy kiugró eredményeket produkáljon az elemzés, a tanulás és az előrejelzés során [42,43]. Általában a CTC-vesztés a kulcskockákat keresi, és az utolsó eredmény egy adott kulcskép előrejelzése, amely nagy valószínűséggel üres címke vagy nem üres címke. Ha a fényesség ugyanazt a címkét vagy üres címkét jelzi előre, ugyanazt a kimenetet eredményezi. Ha azonban ugyanazon címke között van egy beillesztési címke, még ha csak egy hiba is van, az sokkal nagyobb veszteséget eredményez. Itt a figyelmi réteg hozzáadása segít kiválasztani a fontos időbeli sorrendet, mielőtt szekvenciális tanulásra használnák.

A figyelem modul egy többfejes önfigyelő mechanizmust használ [20]. A többfejes modul több párhuzamos figyelemmechanizmus egyidejű működtetésére szolgál. A többfejű figyelem önállóan fut, hogy a rövid távú vagy a hosszú távú függőségekre külön fejben összpontosítson. Ezután az egyes kimeneteket lineárisan összefűzzük, és a kívánt alakra alakítjuk.

Ezzel egyidejűleg a többfejű önfigyelő mechanizmus több reprezentációs altérből származó információkról gondoskodik, a megfigyelések történetétől függően. Az egyszerűség kedvéért a bemeneti szekvenciákat X-ként jelöljük. Matematikailag az egyfejű figyelemmodellnél X t − T plusz 1:t=[X t − T plus 1, · · ·, X t bemenet ] ∈ RT × N × P, három alteret kapunk, nevezetesen a Q ∈ RN × dq lekérdezési alteret, a K ∈ RN × dk kulcs alteret és a V ∈ RN × dv érték alteret. A látens szubtér tanulási folyamat a következőképpen fogalmazható meg [20]:

Q=XWQ, K=XWK , V=XWV,

Ezután a skálázott pont-termék figyelem a figyelemkimenet kiszámításához [20]:

Figyelem (Q, K, V)=tehát f tmaxQKT/ p dkV,

Továbbá, ha több fejünk van, amelyek egyidejűleg követik a bemenet többféle reprezentációját, akkor egyidejűleg relevánsabb eredményeket kaphatunk. Az utolsó lépés az összes fej összefűzése és ismételt kivetítése a végső pontszám kiszámításához [20]:

MultiHead(Q,K,V)=Concat(fej1,...,fejek )WO,

fej=Figyelem (Qi,Ki,Vi),

ahol Qi=XWQ i , Ki=XWVi és WO ∈ R hd × dmodel. Végül kiválaszthatja a fontos részt a jellemzők sorozatából, mivel a sorozatban nem minden információ fontos.

A 7. ábrán látható módon a figyelem modult többféle konfigurációban használjuk. Az első figyelem modul a térbeli modul végén, míg a második és harmadik figyelemmodul az időbeli modulban található. A második figyelem modul, az úgynevezett korai időbeli modul, az időbeli összevonás első blokkja után kerül bemenetként, míg a harmadik időbeli figyelem modul, az úgynevezett késői időbeli figyelem modul, az időbeli összevonás második blokkja után.

Figure 7

7. ábra: A figyelem modulok különböző konfigurációkban vannak beágyazva a térbeli és időbeli modulokba.

Akár ez is tetszhet