Az érzelmi állapotok megmagyarázható automatizált felismerése a kutya arckifejezései alapján: a pozitív várakozás és a frusztráció esete
Aug 11, 2023
Adam-optimalizáló használata {{0}} tanulási sebességgel.{13}}001. A legjobb modellnek azt a modellt választották, amely a validálási adatkészleten maximális pontosságot ér el. Az első 10 korszak során az összes réteg súlyát finomhangolták. Az első 10 korszakban az összes réteg súlyát finomhangolták. A fennmaradó korszakok során a ResNet50 súlyokat lefagyasztották, és csak az új felső rétegek súlyait frissítették. A nem orientációval kapcsolatos változók esetében ('Fül lapító', 'Ajkak rész', 'Füladduktor', 'Fülek előrefelé' és 'Orrnyalás') a kép véletlenszerű vízszintes elforgatásán és legfeljebb 2-os elforgatásán alapuló augmentációs technikát alkalmaztunk. 20 fok. A kódoló bemeneteként egy bemeneti táblázatot használtunk, ahol minden sor az egyes videókon található 11 DogFACS-változó mindegyikének jelenlétét (1)/hiányát (0) jelzi. A kódoló célja egy táblázat, amely tartalmazza az egyes videók feltételét (negatív(0)/pozitív(1)).
A ResNet50 egy mély neurális hálózati architektúra, amely a számítógépes látás egyik klasszikus hálózatává vált. A ResNet50 hálózatot nagyon erős memória és a korábban tanult ismeretek megemlékezésének képessége a képzés során jellemzi, ami miatt jól teljesít összetett képfelismerő feladatokban.
Hogyan éri el a ResNet50 a memóriát? A maradék kapcsolat módszerét alkalmazza, és minden egyes konvolúciós rétegben egy parancsikont ad hozzá a rétegek között, ami javíthatja az információáramlást a hálózatban. A betanítási folyamat során ezeknek a parancsikonoknak köszönhetően a hálózat könnyebben megtanulja a fennmaradó leképezéseket, és nem kell túl sok időt töltenie a fennmaradó leképezések megtalálásával.
Ez a fajta memóriateljesítmény a ResNet50-et jól teljesíti a nagyméretű képfelismerési feladatokban. A ResNet50 nagyon jó eredményeket ért el olyan problémák esetén, mint a képosztályozás, a célfelismerés és az arcfelismerés. Ez a memória teljesítménye hasonló az agyunkhoz, amely szintén összekapcsolja a neuronokat a memória javítása érdekében. Tehát elmondhatjuk, hogy a ResNet50 egy nagyon jó mély neurális hálózati modell, amely erős memóriával rendelkezik, és jól kezeli az összetett képfelismerési feladatokat. Ugyanakkor némi inspirációt is ad számunkra. A ResNet50 ötleteiből tanulhatunk egy hatékonyabb mély neurális hálózati modell kialakításában, amely jobban kiszolgálja az emberi szükségleteket. Látható, hogy javítanunk kell a memóriánkat. A Cistanche javíthatja a memóriát, mert a Cistanche egy hagyományos kínai gyógyászati anyag, számos egyedi hatással, amelyek közül az egyik a memória javítása. A darált hús hatékonysága a benne található különféle hatóanyagoknak köszönhető, beleértve a karbonsavat, poliszacharidokat, flavonoidokat stb. Ezek az összetevők különféle csatornákon keresztül elősegíthetik az agy egészségét.

Kattintson az agyműködés javításának módjaira
Az állatkutatásban az affektív állapotfelismerés automatizálása eddig főként néhány fajnál kezelte a fájdalmat. Az érzelmi állapotok feltérképezetlen területek maradnak, különösen a kutyáknál, arcmorfológiájuk és arckifejezéseik összetettsége miatt. Ez a tanulmány két szempontból járul hozzá a hiánypótláshoz. Először is ez az első, amely kezeli a kutyák érzelmi állapotait egy ellenőrzött kísérleti környezetben nyert adatkészlet segítségével, beleértve a (n=29) labrador retrieverek videóit, amelyekről feltételezik, hogy két kísérletileg kiváltott érzelmi állapotban vannak: negatív (frusztráció) és pozitív (várakozás). A kutyák arckifejezését a Dogs Facial Action Coding System (DogFACS) segítségével mértük.
Két különböző megközelítést hasonlítanak össze abátor céllal: (1) DogFACS-alapú megközelítés egy kétlépcsős csővezetékkel, amely (i) egy DogFACS változó detektorból és (ii) egy pozitív/negatív állapotú döntési fa osztályozóból áll; (2) Mély tanulási technikákat alkalmazó megközelítés köztes reprezentáció nélkül. A megközelítések 71% és 89% feletti pontosságot érnek el, a mély tanulási megközelítés jobban teljesít. Másodszor, ez a tanulmány az első, amely az AI-modellek magyarázhatóságát vizsgálja az állatok érzelmeivel összefüggésben. A DogFACS-alapú megközelítés döntési fákat biztosít, amelyek egy matematikai reprezentáció, amely tükrözi a humán szakértők korábbi megállapításait, amelyek bizonyos arckifejezésekre (DogFACS-változók) vonatkoznak, amelyek bizonyos érzelmi állapotok korrelációi. A mély tanulási megközelítés a magyarázhatóság egy eltérő, vizuális formáját kínálja hőtérképek formájában, amelyek tükrözik a hálózat figyelmének fókuszterületeit, amelyek bizonyos esetekben az adott DogFACS-változók természetéhez kapcsolódó fókuszt mutatnak. Ezek a hőtérképek a kulcsot rejthetik a hálózatnak az emberi szem számára láthatatlan információkat tükröző, árnyalt pixelmintázatok iránti érzékenységével kapcsolatos újszerű meglátásokhoz.
Charles Darwin „Az érzelmek kifejezése az emberben és az állatokban” című alapművében1 híresen leírta az arckifejezések használatát az érzelmi állapotok megnyilvánulásaként emberekben és különféle nem emberi fajokban (a továbbiakban: állatok). Manapság széles körben elismert tény, hogy az arckifejezések fontos információforrások az érzelmi állapotok felismeréséhez. Az embereknél az arckifejezések elsődleges nonverbális eszközként szolgálnak az interakciók szabályozásában2, és az arckifejezések és az érzelmi állapotok közötti összefüggést régóta szisztematikus pszichológiai tanulmányok állapították meg3,4. Az állatokban az arckifejezéseket a legtöbb emlősfaj5 állítja elő, és az emberekhez hasonlóan feltételezik, hogy információkat közvetítenek az érzelmi állapotokról6,7. Ezért az arckifejezéseket egyre gyakrabban tanulmányozzák, mint a szubjektív állapotok lehetséges indikátorait az állatok érzelmeivel és jólétével kapcsolatos kutatásokban.
Az emberi érzelemkutatásban az arckifejezések változásainak objektív értékelésének aranystandardja az Arcműveletek Kódrendszere – FACS8,9. A FACS-t a közelmúltban különféle nem emberi fajokhoz adaptálták, köztük számos főemlőshöz (pl. orangutánok10, csimpánzok11, makákók12,13), selyemmajmok14, kutyák15 és macskák16. Ezeket az AnimalFACS-ként emlegetett rendszereket az emberekhez hasonlóan egyre gyakrabban használják állatok érzelmi állapotainak tanulmányozására (pl. 17–19).
A kutyák standardizált arckifejezéseinek azonosítása során a legnagyobb kihívást a fejük morfológiai sokfélesége20,21 és a fedő bőrstruktúrák jelentik, mint például az állandó ráncok megjelenése egyes fajtákban. A kutyák arc-érzelmi kifejezéseinek azonosítására Caeiro és munkatársai18 a DogFACS-t alkalmazták, hogy felmérjék a különböző fajtájú és keverék egyedeinek spontán reakcióit naturalista érzelmi környezetben online videók segítségével. Mind a pozitív, mind a negatív vegyértékű érzelmeket vizsgálták, beleértve a jutalom-előrejelzést (pozitívan értékelt érzelem) és a frusztrációt (negatív vegyértékű érzelem), mindkettőt a kívánt inger elvárása jellemezte16. A pozitív várakozást úgy határozták meg, mint ami olyan helyzetekben vált ki, amelyekben „[v]étel megjelenítése vagy étkezés/ételhez kapcsolódó szó(k) hallása; [v]póráz megjelenítése, sétálással kapcsolatos szó(k) hallása”, a frusztráció pedig a következőképpen definiált: „[v]egy kívánt erőforrás (játék, élelmiszer, tér) megjelenítése, amely elérhetetlen vagy elérhetetlenné válik”18. Míg Caeiro és munkatársai18 azt találták, hogy a kutyák jelentősen eltérő arckifejezéseket mutattak bizonyos érzelmi állapotok megkülönböztetésében, a frusztráció összefüggésében nem azonosítottak megkülönböztető jegyeket. Ennek megfelelően Bremhorst és munkatársai22 a kutyák pozitív várakozással és frusztrációval jellemezhető arckifejezéseit vizsgálták ellenőrzött kísérleti környezetben, ellentétben Caeiro és munkatársaival18, a kutyafajtát (labrador retriever) is standardizálva. Sőt, a szerzők nem szociális kontextust használtak, hogy kiküszöböljék a korábban tanult figyelemfelkeltő válaszokból származó interferencia kockázatát. Mindkét vizsgált érzelmi állapot kísérleti kiváltására egy nagy értékű táplálékjutalmat használtak kiváltó ingerként két feltétel esetén: a pozitív állapot pozitív várakozást indukál (a feltételes táplálékvárakozáson keresztül), a negatív állapot pedig frusztrációt (pl. a várt élelmezési jutalomhoz való hozzáférés megakadályozása). A kutyák arckifejezését ebben a két állapotban DogFACS segítségével mérték. A szerzők azt találták, hogy az "Ears Adductor" változó gyakrabban fordult elő pozitív állapotban, míg a "pislogás", "ajkak rész", "állkapocs leesés", "orrnyalás" és "füllapító" változók gyakrabban fordultak elő negatív állapotban. állapot22. Egy utólagos vizsgálatban Bremhorst és munkatársai19 egy új kutyacsoportot teszteltek hasonló elrendezéssel. Ebben a tanulmányban azonban két különböző típusú jutalmat (élelmiszert és játékot) használtak, hogy teszteljék korábbi eredményeik általánosíthatóságát szélesebb összefüggésekre19.
A korábbi eredményeket megismételték19, négy további változóval gyakrabban fordult elő negatív állapotban: "Fül lefelé", "Ajaksarok lehúzó", "Nyelvshow" és "Felső ajak emelése". A „Felső ajak emelő” kivételével az összes azonosított arckifejezés független volt attól, hogy a kutyák milyen jutalmat vártak19. Ezen túlmenően a diagnosztikai pontosság alapvető mérőszámait értékelték az azonosított arckifejezések, mint potenciális érzelmi indikátorok tekintetében, beleértve érzékenységüket, specifikusságukat, valamint pozitív és negatív prediktív értékeit19. Az eredmények azt mutatták, hogy ezen arckifejezések egyike sem szolgáltatta volna a kapcsolódó érzelmek következetes és helyes osztályozását, ha önmagukban egyéni érzelemindikátorként használták volna19. Ez nem csökkenti a potenciális jelek értékét, de talán az arckonfigurációk normál holisztikus feldolgozását hangsúlyozza23, nem pedig az egyes elemekre való összpontosítást.
A hallgatóság érzelmi kontextusban való jelenléte fontos elem, amelyet figyelembe kell venni a kutyák arckifejezéseinek (érzelmeinek) vizsgálatakor, amint azt Pedretti és munkatársai egy közelmúltbeli tanulmánya is mutatja24. Hasonlóan a 19,22-hez, a szerzők pozitív várakozásnak, nem szociális és nem szociális frusztrációnak tették ki a kutyákat, ami tesztmeneteket idézett elő. A DogFACS segítségével elemezték a kutyák arckifejezését ezekben a helyzetekben, eltekintve az egyéb viselkedési formáktól, mint például a farokcsóválás, valamint a nyál kortizolkoncentrációjának vizsgálat előtti és utáni mérése. Azt találták, hogy az "Ears Forward" gyakrabban fordult elő pozitív állapotban, mint a negatív körülmények között. Ezenkívül ezt a változót pozitívan befolyásolta a közönség jelenléte, és negatívan korrelált a teszt előtti kortizolkoncentrációkkal, ami arra utal, hogy jó mutatója lehet a kutyák figyelmi szintjének. A „füllapító”, „pislogás”, „orrnyalás”, „farokcsóválás” és „nyafogás” (ez utóbbi kettő nem szerepel a DogFACS-változókban) szintén összefüggésbe hozható a közönség jelenlétével, de nem korreláltak a kortizolkoncentrációval, ami arra utal, hogy ezeknek a viselkedéseknek a kommunikációs összetevője.

Ez azt mutatja, hogy a DogFACS a kutyák arckifejezéseinek vizsgálatára is szolgálhat, nem csak jelzésként (azaz érzelmi állapotokat kísérő viselkedésbeli változások előidézésére), hanem jelzésként is (azaz olyan viselkedések, amelyeket kifejezetten azért hoztak létre, hogy érzelmeket közvetítsenek a kommunikációs partner felé), lásd még 25. Az AnimalFACS rendszerek ezért fontos eszközt jelentenek az állati arckifejezések megértésének elősegítésére. Ezeknek a rendszereknek az arckifejezés-elemzésre való használata azonban megvan a maga kihívása, többek között a manuális megjegyzésektől való függése, amely kiterjedt emberi képzést és tanúsítást igényel, ennek végrehajtása időigényes lehet, és hajlamos lehet emberi hibára vagy elfogultságra26.
Az automatizálás fontos kiegészítő előrelépést jelenthet ehhez a folyamathoz. Különösen azt állítják, hogy az automatizált eszközök objektivitása és megbízhatósága nagyobb, mint a kézi kódolás, kiküszöbölve a szubjektivitást és a torzítást27,28, de sikerük nem függ egyetlen jellemző észlelésétől sem. Ezért nem meglepő, hogy az automatizált arckifejezés-kódolás az emberi érzelemkutatás élénk területe, számos kereskedelmi szoftvereszköz áll rendelkezésre, mint például a FaceReader by Noldus29, Afdex30, EmoVu31, valamint kiterjedt adatbázisok, mint például a CAS(ME)332.
Állatok esetében viszont az arckifejezések elemzésének automatizálása kevéssé kutatott. Ez számos kihívásnak köszönhető (amint azt 33, 34 tárgyalja), többek között először a növekedés viszonylagos frissessége vagy az állati érzelmek kutatása iránti érdeklődés, ami azt jelenti, hogy sokkal kevesebb adat áll rendelkezésre az emberi terület hatalmas adatmennyiségéhez képest. Másodszor, különösen a háziasított fajok esetében, az arc morfológiájának nagy eltérései technikai kihívásokat jelentenek35. Végül a verbális önbevallás hiánya megnehezíti az állatoknál tapasztalt érzelmi állapot alapjait megállapítani, míg az embereknél az önbevallás standard megközelítés erre a célra. Az állatokra vonatkozó adatgyűjtési protokollok ezért kiterjedt ellenőrzést és szabályozást igényelnek, a vizsgált érzelmi állapotok operatív meghatározását (lásd pl. 18), vagy esetleg humán szakértők értékelését – bár ez potenciálisan torzítást és szubjektív megítélést eredményez.
Broomé és munkatársai36 húsz tanulmányból álló átfogó felmérést nyújtottak be, amelyek a legmodernebb megközelítéseket mutatják be az érzelmek és a fájdalom automatikus felismerésére állatokban. E művek többsége a fájdalom előfordulására összpontosít. Az ebben az összefüggésben tárgyalt fajok közé tartoznak a rágcsálók37–39, a juhok40, a lovak33,41,42 és a macskák43. Mindezek a munkák egy bináris osztályozót adnak a fájdalom/fájdalom nélkül, gépi tanulási technikák segítségével.
Az állati érzelmek felismerésének szélesebb körű automatizálására irányuló munka sokkal ritkább. Két főemlősökön végzett tanulmány a kapcsolódó cselekvési egységre/arckifejezés-felismerésre összpontosít, anélkül, hogy kifejezetten foglalkozna az érzelmi állapotokkal44,45. Blumrosen és munkatársai44 a főemlősök négy arckifejezésének automatizált felismerését: semleges, ajakcsattogás, rágás és véletlenszerű szájnyitás minimális megjegyzésekkel, míg Morozov és munkatársai45 prototípus rendszert valósítottak meg a Rhesus makákók automatikus MaqFACS kódolásához. hat MacFACS-változó osztályozására képzett.
Broomé et al.36-ban mindössze három olyan munkát vizsgáltak meg, amelyek a különböző érzelmi állapotok végpontok közötti osztályozását biztosítják. Corujo és munkatársai 46 négy érzelmi állapotot határoztak meg a lovak számára: „riasztott”, „bosszantó”, „kíváncsi” és „lazított”, mindegyiket szem, fül, orr és nyak viselkedése alapján határozták meg. Például a „lazított” szemek: részben vagy többnyire csukott, fülek: laza, oldalra nyíló nyílások, orr: ellazult száj és nyak: körülbelül párhuzamos. Egy konvolúciós neurális hálózat (CNN) modellt képeztek ki az érzelmek e négy "osztályának" előrejelzésére. Ferres és munkatársai47 automatizált pózbecslést használtak a DeepLabCut48 segítségével a kutyák négy érzelmi osztályának „harag”, „félelem”, „boldogság” és „relaxáció” osztályozására. Franzoni és munkatársai 49 egy CNN-modellt is használtak az érzelmi állapotokhoz kapcsolódó korlátozott attribútumok osztályozására: "mosoly" (az "örömhöz" kapcsolódik), "morgás" (a "haraghoz" kapcsolódik) és "alvás" (semlegeshez kapcsolódik). állapot).
A kutyákkal kapcsolatos három mű47,49,50 közül kettő a testtel foglalkozott az érzelmi állapotok47 és a fájdalom50 felismerésére, egy pedig az érzelmek arckifejezésére49. Mindazonáltal a Ferres és munkatársai47 és Franzoni és munkatársai49 tanulmányaiban használt adatkészletek egyaránt tartalmaztak az internetről gyűjtött és nem szakértők által jegyzett képeket, és így potenciálisan alacsony megbízhatóságúak és érvényesek. Zhu50 munkája a fájdalomfelismerést testbeszéd alapján vizsgálja, nem pedig az arckifejezéseket.
Az itt bemutatott tanulmány az első, amely a kutyák érzelmeinek arckifejezésekből történő automatikus felismerését vizsgálja, egy gondosan megtervezett kísérleti protokollból gyűjtött adatkészlet felhasználásával, ahol a kontextus védi az érzelmi állapotokat22. Ebben a protokollban a pozitív várakozás (pozitív érzelem) és a frusztráció (negatív érzelem) érzelmi állapotát operatívan határozták meg (18-nak megfelelően, és kísérletileg indukálták egy 29 labrador retriever alanyból álló mintán, minimalizálva a kutyák közötti morfológiai különbségek változékonyságát. a kutyák által előállított arckifejezéseket objektíven kódolták a szabványos DogFACS rendszer segítségével, minősített DogFACS kódolók. Ez az adatkészlet egyedülálló kísérleti környezetet teremt az érzelemfelismerés automatizálásának különböző megközelítéseihez, minimális torzítással az érzelmek meghatározásában. Az adatok további előnyökkel járnak a résztvevők arcának morfológiai változatossága a fajta standardizálása miatt.
Eszerint36 az érzelmi vagy fájdalmas állapotok osztályozásának két szabványos módja van: kézzel készített jellemzők, vagy a tanult tulajdonságokon alapuló mély tanulási paradigma használata51. A kézzel készített jellemzők durván feloszthatók alacsony szintű jellemzőkre, amelyek a számítógépes látás szakirodalmában általánosan használt képstatisztikákon (például az orientált gradiensek hisztogramján) alapulnak51, és magas szintű jellemzőkre, amelyek szemantikailag megalapozottak a fajokban. specifikus anatómiai arc- és/vagy testfelépítés, grimasz pikkelyek, akcióegységek stb. Ez utóbbiak példái a macska arcának tereptárgyai52, a kutya testének kulcspontjai47 vagy a birkafájdalmak40. Ezek a funkciók elősegítik a gépi tanulási algoritmusok magyarázhatóságát azáltal, hogy a modell döntéseit viselkedési fogalmakra alapozzák. A mély tanulási megközelítés ezzel szemben rugalmasabb, és várhatóan jobban teljesít (különösen, ha nagy adatkészletek állnak rendelkezésre), ugyanakkor költséges számítási erőforrásokat igényel, és „fekete doboz” abban az értelemben, hogy nem alkalmas magyarázatra. ember számára érthető módon, hogy miért születik egy adott besorolási döntés.
Ebben a tanulmányban mindkét alternatív utat megvizsgáljuk a kutyák érzelmi állapotainak automatizált osztályozására. Az első útvonal a DogFACS változókat használja megmagyarázható magas szintű jellemzőkként. Az osztályozási folyamatnak ebben az esetben két szakasza van: egyrészt a DogFACS-kódok automatikus felismerése, másrészt a megjegyzések használata a vizsgált érzelmek osztályozására. Bemutatjuk az ilyen magyarázható reprezentáció hasznosságát annak megértésében, hogy a DogFACS változókat hogyan használják a gép döntéshozatalában. A második út (egyszerűbb, egylépcsős) mély tanulási megközelítést alkalmaz, lehetővé téve, hogy a gép közvetlenül tanuljon azokból az adatszolgáltatásokból, amelyek nem feltétlenül érthetők az ember számára. Továbbá összehasonlítjuk a két megközelítés magyarázhatósági szempontjait, és hőtérképes vizualizációs technikákat alkalmazunk, hogy kiemeljük a tanult jellemzők kapcsolatát a kutya arcrészeihez kapcsolódó szemantikai objektumokkal.
Eredmények
Adatkészlet.
Az adatkészletet és a DogFACS annotációkat használtuk, amelyeket Bremhorst és munkatársai egy korábbi tanulmányának részeként generáltak22. A morfológiai eltérések hatásainak csökkentése érdekében 29, extrém arcvonásokkal nem rendelkező fajtájú (labrador retriever) alanyt teszteltek (19 nőstény – 13 ivartalanított, 10 hím – 9 ivartalanított; életkor: 2–9,5 év, átlagéletkor {{9} },22 év). Az 1. ábra szemlélteti az alany életkorának és nemének megoszlását.
Az adatkészlet összesen 248, 3 másodperces videómintát tartalmazott, amelyeket 25,25 képkocka/s sebességgel rögzítettek, és mindegyik képkocka felbontása 1920 × 1080 pixel volt. A rögzítéshez használt kamera a HIKVision, IR Mini Bullet Network Camera; felvevő: HIKVision, DS-7600 sorozat. Az alanyok egy átlátszó ablak mögött helyezkedtek el a Bremhorst et al.22-ben teljes körűen leírt protokoll szerint. Minden alanyt 3-szor teszteltünk pozitív és 6-szor negatív állapotban. Összességében a videók kétharmadát negatívként, egyharmadát pozitívként jelölték meg. A tanulmányban végig azt feltételezzük, hogy a negatív állapot frusztrációt, a pozitív pedig pozitív várakozást indukál, ezért a továbbiakban a pozitív/negatív vegyértéket használjuk a két érzelmi állapotra. A 2. ábra az adatkészletből kinyert kutyaarcok kivágásait mutatja.

Az adatkészlet kiegyensúlyozása véletlenszerű alulmintavétellel történt, így 82 videó pozitív körülményekről és 82 negatív állapotú videó maradt (n = 29) személytől, összesen 164 videót. A kiegyensúlyozást egyedenként azonos számú pozitív és negatív minta megtartásával végeztük.
Minden videomintát 39 DogFACS-változóval kódoltak a DogFACS kézikönyv53 alapján, egy minősített DogFACS kódolóval, 200 ms-onként egy képkocka megjegyzéssel a Solomon Coder segítségével (15.03.15-ös verzió, András Péter). Ebből a 39 változóból az 1. táblázatban bemutatott tizenegy változót használták fel a Bremhorst22 vizsgálatában, a legalább 10%-os prevalencia alapján az összes pozitív vagy negatív állapotú mintában, és legalább jelentős volt az interkóder megegyezés (lásd 22). további részletekért).

A két megközelítés áttekintése.
Itt bemutatjuk a pozitív és negatív állapotok automatizált osztályozásának két különböző megközelítésének összehasonlítását: DogFACS-alapú vs. tiszta (a DogFACS-megközelítésnek van egy mély tanulási modulja is a DogFACS-változók detektálásához) mély tanulási megközelítés. A 3. ábra a két megközelítés magas szintű áttekintését mutatja be.
A videoadatok elérhetősége lehetővé teszi számunkra, hogy kétféle bemenettel dolgozzunk: egyetlen képkockával vagy képkockák sorozatával. Az előbbi több információvesztéssel jár, de egyszerűbb és jobban ellenőrizhető; míg az utóbbi időbeli dimenziót foglal magában, amiről kimutatták, hogy fontos az ilyen feladatoknál, például a lovak fájdalmának kimutatása kapcsán42,54. Az elterjedt megközelítés az affektív állapotok és az állatok fájdalmának automatizált felismerésének kontextusában azonban az egyetlen keret alapja (pl.33,39,41,55). A tanulmány feltáró jellege miatt ezt a lehetőséget választottuk.
Mindkét megközelítés egyetlen képkocka alapon működik, azaz az osztályozás a videókból kivont egyetlen képkockákon történik. Az egykockából álló információk összesítése azonban a két esetben eltérően történik. A levágott kutyaarcok keretekből való kinyerésének előfeldolgozási lépése után (a példákat lásd a 2. ábrán), a mély megközelítésben a nyers vágott arcokat egy neurális hálózat bemeneteként veszi fel. Itt kétféle neurális hálózati architektúrával kísérletezünk: a konvolúciós neurális hálózattal (Resnet5056) és a nemrégiben bevezetett vision transformer57 (ViT) hálózattal. A kiválasztott hálózat döntéseit ezután többségi szavazással összesítik, és megszületik a videónkénti besorolási döntés.
A DogFACS-alapú megközelítés viszont két egymást követő lépésből álló folyamatot használ. Az első az automatizált DogFACS Variable detektor, amely minden egyes keretben egy sor DogFACS változót észlel. A DogFACS változókat ezután a teljes videóra összesítik. A második lépés egy döntési fa, amelynek bemenete a videóban észlelt DogFACS-változók halmaza, amelyet a végső besorolási döntés meghozatalához alkalmaznak.
Így a DogFACS-alapú megközelítés a videóban azonosított DogFACS-változók halmaza alapján hozza meg az osztályozási döntést; a mély tanulási megközelítés viszont minden képkockáról külön dönt, nyers képekből kinyeri a tanult jellemzőket, majd összesíti a döntést a videó összes képkockájára vonatkozóan. Ezért, amikor a két megközelítés magyarázhatóságát vizsgáljuk, az előbbiben Bremhorst és munkatársai22 szerint „magyarázatokat” várunk (mindegyik feltételben elterjedt változók azonosítása, vagy ezek valamilyen kombinációja). Az utóbbi megközelítés azonban várhatóan több vizuális magyarázatot ad arra vonatkozóan, hogy a modell mely képi jellemzőkre összpontosít, amint azt alább kifejtjük.
Modelljeink teljesítményének értékeléséhez a szabványos pontosság, precizitás és felidézés mérőszámait használtuk, amely a gépi tanulásban szokásos módszer. Validálási módszerként az egy alany elhagyása keresztellenőrzést alkalmaztuk alanyi átfedés nélkül, ami azt jelenti, hogy minden kutyát külön tesztkészletként használunk. Ez a módszer olyan adatkészletekhez ajánlott, amelyekben egy személyhez több minta is tartozik36. A megfelelő validálási módszer kiválasztásának fontosságáról lásd Broomé et al.36.

DogFACS-alapú megközelítés.
DogFACS változók halmazai. Két különböző DogFACS-változókészlettel kísérleteztünk:
1. Az 1. táblázatban bemutatott tizenegy változóból álló halmaz, amelyet Bremhorst és munkatársai tanulmányában22 használtak, a legígéretesebb vagy potenciálisan legfontosabb változók (amelyek legalább 10%-os prevalenciája az összes mintán belül). pozitív vagy negatív feltétel), és megbízhatóan kódolhatók (legalábbis jelentős interkóder megállapodással, lásd 22).
2. A Bremhorst és munkatársai tanulmányában kódolt 39 DogFACS változó teljes halmaza22.
Classification results. To explore optimal performance, we used the manual DogFACS annotations from Bremhorst et al.22 to experiment with different machine learning techniques, including Decision Tree, XGBoost, and Random Forest. Table 2 presents a comparison of their performance, with Random Forest performing slightly better for the full set of DogFACS variables (39 variables), reaching accuracy > 71%. In the limited set (11 DogFACS variables), the three models converged to one tree, and thus are presented together, reaching a slightly lower accuracy of > 66%.
A döntési fa minimalizálása. Ezután szisztematikus keresést végeztünk a DogFACS-változók minimális halmazára, amelyek a 2. táblázatban bemutatott besorolási teljesítményt biztosítanák. A 3. táblázat azt mutatja, hogy csak egy DogFACS-változó felhasználása a 2. táblázatban bemutatotthoz hasonló teljesítményt garantál. A 11 DogFACS változóból álló korlátozott halmazt használó osztályozáshoz az „Ears Flatten” változó a legfontosabb, jelenléte előrejelzi a negatív állapotot. A 4. ábra az egyszerűsített döntési fát mutatja, amely egyetlen jellemzővel jelzi előre a pozitív feltételt – a „Füllapító” hiányát, és a negatív feltételt – a jelenlétét (>66%-os pontossággal).
Nevezetesen, ha mind a 39 DogFACS-változót figyelembe vesszük, az „Eyes Up” a legfontosabb változó mind a 39 változót használó osztályozáshoz, jelenléte nagy, > 71%-os pontossággal jelez előre pozitív körülményeket.
A DogFACS változók automatikus észlelése. Eredményeink alapján egy teljesen automatizált osztályozási folyamathoz elegendő egy detektor betanítása az „Ears Flattener” és „Eyes Up” DogFACS változókhoz. Más változók kimutatását is megvizsgáltuk egy előre betanított ResNet50 konvolúciós neurális hálózat segítségével kiegyensúlyozott adathalmazokon (változó számú képen a DogFACS változó frekvenciájának változékonysága miatt). A kapott detektorok teljesítményét a 4. táblázat mutatja be.

Mély megközelítés.
Ebben a megközelítésben a közös "transzfer tanulás" beállítást alkalmaztuk, egy lineáris szondát tanítva egy rögzített, előre betanított gerincre, emberi megjegyzések segítségével. A különböző gerinchálózatok alkalmasságát erre a feladatra úgy tárjuk fel, hogy megismételjük a kísérletet négy előre betanított gerinccel: ResNet és ViT képosztályozásra felügyelt módon57 vagy önfelügyelt módon, DINO58 segítségével.
Négy különböző modellt betanítottunk (a teljes adatkészletre vonatkozóan), és teszteltük a teljesítményüket a fent leírt kiegyensúlyozott adatkészletből származó képkockák segítségével (82 videó a negatív állapotról, 82 videó a pozitív állapotról (n = 29) személytől, összesen 164 videó).
Az 5. táblázat a videónként elemzett besorolási eredményeket mutatja be, azaz azt mondjuk, hogy egy videó akkor van helyesen besorolva, ha a képkockáinak többsége helyesen van besorolva. Látható, hogy a DINO-ViT gerinccel kiképzett modell mutatja a legjobb teljesítményt, 89% feletti pontossággal. A 6. táblázat keretekenként elemzett osztályozási eredményeket mutatja be. Ahogy az várható volt, ebben az esetben a mérések némileg csökkentek a keretösszegzés elemzéséhez képest, ami 85%-os pontosságot eredményez a DINO-ViT gerinccel betanított modell esetében.

Vita
The present study is the first to explore automated recognition of canine emotional states focusing on diverse facial expressions, whilst using a carefully designed controlled experimental setup for dataset creation and annotation. We present classifiers of two different types: deep learning-based and DogFACS-based, both having a performance that is comparable to and in some cases outperforms those presented in previous studies addressing recognition of pain or emotional state from facial expressions, including mice38,39 (> 89% and 93% respectively), cats43 (> 72%), horses42,46 (> 75% and 65% respectively) and sheep55 (> 64%).
The DogFACS-based approach described here reached an accuracy of > 71% using the full set (n = 39) of DogFACS variables, but a lower accuracy of > 66% when using only the eleven DogFACS variables which were utilized in the study of Bremhorst et al.22 ( this accuracy was achieved based on manual DogFACS annotations and is expected to drop even lower in an end-to-end pipeline). Of the full set of 39 DogFACS variables, 'Eyes Up' were of considerable importance for classification, and including them in the Decision Tree leads to higher accuracy (>71%). Az olyan irányváltozók, mint a szemmozgások és azok jelentőségének potenciális érzelmi indikátorként való értelmezésekor azonban mindig figyelembe kell venni annak a vizsgálatnak a kísérleti felépítését, amelyben az adatokat gyűjtötték. A Bremhorst és mtsai.22-ben a kísérletvezető egy mozdulattal juttatta el a táplálékjutalmat a kutyák szemceruzája fölött. Ez arra ösztönözhette a kutyákat, hogy felfelé nézzenek (indukálva az „Eyes Up” változót) a táplálékra várva. Ezért fel kell ismernünk, hogy ez a DogFACS változó a kísérleti eljárás műterméke lehet. Az érzelmi indikátorok fejlesztése során a változók kiválasztásakor fontos mérlegelni az I. típusú hiba (hamis pozitív) és a II. típusú hiba (hamis negatív) kockázatát, amely szinte elkerülhetetlen. A tizenegy DogFACS-változóból álló csökkentett készlettel végzett munka során a hamis negatívok elkerülését helyeztük előtérbe a hamis pozitívakkal szemben, hogy ne zárjunk ki idő előtt egy változót a további vizsgálatból. Arra számíthatunk, hogy a hibásan elfogadott változók kizárásra kerülnek a későbbi vizsgálatok során, ha a prediktív érvényességük hiányát azonosítják (amint azt a 19-ben tárgyaljuk).
As a byproduct of these results, we obtained automated detectors for nine DogFACS variables, of which five performed with an accuracy >70%, bizonyítva a DogFACS változók pontos automatizált felismerésének megvalósíthatóságát. Az egyes változókra vonatkozó detektorok betanításának fő kihívása az adatok elérhetősége, azaz egyes DogFACS-változók alacsony megjelenési gyakorisága, amely célzott erőfeszítéseket tesz szükségessé az egyes változókhoz tartozó adatkészletek összegyűjtésére. Ezen túlmenően néhány változónak időbeli dimenziója van, és nem kezelhetők egyetlen képkockánként (pl. szempillantás vagy lihegés). A detektorok fejlesztéséhez olyan modellekre van szükség, amelyek az időbeli dinamikát is kihasználják, mint például Broomé et al.42 megközelítése.
Továbbá meg kell jegyezni, hogy mivel adatkészletünk egy fajtára korlátozódik, azonnali jövőbeli kutatási igény a modellek más fajtákra való általánosíthatóságának felmérése. Ha a teljesítmény jelentősen csökken, amikor az eredményeket más fajtákra visszük át, az itt használt mély megközelítés alternatív megközelítéseit javasolják, például Feighelstein et al.43.

Az itt bemutatott modellek általánosíthatóságának feltárása nemcsak a DogFACS-változódetektálás kontextusában, hanem az érzelmek osztályozása szempontjából is fontos. Az itt használt adatkészlet nem csak a fajtára vonatkozik, hanem szigorúan ellenőrzött környezeti feltételek mellett is rögzítésre kerül. Az ellenőrzött környezetről a naturalista beállításokra történő általánosítás köztudottan nehéz kihívás az emberi érzelmi számítástechnikában is60. Feng és munkatársai61 áttekintést adnak arról az emberi területről, hogy az átviteli tanulási technikák hogyan képesek leküzdeni a korlátozott mennyiségű adatmintával, a szűkös címkékkel és a környezeti változékonysággal kapcsolatos kihívásokat, elősegítve az érzelmek felismerésére szolgáló robusztus és általánosítható automatizált rendszereket. Hasonló módszereket lehet felfedezni a kutya affektív számítástechnikában; az itt bemutatott eredmények alapot adnak ennek az iránynak a további feltárásához.
Olyan kérdések, mint például: „Felismerhetik-e a gépek az állatok érzelmi állapotát?” önmagukban is érdekesek, és messzemenő gyakorlati alkalmazásaik vannak az állatjólétben. Vizsgálatunk eredményei a pozitív válaszra utalnak, legalábbis a pozitív frusztráció és várakozás esetén a kutyáknál. A kutyák érzelmeit felismerő mesterséges intelligencia modellek felépítése azonban jelentős hozzáadott értékkel bír abban, hogy megértsük, hogyan osztályozzák a gépek az érzelmeket, hogy érzékenyek-e az emberi szakértő számára nem látható árnyalatokra, és milyen következményekkel jár ez az állatok érzelmeinek megértésében és a folyamatban lévő folyamatokban. viták az állatok érzékéről. Emiatt kulcsfontosságú és ígéretes a magyarázhatóság (mi a gép döntésének oka?) és az értelmezhetőség (milyen kapcsolatban áll a modellstruktúra egy ilyen döntés meghozatalával?)62. Ezek a témák alapvetőek a mesterséges intelligencia számára, és hatalmas mennyiségű kutatás foglalkozik velük63–65, és a legtöbb erőfeszítés a mély tanulási megközelítésekre összpontosul, amelyek értelmezhetőségét összetett szerkezetük korlátozza66. A magyarázhatósági módszerek természetüknél fogva szakterület-specifikusak: az állásinterjúkon az automatizált személyiségjegy-felismerés magyarázata más, mint például az orvosi döntések klinikai indoklása62.

Tanulmányunk elsőként foglalkozik az állatok érzelmeinek felismerésére szolgáló mesterséges intelligencia-modellek magyarázhatósági szempontjaival. Mivel az érzelmek osztályozásának két különböző megközelítését hasonlítottuk össze, hozzáadott értéket jelent az a képesség, hogy össze tudjuk hasonlítani a megmagyarázhatóság szempontjaiban mutatkozó különbségeket is. A DogFACS-alapú megközelítés egyszerű döntési fák formájában megjelenő modellekhez vezet, amelyek az emberi logikai gondolkodást modellezik bizonyos DogFACS-változók jelenlétére/hiányára vonatkozó Boole-feltételek kombinációja formájában. A döntési fák magyarázó jellege különösen tükröződik az egyszerűsített, egyetlen csomóponttal rendelkező változatukban, mint például az itt tanulmányozott változatban (a „Füllapítóval”). Az ilyen fák szorosan kapcsolódnak a humán szakértők számára hasznos fogalmakhoz, különösen a Bremhorst és munkatársai által vizsgált érzelmi indikátorokhoz19. Az érvényes érzelmi indikátorok célja egy adott érzelmi állapot pontos azonosítása, amely mindig jelen van, amikor az érzelem jelen van, és egyébként hiányzik.
Ezeket a jellemzőket az érzékenység és a specificitás írja le, amelyek általában a diagnosztikai tesztek pontosságának értékelésére szolgálnak. Bremhorst és munkatársai19 azt találták, hogy a vizsgálatban figyelembe vett DogFACS-változók egyike sem tekinthető a pozitív várakozás vagy frusztráció specifikus egyéni mutatójának kutyáknál. Pontosabban, az 'Ears Flattener' viszonylag nagy érzékenységgel, de alacsony specificitással rendelkezik. Így nem meglepő, hogy a tanulmányunkban ismertetett modell, amely egy döntési fa, egyetlen jellemzője az „Ears Flattener”, nem ért el magas teljesítményt. A kapcsolat azonban a Bremhorst és munkatársai által19 használt érzelmi mutatók metrikái és a modellünk teljesítményének értékelésére itt használt mérőszámok között nem egyértelmű. Míg az előbbi a teljes, kiegyensúlyozatlan adatra számítja ki az érzékenységet, a specificitást, valamint a pozitív és negatív prediktív értéket, addig az utóbbi egy előrejelzési feladat teljesítményét értékeli. Ez azt jelenti, hogy az adatok két részre oszlanak: képzésre, amelyet a modell betanításához használnak, és tesztelésre a teljesítmény értékeléséhez. Bremhorst et al.19-vel ellentétben mi is alulmintavétellel egyensúlyoztuk ki az adatokat. A kettő között azonban az az intuitív kapcsolat, hogy ha az előbbi megközelítéssel találunk egy kiváló érzelemmutatót, akkor arra számíthatunk, hogy az ezt jellemzőként használó döntési fa is kiváló teljesítményt ér el.
A megmagyarázhatóságon túlmenően az itt bemutatott gépi tanulási megközelítés az optimális döntési fa modellek keresésére a kutyák érzelmeinek előrejelzésére, új betekintést engedhet az érzelmi mutatókba. Ahogy fentebb tárgyaltuk, a pontos érzelmi mutatók felfedezése Bremhorst és munkatársai szerint19 szorosan összefügg azzal a problémával, hogy egyetlen DogFACS-változót tartalmazó döntési fa osztályozókat találjunk az érzelmek előrejelzésére. Noha az ilyen osztályozók nem bizonyultak nagy pontosságúnak tanulmányunkban (és valóban nem fedeztek fel pontos érzelmi mutatókat19), az osztályozási teljesítmény javítható a döntési fák kifinomultabb formáinak figyelembevételével, például a DogFACS-változók párokba csoportosításával. , hármas, stb. Az 5. ábrán látható DogFACS-változópárokat csomópontként használó előzetes kísérleteink azt mutatják, hogy ez javította a modell teljesítményét az előhívás tekintetében. Fontos, hogy annak vizsgálata, hogy a DogFACS-változók mely kombinációi javíthatják a besorolást, automatizáltan, kimerítően és szisztematikusan elvégezhető, ami az érzelmi indikátorok finomabb fogalmaihoz vezethet. Ez ígéretes utat biztosít a jövőbeli kutatás számára.
A mély tanulási megközelítés ezzel szemben jelentősen magasabb, 89% feletti teljesítményt ért el, bizonyítva az ilyen megközelítésekben rejlő lehetőségeket az érzelmek osztályozásában. Sőt, a DINO-ViT gerincoszlop tűnik a legalkalmasabbnak az érzelmek osztályozására mind a négy vizsgált lehetőség közül. Feltételezzük, hogy ez annak köszönhető, hogy a DINO-ViT jellemzői érzékenyek az objektum részeire, amint az a 67. ábrán látható; és az érzelembesorolási feladat természetéből adódóan tárgyrész szintű megértést igényel (arcrészek, például szemek, fülek stb.). Érdekes módon a DINO-val előképzett gerincek jobb eredményeket produkálnak, mint a felügyelt gerincek.
Megjegyzendő, hogy a mély tanulási osztályozó képek alapján működött, majd videónként összesítette az eredményeket. Ez azt jelenti, hogy annak ellenére, hogy sok képkocka nem mutat DogFACS-változókat, a modell továbbra is sikeres a megfelelő osztályozásban. Ez jelezheti a modell érzékenységét a pixelszintű finomszemcsés részletekre, ami túlmutat az emberi szem képességein. Ez azonban összefügghet a lehetséges buktatókkal is, amelyek bizonyos eredendő torzítások formájában jelentkeznek. Emellett a fentebb tárgyalt „Eyes Up” változó is fontos szerepet játszott a hálózatban, és a döntéshozatalra gyakorolt hatása nem könnyen semlegesíthető a mély tanulási hálózatban. E kérdések vizsgálata további adatgyűjtést igényel különböző kísérleti és környezeti körülmények között az ilyen buktatók kizárása érdekében.
Az itt vizsgált mély tanulási megközelítés magyarázhatósága viszont teljesen más, inkább vizuális jellegű, mint a DogFACS-on alapuló. A döntési fa modellekkel ellentétben rendkívül nehéz a neurális hálózatok döntéshozatalának ember számára érthető magyarázata, mivel rendkívül összetett, „fekete dobozos” jellegük68. Az EigenCAM59 módszer használata rávilágít az általunk kísérletezett különböző modellek (ResNet/ViT, felügyelt/DINO) közötti különbségekre. Amint azt a 6. ábra mutatja, van néhány eltérés a modellek között. Úgy tűnik, hogy a Te ViT modellek jobb lokalizációt mutatnak, mint a ResNet modellek, mivel az erősen aktivált régiók (pirossal jelölve) kisebbek, és a szembetűnőbb területeken fekszenek (pl. szemek, fülek, orr, nem pedig bőr). Sőt, úgy tűnik, hogy a DINO-ViT modell több kiemelt területen aktiválódik, nem pedig egy (pl. a füleken, a szemeken és az orron aktiválódik, nem pedig csak a füleken a jobb felső példában). A ViT-alapú modellek sikerét annak tulajdonítjuk, hogy a ViT-ek lokalizáltabb jelet tudnak adni, mint a ResNet modellek. Ez a felépítésükből adódik – a ViT-jellemzők felbontása állandó marad a rétegekben, míg a CNN-jellemzők felbontása csökken, ahogy a rétegek mélyebbre kerülnek.
Míg a végleges következtetések levonása további kutatást igényel, kísérleteztünk az EigenCAM módszerrel, figyelmünket az alábbi feltételeket kielégítő képkockákra összpontosítva: (i) manuálisan kódolva az „Ears Flattener” változóval, és (ii) a videominták osztályába tartozó negatív állapot, és (iii) a DINO-ViT hálózat megfelelően negatív állapotnak minősítette. Elemzésünkben a példákat három kategóriába osztottuk, amint azt a 7. ábra mutatja. Az A kategória példái hőtérképek, amelyek egyértelműen csak a fülekre fókuszálnak. Ez összhangban van a DogFACS-hoz kapcsolódó „Füllapító” magyarázattal, azaz előfordulhat, hogy a modell megtanulta a fülmozgással kapcsolatos mintákat. A B kategória is összhangban van ezzel, a hőtérképeket mindkét fülre és más területekre, például a szemekre, a homlokra, az orrra és a szájra fókuszálva jeleníti meg. Ez utóbbi közvetetten összefügghet a „Füllapító” mozgással, valamint más DogFACS-változókkal vagy más testtartási jellemzőkkel, amelyek jelen lehetnek a keretben. A legérdekesebb kategória azonban a C kategória: itt a modell a füleken kívül más arcrészek jelzéseit is felveszi, és továbbra is a helyes besorolást végzi el. Ezek az esetek rejthetik magukban a kulcsot annak megértéséhez, hogy a hálózat mennyire érzékeny az emberi szem által nem látható árnyalatokra. Mindenesetre meg kell jegyezni, hogy a DogFACS annotációi nem képesek kimerítően lefedni az arc viselkedésében bekövetkező összes lehetséges változást, ami tükröződhet a hálózat érzékeny pixelmintáiban. Ezután hőtérképeket is kivontunk azokból a videókból, amelyek nem tartalmaztak megjegyzésekkel ellátott DogFACS-változókat. Kilenc videó volt változók nélkül, ezek közül nyolc „pozitív”, egy pedig „negatív”. Feltűnő, hogy ezeknek a videóknak a többségét (77%) a modell még mindig helyesen osztályozta. Ez egy újabb jele lehet annak, hogy a modell olyan finom arcviselkedést észlel, amelyet a DogFACS nem rögzített. Az ezen videók képkockáihoz készített hőtérképek vizsgálatakor azt tapasztaltuk, hogy a modellnél az orr-száj terület volt a fő hangsúly. Néhány más képkocka más arcrészekre fókuszál, míg vannak olyan esetek, amikor a keretek megfelelően osztályozódnak, de a hőtérképek homályosak és nem egyértelműek. Ebből a három kategóriából példákat mutatunk be a 8. ábrán. Érdekes módon ezek a hőtérképek nem összpontosítanak bizonyos arcrészekre, ami arra utal, hogy ezekben az esetekben a vizuális jelzések kevésbé voltak nyilvánvalóak a modell számára.


Egy másik figyelemre méltó probléma mindkét megközelítéssel kapcsolatban a teljesítmény tekintetében a videók rövid hossza (3 s) az aktuális adatkészletben. Hosszabb videók használata kihívást jelent egy optimális időablak meghatározásában, amely alatt a belső állapot állandónak tekinthető. Ezt a problémát a lovak enyhe ortopédiai fájdalmaival összefüggésben 69 vizsgálták, és ez a jövőbeli kutatások fontos iránya a kutyák érzelmi állapotaira is.
Összefoglalva, ez a tanulmány bemutatta a két különböző automatizált osztályozási megközelítés értékét két érzelmi állapotra kutyáknál az arckifejezésük alapján: pozitív vagy negatív állapot. Mindkettő jó, más korszerű módszerekkel összehasonlítható pontosságot ért el az állati hatások automatizált felismerésében. Ezek az eredmények nemcsak első alkalommal adnak igenlő választ a „Felismerhetik-e a gépek a kutya pozitív/negatív érzelmeit?” kérdésre, hanem új kutatási utakat nyitnak annak feltárására, hogy a gépek hogyan ismerik fel őket, és hogyan tegyék ezt a felismerést megmagyarázhatóvá az emberek számára. . A nagyobb, szélesebb résztvevői jellemzőkkel rendelkező adatkészletekkel végzett további kísérletezés elősegíti a jó állati érzelmi mutatók kialakításának megértését is. Az egyik konkrét irány, amely különösen ígéretesnek tűnik, az arcok tereptárgyak észlelésével kapcsolatos megközelítések lehetőségeinek feltárása, mint például az OpenFace70 és a Google MediaPipe71. Hasonló megközelítéseket most kezdenek felfedezni nem emberi állatok esetében is, lásd például Feighelstein és társai tanulmányát43 a macskaarcokról. A humán területhez hasonlóan fejlesztésük kiterjedt multidiszciplináris erőfeszítéseket tesz szükségessé a különféle fajokra vonatkozó nagy adatkészletek összegyűjtéséhez.
Mód
Adatkészlet.
Az ehhez a vizsgálathoz használt kutyákra vonatkozó adatkészletet korábban a Lincolni Egyetem alábbi etikai jóváhagyásai alapján gyűjtötték (UID: CoSREC252), a Bremhorst et al.22 szerint, a kutatás módosításával a Lincolni Egyetemtől szerezték be. a jelen tanulmány eredeti adatkészletét használva. Az ezen adatokat használó jelenlegi protokollt a Haifai Egyetem Etikai Bizottsága felülvizsgálta, és nem volt szükség további jóváhagyásra.
Vágás és előfeldolgozás.
Ez a lépés mind a DogFACS, mind a mély megközelítések szempontjából releváns. Az eredeti videókockák háttér zűrzavart tartalmaznak, beleértve a környező helyiséget, embereket, kutyatesteket stb. Célunk, hogy a kutyák arckifejezéseire összpontosítsunk, és kerüljük az egyéb érzelmi állapot előrejelzők (pl. kutya testhelyzetek) megismerését. Ezért betanítottunk egy Mask-RCNN72-t a kutyaarcok azonosítására, és ezzel levágtuk az arc határoló dobozát minden egyes képről. A Mask-RCNN-t nagyjából 200 megjegyzéssel ellátott képen képeztük ki ebből az adatkészletből, így a leginkább alkalmas erre a speciális kísérleti beállításra. A 2. ábrán láthatók az előfeldolgozási szakaszban nyert arcnövények példái.
DogFac-alapú megközelítés.
A videóktól a DogFACS-változókig. A teljes csővezetéket a következő diagram írja le, lásd a 9. ábrát. Ez a következő lépéseket tartalmazza:
• Kutyaarcok kivágása a keretekből a fent leírt módszerrel.
• DogFACS változó adatkészletek készítése Bremhorst et al.22 manuális DogFACS kódolásával minden DogFACS változóhoz két mappát hoztunk létre pozitív és negatív példákkal (a kutyaarc vagy kifejezi vagy nem fejezi ki ezt a DogFACS változót). A pozitív mintákhoz (változó jelen van) az összes, ezzel a változóval kézzel kódolt képkockát kiválasztottuk. A negatív mintákhoz olyan videókockákat választottunk ki, amelyek kódján nem szerepelt a változó a változó első megjelenéséig (vagy a videó végéig, ha nincs jelen). Az adatkészleteket ezután kiegyenlítettük, és minden változóhoz azonos számú képet hagytunk pozitív és negatív példákhoz. A 4. táblázat az összes DogFACS-változóhoz tartozó adatkészletek méretét mutatja, amelyekhez detektorokat szereztünk.
A DogFACS változóktól az érzelmi állapotok osztályozásáig. Az átviteli tanulást az Imagenet súlyokkal inicializált, előre betanított ResNet5{4}} hálózati architektúrán alkalmaztuk. Felső rétegét egy átlagos készletréteggel, egy 20 százalékos kiesési réteggel és egy két osztályos osztályozó réteggel cseréltük le. A modellt 20 korszakon keresztül betanították az Adam optimalizálóval, 0,0001 tanulási sebességgel. A legjobb modellnek azt a modellt választották, amely a validálási adatkészleten maximális pontosságot ér el. Az első 10 korszak során az összes réteg súlyát finomhangolták. Az első 10 korszakban az összes réteg súlyát finomhangolták. A fennmaradó korszakok során a ResNet50 súlyokat lefagyasztották, és csak az új felső rétegek súlyait frissítették. A nem orientációval kapcsolatos változók esetében ('Fül lapító', 'Ajkak rész', 'Füladduktor', 'Fülek előrefelé' és 'Orrnyalás') a kép véletlenszerű vízszintes elforgatásán és legfeljebb 2-os elforgatásán alapuló augmentációs technikát alkalmaztunk. 20 fok. A kódoló bemeneteként egy bemeneti táblázatot használtunk, ahol minden sor az egyes videókon található 11 DogFACS-változó mindegyikének jelenlétét (1)/hiányát (0) jelzi. A kódoló célja egy táblázat, amely tartalmazza az egyes videók feltételét (negatív(0)/pozitív(1)).

Mély megközelítés.
Egészen a közelmúltig a konvolúciós neurális hálózatok (CNN-ek) a számítógépes látási feladatok legkorszerűbb eszközeinek számítottak. Nemrég a Vision Transformer (ViT)57 architektúra jelent meg alternatívaként73. A DINO képzési módszert csak 2021-ben vezették be önlepárló tanulási keretként. Számos DNN gerinchálózat (ResNet50, visit-small, vit-base stb.) ebben a konfigurációban betanítása során kiderült, hogy a DINO megközelítéssel betanított ViT-gerinc jobb teljesítményt nyújt az ImageNet szabványos adatkészleten74 kapott korábbi osztályozási eredményeknél.
ResNet5{11}} architektúrát használtunk a felügyelt és DINO által kiképzett gerinchálózatokhoz; A ViT-S/16 felügyelt, a ViT-S/8 pedig DINO-val lett kiképezve. Előre betanított ViT súlyokat használunk a Timm Library75-ből. Mind a négy modellt 30 korszakra betanítjuk az Adam optimizer76 használatával, béta=(0, 0,999) és tanulási sebességgel: 10–4 a ResNet gerinchálózathoz és 5 · 10–6 a ViT gerinchálózathoz. A betanított modellek veszteséggörbéit a 10. ábra mutatja be.
Térkép megjelenítés.
Az Eigen-CAM módszert59 választjuk, hogy megjelenítsük az egyes modellek végső aktiválásának fő összetevőit. Kimutatták, hogy az Eigen-CAM könnyebben értelmezhető eredményeket biztosít kevesebb számítással, összehasonlítva más CAM-módszerekkel, mint például a népszerű Grad-CAM77. Ezenkívül más vizualizációs módszerekkel, mint például a Grad-CAM59 és a Grad-CAM{8}}, az Eigen-CAM osztályfüggetlen eszköz. Ez a tulajdonság lehetővé teszi, hogy az Eigen-CAM akkor is megjelenítse a tanult mintákat, ha a modell előrejelzése hibás, szemben a régebbi CAM-módszerekkel, amelyek irreleváns térképeket állítanak elő, ha az előrejelzésük helytelen. Az EigenCAM ezen tulajdonsága lehetővé teszi az előrejelzés sikertelenségének okainak értelmezését. Konzisztensebb és osztálymegkülönböztetőbb a többi korszerű vizualizációs módszerhez képest. Ezenkívül az EigenCAM nem modell-specifikus – rétegváltás nélkül használható mind ViT-ekhez, mind CNN-ekhez.
Az adatok elérhetősége
A jelen cikkben használt adatkészlet kérésre elérhető a megfelelő szerzőtől.
Hivatkozások
Darwin, C. Te Érzelmek kifejezése az állatokban és az emberben Vol. 11, 1872 (Murray, 1872).
2. Ekman, P. & Friesen, WV Az arc mozgásának mérése. Environ. Psychol. Nonverbális viselkedés. 1, 56–75 (1976).
3. Ekman, P. & Keltner, D. Az érzelmek univerzális arckifejezései. In Nonverbal Communication: Ahol a természet találkozik a kultúrával (szerk. Segerstrale UP & Molnar, P.) vol. 27, 46 (1997).
4. Russell, JA, Bachorowski, J.-A. és Fernández-Dols, J.-M. Az érzelmek arc- és hangkifejezése. Ann. Rev. Psychol. 54, 329–349 (2003).
5. Diogo, R., Abdala, V., Lonergan, N. & Wood, B. Az fsh-tól a modern emberig – a fej és a nyak izomzatának összehasonlító anatómiája, homológiái és evolúciója. J. Anat. 213, 391–424 (2008).
6. Descovich, KA et al. Arckifejezés: alulhasznált eszköz az emlősök jólétének értékeléséhez (Altex, 2017).
7. Mota-Rojas, D. et al. A kutyák érzelmeinek, arckifejezéseinek és a fájdalom klinikai felismerésére való felhasználásának jelenlegi fejlődése. Animals 11, 3334 (2021).
8. Ekman, P. & Friesen, WV Facial Action Coding System: Manual (Consulting Psychologists Press, 1978).
9. Ekman, P. & Friesen, W. Facial action coding system: a technika az arcmozgás mérésére (1978).
For more information:1950477648nn@gmail.com






