A mellrák osztályozása a gépi tanulás alapján
Sep 12, 2023
A mellrák a leggyakoribb és leghalálosabb rákfajta a világon. A gépi tanulási algoritmusok, például az XGBoost, a véletlenszerű erdő, a logisztikus regresszió és a K-közelebbi szomszéd alapján ez a tanulmány különböző modelleket hoz létre a mellrák osztályozására és előrejelzésére, hogy referenciaként szolgáljon a mellrák korai diagnosztizálásához. A visszahívás a rákos sejtek kimutatásának valószínűségét jelzi az orvosi diagnosztikában, ami nagy jelentőséggel bír az emlőrák osztályozása szempontjából, ezért ez a cikk az emlékezést tekinti elsődleges értékelési indexnek, és figyelembe veszi a precizitást, pontosságot és az F{1}}pontszám értékelését. mutatók az egyes modellek előrejelzési hatásának értékeléséhez és összehasonlításához. Annak érdekében, hogy kiküszöböljük a különböző dimenziós fogalmak hatását a modell hatására, az adatokat szabványosítják.
A K legközelebbi szomszéd algoritmus az egyik legalapvetőbb algoritmus a gépi tanulás területén. Ennek fő ötlete az, hogy megkeressük a célmintához legközelebb eső K mintát, majd ezeknek a K mintáknak a címkéi alapján megjósoljuk a célminta címkéjét. Az emberi mindennapi életben gyakran használunk hasonló módszereket a döntések meghozatalára. Például, amikor egy bizonyos problémával szembesülünk, felidézünk hasonló helyzeteket, amelyekkel korábban találkoztunk, majd megkeressük a leginkább hasonló helyzeteket, és azok eredményei alapján döntünk. Megoldások kidolgozása. Ezért a K legközelebbi szomszéd algoritmus szorosan kapcsolódik az emberi memóriához.
Először is, a K legközelebbi szomszéd algoritmus nagyszámú betanító halmazt igényel a legközelebbi szomszéd gráf adatszerkezetének megtanulásához és létrehozásához. Hasonlóképpen, az embereknek folyamatosan meg kell tapasztalniuk különféle dolgokat, és el kell tárolniuk ezeket a tapasztalatokat a memóriában. Csak nagy mennyiségű tapasztalat és tudás felhalmozásával tudunk pontosabb döntéseket és ítéleteket hozni.
Másodszor, a K legközelebbi szomszéd algoritmus hangsúlyozza a hasonlóság előrejelzésre gyakorolt hatását. Hasonlóképpen, amikor döntéseket hoznak, az emberek gyakran először a múltbeli tapasztalatokat veszik figyelembe, és a jelenlegi helyzethez hasonló tapasztalatokat próbálnak referenciaként találni. A hasonlóságok megtalálásának ez a folyamata az emlékezet egyik fontos jellemzője is.
Végül a K legközelebbi szomszéd algoritmusban a K értéke nagy hatással van az előrejelzési eredményekre. A különböző K értékek eltérő előrejelzési eredményekhez vezetnek. Hasonlóképpen, amikor az emberek felidézik múltbeli tapasztalataikat, az aktuális helyzettől függően különböző referenciapontokat és módszereket kell választaniuk. Ez a rugalmasság és alkalmazkodóképesség a memória fontos jellemzője is. Látható, hogy javítanunk kell a memóriánkat. A Cistanche deserticola jelentősen javíthatja a memóriát, mert a Cistanche deserticola egy hagyományos kínai gyógyászati anyag, számos egyedi hatással, amelyek közül az egyik a memória javítása. A darált hús hatékonyságát a benne található különféle hatóanyagok jelentik, beleértve a savakat, poliszacharidokat, flavonoidokat stb. Ezek az összetevők különféle módon elősegíthetik az agy egészségét.

Kattintson a Tudás gombra a rövid távú memória javításához
Az optimális részhalmaz megtalálása és a modell pontosságának javítása érdekében 15 jellemzőt szűrtünk ki a modell bemeneteként a Pearson korrelációs teszt segítségével. A K-legközelebbi szomszéd modell a keresztellenőrzési módszert használja az optimális k érték kiválasztásához, visszahívást használva kiértékelési indexként. A pozitív és negatív minta kiegyensúlyozatlanság problémájára a hierarchikus mintavételi módszert alkalmazzuk, hogy a különböző kategóriák szerint arányosan kinyerjük a tanítókészletet és a tesztkészletet. A kísérleti eredmények azt mutatják, hogy különböző adathalmaz-felosztások (8:2 és 7:3) mellett ugyanazon modell előrejelzési hatása eltérően változik. Az összehasonlító elemzés azt mutatja, hogy az ebben a cikkben felállított XGBoost-modell (amely 8:2-vel osztja a képzési készletet és a tesztkészletet) jobb hatásokkal rendelkezik, és visszahívása, precizitása, pontossága és F1-pontszáma 1.{{ 11}}, 0,960, 0,974 és 0,980.
1. Bemutatkozás
Az elmúlt tíz évben az emlőrák előfordulása Kínában 47%-kal nőtt, és évről évre növekszik, a mellrák előfordulása pedig fokozatosan fiatalabb [1]. Az emlőrák patogenezise összefügg a személyes hormonokkal, a családtörténettel, a házassággal és a gyermekvállalással [2]. Az emlőrákot nem könnyű felismerni korai stádiumban, és a korai megjelenés, de késői megjelenés jellemzői [3, 4]. Jelenleg az emlőrák fő diagnózisa három módszeren alapul: punkciós citológián [5], ultrahangos vizsgálaton [6] és mammográfiás röntgenfelvételen [7]. Ha a beteget korán elkapják a mellrákban, annál valószínűbb, hogy meggyógyul, és annál jobb a prognózis. Ezért a rendszeres kivizsgálás és a korai diagnózis nagyon szükséges az emlőrák megelőzéséhez és időben történő felismeréséhez.
Az orvostudományban a modellek gépi tanulási módszerekkel történő létrehozása segítheti az orvosokat a rák kimutatási arányának javításában, a korai felismerés és a korai kezelés céljának elérésében. A gépi tanulási módszerek jó eredményeket hoztak a rák diagnosztizálásában [8, 9]. Wu és mtsai. [10] megfigyelték a sejtmorfológiát mikroszkóp alatt, és azt találták, hogy nyilvánvaló különbségek vannak az emlőráksejtek és a normál egészséges sejtek paraméterei között. Ez a megállapítás számos tanulmány elméleti alapot ad. Bár jelenleg számos gépi tanulási módszert alkalmaznak a mellráksejtek osztályozására, egyetlen algoritmus sem alkalmazható minden problémára. A gépi tanulási algoritmusok mindegyik típusának megvannak a saját szakterületei, így az algoritmus kiválasztása a különböző forgatókönyvekben eltérő.
Shen és mtsai. [11] az XGBoost modellt használta a mellrák osztályozására és előrejelzésére, és a pontosság elérte a 97.86%-ot, a visszahívás pedig 95,83%-ot. Deng és mtsai. [12] az XGBoost algoritmust használta a mellrák osztályozására és előrejelzésére 0,96 pontossággal és 0,97 visszahívási pontossággal. Monirujjaman Khan et al. [13] több gépi tanulási modellt használt a mellrák azonosítására, és a véletlenszerű erdő, a döntési fa, a K-legközelebbi szomszéd és a logisztikus regresszió volt a magasabb F{12}}pontszámú algoritmusok, 96%, 95%, 90%. illetve 98%-a. Bhardwaj et al. [14] többrétegű perceptront (MLP), K- legközelebbi szomszédot (KNN), genetikai algoritmust (GP) és véletlen erdőt (RF) használt a jóindulatú és rosszindulatú emlőráksejtek osztályozására, és a kísérleti eredmények azt mutatták, hogy az optimális osztályozó az RF volt. 96,24%-os osztályozási pontossággal. Dong és Ma [15] tanulmányozta a hármas negatív emlőrák lehetséges markereit, és gépi tanulási algoritmusokat használtak annak előrejelzésére, hogy az embereknek van-e tripla negatív mellrákja. Az eredmények azt mutatják, hogy a támogatási vektorgép (SVM) osztályozási előrejelzési modelljének pontossága eléri a 97,8%-ot.
A mellrák azonosítási módszereinek pontosságának javítása és a gépi tanulási algoritmusok javítása érdekében Wang et al. [16] egy SVM-en alapuló súlyozott AUC ensemble tanulási modellt javasolt az emlőrák diagnosztizálására, C-SVM és V-SVM használatával 6 kernelfüggvénnyel, hogy növelje az alapmodellkészlet sokszínűségét, és összehasonlítsa a különböző döntési eredményeket a területi integrációval (WAUCE). ) modell a súlyozott fogadó működési jelleggörbe alatt. Az eredmények azt mutatják, hogy a kis adatkészleten a javasolt WAUCE-struktúra akár 69,23%-kal csökkenti a diagnosztikai pontosság szórását, és 0,94%-kal javítja a pontosságot. Zheng és mtsai. [17] tesztelte a Wisconsin Breast Cancer (WDBC) adatkészletet a K-átlag és a támogató vektorgép hibrid algoritmusa szerint, amely kivonja a daganat jellemzőit és diagnosztizálja a mellrákot, és az eredmények azt mutatják, hogy a hibrid algoritmus 97,38%-ra javítja a pontosságot. Jia et al. [18] egy új populációoptimalizáló algoritmust javasolt, a Whale Optimization Algorithm-et (WOA), amely intelligensen beállítja az SVM modell paramétereit, és a kísérleti eredmények azt mutatják, hogy a WOA-SVM modell teljesítménye lényegesen jobb, mint a hagyományosé. mellrák felismerési modell, 97,5%-os pontossággal.
Az emlőrák osztályozásában a gépi tanulási technikák túlillesztésének problémájának megoldására Singh et al. [19] egy funkcionálisan összekapcsolt mesterséges neurális hálózatot (FLANN) javasolt, és kísérletileg megállapította, hogy a modell nagy pontossággal rendelkezik az emlőrák korai diagnosztizálására. Mahesh et al. [20] egy emlőrák-előrejelző XGBoost ensemble technikát javasol ismert jellemzőmintázatok alapján, először szintetikus kisebbségi túlmintavételezési technológiát (SMOTE) használva az adatkiegyensúlyozatlanság és a zajproblémák kezelésére, majd a Bayes osztályozót, döntési fa osztályozót és véletlenszerű erdőt alkalmazva. , az XGBoosttal kombinálva és az adatok osztályozásával. A kísérleti elemzés szerint az XGBoost-Random Forest együttes osztályozója 98,20%-os pontossággal rendelkezik a mellrák korai felismerésében.
Az XGBoost, a véletlenszerű erdő, a logisztikus regresszió, a K-legközelebbi szomszéd és más gépi tanulási módszerek alapján ez a tanulmány különböző modelleket hoz létre a mellrák osztályozására és előrejelzésére, amelyek referenciaként szolgálnak a mellrák korai diagnosztizálásához. Amikor a legtöbb tanulmány gépi tanulási modelleket alkalmaz az emlőráksejtek diagnosztizálására, akkor a modell precizitása, pontossága és F{1}}pontszáma a modell minőségének mutatóiként való felhasználására összpontosít, figyelmen kívül hagyva a modell orvosi diagnosztikai jelentőségét. a modell felidézése, amely jelzi a rosszindulatú emlőráksejtek előrejelzett arányát, és minél nagyobb a visszahívás, annál nagyobb a valószínűsége annak, hogy rosszindulatú sejtek prognosztizálhatók az emlőrák sejtjeiben. Ezért ez a cikk a felidézést tekinti elsődleges indexnek, és figyelembe veszi a pontosságot, a pontosságot és az F1-pontszámot a használt modell értékeléséhez.
A modellezési folyamatban nagyon fontos része az adatok előfeldolgozása, és a prediktív modell hatása a feldolgozási módtól függően eltérő. Annak érdekében, hogy kiküszöböljük a különböző dimenziós fogalmak hatását a modell hatására, az adatokat szabványosítják. Az optimális részhalmaz megtalálása és a modell pontosságának javítása érdekében a jellemzők kiválasztása a jellemzőváltozó és a célváltozó közötti Pearson-korrelációs együttható szerint történt. A pozitív és negatív minta kiegyensúlyozatlanság problémájára a hierarchikus mintavételi módszert alkalmazzuk, hogy a különböző kategóriák szerint arányosan kinyerjük a tanítókészletet és a tesztkészletet. Tekintettel arra, hogy a gépi tanulási modellek előrejelzési hatása a különböző adatkészlet-felosztásokban eltérő, ez a cikk különböző adatkészlet-felosztásokat (8:2 és 7:3) fog használni két kísérletsorozatként az ebben a cikkben felállított modell előrejelzési hatásának megfigyelésére.
2. Adatok előfeldolgozása
2.1. Adatok Bevezetés. Az ebben a cikkben használt adatkészlet az UCI adathalmazban szereplő emlőrákra vonatkozó adatok, amelyeket a híres Dr. William szolgáltatott, a Wisconsini Egyetem Klinikai Orvostudományi Kutatóintézetéből [21]. A jellemzőket egy emlőtömeg finom tűleszívó (FNA) digitalizált képéből számítják ki. Leírják a képen jelenlévő sejtmagok jellemzőit. Az adatsor 569 kísérleti mintát tartalmazott, köztük 357 jóindulatú és 212 rosszindulatú emlőrák mintát. Az egyes kísérleti objektumokból kinyert sejtekhez főként a sejtmag következő tíz jellemzőjét gyűjtik össze: sugár (a középpont és a kerület pontjai közötti távolság átlaga), kerület, simaság (a sugárhosszak helyi eltérése), terület, tömörség ( kerület * ∗ 2/terület a körvonal) és a fraktál_dimenzió ("partvonal közelítése"-1). Ezen jellemzők átlagát, standard hibáját és „legrosszabb” vagy legnagyobb (a három legnagyobb érték átlaga) értékét minden képre kiszámítottuk, ami 30 jellemzőt eredményezett. Az osztályozási címke az emlőrák típusát jelzi. Ezért a mintaadatkészlet összesen 30 jellemzőt és egy mintacímke jellemzőt (rosszindulatú és jóindulatú) tartalmaz.
2.2. Adatok szabványosítása.
Az egyes jellemzők értéktartományának megfigyelésével megállapítható, hogy a különböző jellemzők adatértékei nagymértékben különböznek egymástól. Egyes modellekben a különböző dimenziók nagymértékben befolyásolják az előrejelzési hatást. Például a távolságosztáson alapuló k-legközelebbi szomszéd algoritmusnak az adatdimenziót konzisztensnek kell tartania, ezért az adatokat szabványosítani kell a modellezés előtt. Néhány modellt azonban kevésbé érint a dimenzionalitás, például a véletlenszerű erdő algoritmusát. A kísérlet összehasonlíthatósága érdekében a különböző modellek adatait azonos módon kezeljük.
A különböző mintaadat-dimenziókkal kapcsolatos problémák esetén az általánosan használt dimenzió nélküli feldolgozási módszerek közé tartozik az adatok szabványosítása, az adatszabványosítási módszerek közé tartozik a Min-max szabványosítás és a Z-score szabványosítás. Ezek közül, ha a felhasznált adatok az értéktartományon kívüli kiugró értékeket tartalmaznak, vagy egyes mutatók maximális és minimális értéke ismeretlen, akkor a Z-score szabványosítás használható.

Ebben a cikkben a WDBC emlőrák adatkészlet jellemzőinek megfelelően a Z-score szabványosítást választottuk az adatok feldolgozásához. A Zscore szabványosítás [22] által feldolgozott adatok standard normál eloszlást követnek, vagyis az átlag 0, a variancia pedig 1. A Z-pontszám szabványosítási képlete a következő:

2.3. Funkció kiválasztása. Az adat-előfeldolgozási folyamat fontos részeként a jellemzők kiválasztása az optimális részhalmaz megtalálása, a jellemzőválasztás csökkentheti a redundáns és haszontalan funkciókat a modell pontosságának javítása érdekében. A jellemző kiválasztási módszer általában a túlgondolt módszerre, a beágyazási módszerre és a beágyazási módszerre oszlik. A szűrési módszer független lehet a későbbiekben a tanulmányban használt algoritmustól, és nagy számítási hatékonysággal és erős általánosító képességgel rendelkezik [23], ezért a jelen cikkben szereplő jellemzőkiválasztási módszer a szűrőmódszert használja, a szűrési módszerben szereplő általános módszer-összefoglaló pedig táblázatban látható.
Az emlőrák adatai a 0 átlag normalizálása után megfelelnek a Pearson korrelációs együttható teszt követelményeinek a szűrési módszerben; ezért ebben a cikkben a Pearson-féle korrelációs együtthatót [24] használjuk az egyes jellemzők és a célváltozó közötti korreláció tesztelésére. A Pearson-féle korrelációs együttható képlete a következő:

3. Modell felépítése
Ebben a cikkben az emlőrák kategóriáit az XGBoost, a véletlenszerű erdő, a logisztikai regresszió és a K-legközelebbi szomszéd modell alapján jósolják meg. A rosszindulatú emlőrák pozitív, míg a jóindulatú emlőrák negatív mintának minősül
A minta kiegyensúlyozatlanság problémájának megoldására ez a cikk egy réteges mintavételi módszert [25] használ a betanítási halmaz és a tesztkészlet kinyerésére mindenféle mintaadattal arányosan. A rétegzett mintavételt típusmintavételnek is nevezik. A mintapopulációt egymástól független részpopulációkra osztjuk. A véletlenszerű mintavételezést az egyes alpopulációk arányában végeztük. A rétegzett mintavétel reprezentatívabb mintát vesz, és alkalmasabb a kiegyensúlyozatlan mintákra.
Az adatkészletek eltérő felosztása eltérő modellhatásokhoz vezethet. Ezért ez a dolgozat két kísérletcsoportot végez a mintaadatkészlet eltérő felosztása szerint. Az első csoport 8:2 arányban osztotta fel az adathalmazt tanítókészletre és teszthalmazra, a második csoport pedig 7 : 3 arányban osztotta fel az adathalmazt tanítókészletre és tesztkészletre. Figyelje meg a modell teljesítményét a négy algoritmus különböző adatkészlet-particionálás alatt.
3.1. Értékelési mutatók. Ebben a tanulmányban a pontosságot, a precizitást, a felidézést és az F{2}}pontszámot [26, 27] használtuk a modell előrejelzési hatásának értékelésére. Az orvosi diagnózis sajátosságait figyelembe véve várható, hogy minden rosszindulatú emlőrák előre jelezhető. Ezért a felidézést itt fontos értékelési indexnek tekintjük. Minél magasabb a visszahívás, annál nagyobb arányban jelezhető előre a rosszindulatú emlőrák. A modellosztályozási eredmények összetéveszthető mátrixot generálhatnak [28], amint az a 4. táblázatban látható
Itt a TP valódi pozitív, amely a pozitív mintáknak jósolt pozitív minták számát jelzi. A TN valódi negatív, amely a negatív mintáknak jósolt negatív minták számát jelzi. Az FP hamis pozitív, a negatív mintákból előrejelzett pozitív minták számát jelzi, amit 1-es típusú hibának nevezünk. Az FN hamis negatív, amely a negatív mintákként előrejelzett pozitív minták számát jelzi, amit 2-es típusú hibának nevezünk.
Precizitás, rövidítve P. Az előrejelzett eredmények esetében a pontosság azt jelenti, hogy a pozitív előre jelzett minták közül hány pozitív minta, és a képlet a következő:


3.2. A mellrák előrejelző modellje az XGBoost alapján. Az XGBoost, az extrém gradiens-növelés rövidítése, egy Boosting algoritmus [29]. Az XGBoost és a véletlenszerű erdő is a döntési fán alapuló integrációs algoritmusok. A Bagging algoritmustól eltérően a Boosting algoritmus egyenként építi fel a gyenge tanulókat, és folyamatos iterációval több gyenge tanulót halmoz fel [30]. A célfüggvény az

. (9) Szabályos kifejezések hozzáadása csökkentheti a modell szórását, és egyszerűbbé teheti a betanítási halmaz által kapott modellt, megelőzve a túlzás előfordulását.. Az XGBoost algoritmus a modell betanítására szolgál a betanítási adatkészleten. A modellképzés során a paramétereket úgy állítjuk be, hogy jobb paraméterkészletet kapjunk, és végül megkapjuk az optimális előrejelzési modellt. A modellt a mellrák kategóriáinak előrejelzésére használták a
beállítás. Ha az adatkészletet 8:2 arányban osztottuk fel egy betanítási és tesztkészletre, az XGBoost modell pontossága, precizitása, felidézése és F{2}}pontszáma 0.974, {{5} }.960, 1.00, illetve 0.980. Amikor az XGBoost modellt 7 : 3 arányban osztottuk fel egy gyakorlókészletre és egy tesztkészletre, az XGBoost modell pontossága, precizitása, felidézése és F{13}}pontszáma 0.959, {{20} },946, 0,991 és 0,968. Az eredmények azt mutatják, hogy az XGBoost modell jobb előrejelzési teljesítményt nyújt, ha az adathalmazt 8-cal osztjuk: 2. Az 1-es visszahívási arány azt jelzi, hogy az XGBoost modell helyesen jelezte előre a mintában szereplő összes rosszindulatú emlőrákot, ami nagyon fontos az orvosi dialógus szempontjából.
osis. 3.3. A mellrák előrejelzési modellje véletlenszerű erdő alapján. A Random forest egy felügyelt tanulási algoritmus, amely több fát integrál a Bagging ötlet révén [31–33]. A bootstrap módszert használják a betanítási mintakészlet kinyerésére az eredeti mintaadatokból, és a megfelelő döntési famodellt betanítják minden egyes betanítási halmazhoz. Végül minden alapbesorolóra szavaznak, és a legtöbb szavazatot kapó a végső kategória.

véres. Ha az adatkészletet 8:2 arányban osztottuk tanítási és teszthalmazra, a véletlenszerű erdőmodell pontossága, precizitása, felidézése és F{2}}pontszáma 0,965, {{5 }}.947, 1.00 és 0.973. Ha az adatkészletet 7:3 arányban osztottuk fel egy képzési halmazra és tesztkészletre, a pontosság, precizitás, felidézés és F1- pontszám 0,953, 0,946, { {18}}.981, illetve 0.963. Az eredmények azt mutatják, hogy a véletlenszerű erdőmodell jobb előrejelzési teljesítményt nyújt, ha az adathalmazt 8:2-vel osztjuk. Ennek a modellnek a visszahívási aránya is 1 volt, ami azt jelzi, hogy a véletlenszerű erdőmodell is helyesen jelezte előre az összes rosszindulatú emlőt.

de l. A k-legközelebbi szomszéd algoritmus három alapeleme a távolságmérés, a k-érték kiválasztása, az osztályozás decisA k legközelebbi szomszéd algoritmus három alapeleme a távolságmérés, a k érték kiválasztása és az osztályozási döntési szabály.
A k legközelebbi szomszéd algoritmusban a K érték kiválasztásának problémájához ez a cikk a tízszeres keresztellenőrzési módszert (38, 39) használja, és a visszahívási sebességet veszi modellértékelési indexként a megfelelő k érték kiválasztásához. Legyen k értéktartománya 1–40, és minden k esetében elvégezzük a tízszeres keresztellenőrzését. A maximális visszahívási arányú k érték az optimális k érték. A különböző k értékek visszahívása a tízszeres keresztellenőrzése mellett az 1. ábrán látható.
Az 1. ábrán látható, hogy a k érték növekedésével a visszahívás csökken. Ha k=3 és k=5, a visszahívás a legnagyobb. Mivel a k érték túl kicsire van állítva, könnyen túlilleszthető, ezért itt a k értéket 5-re állítjuk be.
Amikor az adathalmazt 8:2 arányban osztottuk fel tanítókészletre és teszthalmazra, a k-legközelebbi szomszéd modell pontossága, precizitása, felidézése és F{2}}pontszáma 0,912, { {6}}.888, 0.986, illetve {{10}}.934. Amikor az adathalmazt 7:3-mal felosztottuk egy képzési és tesztkészletre, a pontosság, precizitás, visszahívás és F{14}}pontszám 0,930, {{21} }.906, 0.991 és 0.946. Az eredmények azt mutatják, hogy a k-legközelebbi szomszéd modell jobb előrejelzési teljesítményt nyújt, ha az adatkészletet 7:3-mal osztjuk.
4. Összehasonlítás és elemzés
Az ebben a cikkben felállított modell teljesítményének jobb megértése érdekében ez a cikk a Python 3.9.7 fejlesztői környezeten alapul, és Dr. William, a Wisconsin Egyetem Klinikai Orvosi Kutatóintézetének munkatársa által biztosított emlőrák-adatokat használja kísérletekhez.
A kísérleti környezet a Windows 11 operációs rendszer, a processzor Intel(R) Core(TM) i5-1155G7@ 2,50 GHz 2,50 GHz, a memória pedig 800 GB.
Az egyes modellek kísérleti paramétereit az 5. táblázat mutatja be, és a következő három összehasonlító elemzési eredményt kell elvégezni: (1) az egyes modellek teljesítmény-összehasonlítása ebben a cikkben, ha az adatkészletet egy tanítókészletre és egy tesztkészletre osztjuk fel a 8. : 2. (2) Az egyes modellek teljesítmény-összehasonlítása ebben a cikkben, ha az adatkészletet egy betanítási halmazra és egy teszthalmazra osztjuk fel a 7 : 3-ban. (3) Összehasonlítás néhány szakirodalmi modellel [11–14].
(1) Ha az adatkészletet 8:2 arányban osztják fel egy betanítási halmazra és egy tesztkészletre, az egyes modellek teljesítményét a 6. táblázat mutatja.
A 4. táblázatból látható, hogy a betanítókészlet és a tesztkészlet 8:2 arányban történő felosztása esetén a négy gépi tanulási módszer pontossága 0,9 feletti, ezek közül az XGBoost és az RF értéke { {5}}.95. Az XGBoost előrejelzési pontossága 0.974, ami nagy előrejelzési pontosságot jelez. A pontosság kedvéért a KNN modell pontossága nem nagy, 0,9 alatti, csak 0,888. Az XGBoost a legnagyobb pontossággal, ami 0.960. Ami a visszahívást illeti, az XGBoost, a véletlen erdő és a logisztikus regressziós algoritmusok visszahívása mind 1. A k-legközelebbi szomszéd algoritmus rendelkezik a legalacsonyabb visszahívással, de ez is meghaladja a 0.95 értéket. Ebben a vizsgálatban a visszahívási arányok a helyesen diagnosztizált rosszindulatú emlőrák minták arányát jelentik. Az orvostudományban a betegséget diagnosztizálni kell. A diagnózis elmaradásának következménye a késedelmes kezelés, ami azt eredményezheti, hogy a betegek elmulasztják a kezelésre legmegfelelőbb időpontot. Ez sokkal súlyosabb annál, mint ha valakinek betegsége nélkül diagnosztizálnak. Ezért a visszahívási arány nagyon fontos mutató a betegségdiagnosztika területén. Itt az XGBoost, a véletlenszerű erdő és a logisztikus regressziós algoritmus visszahívása mind 1, ami azt jelzi, hogy a mintákban szereplő összes rosszindulatú emlőrákot diagnosztizálták. Az F{{20}}pontszámhoz látható, hogy az XGBoost, a véletlen erdő és a logisztikai regresszió F1-pontszáma 0,95 felett van. Az XGBoost algoritmus F1-pontszáma a legmagasabb, eléri a 0.980-at. A K-legközelebbi szomszéd modellnek van a legalacsonyabb F1-pontszáma, 0,934. A négy mutatót figyelembe véve elmondható, hogy ha az adatkészletet 8:2 arányban osztjuk fel tanítókészletre és teszthalmazra, az XGBoost algoritmus összesített modellhatása jobb, mint a másik három modellé. Az XGBoost nemcsak 1-es visszahívást ért el, hanem 0,95-ös vagy nagyobb visszahívást is elért a másik három mutató esetében.
(2) Ha az adatkészletet 7 : 3 arányban tanítókészletre és tesztkészletre osztjuk, az egyes modellek teljesítményét a 7. táblázat mutatja.
Amint a 7. táblázatból látható, ha a betanítókészletet és a tesztkészletet elosztjuk 7:3-mal, az XGBoost és az RF modellhatása nem olyan jó, mint a 8:2-é. Először is a fontos index szempontjából. felidézni, amikor az adathalmazt 8:2-vel osztjuk, az XGBoost és az RF visszahívása egyaránt 1 volt, de mostanra 0.991-re, illetve {{10}}.981-re csökkent . A két modell a másik három indexben is némileg csökkent. A logisztikus regresszió és a K-legközelebbi szomszéd modell predikciós hatásának változása azonban eltér e két algoritmustól. A logisztikus regressziós modellben a négy mutató alig változott, amikor a tréningkészletet és a tesztkészletet elosztottuk 7:3-mal, illetve 8:2-vel. Ez azt mutatja, hogy a logisztikus regressziós modellt szinte nem befolyásolják a különböző adatkészlet-partíciók. Az edzéskészlet és a tesztkészlet közötti 7:3 arányú felosztás esetén a logisztikus regresszió alacsonyabb pontosságot és F{19}} pontszámot mutatott, mint az XGBoost és a véletlenszerű erdő. A logisztikus regressziós modell felidézése azonban 1, ami azt jelzi, hogy minden rosszindulatú emlőrákot előre jeleztek, ami nagy jelentőséggel bír a betegség diagnosztizálásában. Ezért elmondható, hogy a logisztikus regressziós modell predikciós hatása jobb, mint a másik három algoritmusé. A KNN modell esetében, amikor a képzési készletet és a tesztkészletet elosztottuk 7:3-mal, mind a négy index nőtt. A visszahívás 0.991-re nőtt, ami magasabb volt, mint a véletlenszerű erdőé. A pontosság, precizitás és F{25}}pontszám 0,912, {{30}},887 és 0,934 értékről 0-ra nőtt. 0,930, 0,906 és 0,946. Ezért a KNN modell jobban teljesít a 7 : 3-mal osztva tanító halmaz és teszthalmaz esetén, mint a 8:2-vel osztva. Az elemzés azt mutatja, hogy az adathalmazok felosztása nem rögzített. A különböző modelleknél a különböző felosztások különböző változásokat hoznak a modell előrejelzési hatásában.
(3) A 6. és 7. táblázatok összehasonlító elemzése szerint az ebben a cikkben felállított XGBoost modell (a képzési és a tesztkészlet 8-cal osztva: 2) a legjobb hatású, és a következőkben összehasonlítjuk a modell teljesítményével a irodalom [11–14] és a konkrét eredményeket a 8. táblázat tartalmazza.
Amint a 8. táblázatból látható, az öt modell közül a legjobban teljesítő modell a szakirodalom [13] logisztikai regressziós modellje és az ebben a cikkben felállított XGBoost modell. A modell felidézése és pontossága a szakirodalomban [13] rendre 0,99 és 0,98, a modell felidézése és pontossága ebben a cikkben 1.{{8} } és 0.974, az irodalomhoz képest [13], a modell felidézése magas, az orvosi diagnosztikában pedig a rákos sejtek kimutatásának valószínűségét jelzi, aminek nagy jelentősége van az osztályozás szempontjából Az emlőráksejtek számának növekedése, így az ebben a cikkben felállított XGBoost modell jobb előrejelző hatást fejt ki, és orvosi eszközként is használható, hogy segítse az orvosokat emlőrákos betegek kezelési terveinek elkészítésében.

5. Következtetés
Ez a tanulmány elsősorban az emlőrák kategóriáit jósolta, az adatok előfeldolgozásától a jellemzők kiválasztásáig, majd a modell felállításáig. Végül az előrejelzési eredményeket összehasonlították és sok szempontból elemezték.
Ebben a cikkben a felidézést fontos indexnek tekintjük a rosszindulatú emlőrák minták lehető legpontosabb előrejelzéséhez. Az eredeti adathalmaz 30 jellemzőt tartalmazott, és a Pearson korrelációs teszt segítségével 15 jellemzőt választottunk ki a modell bemeneteként. A modell felépítése előtt az adatokat szabványosították, hogy kiküszöböljék a különböző dimenziók hatását a modellhatásokra. A kiegyensúlyozatlan pozitív és negatív minták problémájára a rétegzett mintavételezési módszert alkalmazzuk a tanító halmazok és tesztkészletek arányos kinyerésére a különböző adatkategóriák szerint. Az optimális k érték kiválasztásakor a k legközelebbi szomszédban a visszahívást használjuk modellértékelési indexként, így a legmagasabb visszahívási arányú k érték az optimális érték.
A modelleket három szempontból hasonlítjuk össze és elemezzük. Az eredmények a következőképpen jelennek meg:
pects. Az eredmények a következők: (1) Ha a tréningkészletet és a tesztkészletet 8:2-vel osztjuk, az XGBoost, a véletlenszerű erdő és a logisztikus regresszió visszahívása 1, amely előre jelezheti az összes rosszindulatú emlőrákot a K. -a legközelebbi szomszéd visszahívása valamivel alacsonyabb, mint a 0.986 a másik három modellhez képest. A modell előrejelzési pontossága, precizitása és F1-pontszáma tekintetében az XGBoost modell eredményei jobbak, mint a véletlenszerű erdő és logisztikai regresszió eredményei, amelyek 0.974, {{1 0}}.96, illetve 0,98, tehát az XGboost modell lesz kiválasztva végső előrejelzési modellként a betanítókészlet és a tesztkészlet 8:2 arányú felosztása mellett.
(2) A képzési halmaz és a tesztkészlet 7 : 3 arányú felosztása esetén a négy értékelési mutató értéke az XGBoost és a véletlenszerű erdő esetében csökkent, míg a négy értékelési mutató értéke a K-legközelebbi szomszéd modellnél javult, de a visszahívásnál csak a logisztikus regressziós modell visszahívása volt 1, a többi modellé pedig 0,98 feletti, így a logisztikus regresszió modell-előrejelzési hatása volt a legjobb, az előrejelzés pontossága, precizitása és a logisztikus regresszió F1-pontszáma 0,947, {{10}},922, illetve 0,96 volt.

(3) Kísérletekből látható, hogy a különböző felosztások mellett a modell predikciós hatása eltérően változik. Összehasonlítva az optimális modelleket a két különböző kísérletsorozatban, látható, hogy az XGBoost modell előrejelzési pontossága, precizitása és F{1}}pontszáma (amely a képzési és a tesztkészletet 8:2-vel osztja) magasabbak, mint a logisztikus regressziós modellé (amely elosztja a betanítási halmazt és a tesztkészletet 7:3-mal), ha a visszahívás 1, tehát az XGBoost modell (amely a betanítókészletet és a tesztkészletet 8:2-vel osztja) működik legjobb az ebben a cikkben felállított modellben. Ezen túlmenően, az irodalomban [11–14] található modellekkel összehasonlítva, az ebben a cikkben felállított XGBoost modell jobb hatást fejt ki, és képes pontosan azonosítani a rosszindulatú emlőráksejteket. Ez a kutatás azonban numerikus adathalmazokra korlátozódik, és a jövőben mélytanulási algoritmusok segítségével próbálunk meg különféle jellemző-kinyerési technikákat alkalmazni képadatokra (például röntgenfelvételekre), hogy jobb osztályozási eredményeket kapjunk.
Adatok elérhetősége
A tanulmány megállapításait alátámasztó adatok nyíltan elérhetők az UCI Machine Learning Repository-ban a https://archive.ics.uci.edu/ml/datasets/Breast+Cancer+Wisconsin+ %28Diagnostic%29 címen.
Összeférhetetlenség
A szerzők kijelentik, hogy nincs összeférhetetlenségük.
Köszönetnyilvánítás
Ezt a munkát a Kínai Nemzeti Természettudományi Alapítvány (61502156. sz. támogatás), a Hubei Oktatási Bizottság Oktatási és Kutatási Projektje (282. sz. támogatás) és a Hubei Műszaki Egyetem Doktori Alapítványa (BSQD13051 sz. támogatás) támogatta.
Hivatkozások
[1] V. Fotedar, S. Fotedar, P. Takur, S. Vats, A. Negi és L. Chanderkant, "A mellrák kockázati tényezőinek ismerete és korai felismerésének módszerei a Shimla, Himachal állam elsődleges egészségügyi dolgozói körében Pradesh", Journal of Education and Health Promotion, vol. 8. o. 265, 2019.
[2] MS Simon, TA Hastert, A. Barac és mtsai, "Cardiometabolic risk tényezők és túlélés a rák után a női egészségügyi kezdeményezésben", Cancer, vol. 127. sz. 4., 598–608., 2021.
[3] HF Pasha, RH Mohamed, MM Toam és AM Yehia, "Genetic and epigenetic modifikations of adiponectin gene: p", The Journal of Gene Medicine, vol. 21, sz. 10. o. e3120, 2019.
[4] D. Hong, AJ Fritz, SK Zaidi és mtsai: "Az epithelialis to mesenchymalis átmenet és a rákos őssejtek hozzájárulnak a mellrák heterogenitásához", Journal of Cellular Physiology, 1. kötet. 233. sz. 12., 9136–9144. o., 2018.
[5] J. Zhong, D. Sun, W. Wei és munkatársai, "Contrast-enhanced ultrahang-guided fine-needle aspiration for sentinel nyirokcsomó biopszia korai stádiumú emlőrákban", Ultrasound in Medicine and Biology, vol. . 44, sz. 7., 1371–1378., 2018.
[6] K. Babic, C. Siguan-Bell, M. Hee és SC Lin, "Ocular g: ultrasound B-scan assessment of retented sebészeti szivacs Ahmed billentyűműtét után: a case r", Journal of Glaucoma, vol. 26. sz. 10., e239–e241. o., 2017.
[7] A. Yala, PG Mikhael, F. Strand és munkatársai, "Toward robust mammography-based models for breast cancer risk", Science Translational Medicine, vol. 13. sz. 578, cikkazonosító: eaba4373, 2021.
[8] G. Zheng, X. Liu és G. Han, "Medical image computer-aided detection and diagnostic system review", Journal of Software, vol. 29, sz. 5, 1471–1514, 2018.
[9] EY Huang, S. Knight, CR Guetter és társai, "Telemedicine and telementoring in the sebészeti szakterületek: narratív áttekintés, The American Journal of Surgery, 218. kötet, 4. szám, 760–766. 2019.
[10] Q. Wu, BT Wang, HR Rao, Y. Jiang és C. Liu: "A mellrák és a jóindulatú betegségek sejtjei alkotják a metrológiai kutatást", Journal of Anhui Medical University, vol. 31. sz. 02, 1996. 91–93.
[11] Q. Shen, F. Shao és R. Sun, "Az emlőrák előrejelzési modellje az xgbooston alapulva", Journal of Qingdao University (Natural Science Edition), vol. 32. sz. 2019. 1.
[12] Z. Deng, B. Su és K. Zhan. g, "A mellrák osztályozása az együttes tanulás alapján", China Medical Devices, vol. 35, sz. 2020. 12.
[13] M. Monirujjaman Khan, S. Islam, S. Sarkar és mtsai, "Gépi tanuláson alapuló összehasonlító elemzés a mellrák előrejelzéséhez", Journal of Healthcare Engineering, 4. kötet. 2022, cikkazonosító: 4365855, 15 oldal, 2022.
[14] A. Bhardwaj, H. Bhardwaj, A. Sakalle, Z. Uddin, M. Sakalle és W. Ibrahim, "Fa-alapú és gépi tanulási algoritmus elemzése a mellrák osztályozásához", Computational Intelligence and Neuroscience, vol. 2022, cikkazonosító: 6715406, 6 oldal, 2022.
[15] H. Dong és L. Ma, "A hármas negatív mellrák előrejelzési modellje gépi tanuláson alapuló", Journal of Yunnan University, vol. 39. sz. 1., 2017. 111–115.
For more information:1950477648nn@gmail.com






