Mashinani o'rganish asosida ko'krak bezi saratonining tasnifi bashorati
Sep 12, 2023
Ko'krak saratoni dunyodagi eng keng tarqalgan va o'limga olib keladigan saraton turidir. XGBoost, tasodifiy o'rmon, logistik regressiya va K-eng yaqin qo'shni kabi mashinani o'rganish algoritmlariga asoslanib, ushbu maqola ko'krak saratonini erta tashxislash uchun ma'lumotnoma berish uchun ko'krak bezi saratonini tasniflash va bashorat qilish uchun turli modellarni o'rnatadi. Eslab qolish tibbiy diagnostikada saraton hujayralarini aniqlash ehtimolini ko'rsatadi, bu ko'krak bezi saratoni tasnifi uchun katta ahamiyatga ega, shuning uchun ushbu maqola asosiy baholash indeksi sifatida esga olinadi va aniqlik, aniqlik va F1-ballarni baholashni ko'rib chiqadi. har bir modelning bashorat ta'sirini baholash va solishtirish uchun ko'rsatkichlar. Modelning ta'siriga turli o'lchovli tushunchalarning ta'sirini bartaraf etish uchun ma'lumotlar standartlashtiriladi.
K eng yaqin qo'shni algoritmi mashinani o'rganish sohasidagi eng asosiy algoritmlardan biridir. Uning asosiy g'oyasi maqsadli namunaga eng yaqin K namunalarini topish va keyin ushbu K namunalarining teglari asosida maqsadli namunaning yorlig'ini taxmin qilishdir. Insonning kundalik hayotida biz qaror qabul qilish uchun ko'pincha shunga o'xshash usullardan foydalanamiz. Misol uchun, ma'lum bir muammoga duch kelganimizda, biz ilgari duch kelgan shunga o'xshash vaziyatlarni eslaymiz, keyin eng o'xshash vaziyatlarni qidiramiz va ularning natijalariga qarab qaror qabul qilamiz. Yechimlarni ishlab chiqish. Shuning uchun K eng yaqin qo'shni algoritmi inson xotirasi bilan chambarchas bog'liq.
Avvalo, K eng yaqin qo'shni algoritmi eng yaqin qo'shni grafigining ma'lumotlar strukturasini o'rganish va o'rnatish uchun juda ko'p sonli o'quv majmualarini talab qiladi. Xuddi shunday, odamlar doimo turli narsalarni boshdan kechirishlari va bu tajribalarni xotirada saqlashlari kerak. Faqat katta miqdordagi tajriba va bilimlarni to'plash orqali biz qarorlar va hukmlarni yanada aniqroq qilishimiz mumkin.
Ikkinchidan, K eng yaqin qo'shni algoritmi o'xshashlikning bashoratga ta'sirini ta'kidlaydi. Xuddi shunday, qaror qabul qilishda odamlar ko'pincha o'tmishdagi tajribalarni ko'rib chiqadilar va ma'lumot uchun hozirgi vaziyatga o'xshash tajribalarni topishga harakat qilishadi. Bu o'xshashliklarni topish jarayoni ham xotiraning muhim xususiyatlaridan biridir.
Nihoyat, K eng yaqin qo'shni algoritmida K qiymati bashorat natijalariga katta ta'sir ko'rsatadi. Turli xil K qiymatlari turli xil bashorat natijalariga olib keladi. Xuddi shunday, odamlar o'tmishdagi tajribalarini eslaganlarida, hozirgi vaziyatga qarab turli xil mos yozuvlar nuqtalari va usullarini tanlashlari kerak. Bu moslashuvchanlik va moslashuvchanlik ham xotiraning muhim xususiyati hisoblanadi. Ko'rinib turibdiki, biz xotirani yaxshilashimiz kerak. Cistanche deserticola xotirani sezilarli darajada yaxshilashi mumkin, chunki Cistanche deserticola ko'plab noyob effektlarga ega bo'lgan an'anaviy xitoylik dorivor material bo'lib, ulardan biri xotirani yaxshilashdir. Qiymaning samaradorligi uning tarkibidagi turli faol moddalar, jumladan kislota, polisakkaridlar, flavonoidlar va boshqalardan kelib chiqadi. Bu ingredientlar turli yo'llar bilan miya salomatligini mustahkamlashi mumkin.

Qisqa muddatli xotirani yaxshilash uchun "Bilish" tugmasini bosing
Optimal kichik to'plamni topish va modelning aniqligini oshirish uchun Pearson korrelyatsiya testi orqali modelga kirish sifatida 15 ta xususiyat ko'rib chiqildi. K-eng yaqin qo'shni modeli baholash indeksi sifatida eslab qolishdan foydalangan holda optimal k qiymatini tanlash uchun o'zaro tekshirish usulidan foydalanadi. Ijobiy va salbiy namunaviy nomutanosiblik muammosi uchun ierarxik tanlama usuli turli toifalar bo'yicha o'quv to'plami va test to'plamini proportsional ravishda ajratib olish uchun ishlatiladi. Eksperimental natijalar shuni ko'rsatadiki, ma'lumotlar to'plamining turli bo'linmalarida (8: 2 va 7: 3) bir xil modelning bashorat qilish effekti turli xil o'zgarishlarga ega bo'ladi. Qiyosiy tahlil shuni ko'rsatadiki, ushbu maqolada o'rnatilgan XGBoost modeli (o'quv to'plami va testlar to'plamini 8: 2 ga ajratadi) yaxshiroq ta'sirga ega va uning eslab qolish, aniqlik, aniqlik va F1-ballari 1 ga teng.{{ 11}}, 0.960, 0.974 va 0.980.
1.Kirish
So'nggi o'n yil ichida Xitoyda ko'krak bezi saratoni bilan kasallanish 47% ga oshdi va kasallanish yil sayin ortib bormoqda va ko'krak bezi saratoni bilan kasallanish asta-sekin yoshroqdir [1]. Ko'krak bezi saratoni patogenezi shaxsiy gormonlar, oilaviy tarix, nikoh va tug'ish tarixi bilan bog'liq [2]. Ko'krak bezi saratonini erta bosqichda aniqlash oson emas va erta boshlanishining xususiyatlariga ega, ammo kech namoyon bo'ladi [3, 4]. Hozirgi vaqtda ko'krak bezi saratonining asosiy diagnostikasi uchta usulga asoslanadi: ponksiyon sitologiyasi [5], ultratovush tekshiruvi [6] va mammogramma rentgenogrammasi [7]. Agar bemor ko'krak bezi saratoniga erta tashxis qo'yilsa, uni davolash ehtimoli shunchalik yuqori bo'ladi va prognoz shunchalik yaxshi bo'ladi. Shuning uchun ko'krak bezi saratonining oldini olish va o'z vaqtida aniqlash uchun muntazam tekshiruv va erta tashxis qo'yish juda zarur.
Tibbiyot sohasida mashinani o'rganish usullari orqali modellarni yaratish shifokorlarga saraton kasalligini aniqlash darajasini oshirish, erta aniqlash va erta davolash maqsadiga erishishda yordam berishi mumkin. Mashinani o'rganish usullari saraton kasalligini tashxislashda yaxshi natijalar berdi [8, 9]. Wu va boshqalar. [10] mikroskop ostida hujayra morfologiyasini kuzatdi va ko'krak saratoni hujayralari va normal sog'lom hujayra parametrlari o'rtasida aniq farqlar borligini aniqladi. Ushbu topilma ko'plab tadqiqotlar uchun nazariy asos bo'lib xizmat qiladi. Hozirgi vaqtda ko'krak bezi saratoni hujayralarini tasniflashda qo'llaniladigan ko'plab mashinani o'rganish usullari mavjud bo'lsa-da, barcha muammolarga yagona algoritmni qo'llash mumkin emas. Mashinani o'rganish algoritmining har bir turi o'z tajriba sohalariga ega, shuning uchun algoritmni tanlash har xil stsenariylarda har xil.
Shen va boshqalar. [11] koʻkrak bezi saratonini tasniflash va bashorat qilish uchun XGBoost modelidan foydalangan va aniqlik 97.86% ga, eslab qolish esa 95.83% ga yetgan. Deng va boshqalar. [12] XGBoost algoritmidan koʻkrak saratonini tasniflash va bashorat qilish uchun 0.96 aniqlik va 0.97 ni eslab qolish uchun foydalangan. Monirujjaman Xon va boshqalar. [13] koʻkrak bezi saratonini aniqlash uchun bir nechta mashinani oʻrganish modellaridan foydalangan va tasodifiy oʻrmon, qarorlar daraxti, K-eng yaqin qoʻshni va logistik regressiya yuqoriroq F1-bali, 96%, 95%, 90%, va mos ravishda 98%. Bhardwaj va boshqalar. [14] koʻp qatlamli perseptron (MLP), K-eng yaqin qoʻshni (KNN), genetik algoritm (GP) va tasodifiy oʻrmondan (RF) yaxshi va yomon xulqli koʻkrak saratoni hujayralarini tasniflash uchun foydalangan va eksperimental natijalar optimal tasniflagich RF ekanligini koʻrsatdi. tasniflash aniqligi bilan 96,24%. Dong va Ma [15] uch marta salbiy ko'krak saratonining mumkin bo'lgan belgilarini o'rganishdi va odamlarda uch marta salbiy ko'krak saratoni bor yoki yo'qligini taxmin qilish uchun mashinani o'rganish algoritmlari ishlatilgan. Natijalar shuni ko'rsatadiki, qo'llab-quvvatlovchi vektor mashinasi (SVM) tasnifini bashorat qilish modelining aniqligi 97,8% ga etadi.
Ko'krak bezi saratonini aniqlash usullarining aniqligini oshirish va mashinani o'rganish algoritmlarini yaxshilash uchun Vang va boshqalar. [16] asosiy modellar toʻplamining xilma-xilligini oshirish va turli qarorlar natijalarini hududiy integratsiya (WAUCE) bilan solishtirish uchun 6 yadro funktsiyasiga ega C-SVM va V-SVM dan foydalangan holda koʻkrak bezi saratoni tashxisi uchun SVMga asoslangan vaznli AUC ansamblini oʻrganish modelini taklif qildi. ) vaznli qabul qiluvchi ishchi xarakteristikasi egri ostidagi model. Natijalar shuni ko'rsatadiki, kichik ma'lumotlar to'plamida tavsiya etilgan WAUCE tuzilmasi diagnostika aniqligidagi farqni 69,23% gacha kamaytiradi va aniqlikni 0,94% ga yaxshilaydi. Zheng va boshqalar. [17] Viskonsin ko'krak bezi saratoni (WDBC) ma'lumotlar to'plamini K-vositalariga ko'ra sinovdan o'tkazdi va vektor mashinasi gibrid algoritmi o'simta xususiyatlarini chiqaradi va ko'krak bezi saratoniga tashxis qo'yadi va natijalar gibrid algoritm aniqlikni 97,38% ga oshirishini ko'rsatadi. Jia va boshqalar. [18] populyatsiyani optimallashtirishning yangi algoritmini, SVM modeli parametrlarini aqlli ravishda sozlaydigan Whale Optimization Algoritm (WOA) ni taklif qildi va eksperimental natijalar shuni ko'rsatdiki, WOA-SVM modelining ishlashi an'anaviy modelga qaraganda ancha yaxshi. ko'krak bezi saratonini aniqlash modeli, 97,5% aniqlik bilan.
Ko'krak saratoni tasnifida mashinani o'rganish usullarini haddan tashqari o'rnatish muammosini hal qilish uchun Singh va boshqalar. [19] funktsional ravishda bog'langan sun'iy neyron tarmog'ini (FLANN) taklif qildi va eksperimental ravishda model ko'krak saratonini erta tashxislash uchun yuqori aniqlikka ega ekanligini aniqladi. Mahesh va boshqalar. [20] ma'lum xususiyatlar naqshlariga asoslangan ko'krak saratonini bashorat qilishning XGBoost ansambl texnikasini taklif qiladi, avval ma'lumotlar muvozanati va shovqin muammolarini hal qilish uchun sintetik ozchiliklarni haddan tashqari namuna olish texnologiyasidan (SMOTE), keyin esa mos ravishda Bayes klassifikatori, qaror daraxti tasniflagichi va tasodifiy o'rmondan foydalanadi. , XGBoost bilan birlashtirilgan va ma'lumotlarni tasniflash. Eksperimental tahlillarga ko'ra, XGBoost-Random Forest ansambli klassifikatori ko'krak bezi saratonini erta aniqlashda 98,20% aniqlik darajasiga ega.
XGBoost, tasodifiy o'rmon, logistik regressiya, K-eng yaqin qo'shni va boshqa mashinani o'rganish usullariga asoslanib, ushbu maqola ko'krak saratonini tasniflash va bashorat qilish uchun turli modellarni o'rnatadi, bu ko'krak bezi saratonini erta tashxislash uchun ma'lumot beradi. Ko'pgina tadqiqotlar ko'krak saratoni hujayralarini tashxislashda mashinani o'rganish modellarini qo'llaganda, ular model sifatini baholash uchun ko'rsatkichlar sifatida modelning aniqligi, aniqligi va F1-ballaridan foydalanishga e'tibor qaratadilar, shu bilan birga uning tibbiy diagnostik ahamiyatini e'tiborsiz qoldiradilar. prognoz qilingan malign ko'krak saratoni hujayralarining ulushini ko'rsatadigan modelni esga olish va eslash qanchalik yuqori bo'lsa, ko'krak saratoni hujayralarida xavfli hujayralar ehtimoli shunchalik yuqori bo'ladi. Shuning uchun, ushbu maqola asosiy indeks sifatida eslab qolishni oladi va foydalanilgan modelni baholash uchun aniqlik, aniqlik va F1-ballni hisobga oladi.
Modellashtirish jarayonida ma'lumotlarni oldindan qayta ishlash juda muhim qism bo'lib, prognozli modelning ta'siri qayta ishlash usuliga qarab farq qiladi. Modelning ta'siriga turli o'lchovli tushunchalarning ta'sirini bartaraf etish uchun ma'lumotlar standartlashtiriladi. Optimal kichik to'plamni topish va modelning aniqligini oshirish uchun xususiyat o'zgaruvchisi va maqsadli o'zgaruvchi o'rtasidagi Pearson korrelyatsiya koeffitsienti bo'yicha xususiyat tanlash amalga oshirildi. Ijobiy va salbiy namunaviy nomutanosiblik muammosi uchun ierarxik tanlama usuli turli toifalar bo'yicha o'quv to'plami va test to'plamini proportsional ravishda ajratib olish uchun ishlatiladi. Mashinani o'rganish modellarining bashorat qilish effekti turli xil ma'lumotlar to'plami bo'linmalarida o'zgarishini hisobga olsak, ushbu maqolada ushbu maqolada o'rnatilgan modelning prognozlash effektini kuzatish uchun ikkita tajriba to'plami sifatida turli xil ma'lumotlar to'plami bo'linmalaridan (8: 2 va 7: 3) foydalaniladi.
2. Ma'lumotlarni oldindan qayta ishlash
2.1. Ma'lumotlarga kirish. Ushbu maqolada ishlatiladigan ma'lumotlar to'plami UCI ma'lumotlar to'plamidagi ko'krak bezi saratoni ma'lumotlari bo'lib, Viskonsin Universitetining Klinik Tibbiyot Tadqiqot Institutidan mashhur doktor Uilyam tomonidan taqdim etilgan [21]. Xususiyatlari ko'krak massasining nozik igna aspiratining (FNA) raqamli tasviridan hisoblanadi. Ular rasmda mavjud bo'lgan hujayra yadrolarining xususiyatlarini tavsiflaydi. Ma'lumotlar to'plamida 569 ta eksperimental namunalar, shu jumladan 357 ta yaxshi xulqli va 212 ta ko'krak bezi saratoni namunalari mavjud. Har bir eksperimental ob'ektdan olingan hujayralar uchun uning yadrosining quyidagi o'nta xususiyati asosan yig'iladi: radius (markazdan perimetrdagi nuqtalargacha bo'lgan masofa o'rtacha), perimetri, silliqligi (radius uzunligining mahalliy o'zgarishi), maydon, ixchamlik ( perimetr ∗ ∗ 2/maydon-1.0), konkavlik (konturning botiq qismlarining jiddiyligi), simmetriya, tekstura (kulrang shkala qiymatlarining standart og'ishi), konkav nuqtalari (bo'g'in qismlari soni) konturning) va fraktal_o‘lcham ("sohil chizig‘ining yaqinlashuvi"-1). Ushbu xususiyatlarning o'rtacha, standart xatosi va "eng yomoni" yoki eng kattasi (uchta eng katta qiymatning o'rtachasi) har bir tasvir uchun hisoblab chiqilgan, natijada 30 ta xususiyat mavjud. Tasniflash yorlig'i ko'krak saratoni turini ko'rsatadi. Shunday qilib, namunaviy ma'lumotlar to'plami jami 30 ta xususiyat va bitta namuna yorlig'i xususiyatini (yomon va yaxshi xulqli) o'z ichiga oladi.
2.2. Ma'lumotlarni standartlashtirish.
Har bir xususiyatning qiymat diapazonini kuzatish orqali turli xususiyatlarning ma'lumotlar qiymatlari bir-biridan sezilarli darajada farq qilishi aniqlandi. Ba'zi modellarda turli o'lchamlar bashorat qilish effektiga katta ta'sir ko'rsatadi. Masalan, masofaga bo'linishga asoslangan k-eng yaqin qo'shni algoritmi ma'lumotlar o'lchamini izchil saqlashi kerak, shuning uchun modellashtirishdan oldin ma'lumotlarni standartlashtirish kerak. Biroq, ba'zi modellar tasodifiy o'rmon algoritmi kabi o'lchamlarga kamroq ta'sir qiladi. Tajribani qiyosiy qilish uchun turli modellarning ma'lumotlariga bir xil tarzda ishlov beriladi.
Turli xil namunaviy ma'lumotlar o'lchamlari bilan bog'liq muammolar uchun keng tarqalgan bo'lib foydalaniladigan o'lchovsiz ishlov berish usullari ma'lumotlarni standartlashtirishni o'z ichiga oladi va ma'lumotlarni standartlashtirish usullari Min-max standartlashtirish va Z-skor standartlashtirishni o'z ichiga oladi. Ular orasida, agar foydalanilgan ma'lumotlar qiymat oralig'idan tashqarida bo'lsa yoki ba'zi ko'rsatkichlarning maksimal va minimal qiymatlari noma'lum bo'lsa, Z-skor standartizatsiyasidan foydalanish mumkin.

Ushbu maqolada, WDBC ko'krak saratoni ma'lumotlar to'plamining xususiyatlariga ko'ra, ma'lumotlarni qayta ishlash uchun Z-skor standartizatsiyasi tanlangan. Zscore standartlashtirish [22] tomonidan qayta ishlangan ma'lumotlar standart normal taqsimotga amal qiladi, ya'ni o'rtacha 0 va dispersiya 1 ga teng. Z balli standartlashtirish formulasi quyidagicha:

2.3. Xususiyatlarni tanlash. Ma'lumotlarni oldindan qayta ishlash jarayonining muhim qismi sifatida, xususiyat tanlash optimal kichik to'plamni topishdir, Xususiyatlar tanlash modelning aniqligini oshirish uchun ortiqcha va foydasiz xususiyatlarni kamaytirishi mumkin. Xususiyatlarni tanlash usuli odatda ortiqcha o'ylash usuli, inkapsulyatsiya usuli va joylashtirish usuliga bo'linadi. Filtrlash usuli tadqiqotda keyinchalik qo'llaniladigan algoritmdan mustaqil bo'lishi mumkin va yuqori hisoblash samaradorligi va kuchli umumlashtirish qobiliyatiga ega [23], shuning uchun ushbu maqoladagi xususiyatni tanlash usuli filtrlash usulidan foydalanadi va filtrlash usulida umumiy usul xulosasi. 2-jadvalda ko'rsatilgan.
0 o'rtacha normallashuvdan keyin ko'krak bezi saratoni ma'lumotlari filtrlash usulida Pearson korrelyatsiya koeffitsienti testi talablariga javob beradi; Shunday qilib, ushbu maqolada Pearson korrelyatsiya koeffitsienti [24] har bir xususiyat va maqsadli o'zgaruvchi o'rtasidagi korrelyatsiyani tekshirish uchun ishlatiladi Pearson korrelyatsiya koeffitsienti formulasi quyidagicha:

3. Model qurilishi
Ushbu maqolada ko'krak saratoni toifalari mos ravishda XGBoost, tasodifiy o'rmon, logistik regressiya va K-eng yaqin qo'shni modeliga asoslangan holda bashorat qilinadi. Malign ko'krak saratoni ijobiy namuna sifatida qabul qilinadi, yaxshi ko'krak saratoni esa salbiy namunadir
Namuna nomutanosibligi muammosini hal qilish uchun ushbu maqolada barcha turdagi namunaviy ma'lumotlarga mutanosib ravishda o'quv to'plami va test to'plamini ajratib olish uchun tabaqalashtirilgan namuna olish usuli qo'llaniladi [25]. Stratifikatsiyalangan tanlama, shuningdek, turdagi tanlama deb ataladi. Tanlangan populyatsiya bir-biridan mustaqil bo'lgan kichik populyatsiyalarga bo'linadi. Tasodifiy tanlab olish har bir kichik populyatsiyaga mutanosib ravishda amalga oshirildi. Stratifikatsiyalangan namuna olish ko'proq vakillik namunasini oladi va muvozanatsiz namunalar uchun ko'proq mos keladi.
Turli xil ma'lumotlar to'plamiga bo'linish turli model effektlariga olib kelishi mumkin. Shuning uchun, ushbu maqola namunaviy ma'lumotlar to'plamining boshqa bo'linishi bo'yicha ikkita tajriba guruhini amalga oshiradi. Birinchi guruh ma'lumotlar to'plamini 8: 2 nisbatda o'quv to'plami va test to'plamiga bo'lishdi, ikkinchi guruh esa ma'lumotlar to'plamini 7: 3 nisbatda o'quv va test to'plamiga bo'lishdi. turli xil ma'lumotlar to'plamiga bo'linish ostidagi to'rtta algoritm.
3.1. Baholash ko'rsatkichlari. Ushbu tadqiqotda aniqlik, aniqlik, eslab qolish va F1-bal [26, 27] modelning bashorat qilish samarasini baholash uchun ishlatilgan. Tibbiy diagnostikaning o'ziga xosligini hisobga olgan holda, barcha malign ko'krak saratonini oldindan aytish mumkin. Shuning uchun, bu erda eslash muhim baholash indeksi sifatida qabul qilinadi. Eslab qolish qanchalik yuqori bo'lsa, prognoz qilish mumkin bo'lgan malign ko'krak saratoni ulushi shunchalik yuqori bo'ladi. Modelni tasniflash natijalari 4-jadvalda ko'rsatilganidek, chalkashlik matritsasini [28] hosil qilishi mumkin
Bu erda TP haqiqiy ijobiy bo'lib, ijobiy namunalar sifatida bashorat qilingan ijobiy namunalar sonini ko'rsatadi. TN haqiqiy salbiy bo'lib, salbiy namunalar sifatida taxmin qilingan salbiy namunalar sonini ko'rsatadi. FP noto'g'ri musbat bo'lib, salbiy namunalardan bashorat qilingan ijobiy namunalar sonini ko'rsatadi, bu 1-toifa xato deb ataladi. FN noto'g'ri salbiy bo'lib, salbiy namunalar sifatida bashorat qilingan ijobiy namunalar sonini ko'rsatadi, bu 2-toifa xato deb ataladi.
Aniqlik, P deb qisqartirilgan. Bashorat qilingan natijalar uchun aniqlik ijobiy bashorat qilingan namunalarning qanchasi ijobiy namunalar ekanligini ko'rsatadi va formula:


3.2. XGBoost-ga asoslangan ko'krak bezi saratonini bashorat qilish modeli. XGBoost, ekstremal gradient oshirish uchun qisqartma, Boosting algoritmidir [29]. XGBoost ham, tasodifiy o'rmon ham qarorlar daraxtiga asoslangan integratsiya algoritmlaridir. Bagging algoritmidan farqli ravishda Boosting algoritmi kuchsiz o‘quvchilarni birma-bir tuzadi va uzluksiz takrorlash orqali bir nechta zaif o‘quvchilarni to‘playdi [30]. Maqsad funksiyasi

. (9) Muntazam atamalar qo'shilishi modelning tafovutini kamaytirishi va o'quv to'plami tomonidan olingan modelni soddalashtirishi mumkin, bu esa haddan tashqari o'zgarishlarning oldini oladi.. XGBoost algoritmi o'quv ma'lumotlar to'plamida modelni o'rgatish uchun ishlatiladi. Modelni o'qitish jarayonida yaxshiroq parametrlar to'plamini olish uchun parametrlar o'rnatiladi va nihoyat, optimal bashorat modeli olinadi. Model ko'krak saratoni toifalarini bashorat qilish uchun ishlatilgan
sozlash. Ma'lumotlar to'plami o'quv va testlar to'plamiga 8: 2 ga bo'linganida, XGBoost modelining aniqligi, aniqligi, eslab qolish va F1-ballari 0,974, {{5} edi. }.960, 1.00 va 0.980, mos ravishda. XGBoost modeli 7 : 3 ga oʻquv toʻplamiga va testlar toʻplamiga boʻlinganida, XGBoost modelining aniqligi, aniqligi, eslab qolish va F1-ballari 0,959, {{20} edi. }.946, 0.991 va 0.968. Natijalar shuni ko'rsatadiki, XGBoost modeli ma'lumotlar to'plami 8 ga bo'linganda yaxshiroq bashorat qilish ko'rsatkichiga ega: 2. 1 ga eslab qolish darajasi XGBoost modeli namunadagi barcha xavfli ko'krak saratonini to'g'ri bashorat qilganligini ko'rsatadi, bu tibbiy diagnostika uchun juda muhimdir.
osis. 3.3. Tasodifiy o'rmonga asoslangan ko'krak bezi saratonini bashorat qilish modeli. Tasodifiy o'rmon - bu Bagging g'oyasi orqali bir nechta daraxtlarni birlashtirgan nazorat ostida o'rganish algoritmi [31-33]. Bootstrap usuli dastlabki namuna ma'lumotlaridan o'quv namunasi to'plamini olish uchun ishlatiladi va har bir o'quv to'plami uchun tegishli qaror daraxti modeli o'qitiladi. Nihoyat, barcha asosiy tasniflagichlar bo'yicha ovoz beriladi va eng ko'p ovoz olgani yakuniy toifadir.

qonli. Ma'lumotlar to'plami 8: 2 ga o'quv va testlar to'plamiga bo'linganda, tasodifiy o'rmon modelining aniqligi, aniqligi, eslab qolish va F1-ballari 0.965, {{5} edi. }}.947, 1.00 va 0.973. Ma'lumotlar to'plami mashg'ulotlar va testlar to'plamiga 7 : 3 ga bo'linganda, aniqlik, aniqlik, eslab qolish va F1- ball 0.953, 0.946, { {18}}.981 va 0.963. Natijalar shuni ko'rsatadiki, tasodifiy o'rmon modeli ma'lumotlar to'plami 8 ga bo'linganda yaxshiroq bashorat qilish ko'rsatkichiga ega: 2. Ushbu modelning eslab qolish darajasi ham 1 ga teng bo'lib, tasodifiy o'rmon modeli ham barcha malign ko'kraklarni to'g'ri taxmin qilganligini ko'rsatadi.

lekin l. k-eng yaqin qo'shni algoritmining uchta asosiy elementi masofani o'lchash, k-qiymatni tanlash, tasniflash decis. k eng yaqin qo'shni algoritmining uchta asosiy elementi masofani o'lchash, k qiymat tanlash va tasniflash qarori qoidasi.
K eng yaqin qo'shni algoritmida K qiymatini tanlash muammosi uchun ushbu maqola o'n marta o'zaro tekshirish usulidan foydalanadi (38, 39) va mos k qiymatini tanlash uchun modelni baholash indeksi sifatida eslab qolish tezligini oladi. K ning qiymat diapazoni 1-40 bo'lsin va har bir k uchun o'n marta o'zaro tekshirish amalga oshiriladi. Maksimal eslab qolish tezligiga ega k qiymati optimal k qiymati hisoblanadi. O'n marta o'zaro tasdiqlash ostida turli k qiymatlarni esga olish 1-rasmda ko'rsatilgan.
1-rasmdan ko'rinib turibdiki, k qiymati oshgani sayin, eslab qolish kamayadi. k � 3 va k � 5 bo‘lganda, esga olish eng katta hisoblanadi. K qiymati juda kichik o'rnatilganligi sababli, uni ortiqcha moslashtirish oson, shuning uchun bu erda k qiymati 5 qilib o'rnatiladi.
Ma'lumotlar to'plami 8:2 ga o'quv va testlar to'plamiga bo'linganda, k-eng yaqin qo'shni modelining aniqligi, aniqligi, eslab qolish va F1-ballari 0.912, { {6}}.888, 0.986 va {{10}}.934. Ma'lumotlar to'plami mashg'ulotlar va testlar to'plamiga 7 : 3 ga bo'linganda, aniqlik, aniqlik, eslab qolish va F1-ballari 0,930, {{21} }.906, 0.991 va 0.946. Natijalar shuni ko'rsatadiki, k-eng yaqin qo'shni modeli ma'lumotlar to'plami 7: 3 ga bo'linganda yaxshiroq bashorat qilish samaradorligiga ega.
4. Taqqoslash va tahlil qilish
Ushbu maqolada o'rnatilgan modelning ishlashini yaxshiroq tushunish uchun ushbu maqola Python 3.9.7 ishlab chiqish muhitiga asoslangan va tajribalar uchun Viskonsin Universiteti Klinik Tibbiyot Tadqiqot Instituti doktori Uilyam tomonidan taqdim etilgan ko'krak saratoni ma'lumotlaridan foydalanadi.
Tajriba muhiti Windows 11 operatsion tizimi, protsessori Intel(R) Core(TM) i5-1155G7@ 2,50 GHz 2,50 GGs, xotirasi esa 8,00 GB.
Har bir modelning eksperimental parametrlari 5-jadvalda ko'rsatilgan va quyidagi uchta qiyosiy tahlil natijalari amalga oshiriladi: (1) ma'lumotlar to'plami o'quv to'plamiga bo'linganda va testlar to'plami 8 ga bo'linganda ushbu maqoladagi har bir modelning ishlashini taqqoslash. : 2. (2) Ma'lumotlar to'plami o'quv to'plamiga va test to'plamiga 7 : 3 ga bo'linganda ushbu maqoladagi har bir modelning ishlashini taqqoslash. (3) Adabiyotdagi ba'zi modellar bilan taqqoslash [11-14].
(1) Ma'lumotlar to'plami 8: 2 ga o'quv to'plami va test to'plamiga bo'linganda, har bir modelning ishlashi 6-jadvalda ko'rsatilgan.
4-jadvaldan ko'rinib turibdiki, o'quv to'plami va testlar to'plamini 8: 2 nisbatda bo'lishda to'rtta mashinani o'rganish usulining aniqligi 0.9 dan yuqori, ular orasida XGBoost va RF {{ {5}}.95. XGBoost ning bashorat aniqligi 0.974 ni tashkil etadi, bu esa bashorat qilishning yuqori aniqligini ko‘rsatadi. Aniqlik uchun KNN modelining aniqligi yuqori emas, 0.9 dan past, faqat 0.888. XGBoost eng yuqori aniqlikka ega, bu 0.960. Qayta tiklashga kelsak, XGBoost, tasodifiy o'rmon va logistik regressiya algoritmlarining esga olinishi 1 ga teng. K-eng yaqin qo'shni algoritmi eng past eslab qolishga ega, lekin u ham 0.95 dan yuqori. Ushbu tadqiqot uchun eslab qolish darajasi to'g'ri tashxis qo'yilgan malign ko'krak saratoni namunalarining ulushini ifodalaydi. Tibbiyotda kasallik aniqlanishi kerak. Tashxis qo'yilmasligining oqibati davolanishning kechikishi bo'lib, bemorlar davolanish uchun eng yaxshi vaqtni o'tkazib yuborishi mumkin. Bu kasallik bo'lmasdan tashxis qo'yishdan ko'ra jiddiyroqdir. Shuning uchun eslab qolish darajasi kasallik diagnostikasi sohasida juda muhim ko'rsatkichdir. Bu erda XGBoost, tasodifiy o'rmon va logistik regressiya algoritmini esga olish 1 bo'lib, namunalardagi barcha malign ko'krak saratoni tashxisi qo'yilganligini ko'rsatadi. F{{2{25}}}} ball uchun XGBoost, tasodifiy o'rmon va logistik regressiyaning F1-bali 0.95 dan yuqori ekanligini ko'rish mumkin. XGBoost algoritmining F{24}}bali eng yuqori boʻlib, 0,980 ga yetadi. K-eng yaqin qo'shni modelida eng past F{28}}bal 0,934. To'rtta ko'rsatkichni hisobga olgan holda shuni aytish mumkinki, ma'lumotlar to'plami o'quv va testlar to'plamiga 8: 2 ga bo'linganda, XGBoost algoritmining umumiy model effekti qolgan uchta modelga qaraganda yaxshiroq. XGBoost nafaqat 1 ga eslab qolishga erishdi, balki qolgan uchta ko'rsatkich uchun 0,95 yoki undan ko'p eslab qolishga erishdi.
(2) Ma'lumotlar to'plami 7 : 3 da o'quv to'plamiga va test to'plamiga bo'linganda, har bir modelning ishlashi 7-jadvalda ko'rsatilgan.
7-jadvaldan ko'rinib turibdiki, o'quv to'plami va testlar to'plami 7 : 3 ga bo'linganda, XGBoost va RF ning model effekti 8: 2 dagi kabi yaxshi emas. Avvalo, muhim indeks nuqtai nazaridan. esda tuting, ma'lumotlar to'plamini 8: 2 ga bo'lganda, XGBoost va RF ning eslab qolishi ikkalasi ham 1 edi, ammo hozir ular mos ravishda 0.991 va {{1{23}}}}.981 ga kamaydi. . Ikki model boshqa uchta indeksda ham biroz pasaygan. Biroq, logistik regressiya va K-eng yaqin qo'shni modelining bashorat ta'sirining o'zgarishi bu ikki algoritmdan farq qiladi. Logistik regressiya modeli uchun o'quv to'plami va testlar to'plami mos ravishda 7: 3 va 8: 2 ga bo'linganda to'rtta ko'rsatkich deyarli o'zgarmadi. Bu shuni ko'rsatadiki, logistik regressiya modeliga turli xil ma'lumotlar to'plami bo'limlari deyarli ta'sir qilmaydi. Trening toʻplami va test toʻplami oʻrtasida 7:3 boʻlinish boʻlsa, logistik regressiya XGBoost va tasodifiy oʻrmonga qaraganda pastroq aniqlik, aniqlik va F1- ball koʻrsatdi. Biroq, logistik regressiya modelining esga olinishi 1 ga teng bo'lib, barcha malign ko'krak saratoni prognoz qilinganligini ko'rsatadi, bu kasallik tashxisi uchun katta ahamiyatga ega. Shuning uchun logistik regressiya modelining bashorat ta'siri qolgan uchta algoritmga qaraganda yaxshiroq ekanligini aytish mumkin. KNN modeli uchun o'quv to'plami va test to'plami 7 : 3 ga bo'linganda, barcha to'rtta indeks ko'tarildi. Eslab qolish 0.991 ga oshdi, bu tasodifiy oʻrmonnikidan yuqori edi. Aniqlik, aniqlik va F1-ballari 0.912, {{30}}.887 va 0.934 dan 0 gacha oshdi. .930, 0,906 va 0,946. Shuning uchun, KNN modeli o'quv to'plami va test to'plamini 7 : 3 ga bo'lingan holda 8: 2 ga bo'lingan modelga qaraganda yaxshiroq ishlaydi. Tahlil ma'lumotlar to'plamining bo'linishi qat'iy emasligini ko'rsatadi. Turli modellar uchun turli bo'linmalar modelni bashorat qilish effektida turli xil o'zgarishlarga olib keladi.
(3) 6 va 7-jadvallarning qiyosiy tahliliga ko'ra, ushbu maqolada o'rnatilgan XGBoost modeli (o'quv to'plami va testlar to'plamini 8: 2 ga bo'lish) eng yaxshi ta'sirga ega va uni quyidagi modeldagi ko'rsatkichlar bilan taqqoslaydi. adabiyotlar [11-14] va aniq natijalar 8-jadvalda keltirilgan.
8-jadvaldan ko'rinib turibdiki, beshta modelning eng yaxshi ishlaydigan modellari adabiyotning logistik regressiya modeli [13] va ushbu maqolada o'rnatilgan XGBoost modelidir. Adabiyotdagi [13] modelning eslab qolish va aniqligi mos ravishda 0.99 va 0.98, ushbu maqoladagi modelning eslab qolish va aniqligi 1.{{8} } va 0.974, mos ravishda, adabiyot [13] bilan solishtirganda, modelni eslab qolish yuqori va tibbiy diagnostikada eslab qolish saraton hujayralarini aniqlash ehtimolini ko'rsatadi, bu tasniflash uchun katta ahamiyatga ega. ko'krak bezi saratoni hujayralari soni, shuning uchun ushbu maqolada o'rnatilgan XGBoost modeli yaxshiroq prognozlash effektiga ega va shifokorlarga ko'krak bezi saratoni bilan og'rigan bemorlarni davolash rejalarini tuzishda yordam berish uchun tibbiy vosita sifatida ishlatilishi mumkin.

5. Xulosa
Ushbu maqola asosan ko'krak bezi saratoni toifalarini, ma'lumotlarni qayta ishlashdan tortib xususiyatlarni tanlashgacha, keyin esa modelni yaratishgacha bashorat qilgan. Nihoyat, bashorat natijalari ko'p jihatdan taqqoslandi va tahlil qilindi.
Ushbu maqolada eslab qolish xavfli ko'krak saratoni namunalarini iloji boricha aniqroq bashorat qilish uchun muhim indeks sifatida qabul qilinadi. Dastlabki ma'lumotlar to'plami 30 ta xususiyatni o'z ichiga olgan va 15 ta xususiyat Pearson korrelyatsiya testi orqali modelga kirish sifatida tanlangan. Modelni qurishdan oldin, turli o'lchamlarning model effektlariga ta'sirini bartaraf etish uchun ma'lumotlar standartlashtirildi. Balanssiz musbat va manfiy namunalar muammosi uchun tabaqalashtirilgan tanlab olish usuli turli toifadagi ma'lumotlarga muvofiq proportsional ravishda o'quv to'plamlari va test to'plamlarini olish uchun ishlatiladi. k-eng yaqin qo'shnida optimal k qiymatini tanlashda, esga olish modelni baholash indeksi sifatida ishlatiladi, shuning uchun eng yuqori chaqirish tezligiga ega bo'lgan k qiymati optimal qiymatdir.
Modellar uch jihatdan taqqoslanadi va tahlil qilinadi. Natijalar quyidagicha ko'rsatilgan:
pektlar. Natijalar quyidagicha ko'rsatilgan: (1) Trening to'plami va test to'plamini 8: 2 ga bo'lishda, XGBoost, tasodifiy o'rmon va logistik regressiyani esga olish 1 ga teng bo'lib, u barcha malign ko'krak saratoni K. -eng yaqin qo'shni eslab qolish boshqa uchta modelga nisbatan 0.986 dan bir oz pastroq. Modelning bashorat qilish aniqligi, aniqligi va F1-balli uchun XGBoost modeli natijalari tasodifiy o‘rmon va logistik regressiya natijalaridan yaxshiroq, ular 0.974, {{1 0}}.96 va 0,98 mos ravishda, shuning uchun XGboost modeli yakuniy bashorat qilish modeli sifatida 8:2 boʻlinish sharti ostida oʻquv toʻplami va test majmuasi tanlanadi.
(2) Ta'lim to'plami va test to'plamini 7 : 3 ga bo'lgan taqdirda, XGBoost va tasodifiy o'rmon uchun to'rtta baholash ko'rsatkichlarining qiymatlari kamaydi, K-eng yaqin qo'shni modeli uchun to'rtta baholash ko'rsatkichlarining qiymatlari. yaxshilandi, lekin eslab qolish uchun faqat logistik regressiya modelining eslab qolish darajasi 1 edi, boshqa modellar esa 0.98 dan yuqori edi, shuning uchun logistik regressiya modelini bashorat qilish effekti eng yaxshi edi va bashorat qilish aniqligi, aniqligi. , va F{7}}logistik regressiya balli mos ravishda 0.947, {{10}}.922 va 0.96 edi.

(3) Tajribalardan ko'rinib turibdiki, turli bo'linishlarda modelning bashorat qilish effekti turli xil o'zgarishlarga ega. Ikki xil tajribalar to‘plamidagi optimal modellarni solishtirsak, XGBoost modelining bashorat qilish aniqligi, aniqligi va F1-ballari (o‘quv majmuasi va testlar to‘plamini 8:2 ga bo‘ladi) ekanligini ko‘rish mumkin. esga olish 1 bo'lsa, logistik regressiya modelidan (o'quv to'plamini va testlar to'plamini 7: 3 ga ajratadigan) yuqoriroqdir, shuning uchun XGBoost modeli (o'quv to'plami va testlar to'plamini 8: 2 ga ajratadi) ishlaydi. ushbu maqolada o'rnatilgan modelda eng yaxshisi. Bundan tashqari, adabiyotdagi modellar bilan solishtirganda [11-14], ushbu maqolada o'rnatilgan XGBoost modeli yaxshiroq ta'sir ko'rsatadi va malign ko'krak saratoni hujayralarini aniq aniqlashi mumkin. Biroq, bu tadqiqot faqat raqamli ma'lumotlar to'plami bilan cheklangan va kelajakda biz yaxshiroq tasniflash natijalarini olish uchun tasvir ma'lumotlariga (masalan, rentgen tasvirlari) turli xil xususiyatlarni ajratib olish usullarini qo'llash uchun chuqur o'rganish algoritmlaridan foydalanishga harakat qilamiz.
Ma'lumotlar mavjudligi
Ushbu tadqiqot natijalarini tasdiqlovchi maʼlumotlar UCI Machine Learning Repository’da https:// archive.ics.uci.edu/ml/datasets/Breast+Cancer+Wisconsin+ %28Diagnostic%29 manzilida ochiq holda mavjud.
Manfaatlar to'qnashuvi
Mualliflar manfaatlar to'qnashuvi yo'qligini e'lon qiladilar.
Minnatdorchilik
Bu ish Xitoyning Milliy tabiiy fanlar fondi (Grant № 61502156), Xubey taʼlim qoʻmitasining oʻqitish va tadqiqot loyihasi (grant № 282) va Xubey texnologiya universitetining doktorlik fondi (grant № BSQD13051) tomonidan qoʻllab-quvvatlandi.
Ma'lumotnomalar
[1] V. Fotedar, S. Fotedar, P. Takur, S. Vats, A. Negi va L. Chanderkant, "Shimla, Himachal shahridagi birlamchi tibbiyot xodimlari o'rtasida ko'krak bezi saratoni xavfi omillari va uni erta aniqlash usullarini bilish. Pradesh, "Ta'lim va salomatlikni rivojlantirish jurnali, jild. 8, p. 265, 2019 yil.
[2] MS Simon, TA Hastert, A. Barak va boshqalar, "Ayollar salomatligi tashabbusida kardiometabolik xavf omillari va saratondan keyin omon qolish", Saraton, jild. 127, yo'q. 4, 598–608-betlar, 2021 yil.
[3] HF Pasha, RH Mohamed, MM Toam va AM Yehia, "Adiponektin genining genetik va epigenetik modifikatsiyalari: p," Gen tibbiyoti jurnali, jild. 21, yo'q. 10, p. e3120, 2019 yil.
[4] D. Hong, AJ Fritz, SK Zaidi va boshq., "Epiteliyadan mezenximaga o'tish va saraton ildiz hujayralari ko'krak bezi saratoni heterojenligiga hissa qo'shadi", Journal of Cellular Physiology, jild. 233, yo'q. 12, 9136–9144-betlar, 2018 yil.
[5] J. Zhong, D. Sun, W. Wei va boshqalar, "Ko'krak bezi saratonining dastlabki bosqichida sentinel limfa tugunlari biopsiyasi uchun kontrastli ultratovush yordamida nozik igna aspiratsiyasi", Tibbiyot va biologiyada ultratovush, jild. . 44, yo'q. 7, 1371–1378-betlar, 2018 yil.
[6] K. Babic, C. Siguan-Bell, M. Hee va SC Lin, "Okulyar g: Axmed qopqoq jarrohligidan keyin saqlanib qolgan jarrohlik shimgichni ultratovushli B-skanerdan baholash: r hodisasi," Glaukoma jurnali, jild. 26, yo'q. 10, e239–e241-betlar, 2017 yil.
[7] A. Yala, PG Mixael, F. Strand va boshqalar, "Ko'krak saratoni xavfi uchun mustahkam mammografiyaga asoslangan modellarga to'g'ri", Science Translational Medicine, jild. 13, yo'q. 578, maqola ID eaba4373, 2021.
[8] G. Zheng, X. Liu va G. Xan, "Tibbiy tasvirni kompyuter yordamida aniqlash va diagnostika tizimini ko'rib chiqish", Journal of Software, jild. 29, yo'q. 5, 1471–1514-betlar, 2018 yil.
[9] EY Huang, S. Knight, CR Guetter va boshqalar, "Teletibbiyot va jarrohlik ixtisosliklarida telementorlik: hikoya sharhi, Amerika Jarrohlik jurnali, jild. 218, № 4, 760-766-betlar, 2019.
[10] Q. Vu, BT Vang, HR Rao, Y. Jiang va C. Liu, "Ko'krak bezi saratoni va benign kasallik hujayralari metrologiya tadqiqotini tashkil qiladi", Anhui tibbiyot universiteti jurnali, jild. 31, yo'q. 02, 91–93-betlar, 1996 yil.
[11] Q. Shen, F. Shao va R. Sun, "Xgboost-ga asoslangan ko'krak bezi saratonini bashorat qilish modeli", Qingdao universiteti jurnali (tabiiy fanlar nashri), jild. 32, yo'q. 1, 2019 yil.
[12] Z. Deng, B. Su va K. Jan. g, "Ansamblni o'rganishga asoslangan ko'krak bezi saratoni tasnifi", Xitoy tibbiy asboblari, jild. 35, yo'q. 12, 2020 yil.
[13] M. Monirujjaman Khan, S. Islam, S. Sarkar, va boshqalar, "Machine Learning based qiyosiy tahlil ko'krak saratoni bashorati", Journal of Healthcare Engineering, jild. 2022, maqola ID 4365855, 15 bet, 2022 yil.
[14] A. Bhardwaj, H. Bhardwaj, A. Sakalle, Z. Uddin, M. Sakalle va V. Ibrohim, "Ko'krak bezi saratoni tasnifi uchun daraxtga asoslangan va mashinani o'rganish algoritmini tahlil qilish", Computational Intelligence and Neuroscience, vol. 2022, ID 6715406, 6 bet, 2022 yil.
[15] H. Dong va L. Ma, "Mashinani o'rganishga asoslangan uch marta salbiy ko'krak saratonini bashorat qilish modeli", Yunnan universiteti jurnali, jild. 39, yo'q. 1, 111–115-betlar, 2017 yil.
For more information:1950477648nn@gmail.com






