پیش‌بینی طبقه‌بندی سرطان پستان بر اساس یادگیری ماشین

Sep 12, 2023

سرطان سینه شایع ترین و کشنده ترین نوع سرطان در جهان است. این مقاله بر اساس الگوریتم‌های یادگیری ماشینی مانند XGBoost، جنگل تصادفی، رگرسیون لجستیک و K-نزدیک‌ترین همسایه، مدل‌های مختلفی را برای طبقه‌بندی و پیش‌بینی سرطان سینه ایجاد می‌کند تا مرجعی برای تشخیص زودهنگام سرطان پستان ارائه کند. یادآوری احتمال شناسایی سلول‌های سرطانی را در تشخیص پزشکی نشان می‌دهد که برای طبقه‌بندی سرطان پستان اهمیت زیادی دارد، بنابراین این مقاله یادآوری را به عنوان شاخص ارزیابی اولیه در نظر می‌گیرد و دقت، صحت و ارزیابی امتیاز F1-را در نظر می‌گیرد. شاخص هایی برای ارزیابی و مقایسه اثر پیش بینی هر مدل. برای حذف تأثیر مفاهیم ابعادی مختلف بر تأثیر مدل، داده‌ها استاندارد شده‌اند.

الگوریتم K نزدیکترین همسایه یکی از اساسی ترین الگوریتم ها در زمینه یادگیری ماشین است. ایده اصلی آن یافتن نزدیک‌ترین نمونه‌های K به نمونه هدف و سپس پیش‌بینی برچسب نمونه هدف بر اساس برچسب‌های این نمونه‌های K است. در زندگی روزمره انسان اغلب از روش های مشابه برای تصمیم گیری استفاده می کنیم. به عنوان مثال، هنگام مواجهه با یک مشکل خاص، موقعیت های مشابهی را که قبلاً با آن مواجه شده ایم به یاد می آوریم، سپس به دنبال مشابه ترین موقعیت ها می گردیم و بر اساس نتایج آنها تصمیم می گیریم. راه حل ها را توسعه دهید. بنابراین، الگوریتم K نزدیکترین همسایه ارتباط نزدیکی با حافظه انسان دارد.

اول از همه، الگوریتم K نزدیکترین همسایه به تعداد زیادی مجموعه آموزشی برای یادگیری و ایجاد ساختار داده گراف نزدیکترین همسایه نیاز دارد. به همین ترتیب، انسان ها نیاز دارند که دائماً چیزهای مختلف را تجربه کنند و این تجربیات را در حافظه ذخیره کنند. تنها با انباشت مقدار زیادی تجربه و دانش می توانیم تصمیم گیری و قضاوت دقیق تری داشته باشیم.

ثانیاً، الگوریتم K نزدیکترین همسایه بر تأثیر شباهت بر پیش‌بینی تأکید می‌کند. به طور مشابه، هنگام تصمیم گیری، انسان ها اغلب ابتدا تجربیات گذشته را در نظر می گیرند و سعی می کنند تجربیاتی مشابه وضعیت فعلی را برای مرجع پیدا کنند. این فرآیند یافتن شباهت ها نیز یکی از ویژگی های مهم حافظه است.

در نهایت، در الگوریتم K نزدیکترین همسایه، مقدار K تأثیر زیادی بر نتایج پیش‌بینی دارد. مقادیر مختلف K منجر به نتایج پیش‌بینی متفاوتی می‌شود. به همین ترتیب، وقتی انسان‌ها تجربیات گذشته را به یاد می‌آورند، باید بسته به موقعیت فعلی، نقاط مرجع و روش‌های مختلفی را انتخاب کنند. این انعطاف پذیری و سازگاری نیز از ویژگی های مهم حافظه است. مشاهده می شود که باید حافظه خود را تقویت کنیم. Cistanche deserticola می تواند به طور قابل توجهی حافظه را بهبود بخشد زیرا Cistanche deserticola یک ماده دارویی سنتی چینی با اثرات منحصر به فرد بسیاری است که یکی از آنها بهبود حافظه است. اثربخشی گوشت چرخ کرده از مواد فعال مختلفی که شامل اسید، پلی ساکاریدها، فلاونوئیدها و غیره است، ناشی می شود. این مواد می توانند به طرق مختلف سلامت مغز را ارتقا دهند.

increase memory power

برای بهبود حافظه کوتاه مدت، روی دانستن کلیک کنید

برای یافتن زیرمجموعه بهینه و بهبود دقت مدل، 15 ویژگی به عنوان ورودی به مدل از طریق آزمون همبستگی پیرسون غربال شد. مدل K-نزدیکترین همسایه از روش اعتبارسنجی متقاطع برای انتخاب مقدار k بهینه با استفاده از فراخوان به عنوان شاخص ارزیابی استفاده می کند. برای مشکل عدم تعادل نمونه مثبت و منفی، از روش نمونه گیری سلسله مراتبی استفاده می شود تا مجموعه آموزشی و مجموعه آزمون به تناسب با توجه به دسته های مختلف استخراج شود. نتایج تجربی نشان می‌دهد که تحت تقسیم‌بندی داده‌های مختلف (8: 2 و 7: 3)، اثر پیش‌بینی مدل مشابه، تغییرات متفاوتی خواهد داشت. تجزیه و تحلیل مقایسه ای نشان می دهد که مدل XGBoost ایجاد شده در این مقاله (که مجموعه آموزشی و مجموعه تست را بر 8: 2 تقسیم می کند) اثرات بهتری دارد و یادآوری، دقت، دقت و امتیاز F1-ش 1 است. 11}}، 0.960، 0.974، و 0.980، به ترتیب.

1. معرفی

در ده سال گذشته، بروز سرطان سینه در چین 47 درصد افزایش یافته است و میزان بروز آن سال به سال افزایش می‌یابد و بروز سرطان سینه به تدریج جوان‌تر می‌شود [1]. پاتوژنز سرطان پستان به هورمون های شخصی، سابقه خانوادگی، ازدواج و سابقه فرزندآوری مربوط می شود [2]. تشخیص سرطان پستان در مراحل اولیه آسان نیست و ویژگی های سن شروع اولیه اما دیر تظاهر را دارد [3، 4]. در حال حاضر تشخیص اصلی سرطان پستان بر اساس سه روش است: سیتولوژی پونکسیونی [5]، اسکن اولتراسوند [6] و ماموگرافی اشعه ایکس [7]. اگر یک بیمار در مراحل اولیه سرطان سینه گرفتار شود، احتمال درمان بیشتر و پیش آگهی بهتر است. بنابراین معاینه منظم و تشخیص به موقع برای پیشگیری و تشخیص به موقع سرطان سینه بسیار ضروری است.

در زمینه پزشکی، ایجاد مدل‌هایی از طریق روش‌های یادگیری ماشینی می‌تواند به پزشکان در بهبود میزان تشخیص سرطان، برای دستیابی به هدف تشخیص زودهنگام و درمان زودهنگام کمک کند. روش های یادگیری ماشینی نتایج خوبی در تشخیص سرطان به همراه داشته است [8، 9]. وو و همکاران [10] مورفولوژی سلولی را زیر میکروسکوپ مشاهده کرد و دریافت که تفاوت‌های آشکاری بین سلول‌های سرطان سینه و پارامترهای سلول سالم طبیعی وجود دارد. این یافته مبنای نظری بسیاری از مطالعات را فراهم می کند. در حالی که روش‌های یادگیری ماشین زیادی در حال حاضر برای طبقه‌بندی سلول‌های سرطان سینه اعمال می‌شود، هیچ الگوریتم واحدی را نمی‌توان برای همه مشکلات اعمال کرد. هر نوع الگوریتم یادگیری ماشین زمینه های تخصص خود را دارد، بنابراین انتخاب الگوریتم در سناریوهای مختلف متفاوت است.

شن و همکاران [11] از مدل XGBoost برای طبقه‌بندی و پیش‌بینی سرطان سینه استفاده کرد و دقت به 97% رسید.{2}}% و فراخوان به 95.83% رسید. دنگ و همکاران [12] از الگوریتم XGBoost برای طبقه‌بندی و پیش‌بینی سرطان پستان با دقت 96.96 0 و فراخوانی 97.9 0 استفاده کرد. منیرجمان خان و همکاران. [13] از چندین مدل یادگیری ماشین برای شناسایی سرطان سینه استفاده کرد و جنگل تصادفی، درخت تصمیم، K-نزدیک‌ترین همسایه و رگرسیون لجستیک الگوریتم‌هایی با امتیاز F{12} بالاتر، 96%، 95%، 90% بودند. و به ترتیب 98 درصد. بهاردواج و همکاران [14] از پرسپترون چندلایه (MLP)، K-نزدیکترین همسایه (KNN)، الگوریتم ژنتیک (GP) و جنگل تصادفی (RF) برای طبقه بندی سلول های سرطان سینه خوش خیم و بدخیم استفاده کردند و نتایج تجربی نشان داد که طبقه بندی بهینه RF است. با دقت طبقه بندی 96.24٪. دونگ و ما [15] نشانگرهای احتمالی سرطان سینه سه گانه منفی را مورد مطالعه قرار دادند و الگوریتم های یادگیری ماشینی برای پیش بینی اینکه آیا افراد مبتلا به سرطان پستان سه گانه منفی هستند یا خیر استفاده شدند. نتایج نشان می دهد که دقت مدل پیش بینی طبقه بندی ماشین بردار پشتیبان (SVM) به 97.8 درصد می رسد.

وانگ و همکاران برای بهبود دقت روش‌های شناسایی سرطان سینه و بهبود الگوریتم‌های یادگیری ماشینی. [16] یک مدل یادگیری گروه وزنی AUC بر اساس SVM برای تشخیص سرطان پستان، با استفاده از C-SVM و V-SVM با 6 تابع هسته برای افزایش تنوع مجموعه مدل پایه و مقایسه نتایج تصمیم گیری مختلف با ادغام ناحیه (WAUCE) پیشنهاد کرد. ) مدل تحت منحنی مشخصه کاری دریافت وزنی. نتایج نشان می دهد که در مجموعه داده کوچک، ساختار WAUCE پیشنهادی واریانس دقت تشخیصی را تا 69.23٪ کاهش می دهد و دقت را تا 0.94٪ بهبود می بخشد. ژنگ و همکاران [17] مجموعه داده سرطان پستان ویسکانسین (WDBC) را با توجه به الگوریتم ترکیبی ماشین بردار K-means و پشتیبان، ویژگی‌های تومور را استخراج کرده و سرطان سینه را تشخیص می‌دهد، آزمایش کردند و نتایج نشان می‌دهد که الگوریتم ترکیبی دقت را تا 97.38% بهبود می‌بخشد. جیا و همکاران [18] یک الگوریتم جدید بهینه سازی جمعیت را پیشنهاد کرد، الگوریتم بهینه سازی نهنگ (WOA)، که به طور هوشمند پارامترهای مدل SVM را تنظیم می کند و نتایج تجربی نشان می دهد که عملکرد مدل WOA-SVM به طور قابل توجهی بهتر از مدل سنتی است. مدل تشخیص سرطان سینه، با دقت 97.5 درصد.

برای حل مشکل بیش از حد برازش تکنیک های یادگیری ماشین در طبقه بندی سرطان سینه، سینگ و همکاران. [19] یک شبکه عصبی مصنوعی متصل عملکردی (FLANN) را پیشنهاد کرد و به طور تجربی دریافت که این مدل از دقت بالایی برای تشخیص زودهنگام سرطان پستان برخوردار است. ماهش و همکاران [20] یک تکنیک گروه XGBoost برای پیش‌بینی سرطان پستان را بر اساس الگوهای مشخصه‌ای پیشنهاد می‌کند، ابتدا با استفاده از فناوری نمونه‌برداری بیش از حد اقلیت مصنوعی (SMOTE) برای مقابله با عدم تعادل داده‌ها و مشکلات نویز و سپس با استفاده از طبقه‌بندی‌کننده Bayes، طبقه‌بندی درخت تصمیم، و جنگل تصادفی، به ترتیب. ، با XGBoost ترکیب شده و داده ها را طبقه بندی می کند. طبق تجزیه و تحلیل تجربی، طبقه‌بندی گروه XGBoost-Random Forest دارای دقت 98.20 درصد در تشخیص زودهنگام سرطان پستان است.

این مقاله بر اساس XGBoost، جنگل تصادفی، رگرسیون لجستیک، K-نزدیک‌ترین همسایه و سایر روش‌های یادگیری ماشین، مدل‌های مختلفی را برای طبقه‌بندی و پیش‌بینی سرطان پستان ایجاد می‌کند که مرجعی برای تشخیص زودهنگام سرطان پستان است. هنگامی که بیشتر مطالعات از مدل‌های یادگیری ماشینی برای تشخیص سلول‌های سرطان سینه استفاده می‌کنند، بر استفاده از دقت، دقت و امتیاز F1- مدل به عنوان شاخص‌هایی برای ارزیابی کیفیت مدل تمرکز می‌کنند، در حالی که اهمیت تشخیصی پزشکی را نادیده می‌گیرند. فراخوانی مدل، که نشان‌دهنده نسبت سلول‌های سرطانی بدخیم پیش‌بینی‌شده است، و هرچه فراخوان بالاتر باشد، احتمال پیش‌بینی سلول‌های بدخیم در سلول‌های سرطان پستان بیشتر می‌شود. بنابراین، این مقاله یادآوری را به عنوان شاخص اولیه در نظر گرفته و دقت، دقت و امتیاز F1- را برای ارزیابی مدل مورد استفاده در نظر می‌گیرد.

در فرآیند مدل سازی، پیش پردازش داده ها بخش بسیار مهمی است و تأثیر مدل پیش بینی بسته به روش پردازش متفاوت است. برای حذف تأثیر مفاهیم ابعادی مختلف بر تأثیر مدل، داده‌ها استاندارد شده‌اند. برای یافتن زیرمجموعه بهینه و بهبود دقت مدل، انتخاب ویژگی با توجه به ضریب همبستگی پیرسون بین متغیر ویژگی و متغیر هدف انجام شد. برای مشکل عدم تعادل نمونه مثبت و منفی، از روش نمونه گیری سلسله مراتبی استفاده می شود تا مجموعه آموزشی و مجموعه آزمون به تناسب با توجه به دسته های مختلف استخراج شود. با توجه به اینکه اثر پیش‌بینی مدل‌های یادگیری ماشین تحت تقسیم‌بندی داده‌های مختلف متفاوت است، این مقاله از تقسیم‌بندی داده‌های مختلف (8: 2 و 7: 3) به عنوان دو مجموعه آزمایش برای مشاهده اثر پیش‌بینی مدل ایجاد شده در این مقاله استفاده می‌کند.

2. پیش پردازش داده ها

2.1. معرفی داده ها مجموعه داده های مورد استفاده در این مقاله داده های سرطان پستان در مجموعه داده های UCI است که توسط دکتر ویلیام معروف از موسسه تحقیقات پزشکی بالینی دانشگاه ویسکانسین ارائه شده است [21]. ویژگی ها از یک تصویر دیجیتالی از آسپیراسیون با سوزن ظریف (FNA) یک توده پستان محاسبه می شود. آنها ویژگی های هسته های سلولی موجود در تصویر را توصیف می کنند. مجموعه داده ها شامل 569 نمونه آزمایشی شامل 357 نمونه خوش خیم و 212 نمونه بدخیم سرطان پستان بود. برای سلول‌های استخراج‌شده از هر جسم آزمایشی، ده ویژگی زیر از هسته آن جمع‌آوری می‌شود: شعاع (میانگین فاصله مرکز تا نقاط پیرامون)، محیط، صافی (تغییر موضعی در طول شعاع)، مساحت، فشردگی ( محیط ∗ ∗ 2/مساحت-1.0)، تقعر (شدت بخش‌های مقعر کانتور)، تقارن، بافت (انحراف استاندارد مقادیر مقیاس خاکستری)، نقاط مقعر (تعداد بخش‌های مقعر) از کانتور)، و ابعاد فراکتال{10}}("تقریبا خط ساحلی"-1). میانگین، خطای استاندارد و "بدترین" یا بزرگترین (میانگین سه مقدار بزرگ) این ویژگی ها برای هر تصویر محاسبه شد که منجر به 30 ویژگی شد. برچسب طبقه بندی نشان دهنده نوع سرطان سینه است. بنابراین مجموعه داده های نمونه در مجموع شامل 30 ویژگی و یک ویژگی برچسب نمونه (بدخیم و خوش خیم) است.

2.2. استاندارد سازی داده ها

با مشاهده محدوده مقدار هر ویژگی، مشخص می شود که مقادیر داده های ویژگی های مختلف بسیار متفاوت است. در برخی از مدل ها، ابعاد مختلف تاثیر زیادی بر اثر پیش بینی دارند. به عنوان مثال، الگوریتم k نزدیکترین همسایه بر اساس تقسیم فاصله باید بعد داده را ثابت نگه دارد، بنابراین داده ها باید قبل از مدل سازی استاندارد شوند. با این حال، برخی از مدل ها کمتر تحت تأثیر ابعاد قرار می گیرند، مانند الگوریتم جنگل تصادفی. برای مقایسه‌ای کردن آزمایش، داده‌های مدل‌های مختلف به یک شکل رفتار می‌شوند.

برای مسائل مربوط به ابعاد مختلف داده نمونه، روش‌های پردازش بدون بعد متداول شامل استانداردسازی داده‌ها و روش‌های استانداردسازی داده‌ها شامل استانداردسازی Min-max و استانداردسازی Z-score است. در این میان، زمانی که داده های مورد استفاده دارای مقادیر پرت خارج از محدوده مقادیر هستند یا مقادیر حداکثر و حداقل برخی از شاخص ها ناشناخته هستند، می توان از استانداردسازی امتیاز Z استفاده کرد.

increase memory

در این مقاله، با توجه به ویژگی های مجموعه داده سرطان پستان WDBC، استانداردسازی امتیاز Z برای پردازش داده ها انتخاب شد. داده های پردازش شده توسط استاندارد Zscore [22] از یک توزیع نرمال استاندارد پیروی می کنند، یعنی میانگین 0 و واریانس آن 1 است. فرمول استانداردسازی امتیاز Z به شرح زیر است:

improve memory

2.3. انتخاب ویژگی به عنوان بخش مهمی از فرآیند پیش پردازش داده ها، انتخاب ویژگی یافتن زیرمجموعه بهینه است، انتخاب ویژگی می تواند ویژگی های اضافی و بی فایده را برای بهبود دقت مدل کاهش دهد. روش انتخاب ویژگی به طور کلی به روش تفکر بیش از حد، روش کپسوله سازی و روش تعبیه تقسیم می شود. روش فیلتر می‌تواند مستقل از الگوریتم مورد استفاده بعدا در مطالعه باشد و دارای راندمان محاسباتی بالا و توانایی تعمیم قوی [23] است، بنابراین روش انتخاب ویژگی در این مقاله از روش فیلتر استفاده می‌کند و خلاصه روش کلی در روش فیلترینگ در جدول 2 نشان داده شده است.

داده‌های سرطان پستان پس از نرمال‌سازی میانگین 0 الزامات آزمون ضریب همبستگی پیرسون در روش فیلتر کردن را برآورده می‌کند. بنابراین در این مقاله از ضریب همبستگی پیرسون [24] برای آزمون همبستگی بین هر ویژگی و متغیر هدف استفاده شده است. فرمول ضریب همبستگی پیرسون به شرح زیر است:

boost memory


3. ساخت مدل
در این مقاله دسته بندی سرطان پستان به ترتیب بر اساس مدل XGBoost، جنگل تصادفی، رگرسیون لجستیک و مدل K-nearest Neighbor پیش بینی شده است. سرطان بدخیم پستان به عنوان نمونه مثبت و سرطان خوش خیم پستان به عنوان نمونه منفی در نظر گرفته می شود

برای حل مشکل عدم تعادل نمونه، این مقاله از روش نمونه گیری طبقه ای [25] برای استخراج مجموعه آموزشی و مجموعه آزمون متناسب با انواع داده های نمونه استفاده می کند. نمونه برداری طبقه ای را نمونه گیری نوع نیز می گویند. جامعه نمونه به زیرجمعیت هایی تقسیم می شود که مستقل از یکدیگر هستند. نمونه گیری تصادفی به نسبت هر زیرجمعیت انجام شد. نمونه‌برداری طبقه‌ای نمونه‌ای نماینده‌تر می‌کشد و برای نمونه‌های نامتعادل مناسب‌تر است.

پارتیشن بندی مجموعه داده های مختلف ممکن است به اثرات مدل متفاوتی منجر شود. بنابراین، این مقاله دو گروه آزمایش را با توجه به تقسیم بندی متفاوت مجموعه داده های نمونه انجام می دهد. گروه اول مجموعه داده ها را به یک مجموعه آموزشی و مجموعه تست به نسبت 8: 2 تقسیم کردند و گروه دوم مجموعه داده ها را به یک مجموعه آموزشی و مجموعه تست به نسبت 7: 3 تقسیم کردند. عملکرد مدل را مشاهده کنید. چهار الگوریتم تحت پارتیشن بندی مجموعه داده های مختلف.

3.1. شاخص های ارزیابی در این مطالعه از دقت، دقت، یادآوری و امتیاز F [26، 27] برای ارزیابی اثر پیش‌بینی مدل استفاده شد. با توجه به خاص بودن تشخیص پزشکی، انتظار می رود که تمامی سرطان های بدخیم پستان قابل پیش بینی باشند. بنابراین، یادآوری به عنوان یک شاخص ارزیابی مهم در اینجا در نظر گرفته می شود. هر چه میزان یادآوری بیشتر باشد، نسبت سرطان بدخیم پستان قابل پیش بینی بیشتر است. نتایج طبقه بندی مدل می تواند یک ماتریس سردرگمی [28] ایجاد کند، همانطور که در جدول 4 نشان داده شده است

در اینجا، TP یک مثبت واقعی است، که تعداد نمونه های مثبت پیش بینی شده به عنوان نمونه های مثبت را نشان می دهد. TN یک منفی واقعی است که تعداد نمونه های منفی پیش بینی شده به عنوان نمونه های منفی را نشان می دهد. FP یک مثبت کاذب است که تعداد نمونه های مثبت پیش بینی شده از نمونه های منفی را نشان می دهد که به آن خطای نوع 1 می گویند. FN یک منفی کاذب است که نشان دهنده تعداد نمونه های مثبت پیش بینی شده به عنوان نمونه های منفی است که به آن خطای نوع 2 می گویند.

دقت، به اختصار P. برای نتایج پیش‌بینی‌شده، دقت نشان می‌دهد که چند نمونه از نمونه‌های پیش‌بینی‌شده مثبت، نمونه‌های مثبت هستند و فرمول این است:

10 ways to improve memory

short term memory how to improve

3.2. مدل پیش بینی سرطان سینه بر اساس XGBoost. XGBoost، مخفف تقویت گرادیان شدید، یک الگوریتم تقویتی است [29]. هم XGBoost و هم جنگل تصادفی الگوریتم های یکپارچه سازی بر اساس درخت تصمیم هستند. متفاوت از الگوریتم Bagging، الگوریتم Boosting یادگیرندگان ضعیف را یکی یکی می سازد و چندین یادگیرنده ضعیف را از طریق تکرار مداوم جمع می کند [30]. تابع هدف است

ways to improve memory

. (9) افزودن عبارت‌های منظم می‌تواند واریانس مدل را کاهش دهد و مدل به‌دست‌آمده توسط مجموعه آموزشی را ساده‌تر کند، تا از وقوع اورینگ جلوگیری شود.. الگوریتم XGBoost برای آموزش مدل بر روی مجموعه داده های آموزشی استفاده می شود. در فرآیند آموزش مدل، پارامترها برای به دست آوردن مجموعه ای بهتر از پارامترها تنظیم می شوند و در نهایت مدل پیش بینی بهینه به دست می آید. این مدل برای پیش‌بینی دسته‌بندی‌های سرطان پستان در سال 1396 مورد استفاده قرار گرفت

تنظیمات. هنگامی که مجموعه داده به یک مجموعه آموزشی و مجموعه آزمایشی با 8: 2 تقسیم شد، دقت، دقت، فراخوانی و F{2}}نمره مدل XGBoost 0.974، {{5} بود. }.960، 1.00، و 0.980، به ترتیب. وقتی مدل XGBoost به یک مجموعه آموزشی و مجموعه آزمایشی با 7 : 3 تقسیم شد، دقت، دقت، فراخوانی و F{13}}نمره مدل XGBoost 0.959، {{20} بود. }.946، 0.991، و 0.968، به ترتیب. نتایج نشان می‌دهد که مدل XGBoost وقتی مجموعه داده‌ها بر 8: 2 تقسیم می‌شود، عملکرد پیش‌بینی بهتری دارد. نرخ فراخوان 1 نشان می‌دهد که مدل XGBoost به درستی همه سرطان‌های بدخیم پستان را در نمونه پیش‌بینی کرده است، که برای دیا پزشکی بسیار مهم است.

osis 3.3. مدل پیش‌بینی سرطان پستان بر اساس جنگل تصادفی. جنگل تصادفی یک الگوریتم یادگیری نظارت شده است که چندین درخت را از طریق ایده بگینگ ادغام می کند [31-33]. روش بوت استرپ برای استخراج مجموعه نمونه آموزشی از داده های نمونه اصلی استفاده می شود و مدل درخت تصمیم مربوطه برای هر مجموعه آموزشی آموزش داده می شود. در نهایت، همه طبقه‌بندی‌کننده‌های پایه مورد رأی‌گیری قرار می‌گیرند و دسته‌بندی نهایی که بیشترین رأی را دارد، دسته‌بندی می‌شود.

ways to improve brain function

غمگین هنگامی که مجموعه داده به یک مجموعه آموزشی و مجموعه آزمایشی با 8: 2 تقسیم شد، دقت، دقت، یادآوری و F{2}}نمره مدل جنگل تصادفی 0.965، {{5} بود. }}.947، 1.00، و 0.973، به ترتیب. هنگامی که مجموعه داده ها به یک مجموعه آموزشی و مجموعه آزمایشی با 7: 3 تقسیم شد، دقت، دقت، یادآوری و F{13}} امتیاز 0.953، 0.946، 0 بود. {18}}.981، و 0.963، به ترتیب. نتایج نشان می‌دهد که مدل جنگل تصادفی با تقسیم مجموعه داده‌ها بر 8: 2 عملکرد پیش‌بینی بهتری دارد. نرخ یادآوری این مدل نیز 1 بود که نشان می‌دهد مدل جنگل تصادفی نیز به درستی تمام پستان‌های بدخیم را پیش‌بینی کرده است.

memory enhancement

اما من. سه عنصر اساسی الگوریتم k نزدیکترین همسایه عبارتند از اندازه‌گیری فاصله، انتخاب مقدار k، تصمیم طبقه‌بندی.

برای مسئله انتخاب مقدار K در الگوریتم k نزدیکترین همسایه، این مقاله از روش اعتبارسنجی متقاطع ده برابری (38، 39) استفاده می کند و نرخ فراخوان را به عنوان شاخص ارزیابی مدل برای انتخاب یک مقدار k مناسب در نظر می گیرد. بگذارید محدوده مقدار k بین 1 تا 40 باشد و برای هر k اعتبار دهی متقابل ده برابر انجام می شود. مقدار k با حداکثر نرخ فراخوان، مقدار k بهینه است. فراخوانی مقادیر مختلف k تحت اعتبار دهی متقاطع در شکل 1 نشان داده شده است.

از شکل 1 می توان دید که با افزایش مقدار k، فراخوان کاهش می یابد. هنگامی که k 3 و k 5، فراخوان بزرگترین است. از آنجایی که مقدار k بسیار کوچک تنظیم شده است، به راحتی می توان آن را اضافه کرد، بنابراین مقدار k در اینجا 5 تنظیم می شود.

وقتی مجموعه داده‌ها به یک مجموعه آموزشی و مجموعه آزمایشی با 8: 2 تقسیم شد، دقت، دقت، فراخوانی و F{2}}نمره k-نزدیک‌ترین مدل همسایه 0.912، 0 بود. {6}}.888، 0.986، و {{10}}.934، به ترتیب. هنگامی که مجموعه داده ها به یک مجموعه آموزشی و مجموعه آزمایشی با 7 : 3 تقسیم شد، دقت، دقت، یادآوری و F{14}}امتیاز 0.930، {{21} بود. }.906، 0.991، و 0.946، به ترتیب. نتایج نشان می‌دهد که مدل k-نزدیک‌ترین همسایه زمانی که مجموعه داده بر 7:3 تقسیم شود، عملکرد پیش‌بینی بهتری دارد.

4. مقایسه و تجزیه و تحلیل

برای درک بهتر عملکرد مدل ایجاد شده در این مقاله، این مقاله بر اساس محیط توسعه Python 3.9.7 است و از داده‌های سرطان پستان ارائه شده توسط دکتر ویلیام از موسسه تحقیقات پزشکی بالینی دانشگاه ویسکانسین برای آزمایش‌ها استفاده می‌کند.

محیط آزمایشی سیستم عامل Windows 11، پردازنده Intel(R) Core(TM) i5-1155G7@ 2.50 GHz 2.50 GHz و حافظه 8.{8}} گیگابایت است.

پارامترهای آزمایشی هر مدل در جدول 5 نشان داده شده است و سه نتیجه تحلیل مقایسه ای زیر انجام خواهد شد: (1) مقایسه عملکرد هر مدل در این مقاله زمانی که مجموعه داده ها به یک مجموعه آموزشی و مجموعه تست در 8 تقسیم می شود. : 2. (2) مقایسه عملکرد هر مدل در این مقاله زمانی که مجموعه داده ها به یک مجموعه آموزشی و مجموعه تست در 7: 3 تقسیم می شود. (3) مقایسه با برخی از مدل ها در ادبیات [11-14].

(1) هنگامی که مجموعه داده به یک مجموعه آموزشی و مجموعه آزمایشی با 8: 2 تقسیم می شود، عملکرد هر مدل در جدول 6 نشان داده شده است.

همانطور که از جدول 4 مشاهده می شود، هنگام تقسیم مجموعه آموزشی و مجموعه تست به نسبت 8: 2، دقت چهار روش یادگیری ماشینی بالاتر از 0.9 است که در میان آنها XGBoost و RF بالاتر از { هستند. {5}}.95. دقت پیش‌بینی XGBoost 0.974 است که نشان‌دهنده دقت پیش‌بینی بالایی است. برای دقت، دقت مدل KNN بالا نیست، زیر 0.9، فقط 0.888 است. XGBoost بالاترین دقت را دارد که 0.960 است. در مورد فراخوانی، فراخوانی XGBoost، جنگل تصادفی و الگوریتم های رگرسیون لجستیک همگی 1 هستند. الگوریتم k-nearest همسایه کمترین فراخوان را دارد، اما همچنین بالای 0.95 است. برای این مطالعه، نرخ های یادآوری نشان دهنده نسبت نمونه های سرطان بدخیم پستان است که به درستی تشخیص داده شده اند. در پزشکی، یک بیماری نیاز به تشخیص دارد. پیامد عدم تشخیص، تاخیر در درمان است که ممکن است منجر به از دست دادن بهترین زمان برای درمان توسط بیماران شود. این بسیار جدی تر از تشخیص بیماری بدون داشتن آن است. بنابراین، نرخ فراخوان شاخص بسیار مهمی در زمینه تشخیص بیماری است. در اینجا، فراخوانی XGBoost، جنگل تصادفی و الگوریتم رگرسیون لجستیک همگی 1 هستند، که نشان می‌دهد همه سرطان‌های بدخیم پستان در نمونه‌ها تشخیص داده شده‌اند. برای امتیاز F{{20}}می‌توان مشاهده کرد که امتیاز F1-XGBoost، جنگل تصادفی و رگرسیون لجستیک همه بالاتر از 0.95 است. امتیاز F{24}}الگوریتم XGBoost بالاترین است و به 0.980 می‌رسد. مدل K نزدیکترین همسایه کمترین امتیاز F1- 0.934 را دارد. با در نظر گرفتن چهار شاخص، می توان گفت که وقتی مجموعه داده ها به یک مجموعه آموزشی و مجموعه آزمایشی با 8: 2 تقسیم می شوند، تأثیر مدل کلی الگوریتم XGBoost بهتر از سه مدل دیگر است. XGBoost نه تنها به فراخوانی 1 دست یافت، بلکه برای سه معیار دیگر به فراخوانی 0.95 یا بیشتر نیز دست یافت.

(2) هنگامی که مجموعه داده به یک مجموعه آموزشی و مجموعه تست در 7: 3 تقسیم می شود، عملکرد هر مدل در جدول 7 نشان داده شده است.

همانطور که از جدول 7 مشاهده می شود، وقتی مجموعه آموزشی و مجموعه تست بر 7: 3 تقسیم می شوند، اثر مدل XGBoost و RF به خوبی 8: 2 نیست. اول از همه، از نظر شاخص مهم. به یاد بیاورید، هنگام تقسیم مجموعه داده بر 8: 2، فراخوانی XGBoost و RF هر دو 1 بودند، اما اکنون به ترتیب به 991.991.{8}} و 981.981. . این دو مدل در سه شاخص دیگر نیز اندکی کاهش داشته اند. با این حال، تغییر در اثر پیش‌بینی رگرسیون لجستیک و مدل K-نزدیک‌ترین همسایه با این دو الگوریتم متفاوت است. برای مدل رگرسیون لجستیک، زمانی که مجموعه آموزشی و مجموعه آزمون به ترتیب بر 7: 3 و 8: 2 تقسیم شدند، چهار شاخص به سختی تغییر کردند. این نشان می دهد که مدل رگرسیون لجستیک تقریباً تحت تأثیر پارتیشن های مجموعه داده های مختلف قرار نمی گیرد. در مورد تقسیم 7: 3 بین مجموعه آموزشی و مجموعه آزمایشی، رگرسیون لجستیک دقت، دقت و امتیاز F{19}} کمتری را نسبت به XGBoost و جنگل تصادفی نشان داد. با این حال، یادآوری مدل رگرسیون لجستیک 1 است، که نشان می‌دهد همه سرطان‌های بدخیم پستان پیش‌بینی شده‌اند که برای تشخیص بیماری از اهمیت بالایی برخوردار است. بنابراین می توان گفت که اثر پیش بینی مدل رگرسیون لجستیک بهتر از سه الگوریتم دیگر است. برای مدل KNN، وقتی مجموعه آموزشی و مجموعه تست بر 7: 3 تقسیم شدند، هر چهار شاخص افزایش یافت. یادآوری به 0.991 افزایش یافت که بالاتر از جنگل تصادفی بود. دقت، دقت و امتیاز F{25}} از 0.912، {{3{32}}}}.887، و 0.934 به 0 افزایش یافت. 930/0، 906/0 و 946/0 به ترتیب. بنابراین، مدل KNN در مورد مجموعه آموزشی و مجموعه آزمون تقسیم بر 7: 3 بهتر از مدل تقسیم بر 8: 2 عمل می کند. تجزیه و تحلیل نشان می دهد که تقسیم مجموعه داده ها ثابت نیست. برای مدل‌های مختلف، تقسیم‌بندی‌های مختلف تغییرات متفاوتی را در اثر پیش‌بینی مدل ایجاد می‌کنند.
(3) با توجه به تحلیل مقایسه ای جداول 6 و 7، مدل XGBoost ایجاد شده در این مقاله (تقسیم مجموعه آموزشی و مجموعه تست بر 8: 2) بهترین تأثیر را دارد و موارد زیر آن را با عملکرد مدل در مدل مقایسه می کند. ادبیات [11-14] و نتایج خاص در جدول 8 نشان داده شده است.

همانطور که از جدول 8 مشاهده می شود، مدل های با عملکرد بهتر از پنج مدل، مدل رگرسیون لجستیک ادبیات [13] و مدل XGBoost است که در این مقاله ایجاد شده است. فراخوانی و دقت مدل در ادبیات [13] به ترتیب 0.99 و 0.98، ​​و فراخوانی و دقت مدل در این مقاله 1 است.{{8} } و 0.974، به ترتیب، در مقایسه با ادبیات [13]، یادآوری مدل بالا است، و یادآوری در تشخیص پزشکی احتمال تشخیص سلول های سرطانی را نشان می دهد که برای طبقه بندی اهمیت زیادی دارد. از سلول‌های سرطان سینه، بنابراین مدل XGBoost که در این مقاله ایجاد شده است، اثر پیش‌بینی بهتری دارد و می‌تواند به عنوان یک ابزار پزشکی برای کمک به پزشکان برای ایجاد برنامه‌های درمانی برای بیماران مبتلا به سرطان پستان استفاده شود.

increase brain power

5. نتیجه گیری

این مقاله عمدتاً مقوله‌های سرطان سینه، از پیش پردازش داده‌ها تا انتخاب ویژگی، و سپس تا ایجاد مدل را پیش‌بینی می‌کند. در نهایت، نتایج پیش‌بینی از جنبه‌های مختلف مقایسه و تحلیل شدند.

در این مقاله، یادآوری به عنوان یک شاخص مهم برای پیش‌بینی دقیق نمونه‌های سرطان پستان در نظر گرفته شده است. مجموعه داده های اولیه شامل 30 ویژگی بود و 15 ویژگی به عنوان ورودی مدل از طریق آزمون همبستگی پیرسون انتخاب شد. قبل از ساخت مدل، داده ها برای حذف تاثیر ابعاد مختلف بر اثرات مدل استاندارد شده بودند. برای مشکل نامتعادل نمونه‌های مثبت و منفی، از روش نمونه‌گیری طبقه‌ای برای استخراج مجموعه‌های آموزشی و مجموعه‌های آزمون متناسب با دسته‌های مختلف داده‌ها استفاده می‌شود. هنگام انتخاب مقدار k بهینه در k نزدیکترین همسایه، فراخوانی به عنوان شاخص ارزیابی مدل استفاده می شود، به طوری که مقدار k با بالاترین نرخ فراخوان مقدار بهینه است.

مدل ها از سه جنبه مقایسه و تحلیل می شوند. نتایج به شرح زیر نشان داده شده است:

پکت ها نتایج به شرح زیر نشان داده شده است: (1) در مورد تقسیم مجموعه آموزشی و مجموعه تست بر 8: 2، فراخوان XGBoost، جنگل تصادفی و رگرسیون لجستیک 1 است که می تواند تمام سرطان های بدخیم پستان را پیش بینی کند. - فراخوان نزدیکترین همسایه در مقایسه با سه مدل دیگر کمی کمتر از 0.986 است. برای دقت پیش‌بینی، دقت و امتیاز F مدل، نتایج مدل XGBoost بهتر از نتایج جنگل تصادفی و رگرسیون لجستیک است که 0.974، {{1 است. 0}}.96 و 0.98 به ترتیب، بنابراین مدل XGboost به عنوان مدل پیش‌بینی نهایی تحت شرط تقسیم 8:2 مجموعه آموزشی و مجموعه آزمایشی انتخاب می‌شود.

(2) در صورت تقسیم مجموعه آموزشی و مجموعه آزمون در 7: 3، مقادیر چهار شاخص ارزیابی برای XGBoost و جنگل تصادفی کاهش یافت، در حالی که مقادیر چهار شاخص ارزیابی برای مدل K-نزدیک‌ترین همسایه بود. بهبود یافته است، اما برای فراخوانی، تنها فراخوانی مدل رگرسیون لجستیک 1 بود و سایر مدل‌ها بالای 98.9 0 بودند، بنابراین اثر پیش‌بینی مدل رگرسیون لجستیک بهترین و دقت پیش‌بینی، دقت بود. امتیاز رگرسیون لجستیک و F{7}}به ترتیب 947.947، {{1{12}}}} و 0.96 بود.

improve your memory

(3) از آزمایش‌ها می‌توان دریافت که تحت تقسیم‌بندی‌های مختلف، تأثیر پیش‌بینی مدل تغییرات متفاوتی دارد. با مقایسه مدل‌های بهینه در دو مجموعه آزمایش‌های مختلف، می‌توان دریافت که دقت پیش‌بینی، دقت و امتیاز F1- مدل XGBoost (که مجموعه آموزشی و مجموعه تست را بر 8:2 تقسیم می‌کند) زمانی که فراخوانی 1 است از مدل رگرسیون لجستیک (که مجموعه آموزشی و مجموعه تست را بر 7:3 تقسیم می کند) بالاتر هستند، بنابراین مدل XGBoost (که مجموعه آموزشی و مجموعه تست را بر 8:2 تقسیم می کند) کار می کند. بهترین در مدل ایجاد شده در این مقاله. علاوه بر این، در مقایسه با مدل‌های موجود در ادبیات [11-14]، مدل XGBoost ایجاد شده در این مقاله تأثیر بهتری دارد و می‌تواند سلول‌های سرطانی بدخیم پستان را با دقت شناسایی کند. با این حال، این تحقیق به مجموعه داده‌های عددی محدود می‌شود و در آینده سعی می‌کنیم از الگوریتم‌های یادگیری عمیق برای اعمال تکنیک‌های مختلف استخراج ویژگی در داده‌های تصویر (مانند تصاویر اشعه ایکس) استفاده کنیم تا نتایج طبقه‌بندی بهتری به دست آوریم.

در دسترس بودن داده ها

داده‌هایی که از یافته‌های این مطالعه پشتیبانی می‌کنند به‌طور آشکار در مخزن یادگیری ماشین UCI در https:// archive.ics.uci.edu/ml/datasets/Breast+Cancer+Wisconsin+ %28Diagnostic%29 در دسترس هستند.

تضاد علاقه

نویسندگان اعلام می کنند که هیچ تضاد منافعی ندارند.

قدردانی

این کار توسط بنیاد ملی علوم طبیعی چین (با شماره گرنت 61502156)، پروژه آموزشی و تحقیقاتی کمیته آموزش هوبی (گرنت شماره 282)، و بنیاد دکتری دانشگاه فناوری هوبی (با شماره گرنت BSQD13051) پشتیبانی شد.


منابع

[1] V. Fotedar، S. Fotedar، P. Takur، S. Vats، A. Negi، و L. Chanderkant، "دانش عوامل خطر سرطان پستان و روش های تشخیص زودهنگام آن در بین کارکنان مراقبت های بهداشتی اولیه در شیملا، هیماچال. پرادش، مجله آموزش و ارتقای سلامت، ش. 8، ص. 265، 2019.

[2] MS Simon، TA Hastert، A. Barac، و همکاران، "عوامل خطر متابولیک قلبی و بقا پس از سرطان در ابتکار عمل سلامت زنان"، سرطان، جلد. 127، شماره 4، صفحات 598-608، 2021.

[3] HF Pasha، RH Mohamed، MM Toam، و AM Yehia، "اصلاحات ژنتیکی و اپی ژنتیکی ژن آدیپونکتین: p," The Journal of Gene Medicine, vol. 21، شماره 10، ص. e3120، 2019.

[4] D. Hong, AJ Fritz, SK Zaidi, et al., "Transition اپیتلیال به مزانشیمی و سلول های بنیادی سرطانی به ناهمگونی سرطان پستان کمک می کنند" Journal of Cellular Physiology, vol. 233، شماره 12، صفحات 9136–9144، 2018.

[5] J. Zhong، D. Sun، W. Wei، و همکاران، "آسپیراسیون با سوزن نازک با هدایت اولتراسوند با کنتراست برای بیوپسی غدد لنفاوی نگهبان در سرطان پستان در مراحل اولیه"، اولتراسوند در پزشکی و زیست شناسی، جلد . 44، شماره 7، ص 1371–1378، 2018.

[6] K. Babic، C. Siguan-Bell، M. Hee، و SC Lin، "Ocular g: اولتراسوند B-اسکن ارزیابی اسفنج جراحی باقی مانده پس از جراحی دریچه احمد: مورد r"، مجله گلوکوم، جلد. 26، شماره 10، صفحات e239–e241، 2017.

[7] A. Yala، PG Mikhael، F. Strand، و همکاران، "به سوی مدل های قوی مبتنی بر ماموگرافی برای خطر سرطان پستان"، Science Translational Medicine، جلد. 13، شماره 578، شناسه مقاله eaba4373، 2021.

[8] G. Zheng، X. Liu، و G. Han، "تصویر پزشکی با کمک کامپیوتر تشخیص و بررسی سیستم تشخیص"، مجله نرم افزار، جلد. 29، شماره 5، صفحات 1471-1514، 2018.

[9] EY Huang, S. Knight, CR Guetter, et al., "Telemedicine and Telementoring in the Surgical Specialities: a Narrative Review, The American Journal of Surgery, vol. 218, no. 4, pp. 760-766, 2019.

[10] Q. Wu، BT Wang، HR Rao، Y. Jiang و C. Liu، "سرطان پستان و سلول های بیماری خوش خیم از تحقیقات اندازه گیری تشکیل می دهند"، مجله دانشگاه پزشکی آنهویی، جلد. 31، شماره 02، صفحات 91-93، 1996.

[11] Q. Shen، F. Shao، and R. Sun، "مدل پیش بینی سرطان پستان بر اساس xgboost"، مجله دانشگاه Qingdao (نسخه علوم طبیعی)، جلد. 32، شماره 1، 2019.

[12] Z. Deng، B. Su، و K. Zhan. g، "طبقه بندی سرطان پستان بر اساس یادگیری گروهی"، China Medical Devices، vol. 35، شماره 12، 2020.

[13] M. Monirujjaman Khan، S. Islam، S. Sarkar، و همکاران، "تحلیل مقایسه ای مبتنی بر یادگیری ماشین برای پیش بینی سرطان پستان"، Journal of Healthcare Engineering، vol. 2022، شناسه مقاله 4365855، 15 صفحه، 2022.

[14] A. Bhardwaj, H. Bhardwaj, A. Sakalle, Z. Uddin, M. Sakalle, and W. Ibrahim, "تجزیه و تحلیل الگوریتم یادگیری ماشینی و درختی برای طبقه بندی سرطان پستان" Computational Intelligence and Neuroscience, vol. 2022، شناسه مقاله 6715406، 6 صفحه، 2022.

[15] H. Dong و L. Ma، "مدل پیش بینی سرطان پستان سه گانه منفی بر اساس یادگیری ماشین"، مجله دانشگاه یوننان، جلد. 39، شماره 1، صفحات 111-115، 2017.


For more information:1950477648nn@gmail.com


شما نیز ممکن است دوست داشته باشید