تشخیص گفتار واکه از الکتروانسفالوگرافی موش صحرایی با استفاده از شبکه عصبی حافظه کوتاه مدت بلندمدت قسمت 3
Dec 28, 2023
طبقه بندی کننده های یادگیری ماشین
عملکرد BiLSTM با طبقهبندیکنندههای یادگیری ماشین معمولی مقایسه شد: SVM با هسته خطی (SVM{0}}lin)، SVM با هسته تابع پایه شعاعی (SVM_rbf)، جنگلهای تصادفی (RF)، NB، و KNN.
جنگل تصادفی یک الگوریتم یادگیری ماشینی است که در حال حاضر به طور گسترده در زمینه های مختلف تجزیه و تحلیل داده ها و زمینه های پیش بینی استفاده می شود. در مقایسه با سایر الگوریتمهای یادگیری ماشینی، استحکام و دقت بهتری دارد، در حالی که به طور موثری بیش از حد برازش را کاهش میدهد. در سالهای اخیر، دامنه کاربرد جنگلهای تصادفی در حال گسترش است و حتی میتوان از آن برای پیشبینی برخی از تواناییهای حافظه انسان استفاده کرد.
در زمینه روانشناسی شناختی، حافظه یک جهت تحقیقاتی بسیار مهم است. دانشمندان به دنبال راهی ساده و موثر برای ارزیابی سطح حافظه انسان بوده اند. در سالهای اخیر، پیدایش جنگلهای تصادفی، ایدهها و روشهای جدیدی را وارد این عرصه کرده است.
Random Forest می تواند یک مدل را برای پیش بینی یک متغیر آموزش دهد، که می تواند هر چیزی باشد که می خواهید پیش بینی کنید، از جمله توانایی حافظه. دانشمندان می توانند فاکتورهای مربوطه را به یک مدل جنگل تصادفی برای پیش بینی میزان نمره یک فرد در آزمون حافظه وارد کنند. این عوامل می توانند عواملی مانند سن، سطح تحصیلات، جنسیت، وزن و ... و یا شاخص های بیولوژیکی مانند ساختار مغز باشند. بر اساس تحقیقات انجام شده، رابطه مشخصی بین این عوامل و توانایی حافظه انسان وجود دارد.
با جمع آوری و تجزیه و تحلیل مقادیر زیادی از داده های آزمایشی از افراد، دانشمندان می توانند مدلی بسازند که توانایی حافظه را در یک مدل جنگل تصادفی پیش بینی می کند. پیشبینی نتایج میتواند اطلاعات ارزشمندی در مورد عملکرد آتی آزمودنی در یک آزمون حافظه خاص ارائه دهد.
به طور خلاصه، الگوریتم جنگل تصادفی روش جدیدی را برای ارزیابی سطح حافظه انسان در اختیار دانشمندان قرار می دهد. در آینده، کاربرد آن ممکن است نقش مهمی در روانشناسی شناختی، علوم اعصاب و سایر زمینه ها ایفا کند. ما دلایلی داریم که باور کنیم ترکیب جنگلهای تصادفی و سایر تکنیکها میتواند دیدگاه وسیعتری و درک عمیقتری از تحقیقات عملکرد مغز انسان ارائه دهد. مشاهده می شود که ما نیاز به بهبود حافظه داریم و سیستانش دسرتیکولا می تواند حافظه را به میزان قابل توجهی بهبود بخشد، زیرا سیستانش دسرتیکولا می تواند تعادل انتقال دهنده های عصبی مانند افزایش سطح استیل کولین و فاکتورهای رشد را نیز تنظیم کند. این مواد برای حافظه و یادگیری بسیار مهم هستند. علاوه بر این، گوشت همچنین می تواند جریان خون را بهبود بخشد و اکسیژن رسانی را تقویت کند، که می تواند اطمینان حاصل کند که مغز مواد مغذی و انرژی کافی را دریافت می کند و در نتیجه نشاط و استقامت مغز را بهبود می بخشد.

روی روش های بهبود عملکرد مغز کلیک کنید
هدف SVM [74] تعیین ابرصفحه بهینه جدا شده از طریق به حداکثر رساندن حاشیه، که فاصله بین بردارهای پشتیبانی است، است. با استفاده از ترفند هسته، SVM میتواند فضای ویژگیها را از ابعاد کم به بالا ترسیم کند. بنابراین، می تواند به طور موثر طبقه بندی خطی و طبقه بندی غیر خطی را انجام دهد.
RF [75] با ساخت چندین درخت تصمیم در طول مرحله آموزش و تولید کلاس نهایی که نتایج هر درخت تصمیم را ترکیب می کند، عمل می کند. NB [76، 77] یک طبقهبندی احتمالی مبتنی بر قضیه بیز و احتمال شرطی است که معمولاً فرض میکند که همه ویژگیها مستقل از یکدیگر هستند.
KNN [78] یک رویکرد ناپارامتریک است که ورودی را بر اساس اکثریت کلاس k نزدیکترین همسایگان خود در فضای ویژگی طبقه بندی می کند. معمولاً، مقدار k به عنوان یک عدد فرد انتخاب می شود تا از کلاس های گره خورده جلوگیری شود.
برای آموزش و ارزیابی مدلهای یادگیری ماشینی فوق، از همان 10-CV مانند BiLSTM استفاده شد. همه مدلهای یادگیری ماشین با استفاده از کتابخانه Scikit-Learn [73] در پایتون پیادهسازی شدند.
تجزیه و تحلیل های آماری
تمامی تجزیه و تحلیل های آماری با استفاده از نرم افزار SPSS (SPSS نسخه 20.0، SPSS Inc.,Armonk, NY, USA) و نرم افزار MATLAB نسخه 2017b (Mathworks, Inc., MA, USA) انجام شد.
دادهها با آمار پارامتریک تجزیه و تحلیل شدند، زیرا همه دادههای مطالعه توزیع نرمال را در آزمون Shapiro-Wilk نشان دادند (p > 0.05). ANOVA برای تجزیه و تحلیل اهمیت آماری TFR ها با توجه به محرک های واکه های مختلف استفاده شد.
علاوه بر این، ANOVA اندازه گیری های مکرر برای مقایسه عملکرد هر طبقه بندی انجام شد. متعاقبا، مقایسههای زوجی با استفاده از آزمونهای t زوجی بین شبکه BiLSTM و دیگر طبقهبندیکنندههای یادگیری ماشینی کلاسیک انجام شد و یک تصحیح Bonferroni برای تنظیم نرخ خطای نوع تورم انجام شد.
معنیداری آماری p-value روی 0 تنظیم شد.01 هنگام مقایسه TFR پاسخهای EEG، در حالی که سطح معنیداری thep-value در هنگام مقایسه عملکرد بین شبکه BiLSTM 0.05 تنظیم شد. و سایر طبقه بندی کننده های یادگیری ماشینی
نتایج
پتانسیل های برانگیخته شنوایی در پاسخ به صداهای مصوت
در مجموع 19 موش Sprague-Dawley تحت عمل جراحی کاشت الکترود اپیدورال قرار گرفتند و allrats از روش جراحی جان سالم به در بردند. در نتیجه، پاسخ EEG به پنج صدا واکه انگلیسی از 19 موش بیهوش با ایزوفلوران ثبت شد. برای استخراج میانگین شکلهای موج AEP، تمام پاسخهای عصبی بر روی افراد برای هر محرک میانگینگیری شد. شکل 4 میانگین شکل موج AEP را برای هر صدای مصوت از AAF دو طرفه نشان می دهد.
همانطور که انتظار میرفت، هر صدای واکه طبقهای فعالیتهای عصبی متمایز را در AAF دوطرفه با دامنههای اوج و تأخیرهای متفاوت برانگیخت. دامنه پیک AEP ها، که به عنوان بالاترین ولتاژ ثبت شده پس از محرک های مصوت تعریف می شود، برای /i/ کوچکترین بود (61.74 ㎶ در AAF چپ و 61.27 ㎶ در AAF سمت راست)، در حالی که AEP ها در پاسخ به /a/ بزرگترین دامنه پیک را نشان دادند. (92.12 ㎶ در AAF چپ و 90.18 ㎶ در AAF راست).
اوج تأخیر، که به عنوان مدت زمان شروع محرک تا دامنه اوج تعریف میشود، تقریباً {{0}}.39 ثانیه تا 0.5 ثانیه، کوتاهترین در /i/(0) بود. 39 ثانیه در AAF چپ و راست)، و طولانی ترین در صدای /o/ (0.51 ثانیه در AAF چپ و راست). همانطور که در شکل 4 نشان داده شده است، شکل موج های مشابه AEP از سمت چپ و راست AAF مشاهده شد.

تجزیه و تحلیل فرکانس زمانی سیگنال های EEG
تجزیه و تحلیل زمان-فرکانس یک روش قدرتمند برای تجزیه و تحلیل سیگنال های EEG غیر ثابت در صفحه فرکانس زمانی است و برای ارائه اطلاعات کیفی برای طبقه بندی EEG استفاده می شود [79، 80]. بنابراین، TFR EEG متوسط بزرگ برای هر صدا محاسبه شد تا تغییرات مربوط به تشخیص مصوت در بزرگی و فاز نوسانات EEG در فرکانسهای خاص مشخص شود (شکل 5A).
از تجزیه و تحلیل TFR، فعال سازی توان بالا در اطراف باند دلتا (1-4 هرتز)، تتا (4-8 هرتز) و آلفا (8-12 هرتز) در 0.3-{8} مشاهده شد. }.6 ثانیه از شروع این محرک، بدون توجه به تحریک صدای گفتار.

علاوه بر این، یک آزمون ANOVA با تصحیح بونفرونی برای تجزیه و تحلیل مولفه های آماری معنی دار TFR با توجه به هر محرک واکه انجام شد.
متعاقباً، قدرت مناطق از نظر آماری معنیدار (p < {{0}}.01) با مقدار F نشان داده شد (شکل 5B). در تجزیه و تحلیل، بسیاری از باندهای فرکانس EEG از 0.2-0.8 ثانیه به طور قابل توجهی با توجه به محرک های واکه متفاوت بودند.
علاوه بر این، بخشی از TFR از {0}}}.8-1 ثانیه نیز از نظر آماری برای هر محرک متفاوت بود. با در نظر گرفتن شکل موج های AEP و نتایج آزمون های ANOVA، استنباط شد که AEP ها از 0.2-0.8 ثانیه بعد از محرک واکه، آموزنده ترین پاسخ های عصبی بوده و به تشخیص صدا مربوط می شوند.
آموزش مدل و ارزیابی شبکه های BiLSTM
بر اساس نتایج شکل 5B، داده های EEG که به صورت باند گذر بین 1-6{4}} هرتز با پنجره زمان 0.2-0.8 ثانیه فیلتر شده بودند، انتخاب شدند. سپس، z-score داده های EEG انتخاب شده به عنوان ورودی به شبکه BiLSTM استفاده شد.
تمام داده های EEG برای ارزیابی شبکه های BiLSTM به 10 برابر در هر موضوع تقسیم شدند. بنابراین، عملکرد آزمون به ازای تا کردن مدل آموزشدیده با چینهای باقیمانده در یک طرح 10-CV بهدست آمد.
عملکرد شبکه با استفاده از معیارهای دقت، f{0}}امتیاز، و آماره کاپا کوهن κ (شکل 6 و جدول 1) ارزیابی شد. میانگین دقت تشخیص EEG پنج کلاس شبکه BiLSTM 7 ± 75.18 بود.06% و امتیاز f{13}}.74 ± 0.08 بود. . κ کوهن 0.09 ± 0.68 بود که به عنوان یک توافق متوسط تفسیر شد [81].
برای تجزیه و تحلیل عملکرد شبکه BiLSTM با جزئیات بیشتر، ماتریس سردرگمی در شکل 7 ترسیم شد. این نشان می دهد که بسیاری از خطاها به دلیل طبقه بندی اشتباه پاسخ های EEG به /u/ به عنوان /a/ و /e/ به عنوان /o/ است. با این حال، شبکه BiLSTM بیشتر پاسخهای EEG را با دقت بیش از 50 درصد طبقهبندی کرد، که دقت بالایی در طبقهبندی EEG کلاس پنج است.

مقایسه شبکه BiLSTM با سایر روش های یادگیری ماشینی
برای تأیید اثربخشی شبکههای BiLSTM در طبقهبندی EEG برای تشخیص صدا، نتایج با سایر روشهای یادگیری ماشینی مرسوم مقایسه شد. شکل 6 و جدول 1 عملکرد طبقه بندی کننده های یادگیری ماشین را نشان می دهد.
RF بالاترین دقت طبقهبندی را در بین الگوریتمهای یادگیری ماشین معمولی نشان داد (دقت: 7.41 ± 63.21%, f{4}}امتیاز: 0.62 ± 0.09 و کوهن : 0.52 ± 0.1). در تجزیه و تحلیل آماری، عملکرد طبقه بندی RF به طور قابل توجهی بالاتر از SVM{13}}lin و SVM{14}}rbf نبود، در حالی که در مقایسه با عملکرد NB و KNN عملکرد بالاتری را نشان داد.
با این حال، هنگامی که عملکرد الگوریتمهای یادگیری ماشین معمولی، از جمله RF، با BiLSTM مقایسه شد، واضح بود که شبکه BiLSTM برای تمام معیارهای مورد استفاده در مطالعه برتر است (p < 0.01).
در ماتریس سردرگمی، الگوریتمهای معمولی یادگیری ماشینی نمیتوانند پاسخهای EEG را به خوبی تشخیص دهند. به طور خاص، همه الگوریتمهای یادگیری ماشینی معمولی در تشخیص صدای /u/ مشکل داشتند. اشاره شد که الگوریتمها تمایل به طبقهبندی اشتباه صدا /u/ به عنوان /a/ را به طور متوسط در 30٪ مواقع نشان دادند (25.96٪ در NB تا 36.97٪ در KNN)، که منجر به کاهش عملکرد طبقهبندی کلی شد (شکل 7). .

بحث
در این مطالعه، پاسخ های EEG اپیدورال موش به پنج صدا واکه طبقه بندی شده (/a/، /e/، /i/، /o/، و/u/) با استفاده از شبکه BiLSTM متمایز شد. طبقه بندی پنج کلاس سیگنال های EEG اپیدورال به صورت تک آزمایشی انجام شد که به عنوان چالش برانگیز شناخته شده است. برای به حداکثر رساندن عملکرد یادگیری، این مطالعه سعی کرد مولفههای EEG خاصی را که ممکن است با تشخیص صداهای گفتاری در مغز موش مرتبط باشد تعیین کند و از این ویژگیهای ورودی EEG استفاده کرد. در نتیجه، عملکرد نسبتاً بالایی در طبقهبندی AEPها به پنج صدا واکه مختلف با استفاده از BiLSTM به دست آمد. مقایسه عملکرد طبقهبندی شبکه BiLSTM با سایر الگوریتمهای یادگیری ماشین نشان داد که شبکه BiLSTM از دیگر طبقهبندیکنندههای کلاسیک بهتر عمل میکند. این نتایج نشان میدهد که شبکه BiLSTM آموزشدیده با اجزای EEG مرتبط با تشخیص گفتار، AEPها را بهطور قابل اعتمادی برای هر صدای مصوت طبقهبندی شده با درجه بالایی از دقت طبقهبندی میکند. طبق دانش ما، شبکههای LSTM برای طبقهبندی پاسخهای EEG به محرکهای شنوایی استفاده نشدهاند، و این اولین مطالعهای است که از یک الگوریتم یادگیری عمیق برای تجزیه و تحلیل سیگنالهای EEG از AAF موش استفاده میکند.

در حال حاضر، تنها چند مطالعه از معماری LSTM برای دستیابی به نتایج پیشرفته در طبقهبندی مبتنی بر EEG استفاده کردهاند. معماری LSTM برای طبقه بندی مبتنی بر EEG مناسب است زیرا ساختار زنجیره مانند آن می تواند توالی زمانی داده های EEG را ضبط کند [82]. در ابتدا، تحقیقات بر بهبود نتایج طبقهبندی از طریق معماریهای مختلف LST متمرکز بود. با این حال، ویژگیهای ورودی همچنان به صورت دستی استخراج میشدند، مانند روشهای متداول یادگیری ماشینی [83، 84].
تسیوریس و همکاران عملکرد ترکیبهای متنوع عناصر شبکه LSTM را برای یافتن کارآمدترین معماریهای LSTM برای تشخیص تشنجهای صرعی ارزیابی کرد، بنابراین نتایج تقریباً کاملی را در پیشبینی تشنج بهدست آورد (100٪ حساسیت و 99.{3}}٪ ویژگی) [83]. از آنجا که LSTM یک ساختار قدرتمند برای پردازش داده های متوالی است، برخی از مطالعات از داده های خام EEG به عنوان ویژگی های ورودی با حداقل پیش پردازش استفاده می کنند. از آنجایی که شبکه LSTM مستقیماً ویژگیها را از دادههای EEG خام یاد میگیرد، عملکرد در مطالعات تشخیص احساسات حداقل 12٪ [85] بهبود یافت و نتایج مطالعات طبقهبندی موتور تصویر نیز در مقایسه با سایر مطالعات سنتی بهبود یافت [86]. تکنیک های استخراج ویژگی
علاوه بر این، معماری BiLSTM برای طبقهبندی مبتنی بر EEG مورد استفاده قرار گرفت، زیرا میتواند به اطلاعات وضعیتهای گذشته و آینده دسترسی داشته باشد. بنابراین، با شناسایی حالات مختلف مغز منعکس شده در داده های EEG، مانند تشنج، خواب، و غیره [63-67]، شبکه BiLSTM عموماً از شبکه LSTM که فقط اطلاعات گذشته را از توالی در جهت رو به جلو می گیرد، بهتر عمل کرد. به همین دلیل، عملکرد بالایی در طبقهبندی مبتنی بر EEG اخیر با استفاده از شبکههای BiLSTM گزارش شده است. شارما و همکاران بر اساس الگوریتم BiLSTM و آمار مرتبه بالاتر، دقت طبقهبندی 82.01 درصد را برای چهار نوع احساسات به دست آورد [87]. علاوه بر این، شبکههای BiLSTM با موفقیت انواع صرع و مراحل خواب را طبقهبندی کردند [88، 89].
مشابه مطالعات قبلی، این مطالعه با استفاده از شبکههای BiLSTM به نتایج نسبتاً خوبی دست یافت. الگوریتم پیشنهادی با موفقیت پاسخ های EEG را به پنج صدادار با مقادیر بالای دقت، f{0}}امتیاز، و κ کوهن 75.18%، 74.43% و 0.68، متمایز کرد. ارزش κ کوهن برای طبقه بندی پنج کلاس بالاتر از آنچه در اکثر مطالعات جاری دیده می شود [90] است. همانطور که در شکل 6 نشان داده شده است، روش BiLSTM بالاترین مقدار را برای همه معیارها در مقایسه با سایر روشهای یادگیری ماشین ایجاد کرد. علاوه بر این، برای تعیین تفاوت آماری در عملکرد طبقهبندی، نتایج ANOVA با اندازهگیری مکرر بین BiLSTM و سایر روشهای یادگیری ماشین کلاسیک با استفاده از تمام مقادیر موضوعی تجزیه و تحلیل شد. از طریق تجزیه و تحلیل آماری، مشخص شد که عملکرد طبقهبندی شبکه BiLSTM به طور قابلتوجهی بالاتر از سایر روشهای یادگیری ماشینی کلاسیک است (01/0p<). این نتیجه نیز با ماتریس سردرگمی سازگار بود. همانطور که در شکل 7 نشان داده شده است، شبکه BiLSTM برچسب های واقعی پنج صدا صدادار را به خوبی پیش بینی کرد، در حالی که روش های یادگیری ماشین کلاسیک این کار را نکردند.
پیشبینی بهدستآمده از طریق طبقهبندیکننده یادگیری ماشین معمولی در طبقهبندی صدای /u/ ضعیف بود. صدای /u/به طور عمده به اشتباه به عنوان /a/ تعبیر شد. حتی RF که بهترین عملکرد را در بین پنج طبقهبندیکننده یادگیری ماشین معمولی نشان داد، دارای نرخ طبقهبندی 34.48٪ برای صدای/u/ بود، با نرخ طبقهبندی اشتباه صدای /u/ به عنوان صدای /a/ 33.89٪. همانطور که در شکل 4 مشاهده می شود، صداهای /a/ و /u/ دارای تاخیر پیک مشابهی بودند که یکی از مشخصه های اصلی شکل موج های AEP است (پیک تاخیر صدا /a/: 0.448، اوج تأخیر صدا /u/: 0.444). هنگامی که طبقهبندی براساس سیگنالهای EEG تک آزمایشی حداقل از پیش پردازش شده انجام شد، به نظر میرسد که چنین شباهتهایی با الگوریتمهای یادگیری ماشین معمولی قابل تشخیص نیستند، در حالی که شبکه BiLSTM توانست آنها را متمایز کند.
با توجه به اینکه شبکه BiLSTM می تواند به طور همزمان به تمام زمینه های گذشته و آینده دسترسی داشته باشد، اطلاعات غنی را می توان از طریق این شبکه آموخت. علاوه بر این، حتی اگر ویژگیهای منعکسکننده ویژگیهای پاسخهای EEG به هر صدای مصوت مستقیماً از جهتهای جلو و عقب لایه LSTM استخراج شد، عملکرد طبقهبندی بهبود یافت. در این مطالعه، میتوانیم نتایج طبقهبندی خوبی را با استفاده از یک معماری ساده BiLSTM بدون فرآیند استخراج ویژگی دست ساز اضافی به دست آوریم.
طبقه بندی پاسخ های ERP به محرک های گفتاری در یک آزمایش منفرد به دلیل ویژگی های SNR پایین EEG بسیار چالش برانگیز است. اگرچه یکی از مزایای کلیدی روش یادگیری عمیق، توانایی آن در یادگیری ویژگی های سطح بالا بدون استخراج ویژگی های سخت است، ما سعی کردیم مرتبط ترین سیگنال های EEG مربوط به تشخیص گفتار را برای دستیابی به عملکرد بهتر انتخاب کنیم. در این مطالعه، شکلهای موج AEP متمایز مربوط به هر محرک صوتی گفتاری با فعالسازی با توان بالا باند فرکانس پایین، از جمله باندهای دلتا، تتا و آلفا، در تحلیلهای TFR مشاهده شد. نوسانات عصبی در باند آلفا به طور گسترده ای به عنوان نقش مهمی در پردازش شنوایی شناخته شده است. مظاهری و همکاران. گزارش داد که کاهش فعالیت آلفا ارتباط نزدیکی با تمایز اهداف شنوایی دارد [91].
استاروس و همکاران ثابت کرد که نوسانات آلفای قشری مکانیزمی محوری برای مهار انتخابی پردازش نویز برای بهبود توجه انتخابی شنوایی به سیگنالهای هدف هستند [92]. پیش از این، ما همچنین دریافتیم که قدرت آلفا در نواحی زمانی دوطرفه پس از محرکهای صوتی خاص که از نظر آماری از نظر نوع صدا متفاوت بودند، بسیار فعال میشد [48]. علاوه بر این، باندهای دلتا و تتا با شکل دادن به تقسیم بندی و تأثیر ادراکی اطلاعات صوتی مرتبط هستند [93].
اگرچه این مطالعه بر اساس دادههای تجربی حیوانی است، مؤلفههای مرتبط با گفتار مشابه، در مقایسه با مطالعات قبلی روی افراد انسانی، در تجزیه و تحلیل TFR مشاهده شد. 1 محرک ها را ایمن تر کرده و مؤلفه های EEG مربوط به درک صدا را نشان می دهد. این نتایج تا حدودی با نتایج مطالعات قبلی متفاوت بود، و نشان میدهد که تنها باندهای خاص EEG، مانند باند آلفا، با درک صدا مرتبط هستند. انتظار میرود که تغییرات جزئی در تمام فعالیتهای باند EEG از طریق ضبط EEG اپیدورال ثبت شود، زیرا SNR بالاتری را با کاهش رسانایی حجم و حذف آرتیفکتهای ذاتی ضبط EEG خارج جمجمهای فراهم میکند.
در این مطالعه، اجزای EEG مربوط به تشخیص صدای گفتار در موشها تعیین شد و اجزای AEP با موفقیت با استفاده از شبکه BiLSTM طبقهبندی شدند. با این حال، این مطالعه دارای محدودیت هایی بود. اول، تعداد موضوعات درج شده بسیار کم بود، به خصوص برای یادگیری عمیق. علاوه بر این، این مطالعه عملکرد هر طبقهبندی کننده را با اعتبارسنجی خارجی ارزیابی نکرد، بلکه از 10-CV برای غلبه بر حجم نمونه محدود استفاده کرد. علاوه بر این، ما نمیتوانیم این احتمال را که سیستم شنوایی موش به طور مداوم به صدا پاسخ میدهد رد کنیم، زیرا در این مطالعه از هر صدای مصوت فقط یک بیان واحد استفاده شده است. علاوه بر این، پاسخ های EEG اکتسابی تحت تأثیر اثرات بیهوشی قرار گرفتند. اگرچه حداقل دوز بیهوشی استفاده شد، کاهش فرکانس با افزایش توان دلتا یک یافته معمولی از تغییرات EEG پس از استنشاق ایزوفلوران است [94]. بنابراین، اجزای EEG تشخیص مصوت پیشنهاد شده در این مطالعه ممکن است با سیگنالهای EEG بدستآمده از موشهای بیدار متفاوت باشد. با این حال، ما معتقدیم که کیفیت سیگنال EEG به اندازه کافی خوب است زیرا EEG از طریق کاشت الکترود اپیدورال ثبت شد و توسط مصنوعات حرکتی آلوده نشد.
نتیجه گیری
در نتیجه، این مطالعه مولفههای عصبی معنادار مرتبط با ادراک گفتاری طبقهبندی شده را استخراج کرد. علاوه بر این، بر اساس ویژگیهای شبکههای LSTM، ثابت شد که شبکه BiLSTM برای طبقهبندی پاسخهای EEG با AEPهای حداقل پیش پردازش شده مناسب است. از آنجایی که این مطالعه تحقیقاتی پیشگام با داده های حیوانی است، ممکن است به طور مستقیم به سایر برنامه های کاربردی مانند رابط های مغز و رایانه یا وسایل کمکی ارتباطی جایگزین برای انسان قابل انتقال نباشد.

بنابراین، مطالعات آینده با دادههای EEG انسانی برای تأیید اثربخشی شبکه BiLSTM در طبقهبندی تشخیص گفتار مبتنی بر EEG شنوایی مورد نیاز است. علاوه بر این، برای تنظیم پارامترهای بهینه و استخراج ویژگی ها باید دوباره ارزیابی شود. انتظار می رود که این مطالعه یک رویکرد جدید برای تجزیه و تحلیل سیگنال های EEG و همچنین اطلاعات ارزشمند در مورد مکانیسم های درک و تشخیص گفتار در مغز ارائه دهد.

منابع
1. Wernicke C. کمپلکس علائم آفازی. در: کوهن RS، Wartofsky MW، ویراستاران. مجموعه مقالات کولوکیوم بوستون برای فلسفه علم 1966/1968. دوردرخت: اسپرینگر هلند، 1969. صص 34-97.
2. Shi Z، Yan S، Ding Y، Zhou C، Qian S، Wang Z، و همکاران. میدان شنوایی قدامی برای طبقه بندی صدا در وظیفه شرطی سازی ترس موش های بالغ مورد نیاز است. نوروسک جلو. 2019; 13: 1374.
3. Liberman AM، Harris KS، Hoffman HS، Griffith BC. تمایز آواهای گفتار در داخل و فراتر از مرزهای واج. J Exp Psychol. 1957; 54: 358-368.
4. جانسون کی. آواشناسی صوتی و شنیداری. چیچستر: وایلی بلکول؛ 2012.
5. Green PA، Brandley NC، Nowicki S. ادراک طبقه بندی شده در ارتباط و تصمیم گیری حیوانات. رفتار اکول. 2020; 31: 859-867.
6. Craik A, He Y, Contreras-Vidal JL. یادگیری عمیق برای وظایف طبقه بندی الکتروانسفالوگرام (EEG): مروری. J Neural Eng. 2019; 16:28.
7. Na¨a¨ta¨nen R، Paavilainen P، Rinne T، Alho K. منفی بودن عدم تطابق (MMN) در تحقیقات اساسی پردازش شنوایی مرکزی: یک بررسی. نوروفیزیولوژی بالینی. الزویر; 2007. صفحات 2544–2590.
8. Garrido MI، Kilner JM، Stephan KE، Friston KJ. منفی بودن عدم تطابق: بررسی مکانیسم های اساسی. نوروفیزیولوژی بالینی. الزویر; 2009. صفحات 453-463
For more information:1950477648nn@gmail.com






