تشخیص علائم ترافیکی بر اساس الگوریتم YOLOv3 قسمت 2

Jan 19, 2024

2. اصول الگوریتم

2.1. الگوریتم YOLOv3

YOLOv3 [14] الگوریتم تشخیص هدف تک مرحله ای بهبود یافته Redmon بر اساس YOLOv2 است که دقت تشخیص و عملکرد بلادرنگ را بهبود بخشیده و از نظر سرعت و دقت از سایر الگوریتم ها بهتر است.

در سال‌های اخیر، توسعه سریع فناوری هوش مصنوعی باعث شده تا سیستم‌های تشخیص هوشمند مختلف در زمینه‌های مختلف به کار گرفته شوند. دقت تشخیص یک شاخص مهم برای ارزیابی کیفیت یک سیستم هوشمند است و حافظه یکی از قابلیت های اصلی است که از عملکرد یک سیستم هوشمند پشتیبانی می کند. بنابراین، چه رابطه ای بین این دو وجود دارد؟

اول از همه، باید روشن کنیم که دقت تشخیص و حافظه یک "همبستگی مثبت" یا "همبستگی منفی" ساده نیستند. بین آنها تعامل و هماهنگی بالایی وجود دارد. در بسیاری از موارد، دقت تشخیص یک سیستم هوشمند به حافظه آن، یعنی توانایی آن در درک و یادگیری داده های نمونه بستگی دارد.

به عنوان مثال، در زمینه تشخیص چهره، یک سیستم تشخیص چهره خوب نیاز دارد که بتواند چهره های مختلف را به طور دقیق شناسایی کند و آنها را با اطلاعات فرد در پایگاه داده چهره شناخته شده مطابقت دهد. این امر مستلزم آن است که سیستم هوشمند حافظه ای قوی داشته باشد، بتواند اطلاعات چهره های شناخته شده را در پایگاه داده ذخیره کند و از آن در کارهای شناسایی بعدی به صورت انعطاف پذیر استفاده کند.

به طور مشابه، در زمینه پزشکی، سیستم های هوشمند نیاز به درک و به خاطر سپردن مقدار زیادی از دانش پزشکی برای کمک به پزشکان در تشخیص بیماری و طراحی طرح درمان دارند. این امر همچنین مستلزم داشتن حافظه و قابلیت یادگیری قوی، جذب مداوم دانش پزشکی جدید و تأیید متقابل و ارتقاء با پایگاه دانش موجود، سیستم هوشمند است.

البته ارتباط بین دقت تشخیص و حافظه یک طرفه نیست. در مقابل، دقت تشخیص خوب همچنین می تواند باعث بهبود حافظه سیستم های هوشمند شود. به عنوان مثال، در برخی از وظایف طبقه‌بندی و شناسایی، سیستم‌های هوشمند نیاز به ارائه بازخورد و بهینه‌سازی مداوم دارند تا به طور مداوم دقت و دقت خود را بهبود بخشند و در نتیجه توانایی درک و به خاطر سپردن داده‌های نمونه را بیشتر تقویت کنند.

به طور کلی، دقت تشخیص و حافظه دو عنصر ضروری برای عملکرد سیستم های هوشمند هستند. آنها دارای تعاملات و روابط پیچیده ای هستند که باید به طور کامل در نظر گرفته شوند و هماهنگ شوند. تنها با بهبود مستمر دقت تشخیص و تقویت مداوم حافظه و قابلیت‌های یادگیری سیستم هوشمند می‌توان به توسعه و کاربرد همه جانبه سیستم هوشمند واقعاً پی برد. مشاهده می شود که ما نیاز به بهبود حافظه داریم و سیستانش دسرتیکولا می تواند حافظه را به میزان قابل توجهی بهبود بخشد، زیرا سیستانش دسرتیکولا می تواند تعادل انتقال دهنده های عصبی مانند افزایش سطح استیل کولین و فاکتورهای رشد را نیز تنظیم کند. این مواد برای حافظه و یادگیری بسیار مهم هستند. علاوه بر این، گوشت همچنین می تواند جریان خون را بهبود بخشد و اکسیژن رسانی را تقویت کند، که می تواند اطمینان حاصل کند که مغز مواد مغذی و انرژی کافی را دریافت می کند و در نتیجه نشاط و استقامت مغز را بهبود می بخشد.

improving brain function

برای تقویت حافظه روی مکمل‌های شناختی کلیک کنید

YOLOv3 در حال حاضر محبوب ترین الگوریتم در خانواده YOLO است و به طور گسترده در سناریوهای تشخیص واقعی استفاده می شود [15]؛ ساختار شبکه YOLOv3 در شکل 1 نشان داده شده است.

increase brain power

ساختار کانولوشنال کامل مورد استفاده توسط YOLOv3 با اندازه ورودی تصویر محدود نمی شود.

لایه های ادغام و کاملاً متصل از کل ساختار شبکه حذف می شوند و یک لایه کانولوشن با اندازه گام 2 به جای لایه ادغام برای عملیات نمونه برداری پایین استفاده می شود که از از بین رفتن اطلاعات هدف در حین ادغام جلوگیری می کند و تشخیص اهداف کوچک را تسهیل می کند. 16].

علاوه بر این، YOLOv3 ساختار شبکه DarkNet-19 YOLOv2 را با لایه استخراج ویژگی DarkNet-53 جایگزین می‌کند.

شبکه DarkNet{0}}، که با موفقیت مشکل گرادیان شبکه عمیق و از دست دادن اطلاعات اصلی را در طول عملیات پیچیده چند لایه برای استخراج بهتر ویژگی‌ها و بهبود تشخیص و طبقه‌بندی [17] حل می‌کند، ساختار شبکه باقی‌مانده ResNet را به عاریت می‌گیرد [ 18] و از خروجی اصلی لایه قبلی به عنوان بخشی از ورودی لایه آخر شبکه استفاده می کند.

همانطور که در شکل 2 نشان داده شده است، ماژول باقیمانده در YOLOv3 از دو لایه کانولوشن و یک لایه میانبر تشکیل شده است.

increase memory power

علاوه بر این، YOLOv3 از مفهوم شبکه هرمی ویژگی (FPN) استفاده می کند (19) و شبکه هرمی ویژگی را برای پیش بینی نقشه های ویژگی در سه مقیاس، با مقیاس های تشخیص 13×13، 26×26، و 52×52 معرفی می کند.

روش استخراج ویژگی توسط شبکه عصبی کانولوشن در شبکه FPN از پایین به بالا است و فرآیند نمونه برداری از نقشه های ویژگی لایه کانولوشن از بالا به پایین است، همانطور که در شکل 3 نشان داده شده است.

2.2. ساختار ترکیبی هرمی فضایی

ساختار ادغام هرم فضایی (SPP) (20) مشکل استخراج مکرر ویژگی های تصویر توسط شبکه های عصبی کانولوشن را حل می کند و کارایی تشخیص را تا حد زیادی بهبود می بخشد؛ ساختار شبکه SPPNet در شکل 4 نشان داده شده است.

improve cognitive function

برای اطمینان از اینکه وضوح تصویر ورودی با بعد ویژگی لایه کاملاً متصل در یک شبکه عصبی با یک لایه کاملاً متصل مطابقت دارد، عملیات برش ناحیه و مقیاس‌گذاری روی تصویر ورودی مورد نیاز است.

فرآیندهای مقیاس بندی و برش منجر به از دست دادن اطلاعات ویژگی تصویر، کاهش دقت تشخیص و تأثیر بر نتایج تشخیص می شود: با این حال، فرآیندهای مقیاس بندی و برش منجر به از دست دادن دقت تشخیص اطلاعات ویژگی تصویر می شود و بر نتایج تشخیص تأثیر می گذارد، در حالی که SPPNet می تواند بر محدودیت ها غلبه کند. اندازه ثابت تصویر ورودی، صرفه جویی در هزینه محاسباتی 21.

improve short term memory

3. YOLOv3 بهبود یافته است

3.1. ساختار شبکه YOLOv3 بهبود یافته است

طبق توضیحات مجموعه داده COCO، شبکه استخراج ویژگی اصلی معمولاً پنج بار پایین‌نمونه می‌شود، با نرخ کاهش نمونه 2، و تعدد پنج بار پایین‌نمونه‌سازی، 32 به توان پنجم دو است.

اگر نمونه برداری پایین ادامه یابد، نقشه ویژگی به دست آمده یک می شود و اطلاعات هدف از بین می رود. اهداف کوچک کمتر از 32 × 32 پیکسل، اهداف متوسط ​​32 × 32-96 × 96 پیکسل هستند، و اهداف غول پیکر بزرگتر از 96 × 96 پیکسل هستند [22].

همانطور که در شکل 5 نشان داده شده است، مجموعه داده علائم ترافیکی TT100K مورد استفاده در این کار عمدتاً از اهداف کوچک و متوسط ​​تشکیل شده است، با اهداف بزرگ تنها 7.4٪ از کل مجموعه داده را به خود اختصاص می دهد و اهداف کوچک 42.5٪ را تشکیل می دهند [23].

increase memory

مجموعه داده TT100K دارای وضوح بالایی است، با هر تصویر دارای وضوح 2048 × 2048 پیکسل و بزرگترین علائم راهنمایی و رانندگی در بین اهداف کوچک که کمتر از 0.1٪ از کل تصویر را تشکیل می دهند، که چالش مهمی برای هدف ایجاد می کند. گوریتم تشخیص

اهداف کوچک دارای ویژگی های محدودی هستند و به دقت محلی سازی زیادی نیاز دارند.

علی‌رغم معرفی ساختار FPN در YOLOv3 برای استفاده از ویژگی‌های چند مقیاسی برای تولید پیش‌بینی‌ها با ادغام یافته‌های لایه‌های ویژگی متمایز، که برای شناسایی هدف کوچک حیاتی است، نتایج هنوز رضایت‌بخش نبودند.

در شبکه YOLOv3، لایه کم عمق حاوی اطلاعات معنایی ویژگی های کمتری است اما مکان هدف دقیقی دارد، در حالی که لایه عمیق دارای مکان هدف بیشتر اما درشت است.

در نتیجه از لایه های کانولوشنال کم عمق برای پیش بینی اهداف کوچک و لایه های کانولوشنال عمیق برای پیش بینی اهداف بزرگ استفاده می شود. چهارمین مقیاس پیش‌بینی ویژگی با اندازه 152 × 152 به سه مقیاس پیش‌بینی ویژگی ساختار شبکه YOLOv3 اضافه شد تا به طور کامل از ویژگی‌های سطحی در شبکه برای پیش‌بینی اهداف کوچک استفاده شود.

با اندازه تصویر ورودی 608 × 608، اندازه ویژگی تصویر خروجی 152 × 152 پس از پیچیدگی و نمونه‌برداری دو برابری از تصویر ورودی بود و لایه ویژگی از طریق لایه مسیریابی القا شد. این استخراج ویژگی با ویژگی لایه یازدهم ترکیب شد تا مقیاس پیش‌بینی ویژگی چهارم را افزایش دهد.

علاوه بر این، ماژول SPP برای تحقق بخشیدن به ادغام ویژگی های محلی و جهانی با قرض گرفتن مفهوم SPPNet و ترکیب آن با YOLOv3 اضافه شد.

قبل از لایه شناسایی YOLO، ماژول SPP بین لایه‌های کانولوشن پنجم و ششم ادغام شد و نقشه‌های ویژگی و نقشه‌های ویژگی ماژول SPP دوباره متصل شدند و به لایه شبکه تشخیص بعدی منتقل شدند.

improve working memory

برای انجام ادغام سطح ویژگی نقشه ویژگی های محلی و جهانی، حداکثر هسته ادغام ماژول SPP باید تا حد امکان نزدیک به اندازه نقشه ویژگی باشد که باید ادغام شود.

برای به حداقل رساندن تلاش محاسباتی ناشی از ماژول SPP، غنی‌سازی قابلیت بیان نقشه ویژگی و افزایش تاثیر تشخیص، ماژول SPP در این تحقیق از دو شاخه موازی تشکیل شده است که هر کدام از یک لایه 19 × 19 حداکثر ترکیبی و پرتابی تشکیل شده است. ارتباط. شکل 6 ساختار شبکه YOLOv3 بهبود یافته را نشان می دهد.

ways to improve brain function

3.2. عملکرد از دست دادن بهبود یافته است

تابع تلفات YOLOv3 از از دست دادن مختصات مرکزی (تلفات)، از دست دادن مختصات عرض-ارتفاع (از دست دادن)، از دست دادن اطمینان (lossconf) و از دست دادن طبقه بندی (تلفات) تشکیل شده است. از دست دادن مختصات مرکزی به صورت زیر نمایش داده می شود:

improve your memory

که در آن λcoord نشان دهنده وزن کاهش مختصات است. λnoobj نشان دهنده کاهش وزن بدون جسم است. Iobjij نشان می دهد که آیا جعبه لنگر jth سلول ith مسئول شی (1 یا 0) است یا خیر. Inobbyij نشان دهنده جعبه لنگر j ام شبکه i است که مسئول شی نیست. (xi,yi,wji,hjI, CjI, Pji) مختصات جعبه هدف، اطمینان و دسته بندی پیش بینی شده را نشان می دهد؛ و (xˆji,yˆji,wˆji,ˆhjI, CˆjI, Pˆji) مختصات جعبه هدف واقعی، اطمینان و دسته را نشان می دهد.

تابع ضرر YOLOv3 با معادله (5) نشان داده می شود، که در آن تابع تلفات میانگین مربعات (MSE) برای رگرسیون جعبه مرزی و آنتروپی متقاطع به عنوان تابع ضرر در lossconf و locals استفاده می شود.

ضرر=lossxy + losswh − losscon f − losscls (5)

با این حال، استفاده از MSE به عنوان تابع تلفات رگرسیون جعبه مرزی برای تشخیص هدف کوچک نامطلوب است، به مقیاس شی حساس است و روی اهداف مقیاس بزرگ تمرکز می‌کند در حالی که برای اشیاء مقیاس کوچک غیردوستانه است.

برای متعادل کردن از دست دادن اهداف بزرگ و کوچک و به حداکثر رساندن نتایج تشخیص با تضعیف تأثیر اندازه جعبه مرزی بر تابع تلفات عرض و ارتفاع، از تابع تلفات نوع IoU در این مقاله استفاده شد و تلفات متریک تولید شده توسط IoU به عنوان معادله عملکرد (6).

IoU ٪ 7b٪ 7b0٪ 7d٪ 7d٪ 7cA ٪ e2٪ 88٪ a9 B٪ 7c٪ 7cA ٪ e2٪ 88٪ aa B٪ 7c (6)

هنگامی که کادر محدود و کادر هدف همپوشانی ندارند، IoU=0 فاصله فاصله بین دو کادر را منعکس نمی‌کند. هنگامی که کادر پیش‌بینی و کادر برچسب‌گذاری شده کاملاً همپوشانی دارند، IoU=1، نقطه مرکزی جعبه مرزی را نمی‌توان تعیین کرد و شکاف اندازه با کادر هدف را نمی‌توان بیشتر بهینه کرد.

افت DIoU [24] مستقل از اندازه است. بنابراین، اندازه های بزرگ منجر به ضرر زیادی نمی شود. از آنجا که یک اندازه کوچک تلفات کمی ایجاد می کند، که می تواند مشکل را برطرف کند، این کار از تلفات DIoU استفاده کرد که فرمول محاسبه آن در معادله (7) ارائه شده است.

ضرر D IoU=1 - IoU +ρ2 b، bgt c2(7)

که در آن b و bgt نقاط مرکزی را نشان می دهند، ρ فاصله اقلیدسی است، و c طول قطر کوچکترین جعبه محصور کننده دو کادر است.

اتلاف DIoU فاصله بین دو فریم هدف را به طور مستقیم و سریع به حداقل می رساند و بیشتر با مکانیسم رگرسیون فریم هدف مطابقت دارد که فاصله بین هدف و لنگر، نرخ همپوشانی و مقیاس را در نظر می گیرد و رگرسیون فریم هدف را بیشتر می کند. پایدار است، در حالی که همچنان جهت گرادیان را برای جعبه مرزی زمانی که با قاب هدف همپوشانی ندارد ارائه می دهد.

help with memory


For more information:1950477648nn@gmail.com


شما نیز ممکن است دوست داشته باشید