جغرافیا و برنامه ریزی منطقه‌ای

جغرافیا و برنامه ریزی منطقه‌ای

استفاده از یادگیری نیمه‌نظارتی و ردیابی نقاط ویدیویی برای پایش خودکار تغییرات کاربری اراضی در محورهای مواصلاتی منطقه‌ای

نوع مقاله : مقاله های برگرفته از رساله و پایان نامه

نویسنده
فارغ‌التحصیل کارشناسی ارشد مهندسی کامپیوتر ـ گرایش هوش مصنوعی و رباتیکز، دانشگاه صنعتی خواجه نصیرالدین طوسی.
10.22034/jgeoq.2025.546328.4338
چکیده
قطعه‌بندی معنایی جاده نقشی کلیدی در درک صحنه برای سامانه‌های رانندگی خودکار و کمک‌راننده دارد، اما برچسب‌گذاری دقیق پیکسلی برای هر فریم از ویدیوهای جاده‌ای پرهزینه و زمان‌بر است. در این مقاله، یک چارچوب یادگیری نیمه‌نظارتی برای قطعه‌بندی معنایی ویدیوهای جاده‌ای معرفی می‌شود که بر بهره‌گیری از قیود حرکتی استخراج‌شده از ردیابی نقاط متکی است. در این رویکرد، تنها فریم اول هر دنباله ۱۵ فریمی دارای برچسب پیکسلی دستی است و برای فریم‌های بعدی، ماسک‌های شبه‌برچسب با استفاده از ردیابی نقاط توسط مدل CoTracker3 تولید می‌شود.این شبه‌برچسب‌ها سپس برای آموزش نیمه‌نظارتی یک شبکه قطعه‌بندی سبک مبتنی بر LR-ASPP با ستون فقرات MobileNetV3 به‌کار می‌روند. تابع خطای ترکیبی شامل جزء نظارت‌شده روی فریم‌های دارای برچسب و جزء شبه‌نظارتی با لحاظ‌کردن پیکسل‌های ردیابی‌شده طراحی شده است. چارچوب پیشنهادی بر روی مجموعه‌داده KITTI-STEP، که نسخه‌ای گسترش‌یافته از KITTI برای قطعه‌بندی و ردیابی هر پیکسل در ویدیو است، ارزیابی شده است. نتایج نشان می‌دهد که مدل نیمه‌نظارتی پیشنهادی SSL-Tracker به mIoU برابر 27.67% و دقت پیکسلی 72.58% دست می‌یابد و نسبت به مدل پایه کاملاً نظارت‌شده که فقط با فریم‌های دارای برچسب آموزش دیده است (25.13%)، بهبود 2.54 درصدی در mIoU را ثبت می‌کند. تحلیل دقیق‌تر کلاس‌ها نشان می‌دهد که استفاده از ردیابی نقاط، به‌ویژه برای کلاس‌های پویا مانند «خودرو» و «دوچرخه» مزیت قابل‌توجهی ایجاد می‌کند. این نتایج نشان می‌دهد که می‌توان با بهره‌گیری از اطلاعات حرکتی نهفته در ویدیو و بدون افزایش تعداد برچسب‌های دستی، بهبود قابل‌ملاحظه‌ای در قطعه‌بندی معنایی جاده به دست آورد.
کلیدواژه‌ها

عنوان مقاله English

Using semi-supervised learning and video point tracking for automatic monitoring of land use changes in regional transportation axes

نویسنده English

Mohammad Mohammadi
Graduated from Master's degree inComputer Engineering - Artificial Intelligence and Robotics, Khajeh Nasiruddin Toosi University of Technology.
چکیده English

Road semantic segmentation plays a key role in scene understanding for autonomous and assisted driving systems, but accurate pixel-level labeling of each frame of road videos is expensive and time-consuming. In this paper, a semi-supervised learning framework for semantic segmentation of road videos is introduced, which relies on exploiting motion constraints extracted from point tracking. In this approach, only the first frame of each 15-frame sequence is manually pixel-labeled, and for subsequent frames, pseudo-label masks are generated using point tracking by the CoTracker3 model. These pseudo-labels are then used to semi-supervisedly train a lightweight LR-ASPP-based segmentation network with a MobileNetV3 backbone. The combined error function consists of a supervised component on labeled frames and a pseudo-supervised component considering tracked pixels. The proposed framework is evaluated on the KITTI-STEP dataset, which is an extended version of KITTI for segmentation and tracking of each pixel in video. The results show that the proposed semi-supervised model SSL-Tracker achieves an mIoU of 27.67% and a pixel accuracy of 72.58%, recording a 2.54% improvement in mIoU over the fully supervised base model trained only with labeled frames (25.13%). A more detailed analysis of the classes shows that the use of point tracking provides a significant advantage, especially for dynamic classes such as “car” and “bicycle”. These results indicate that a significant improvement in semantic road segmentation can be achieved by exploiting the motion information embedded in the video without increasing the number of manual labels.

کلیدواژه‌ها English

Video semantic segmentation
semi-supervised learning
land use
regional planning