به گزارش آگاه، پژوهشگران دانشکدگان فنی دانشگاه تهران با ارائه یک روش جدید و توزیعشده در حوزه یادگیری تقویتی چندعامله، امکان آموزش و تصمیمگیری مستقل عاملهای هوشمند را در مسائل پیچیده و دارای قیود تداخلی مشترک فراهم کردند؛ دستاوردی که میتواند زمینهساز توسعه سامانههای هوشمند چندعاملی در حوزههایی مانند رباتیک، شبکههای هوشمند انرژی، حملونقل و اقتصاد محاسباتی باشد.
این مقاله با عنوان «A Distributed Primal-Dual Method for Constrained Multi-Agent Reinforcement Learning With General Parameterization» به قلم علی کاهه دانشآموخته رتبه اول کارشناسی ارشد مهندسی برق دانشگاه تهران و حامد کبریایی استاد و عضو هیئت علمی دانشکدگان فنی دانشگاه تهران، در سال ۲۰۲۶ در نشریه معتبر IEEE Transactions on Automatic Control منتشر شده است. این مجله با شاخص اعتبار علمی SJR=۳.۹۲۹، در جدیدترین رتبهبندی پایگاه استنادی SCImago، جایگاه نخست را در میان ۳۸۲ نشریه بینالمللی حوزه سیستم و کنترل به خود اختصاص داده است.
این پژوهش به ارائه روشی نوین برای حل مسائل یادگیری تقویتی چندعامله مقیدشده (Constrained Multi-Agent Reinforcement Learning) میپردازد. در بسیاری از سامانههای هوشمند، مجموعهای از عاملها (Agents) باید بهصورت همزمان و مستقل تصمیمگیری کنند و در عین حال به اهداف مشترکی دست یابند. اغلب روشهای موجود برای آموزش این عاملها به یک واحد کنترلکننده مرکزی یا هماهنگی متمرکز نیاز دارند که اجرای آنها را در محیطهای واقعی و مقیاس بزرگ با محدودیت مواجه میکند. پژوهشگران دانشگاه تهران در این مطالعه، روشی کاملاً توزیعشده ارائه کردهاند که در آن هر عامل تنها با استفاده از اطلاعات محلی خود و عاملهای همسایه، قادر به یادگیری و تصمیمگیری است.
این روش مبتنی بر الگوریتم «اولیه دوگان (Primal-Dual)» و ساختار «Actor-Critic» طراحی شده و به عاملهای هوشمند اجازه میدهد ضمن رعایت محدودیتهای مشترک سیستم، بهصورت آنلاین و مستقل فرآیند یادگیری را انجام دهند. همچنین پژوهشگران نشان دادهاند که متغیرهای دوگان یا ضرایب لاگرانژ میان عاملها به اجماع میرسند و الگوریتم پیشنهادی از لحاظ، نظری به یک نقطه تعادل همگرا میشود.
از ویژگیهای مهم این پژوهش، امکان استفاده از سیاستهای پارامتری عمومی در محیطهای با فضای حالت بزرگ است که قابلیت کاربرد آن را در مسائل پیچیده دنیای واقعی افزایش میدهد. بهعلاوه، عملکرد الگوریتم در یک مدل مشارکتی و پویای بازی اقتصادی «کورنو» مورد ارزیابی قرار گرفته و نتایج، کارآمدی روش پیشنهادی را در شرایط پیچیده و تصادفی تأیید کرده است.
یادگیری تقویتی چندعامله یکی از مهمترین شاخههای هوش مصنوعی به شمار میرود و کاربردهای گستردهای در حوزههایی نظیر رباتیک، کنترل شبکههای هوشمند برق، مدیریت ترافیک شهری، سامانههای خودران و مدلسازی بازارهای اقتصادی دارد. ارائه روشهای توزیعشده و مقیاسپذیر در این حوزه میتواند نقش مهمی در توسعه نسل جدید سامانههای هوشمند و خودمختار ایفا کند.
انتهای خبر/266840/
- دشمن پس از شکست نظامی بهدنبال فروپاشی اجتماعی از مسیر فشار اقتصادی است
- «مانوین» گام تازه برای همافزایی پارکهای علم و فناوری در توسعه اقتصاد خلاق
- «اقتصاد نوآوری» محور ششمین کنفرانس ملی پارکهای فناوری ایران شد
- هراس تلآویو از چرخش ابوظبی به سمت تهران/ «واقعیتهای اقتصادی» معادلات منطقه را تغییر داد
- طراحی زیستبوم جدید تأمین مالی برای اقتصاد فرهنگ و هنر
- دبیرکل حزب مؤتلفه: معیشت مردم باید در صدر اولویتهای حکمرانی باشد/ ضرورت تشکیل «قرارگاه عالی جنگ اقتصادی»
- اقتصاد ایران از شوک جنگ تحمیلی عبور کرده است/ دستور رئیسجمهور برای جلوگیری از قطعی برق صنایع در شهریورماه
- وزیر نیرو: اقتصاد معیوب صنعت آب و برق، ناترازی را بازتولید میکند
- گسترش زیرساختهای ارتباطی منجر به شکوفایی اقتصاد دیجیتال گلستان میشود
- طرح سهفوریتی نجات اقتصاد مقاومتی کشور تدوین شد
- اهدای خون فرهنگ نوعدوستی، ایثار و مسئولیتپذیری اجتماعی را در جامعه ترویج میکند
- ضرورت انجام فعالیتهای پژوهشی در حوزههای استراتژیک بهویژه علوم انسانی و اجتماعی
- جزئیات همایش ملی «هوش مصنوعی؛ پیشگیری از جرم و آسیبهای اجتماعی، فرصتها و چالشها»
- چگونه لایک کردن، رفتار در شبکههای اجتماعی را شکل میدهد
- پیشگیری از اعتیاد از کودکی آغاز میشود؛ خانواده ایمن، نخستین سد در برابر آسیبهای اجتماعی است
- اختلال در سامانه نسخهنویسی الکترونیک سازمان تامین اجتماعی برطرف شد
- چرا فرانسه نتوانست شبکههای اجتماعی را برای زیر ۱۵ سال ممنوع کند؟
- تابآوری؛ سرمایهای اجتماعی برای پیشگیری از اعتیاد و رفتارهای پرخطر
- توجه به نماز زمینهساز تقویت فضائل اخلاقی و کاهش بسیاری از آسیبهای اجتماعی است
- ذوالفقاری: مشارکتهای اجتماعی، بنیان تابآوری ملی و رکن اصلی سلامت اجتماعی است

