نوع مقاله : مقاله پژوهشی فارسی
نویسندگان
1 دانش آموخته دکتری، دانشکده مهندسی برق و کامپیوتر، دانشگاه شیراز، شیراز، ایران
2 استادیار گروه برق، دانشکده مهندسی، دانشگاه فسا، فسا، ایران
3 استادیار گروه علوم کامپیوتر، دانشکده علوم پایه، دانشگاه فسا، فسا، ایران
چکیده
کلیدواژهها
موضوعات
عنوان مقاله [English]
نویسندگان [English]
In electric power distribution systems, reliability is of paramount importance, and the occurrence of unscheduled outages affects customer satisfaction and operational costs. Detecting the causes of permanent and momentary outages, particularly in grids with limited observability, is time-consuming and heavily dependent on field operations and experience. This paper proposes a data-driven framework based on ensemble learning and logistic regression. The proposed approach leverages more than 50,000 records of unscheduled outages from a real-world distribution system, along with hot-line and cold-line maintenance records, hourly feeder load data, and weather data, to extract rich descriptive features. Using a One-vs-Rest strategy combined with resampling, we address the severe class imbalance in outage data. Ensemble models are trained for each outage cause and are then combined via soft voting, with weights determined by validation AUC. This prioritizes the most likely causes of permanent and momentary outages. The results demonstrate high classification accuracy across different outage causes, achieving up to a 30% improvement in the accuracy of identifying different outage causes compared to state-of-the-art methods. Overall, the proposed approach enhances the distribution system's reliability by reducing outage duration and accelerating outage cause identification.
کلیدواژهها [English]
قابلیت اطمینان سیستمهای توزیع انرژی الکتریکی، با توجه به اتصال مستقیم مشترکین به آنها، یکی از مهمترین شاخصهای عملکرد این سیستمها محسوب میشود و به طور مستقیم بر رضایت مشترکین، هزینهها و الزامات بهرهبرداری تأثیر میگذارد. با توجه به ساختار عمدتاً شعاعی فیدرهای توزیع، وقوع خطا ممکن است به خاموشی بخشی قابل ملاحظه از مشترکین منجر شود و فرایند یافتن محل خطا و برقراری سرویس را با چالش مواجه کند ]1[. محدودیت رؤیتپذیری در بسیاری از سیستمهای توزیع، به ویژه در فیدرهایی با سطح نفوذ پایین تجهیزات و ادوات هوشمند نیز سبب میشود شناسایی علت خاموشی و تعیین تجهیز معیوب زمانبر و متکی بر عملیات میدانی باشد ]2[. از این رو، کاهش مدت و فراوانی خاموشیها و بهبود شاخصهای قابلیت اطمینان مانند SAIDI [1] و SAIFI[2] ، مستلزم درکی دقیقتر از الگوهای وقوع خاموشیهای شبکۀ توزیع و عوامل مؤثر بر آنهاست ]3[.
خاموشیهای سیستم توزیع به طور کلی به دو دستۀ خاموشیهای دائم و خاموشیهای گذرا تقسیم میشوند. خاموشیهای دائم ناشی از خرابی یا خطای پایدار تجهیزات و مستلزم عیبیابی میدانی، تعمیر یا تعویض اجزا و ثبت دقیق اطلاعات در سیستمهای بهرهبرداری هستند، در حالی که خاموشیهای گذرا ماهیتی موقتی دارند و معمولاً از طریق بازبست خودکار یا دستی مدار برطرف میشوند ]4[. تشخیص صحیح علت زمینهای خاموشی (تجهیز خطادیده یا علل طبیعی مانند برخورد پرندگان و حیوانات یا پوشش گیاهی)، نقشی اساسی در کاهش مدت و فراوانی خاموشیها و طراحی راهبردهای مؤثر تعمیرات اصلاحی دارد؛ به گونهای که آگاهی اولیه از علت احتمالی خاموشیهای دائم میتواند فرایند یافتن محل خطادیده و برقراری سرویس را تسریع کند ]5[. از سوی دیگر، علت خاموشیهای گذرا معمولاً به دلیل عدم اجرای تعمیرات اصلاحی ثبت نمیشود، در حالی که تحلیل این رخدادها و تشخیص علت واقعی آنها ممکن است به شناسایی عوامل زوال شبکه و بهبود شاخصهایی مانند SAIFI منجر شود. به نظر میرسد بهرهگیری از تحلیلهای دادهمحور روی مجموعهدادههای متنوع موجود در شبکۀ توزیع شامل سوابق خاموشیهای برنامهریزیشده و برنامهریزینشده، سوابق تعمیرات و نگهداری تجهیزات و سایر دادههای بهرهبرداری، امکان استخراج الگوهای پنهان حاکم بر خاموشیها و ارتقای شاخصهای قابلیت اطمینان سیستمهای توزیع را فراهم میکند. در این راستا، مطالعات اخیر از رویکردهای یادگیری ماشین و یادگیری گروهی برای بهبود مدیریت و کاهش تأثیر خاموشیها در سیستمهای توزیع بهره بردهاند ]6، 7 [.
به این منظور، در سالهای اخیر و با گسترش روشهای دادهکاوی و یادگیری ماشین، استفاده از این رویکردها برای تحلیل خاموشیهای رخداده در سیستمهای توزیع و بهرهبرداری از دانش استخراجشده برای افزایش قابلیت اطمینان شبکه مورد توجه قرار گرفته است. برای مثال، در ]8[، تعداد خاموشیهای ناشی از پوشش گیاهی و رعدوبرق به صورت ماهانه و با استفاده از مدلهای سری زمانی پیشبینی شده است. همچنین، در ]9[، اثر درختزنی و هرس پوشش گیاهی بر نرخ وقوع خاموشیها بررسی شده و در ]10[، با یک رهیافت آماری، تعداد خاموشیهای ناشی از رعدوبرق به صورت روزانه پیشبینی شده است.
در مقابل، دستهای دیگر از مطالعات بر شناسایی علت خاموشیهای رخداده برای تعمیر سریع اصلاحی یا استخراج عوامل مؤثر بر وقوع آنها به منظور پشتیبانی از برنامههای نگهداری پیشگیرانه تمرکز دارند. برخی از پژوهشها با تکیه بر دادههای شکل موج خطا، دادههای حسگرهای پیشرفته مانند PMUهای سطح توزیع و شکل موجهای خطا و مدلهای طبقهبندی، علت خاموشی را در زمان وقوع تشخیص میدهند ]11، 12 [؛ اما محدودیت دسترسی به این دادهها با رزولوشن زمانی زیاد در بسیاری از فیدرهای توزیع، بسیاری از مطالعات را به سمت دادههای عملیاتی عمومیتر مانند سوابق خاموشیهای برنامهریزینشده سوق داده است. در این میان، برخی از پژوهشها از قواعد انجمنی[3] برای شناسایی عوامل مؤثر بر خاموشیها بهره گرفتهاند. برای مثال، ]13[ صرفاً بر خاموشیهای با منشأ حیوانات و پوشش گیاهی تمرکز داشته و ]5[ با لحاظ بار ایستگاه فوق توزیع، علاوه بر علل طبیعی، به خطاهای تجهیز محور نیز رسیدگی کرده است. همچنین، در ]14، 15 [، با استفاده از مدلهای یادگیری ماشین مانند درخت تصمیم و جنگل تصادفی، علت خاموشی از طریق آموزش یک مدل طبقهبندی پیشبینی شده است. ]1[ نیز از روشهایی مانند LR و شبکۀ عصبی مصنوعی (ANN)[4] برای تشخیص دو علت پوشش گیاهی و حیوانات بهره برده است.
با وجود تلاشهای انجامشدۀ پیشین، بیشتر مطالعات به مجموعهای محدود از علل خاموشی (معمولاً علل طبیعی مانند حیوانات و پوشش گیاهی) محدود شدهاند یا تجهیزات شبکه را به صورت کلی در نظر گرفتهاند و تفاوت رفتار تجهیزات مختلف کمتر بررسی شده است. همچنین، بهرهگیری همزمان از دادههای خاموشی و سوابق کامل تعمیرات و نگهداری (به ویژه تعمیرات خط سرد و گرم) در بیشتر این پژوهشها مشاهده نمیشود. افزون بر این، بهجز مرجع ]16[ که صرفاً به خاموشیهای گذرا اختصاص یافته، شناسایی علل خاموشیهای دائم و گذرا در قالب یک چارچوب دادهمحور یکپارچه مورد توجه قرار نگرفته است.
در این مقاله، به منظور برطرفکردن کاستیهای شناساییشده در پژوهشهای پیشین، یک چارچوب دادهمحور مبتنی بر یادگیری گروهی و رگرسیون لجستیک (LR)[5] برای شناسایی علل احتمالی خاموشیهای دائم و گذار در سیستم توزیع ارائه میشود. یکی از چالشهای اصلی در این مسأله نامتعادلی شدید دادههاست؛ به گونهای که برخی از علل خاموشی فراوانی بسیار بیشتری نسبت به سایر علل دارند. برای مواجهه با این چالش، از یک رویکرد یادگیری گروهی مبتنی بر نمونهبرداری مجدد[6] استفاده میشود. در این رویکرد، برای هر علت خاموشی، چندین زیرمجموعه از دادهها با استفاده از ضرایب نمونهبرداری متفاوت (α) ایجاد میشوند تا آن علت به صورت متناوب در موقعیت کلاس اکثریت یا اقلیت قرار گیرد. سپس، برای هر زیرمجموعه، یک مدل رگرسیون لجستیک آموزش دیده میشود و در نهایت، این مدلها از طریق رأیگیری نرم[7] و وزندهی بر اساس [8]AUC مجموعۀ اعتبارسنجی با یکدیگر ترکیب میشوند. این سازوکار اجازه میدهد مدل گروهی تنوع کامل رکوردها را مشاهده و به ویژه الگوهای حاکم بر کلاسهای اقلیت را با دقت و پایداری بیشتری شناسایی کند. خروجی این چارچوب به صورت وزندهیشده برای شناسایی علل احتمالی خاموشیهای دائم و گذرا به کار گرفته میشود. ضمناً، برای افزایش غنای ویژگیهای ورودی و بهبود دقت طبقهبندی، در این پژوهش، از مجموعهدادههای شبکۀ توزیع شامل خاموشیهای برنامهریزینشده و برنامهریزیشده، سوابق تعمیرات و نگهداری به روشهای سرد و گرم، بار فیدرهای توزیع و اطلاعات آبوهوایی استفاده شده است. ترکیب این منابع داده امکان تحلیل یکپارچۀ رفتار شبکه و ارتباط بین وضعیت بهرهبرداری، شرایط محیطی و عملکرد تجهیزات را فراهم میکند. به طور خلاصه، نوآوریهای اصلی این پژوهش به شرح زیر هستند:
در ادامۀ این مقاله، ابتدا در بخش دوم، مجموعهدادههای استفادهشده و ویژگیهای استخراجشده از آنها بررسی میشوند. سپس، بخش سوم و چهارم به ارائۀ مبانی روش پیشنهادی مبتنی بر مدلهای گروهی و LR برای شناسایی خاموشیهای دائم و گذرا اختصاص دارند. در بخش پنجم، نتایج سه مطالعۀ موردی ارائه میشود و در نهایت، بخش ششم به جمعبندی و بیان مسیرهای پژوهشی آینده اختصاص دارد.
این بخش به معرفی مجموعهدادههای پژوهش (شامل خاموشیهای برنامهریزیشده و برنامهریزینشده، بار فیدرها، سوابق تعمیراتی و اطلاعات آب و هوایی)، مراحل پیشپردازش و استخراج ویژگی برای مدلهای یادگیری ماشین اختصاص دارد.
مجموعهدادۀ خاموشیهای برنامهریزینشده شامل ۵۰,۸۸۸ رکورد از سالهای ۱۳۹۹ تا ۱۴۰۳ در ۲۴ منطقۀ عملیاتی شبکۀ توزیع مورد بررسی است و هستۀ اصلی دادههای پژوهش را تشکیل میدهد. این دادهها که در زمان وقوع خاموشیهای سطح فشار متوسط ثبت میشوند، عناوین کلیدی مانند زمان و تاریخ وقوع، شناسۀ فیدر، امور مربوط، نام پست فوق توزیع، جریان قطعشده، محل قطع فیدر و علت خاموشی را پوشش میدهند. علت خاموشی، به عنوان متغیر هدف، نقش مرکزی دارد. پیشپردازش با هدف آمادهسازی برای مدلهای یادگیری ماشین شامل حذف عناوین غیرقابل استفاده در لحظۀ وقوع مانند توضیحات حادثه، مدت خاموشی، ENS[9] و محل دقیق وقوع حادثه است. همچنین، برچسبهای علت (شامل بیش از ۸۶ نوع) بر اساس دستورالعمل ثبت حوادث توانیر تجمیع شدند ]17[. این فرایند تعداد کلاسها را به ۲۰ کاهش داد و نامتعادلی را تا حدی تعدیل کرد. جدول (۱) سهم علل و مقدار درصد ENS ناشی از آنها را نشان میدهد.
همانطور که در جدول (۱) مشاهده میشود، عملکرد یا نقص در کاتاوت فیوز (73 درصد)، خاموشیهای گذرا (6/11 درصد) و حیوانات (4/2 درصد) مهمترین علل خاموشی هستند. تحلیلها حاکی از آن است که بیشتر خاموشیهای کاتاوت فیوز ناشی از عوامل خارجی مانند برخورد پرنده یا درخت است، نه خرابی ذاتی فیوز و با وجود سهم بالا در تعداد، ENS ناچیزی دارند؛ زیرا معمولاً فقط یک پست توزیع یا شاخۀ جانبی (T-Off) را قطع میکنند. در مقابل، خاموشیهای گذرا با قطع کل فیدر، با وجود آنکه مدتزمان وقوعشان کوتاه و نیز، تعدادشان از خاموشیهای ناشی از «عملکرد یا اشکال در کاتاوت فیوز» کمتر است، سهمی قابل ملاحظه از ENS را به خود اختصاص میدهند.
برای آموزش مدل، ویژگیهای زمانی (شامل فصل و ساعت وقوع به منظور بررسی تأثیر شرایط جوی و پیک بار)، ویژگیهای مکانی (منطقۀ عملیاتی برای تحلیل تفاوتهای جغرافیایی) و محل قطع مدار (قطعی یا عدم آن از ابتدای فیدر) استخراج شدند. افزون بر این، از دادههای خاموشیهای برنامهریزینشده، دو ویژگی مرتبط با خاموشیهای گذرا شامل فاصلۀ زمانی تا آخرین خاموشی گذرا و تعداد خاموشیهای گذرا در ۳۰ روز گذشته در همان فیدر استخراج شدند که به ترتیب نشاندهندۀ احتمال تکرار کوتاهمدت و وجود مشکلات مزمن در فیدر هستند. مقادیر ناموجود ابتدا با میانگین همان فیدر در سایر رخدادها و در صورت نبود، با میانگین منطقۀ عملیاتی جایگزین شدند.
مجموعهدادۀ خاموشیهای برنامهریزیشده شامل ۱۹,۲۷۸ رکورد از ۱۳۹۹ تا ۱۴۰۳ است که عمدتاً برای تعمیرات پیشگیرانه، تعویض تجهیزات فرسوده یا ارتقای شبکه ثبت شدهاند. تحلیلها نشان داد علل پرتکرار شامل سرویس و آچارکشی (16 درصد، عمدتاً پستهای زمینی/هوایی)، تعدیل/تعویض ترانسفورماتور (6 درصد) و تعمیر تابلوی فشارضعیف (2 درصد) است. برچسبها با استفاده از تجهیزات تعمیرشده یا نوع تعمیر مانند پست/ترانسفورماتور، ادوات کلیدزنی، کابل، پایه، جمپر، خط هوایی، سرکابل، برقگیر، شاخهزنی و تعمیرات عمومی تجمیع شدند. از این داده، ویژگیهای کلیدی مانند «فاصلۀ زمانی تا آخرین تعمیر در تجهیز X» (مانند پست، ترانسفورماتور، کابل، جمپر، مقره یا درختزنی) استخراج شدند که تعداد روزهای گذشته از تعمیر اخیر در فیدر دارای خاموشی را نشان میدهد.
مجموعۀ تعمیرات خط گرم (۹,۶۶۹ عملیات) عمدتاً شامل درختبری (32 درصد)، تعویض جمپر (18 درصد) و نصب کاور سوزنی (15 درصد) است. تعمیرات خط سرد (۲۸,۳۶۴ عملیات) نیز عمدتاً به تعویض تجهیزات معیوب (45 درصد)، نصب ادوات حفاظتی (30 درصد) و اقدامات اصلاحی پایهها (25 درصد) اختصاص دارد. از اینها نیز ویژگیهای مشابه (فاصله تا تعمیر در تجهیزات مختلف مانند کابل/اتصالات، مقرهها، پوشش گیاهی، ادوات کلیدزنی، پایه/یراق، جمپر و پست) استخراج شدند. مقادیر گمشده با میانگین امور پر و به نزدیکترین عدد صحیح گرد شدند تا واحد روز حفظ شود.
این ویژگیها برای ارزیابی اثربخشی تعمیرات پیشین مفید هستند. برای مثال، اگر خاموشی کوتاهی پس از تعمیر رخ دهد، ممکن است نشاندهندۀ نقص در تعمیر باشد، در حالی که فاصلۀ طولانی ممکن است نشانۀ فرسودگی طبیعی تجهیزات و عدم توجه به تعمیرات پیشگیرانه باشد.
جدول (1): فرکانس وقوع خاموشیها و سهم ENS ناشی از وقوع خاموشیها با علل مختلف در سالهای 1399-1403
|
علت خاموشی |
درصد وقوع |
ENS (مگاواتساعت) |
علت خاموشی |
درصد وقوع |
ENS (مگاواتساعت) |
|
ادوات کلیدزنی (بریکر و سکسیونر) |
03/1 |
6/517 |
دیگر علل خاموشی |
24/0 |
1/36 |
|
برقگیر |
33/0 |
1/158 |
سرکابل |
30/1 |
3/856 |
|
پایه |
47/0 |
2/345 |
شرایط بد آبوهوایی |
35/1 |
7/444 |
|
پوشش گیاهی |
35/0 |
9/189 |
عملکرد یا اشکال در کات اوت فیوز |
81/72 |
3/799 |
|
تجهیزات پست توزیع |
07/1 |
4/37 |
عوامل خارجی (انسانی و متفرقه) |
06/1 |
3/324 |
|
ترانسفورماتور |
71/0 |
4/22 |
عیب در تجهیزات فوق توزیع |
03/0 |
6/15 |
|
جمپر |
34/1 |
3/312 |
عیب نامشخص |
15/1 |
1/706 |
|
حیوانات |
4/2 |
6/139 |
کابل |
02/1 |
674 |
|
خاموشی گذرا |
63/11 |
6/1049 |
مشکلات سمت مشترکین |
75/0 |
8/387 |
|
خط توزیع هوایی و متعلقات آن |
58/0 |
378 |
مقره |
4/0 |
5/246 |
مجموعهدادۀ بار ساعتی فیدرهای فشار متوسط شامل اطلاعات بار ساعتیِ (برحسب مگاوات) بیش از ۴۰۰ فیدر است و به عنوان دادۀ مکمل استفاده شد تا تأثیر بار بر خاموشیها بررسی شود. پیشپردازش شامل ترکیب با دادههای خاموشیهای برنامهریزینشده، آمادهسازی مقادیر ساعتی/روزانه و محاسبۀ بیشینۀ بار سالانه برای نرمالسازی بود.
از این مجموعه، ویژگیهای کلیدی شامل بار نرمالشده در لحظۀ خاموشی و میانگین بار نرمالشده استخراج شدند. بار نرمالشده در لحظۀ خاموشی که برابر نسبت بار لحظهای به بیشینۀ بار سالانه فیدر است، برای تشخیص خاموشی در شرایط اوج بار و تنش حرارتی تجهیزات استخراج شد. همچنین، میانگین بار نرمالشده در بازههای ۳، ۶ و ۱۲ ساعت پیش از خاموشی برای ارزیابی فشار لحظهای، پایدار و تجمعی بر شبکه، اثر انباشتۀ مصرف (مانند افزایش دما و فرسودگی) در نظر گرفته شده است و ریسک را حتی در بار لحظهای پایین آشکار میکند. برای اجرای پیشپردازش نیز، مقادیر نامعتبر یا صفر با میانگین همان فیدر در ماه مربوط پر شدند.
مجموعهدادۀ اطلاعات آبوهوایی به عنوان دادۀ مکمل در این مقاله، شامل اطلاعات ساعتی دما و بارندگی برای امورهای عملیاتیِ مورد مطالعه بوده و از مرجع ]18[ گردآوری شده است. این دادهها شرایط محیطی لحظۀ وقوع خاموشی را بازنمایی و امکان کشف ارتباط مستقیم میان وضعیت جوی و علل خاموشی را فراهم میکنند. در مرحلۀ پیشپردازش، دادهها با مجموعۀ خاموشیها ادغام شدند. دمای هوا به شکل پیوسته و بارندگی به صورت دودویی (بارانی/غیربارانی) در نظر گرفته شدند.
در نتیجۀ فرایند پیشپردازش و استخراج ویژگیها، مجموعهای از ویژگیهای پیوسته و گسسته حاصل شد که پس از پاکسازی، تبدیل و تجمیع دادههای خام، مبنای آموزش مدلهای یادگیری ماشین قرار گرفتند. جدول (۲) نام این ویژگیها را به همراه توضیحی مختصر از ماهیت و کاربرد آنها ارائه میدهد. افزون بر این، دو ویژگی درصد طول هوایی و زمینی فیدرها به منظور نمایش سهم خطوط هوایی و زیرزمینی در فیدر محل خاموشی در نظر گرفته شدند، زیرا ساختار شبکه تأثیری مستقیم بر علل و الگوهای خاموشی دارد؛ به گونهای که بخشهای هوایی بیشتر در معرض عوامل محیطی و بخشهای زمینی عمدتاً مستعد عیوب فنی کابل هستند.
جدول (2): ویژگیهای استفادهشده برای آموزش مدل
|
نام خصیصه |
توضیحات |
|
منطقۀ عملیاتی |
گسسته، 24 منطقۀ عملیاتی |
|
فصل |
گسسته، نگاشت ماه به فصل |
|
بازۀ زمانی وقوع خاموشی |
گسسته، تقسیم روز به 4 دورۀ زمانی |
|
نقطۀ قطع |
گسسته (قطع یا عدم از ابتدای فیدر) |
|
آخرین خاموشی گذرا در فیدر |
پیوسته، فاصلۀ زمانی آخرین خاموشی گذرا از خاموشی رخداده در همان فیدر |
|
سابقۀ تعمیرات تجهیز X در فیدر |
پیوسته، فاصلۀ زمانی آخرین تعمیر و نگهداری در تجهیز X در همان فیدر |
|
تعداد خاموشیهای گذرا در 30 روز گذشته در فیدر |
تعداد خاموشیهای گذرای رخداده در همان فیدر در 30 روز قبل از وقوع خاموشی |
|
بار لحظهای و میانگین نرمالشده |
پیوسته، بار لحظهای و میانگین نرمالشدۀ 3، 6 و 12 ساعته (تقسیم بار ابتدای فیدر به پیک بار سالانه فیدر) |
|
درصد طول هوایی و زمینی فیدر |
پیوسته، درصد طول فیدر فشارمتوسط که به صورت خطوط هوایی یا کابلهای زیزمینی قرار دارد. |
|
دمای هوا و بارندگی |
دمای هوا، پیوسته است و بارندگی/عدم بارندگی، خصیصهای دودویی |
در این بخش، مبانی نظری مرتبط با مدلهای طبقهبندی مبتنی بر رگرسیون لجستیک و مدلهای گروهی بهاختصار ارائه میشود.
رگرسیون لجستیک (LR) یکی از الگوریتمهای پرکاربرد در مسائل طبقهبندی دوتایی است که هدف آن پیشبینی احتمال تعلق یک نمونه به یکی از دو کلاس (طبقهبندی دوتایی)[10] است. خروجی LR به بازۀ [۰،۱] محدود میشود تا به عنوان احتمال تفسیر شود.
احتمال تعلق نمونه به کلاس مثبت (یعنی) به صورت معادلۀ 1 محاسبه میشود و احتمال کلاس منفی نیز با معادلۀ 2 مشخص میشود. در آنها، ، با به عنوان بردار ویژگیها، به عنوان بردار ضرایب (وزنها) و b به عنوان بایاس شناخته میشود. نیز نشاندهندۀ تابع سیگموید است که در معادلۀ 3 نشان داده شده است.
همچنین، برای آموزش مدل، از تابع هزینۀ لگاریتمی یا Binary Cross-Entropy استفاده میکنیم. معمولاً، پس از آموزش، برای تعیین کلاس نمونۀ جدید، مطابق رابطۀ 4، از آستانۀ 5/0 استفاده میشود که البته آستانه ممکن است بسته به مسأله تغییر کند تا حساسیت و دقت مدل بهینه شود.
مزایای LR شامل سادگی، سرعت محاسباتی زیاد، تفسیرپذیری عالی (از طریق ضرایب نشاندهندۀ جهت و شدت تأثیر ویژگیها بر احتمال کلاس مثبت (w در معادلۀ 1 و 2))، مقاومت متوسط در برابر بیش برازش و عملکرد مناسب در دادههای حجیم است ]19[.
مدلهای گروهی[11] با ترکیب چندین مدل پایه، دقت، پایداری و تعمیمپذیری مدلهای یادگیری ماشین را افزایش میدهند و با کاهش سوگیری نسبت به کلاسهای خاص و خطاهای تصادفی، عملکردی بهتر نسبت به مدلهای منفرد ارائه میکنند ]20[ و ]21[. این رویکردها به ویژه در مسائل طبقهبندی پیچیده؛ مانند شناسایی علت خاموشیها، به دلیل توانایی در مدیریت دادههای نامتعادل و نویزی، مؤثر هستند.
در این مقاله، مدلهای گروهی مبتنی بر LR به عنوان مدلهای پایه برای مسائل طبقهبندی دوتایی (یک علت در برابر سایر علل)[12] به کار گرفته میشوند؛ زیرا سادگی، تفسیرپذیری و سرعت LR با توان ترکیب در چارچوبهای یادگیری گروهی همخوانی دارد و دقت شناسایی علل خاموشی در لحظۀ وقوع را بهبود میبخشد ]20[ و ]21[. به طور مشخص، در رویکرد Stacking، چندین مدل پایه آموزش داده میشوند و خروجی آنها به عنوان ورودی یک مدل ترکیبی[13] برای تولید پیشبینی نهایی استفاده میشود ]20[. این چارچوب در مقایسه با مدلهای منفرد LR، مقاومت بیشتری در برابر بیش برازش دارد و امکان اولویتبندی علل محتمل خاموشی را نیز فراهم میکند.
در این بخش، روش پیشنهادی برای طبقهبندی علل خاموشی در سیستم توزیع ارائه میشود. در این روش، برای هر یک از علل خاموشی، یک مدل گروهی مجزا آموزش داده میشود که به صورت دودویی پیشبینی میکند آیا آن علت خاص رخ داده است یا خیر. در نهایت، با ترکیب خروجی همۀ مدلهای گروهی، محتملترین علت (یا علل) خاموشی تعیین و بر اساس احتمال نزولی اولویتبندی و ارائه میشود.
در این روش، برای هر علت خاموشی، یک مجموعهدادۀ فرعی ایجاد میشود که رکوردهای آن علت به عنوان کلاس مثبت و سایرین به عنوان کلاس منفی برچسبگذاری میشوند. به این ترتیب، چندین مدل دودویی تخصصی (به جای یک مدل چندکلاسۀ واحد) آموزش داده میشوند که هر کدام بر تشخیص یک علت خاص تمرکز دارد.
برای مدیریت نامتعادلی، ضرایب نمونهبرداری () (در این مقاله، 5/0، 7/0، 1، 3/1 و 5/1) متنوعی تعریف میشود تا نسبت اکثریت به اقلیت تغییر کند؛ برای هر ضریب و در هر یک از مجموعهدادههای فرعی بیانشده، یک زیرمدل LR آموزش دیده میشود و سپس، زیرمدلها در یک مدل گروهی با رأیگیری نرم[14] ترکیب میشوند. خروجی نهایی میانگین احتمالات زیرمدلهاست که الگوهای متمایز هر علت را مؤثرتر میآموزد. مدل گروهی میتواند برای تشخیص آنلاین وقوع/عدم وقوع آن علت به کار رود. خروجی نهایی مدل گروهی برای نمونۀ x برای علت خاموشی c به صورت معادلۀ 5 محاسبه میشود.
در رابطۀ 5، احتمال پیشبینیشده توسط زیرمدل با ضریب نمونهبرداری است و در اینجا فرض میشود وزن تمامی مدلهای بهدستآمده از ضرایب مختلف نمونهبرداری برای هر علت خاموشی (c) برابر است که در آن، تعداد ضرایب نمونهبرداری است.
خروجی مدلهای LR احتمالی بین ۰ تا ۱ است که برای تبدیل به پیشبینی قطعی، از یک آستانه استفاده میشود. آستانۀ پیشفرض ساده 5/0 است و فرض تعادل کلاسها و هزینۀ برابر خطاها را دارد، اما در دادههای نامتعادل علت خاموشی، این آستانه بهینه نیست و TPR یا TNR را کاهش میدهد. برای برطرفکردن این مشکل، از روش شاخص یودن[15] برای تعیین آستانۀ بهینه هر مدل استفاده شد که طی آن، آستانهای که شاخص یودن را در مجموعۀ اعتبارسنجی بیشینه کند، به عنوان آستانۀ بهینه انتخاب میشود ]22[. شاخص یودن در رابطۀ 6 نشان داده شده است.
روند تشخیص آستانۀ بهینه نیز به صورت آزمون و خطا خواهد بود که طی آن، آستانههای مختلف از 0 تا 1 آزموده میشوند و در نهایت، آستانۀ بهینه انتخاب میشود. آستانۀ بهینۀ مدل گروهی کلاس c برای رکورد iام به صورت زیر استفاده میشود که در آن، نشانگر آستانۀ بهینه برای مدل گروهی کلاس c است.
هر مدل گروهیِ ساختهشده میتواند مستقلاً برای تشخیص دودویی یک علت خاص استفاده شود، اما در کاربرد اصلی سیستم، تمام مدلها همزمان اجرا، احتمالات محاسبه و علل بر اساس احتمال نزولی اولویتبندی میشوند. علل برتر (برای مثال، 3 اولویت بالاتر از همه) به عنوان محتملترین پیشنهاد میشود تا بررسی میدانی از آنها آغاز شود.
در روش پیشنهادی، خروجیهای مدلهای گروهی دودویی (معادلۀ 5) به صورت موازی برای تصمیمگیری نهایی استفاده میشوند. احتمالات پیشبینیشده با وزندهی بر اساس AUC هر مدل روی مجموعۀ اعتبارسنجی اصلاح میشوند تا مدلهای دقیقتر تأثیر بیشتری داشته باشند. فرمول امتیاز وزنی برای هر علت به صورت معادلۀ (8) محاسبه میشود. مقدار AUC بهدستآمده از مجموعۀ اعتبارسنجی برای مدل دودویی مربوط به کلاس c است. سپس، علل بر اساس امتیاز وزنی نزولی مرتب میشوند و محتملترین علت (Top-1) همراه با فهرست چند علت برتر (Top-N) استخراج میشود.
رویکرد پیشنهادی مزایای کلیدی زیر را داراست:
شبهکد شمارۀ 1 نشانگر چگونگی استفاده از روش ارائهشده در این بخش برای طبقهبندی علت خاموشی است.
|
شبهکد شمارۀ 1: آموزش و آزمایش روش پیشنهادی مبتنی بر مدلهای گروهی برای شناسایی علت خاموشی در سیستم توزیع |
|
ورودی: مجموعهدادههای خاموشی، تعمیرات، بار فیدرها، دادههای آبوهوایی (خصیصههای استخراجشده و برچسبها)، فهرست علل خاموشی برای هر علت خاموشی در فهرست علل خاموشی: ۱. ساخت مجموعهدادۀ فرعی: رکوردهایِ علت خاموشی مدنظر ← کلاس اصلی سایر رکوردها ← کلاس دیگران ۲. برای هر ضریب نمونهبرداری α: اعمال نمونهبرداری تصادفی با نسبت α آموزش یک زیرمدل دوتایی روی مجموعهدادۀ آموزش ساختهشده ۳. ترکیب تمام زیرمدلها با رأیگیری نرم ← ایجاد مدل گروهی برای علت ۴. تقسیم دادهها به مجموعۀ آموزش و اعتبارسنجی ۵. پیشبینی احتمال وقوع کلاس هدف روی مجموعۀ اعتبارسنجی ۶. محاسبۀ منحنی ROC و شاخص یودن ۷. انتخاب آستانۀ بهینه که بالاترین شاخص یودن را دارد ۸. ذخیرۀ مدل گروهی و آستانۀ بهینه
برای هر رکورد جدید: ۱. برای هر مدل گروهی (هر علت): پیشبینی احتمال وقوع علت و استفاده از آستانۀ بهینه برای تعیین وقوع یا عدم وقوع خاموشی با آن علت بهخصوص ضرب احتمال بهدستآمده از هر مدل در وزن مدل (AUC اعتبارسنجی) ۲. مرتبسازی علل بر اساس مقادیر وزنی ۳. خروجی: Top-1: محتملترین علت خاموشی Top-N: فهرست چند علت محتمل دیگر خروجی: فهرست علل احتمالی هر رکورد، به همراه Top-1 و Top-Nو نیز، علل اعلامشدۀ خاموشی با استفاده از آستانههای بهینه |
در این بخش، ابتدا نتایج حاصل از آموزش و ترکیب مدلهای گروهی مبتنی بر LR و تعیین آستانۀ تصمیمگیری بهینه ارائه و با روشهای مبتنی بر درخت تصمیمِ ]15[ مقایسه میشود. سپس، عملکرد روش پیشنهادی در ترکیب و وزندهی خروجی مدلها و دقت آن در پیشبینی اولویت علل خاموشی ارزیابی و با روش ]14[ مقایسه میشود. در نهایت، روند پیشنهادی اولویتدهی علل خاموشیهای گذرا بررسی و نتایج آن با روش مبتنی بر قواعد انجمنی ارائهشده در ]16[ مقایسه میشود. ضمناً، برای اجرای تمام آزمایشها و ارزیابی عملکرد روش پیشنهادی، از یک سیستم با مشخصات زیر استفاده شد: پردازندۀ Intel Core i7-8700K با فرکانس 7/3 گیگاهرتز، ۲۴ گیگابایت رم و محیط اجرای پایتون نسخۀ 3.9.12. تمامی زمانهای گزارششده در این بخش بر اساس اجرای کد روی این سیستم اندازهگیری شدهاند.
در این بخش، فرایند آموزش مدلهای اولیه تشریح میشود و با بهرهگیری از مفهوم مدلهای گروهی، مدلهای LR آموزشدیده برای هر یک از علل خاموشی با یکدیگر ترکیب میشوند. سپس، آستانۀ تصمیمگیری مدل با استفاده از معیار یودن به صورت بهینه تعیین و عملکرد مدلهای گروهی پیشنهادیِ مبتنی بر LR با روش ارائهشده در مرجعِ ]15[ مقایسه میشود که مبتنی بر روشی بر پایۀ درخت تصمیم است.
ابتدا، سه برچسب غیراستاندارد («نامربوط به توزیع»، «عیب نامشخص» و «حاوی اثر انسانی»)، به علت نامرتبطبودن به توزیع یا عدم اثرگذاری عوامل غیرقطعی روی وقوع آنها، ادغام و از آموزش حذف شدند. پیشپردازش شامل نرمالسازی z-score برای ویژگیهای پیوسته و OneHotEncoder برای ویژگیهای گسسته اجرا شد. دادهها به نسبت 80 درصد آموزش و 20 درصد آزمایش تقسیم شدند. سپس، روی دادههای آموزش، تشخیص ناهنجاری[16] با جنگل انزوا[17] اعمال شد. پس از پالایش، دادههای آموزش مجدداً به 80 درصد آموزش نهایی و 20 درصد اعتبارسنجی تقسیم شدند. مجموعهدادهها با نسبتهای مختلف () اکثریت/اقلیت ساخته شد. برای هر زیرمجموعه، انتخاب فراپارامتر[18]های مدل LR با جستوجوی شبکهای[19] اجرا شد.
در ابتدا، با آستانۀ پیشفرض 5/0، مدلها عملکردی مناسب در کلاسهای اکثریت در زمان آزمایش نشان دادند، اما در کلاسهای اقلیت (برای مثال، پوشش گیاهی با ۳۵ رکورد) TPR پایین بود. برای بهبود این امر، آستانۀ بهینه با روش شاخص یودن تعیین شد که تعادل بهتری بین TPR و TNR ایجاد کرد (جدول 3). نتایج نشان داد این بهینهسازی، TPR کلاسهای اقلیت را بدون کاهش چشمگیر TNR افزایش داد.
مقایسه با ]15[ که از مدلهای گروهی مبتنی بر درخت تصمیم C4.5 استفاده کرده است، برتری روش پیشنهادی را نشان میدهد. برای عللی مانند کابل، سرکابل، جمپر و خط توزیع هوایی، مدل پیشنهادی TPR بالاتری به دست آورده است. همچنین، برای کلاسهایی مانند حیوانات، شرایط بد آبوهوایی و پوشش گیاهی که در ]15[ بررسی نشدهاند، مدل پیشنهادی به AUC بالاتر از 82/0 دست یافته است. این بهبود عمدتاً ناشی از استفاده از LR به جای C4.5 با مقاومت بهتر در برابر نامتعادلی دادهها، بهکارگیری ویژگیهای غنیتر مانند فاصلۀ زمانی تا تعمیرات اخیر و میانگین بار ساعات پیشین و نیز استفاده از رأیگیری نرم در ترکیب مدلهای گروهی است؛ در حالی که ]15[ از رأیگیری سخت[20] بهره برده است.
از دیدگاه کاربردی، روش پیشنهادی، با وجود استفاده از چندین مدل گروهی، همچنان بسیار سبک و کارآمد است. زمان کل آموزش تمام مدلهای گروهی برای ۱۶ کلاس اصلی روی دادههای واقعی (بیش از ۵۰ هزار رکورد که 80 درصد آن برای آموزش و اعتبارسنجی استفاده شده است) حدود 5/64 ثانیه (معادل 07/1 دقیقه) بوده است؛ یعنی میانگین زمان آموزش برای هر کلاس حدود ۴ ثانیه است؛ هرچند بخشی قابل ملاحظه از زمان آموزش به کلاس بزرگ و پرتکرار «عملکرد یا اشکال در کاتاوت فیوز» اختصاص یافته است. زمان استنتاج[21] نیز بسیار پایین است؛ میانگین زمان پردازش برای ۱۰۰ نمونه حدود 284/0 ثانیه بوده است که معادل حدود 84/2 میلیثانیه بهازای هر نمونه میشود. این سرعت زیاد امکان استفادۀ کاملاً آنلاین روش را در لحظۀ وقوع خاموشی فراهم میکند؛ به گونهای که بلافاصله پس از ثبت اطلاعات خاموشی، سیستم میتواند علل محتمل را اولویتبندی کند و پیشنهادهای عملی را به بهرهبردار ارائه دهد. با توجه به سادگی ذاتی رگرسیون لجستیک و عدم نیاز به منابع محاسباتی سنگین، روش پیشنهادی بهراحتی قابلیت اجرا در محیطهای واقعی شبکههای توزیع نیروی برق را دارد و میتواند بدون نیاز به سختافزارهای گرانقیمت یا سرورهای قدرتمند، در مراکز کنترل و دیسپاچینگ استفاده شود.
برای بررسی دقیقتر تأثیر رویکرد یادگیری گروهی، یک مدل پایۀ رگرسیون لجستیک تک نیز با راهبرد One-vs-Rest (اما بدون نمونهبرداری مجدد و ترکیب گروهی) روی همان مجموعهداده و ویژگیها آموزش داده شد. مقایسۀ نتایج نشان میدهد مدل گروهی در کلاسهای اکثریت (مانند کاتاوت فیوز و خاموشی گذرا) عملکردی مشابه یا کم بهتری داشته است. با این حال، مهمترین دستاورد رویکرد پیشنهادی در کلاسهای اقلیت مشاهده شد. مدل گروهی توانست در بیشتر کلاسهای کمتکرار AUC را تا حدی مناسب بهبود دهد. برای مثال، در کلاس پایه AUC از 763/0 به 799/0، در کلاس حیوانات از 817/0 به 825/0، و در کلاس پوشش گیاهی از 873/0 به 883/0 افزایش یافت. فراتر از افزایش AUC، رویکرد گروهی تعادلی بهتر بین TPR و TNR برقرار کرد. در کلاسهایی مانند شرایط بد آبوهوایی، حیوانات و مشکلات سمت مشترکین، مدل گروهی همزمان TPRو TNR را بهبود بخشید یا تعادلی منطقیتر بین آنها ایجاد کرد. این بهبود تعادل، همراه با افزایش پایداری[22] نتایج در برابر تغییرات توزیع داده، نشاندهندۀ برتری مدل گروهی نسبت به مدل تک LR است.
برای ارزیابی پایداری و قابلیت اعتماد روش پیشنهادی نیز، مدل گروهی برای هر علت خاموشی با تغییر ۱۰۰ بار seed تصادفی برای تقسیمبندی دادهها به مجموعههای آموزش و آزمون اجرا و ارزیابی شد. نتایج به صورت میانگین ± ۲ انحراف معیار (تقریباً معادل بازۀ اطمینان 95 درصد) برای معیارهای TPR، TNR و AUC در جدول (۴) ارائه شده است. همانطور که مشاهده میشود، روش پیشنهادی در کلاسهای پرتکرار (مانند عملکرد یا اشکال در کاتاوت فیوز و خاموشی گذرا) دارای پایداری بسیار زیادی است. با این حال، در کلاسهای اقلیت انحراف معیار بیشتری مشاهده میشود که عمدتاً ناشی از حجم بسیار محدود نمونههای این کلاسها است. با وجود این نوسان، رویکرد یادگیری گروهی با نمونهبرداری مجدد هدفمند توانسته است الگوهای پنهان کلاسهای اقلیت را بهتر شناسایی کند و بهبودهایی قابل ملاحظه در AUC و تعادل بین TPR و TPR ایجاد کند.
5-2- اولویتدهی به علل احتمالی خاموشیها
در این بخش، عملکرد روش پیشنهادی بر اساس پیشبینی علت با اولویت اول و همچنین، قرارگیری علت واقعی در میان سه و پنج اولویت نخست ارزیابی میشود. این اولویتها با استفاده از چارچوب مدلهای گروهی و بر مبنای خروجیهای احتمالیِ وزندهیشده بر اساس AUC هر مدل به دست آمدهاند. نتایج این ارزیابی در جدول (5) ارائه شده است و نشان میدهد علت واقعی در چه درصدی از نمونههای مجموعۀ آزمایش با اولویت اول منطبق است یا در میان سه و پنج اولویت نخست قرار گرفته است.
جدول 3- عملکرد مدلهای گروهی مربوط به هر علت خاموشی در مجموعهی آزمایش و مقایسه عملکرد آنها با روش پیشنهادیِ ]15[
|
علت خاموشی |
تعداد رکوردها |
آستانۀ بهینه |
TPR |
TPR [15] |
TNR |
TNR [15] |
AUC |
AUC [15] |
|
عملکرد یا اشکال در کات اوت فیوز |
7410 |
509/0 |
98/0 |
955/0 |
744/0 |
733/0 |
919/0 |
861/0 |
|
خاموشی گذرا |
1183 |
65/0 |
985/0 |
919/0 |
929/0 |
924/0 |
974/0 |
923/0 |
|
حیوانات |
244 |
569/0 |
779/0 |
68/0 |
771/0 |
695/0 |
825/0 |
683/0 |
|
شرایط بد آبوهوایی |
138 |
399/0 |
841/0 |
819/0 |
835/0 |
863/0 |
905/0 |
841/0 |
|
جمپر |
137 |
497/0 |
679/0 |
599/0 |
667/0 |
582/0 |
717/0 |
59/0 |
|
سرکابل |
132 |
446/0 |
932/0 |
833/0 |
851/0 |
828/0 |
937/0 |
831/0 |
|
تجهیزات پست توزیع |
109 |
558/0 |
688/0 |
633/0 |
76/0 |
63/0 |
809/0 |
632/0 |
|
ادوات کلیدزنی (بریکر و سکسیونر) |
104 |
458/0 |
75/0 |
606/0 |
66/0 |
62/0 |
754/0 |
612/0 |
|
کابل |
104 |
345/0 |
904/0 |
798/0 |
857/0 |
85/0 |
927/0 |
824/0 |
|
مشکلات سمت مشترکین |
76 |
406/0 |
776/0 |
697/0 |
71/0 |
706/0 |
824/0 |
701/0 |
|
ترانسفورماتور |
72 |
625/0 |
569/0 |
611/0 |
848/0 |
617/0 |
748/0 |
614/0 |
|
خط توزیع هوایی و متعلقات آن |
59 |
47/0 |
644/0 |
712/0 |
758/0 |
639/0 |
73/0 |
675/0 |
|
پایه |
48 |
34/0 |
771/0 |
688/0 |
707/0 |
656/0 |
799/0 |
672/0 |
|
مقره |
40 |
446/0 |
825/0 |
625/0 |
784/0 |
717/0 |
861/0 |
671/0 |
|
پوشش گیاهی |
35 |
411/0 |
857/0 |
743/0 |
784/0 |
793/0 |
883/0 |
768/0 |
|
برقگیر |
34 |
396/0 |
706/0 |
618/0 |
635/0 |
603/0 |
749/0 |
61/0 |
جدول (4): حدود معیارهای ارزیابی مدلهای گروهی در اجرای 100بارۀ فرایند آموزش و آزمایش (بازۀ اطمینان 95 درصد)
|
کلاس |
تعداد رکوردهای آزمایش |
حدود TPR |
حدود TNR |
حدود AUC |
|
عملکرد یا اشکال در کات اوت فیوز |
7410 |
۰٫۹۸۴ ± ۰٫۰۱۴ |
۰٫۷۴۱ ± ۰٫۰۱۵ |
۰٫۹۲۰ ± ۰٫۰۰۵ |
|
خاموشی گذرا |
1183 |
۰٫۹۸۵ ± ۰٫۰۰۸ |
۰٫۹۲۷ ± ۰٫۰۰۴ |
۰٫۹۷۳ ± ۰٫۰۰۳ |
|
حیوانات |
244 |
۰٫۸۲۵ ± ۰٫۰۷۷ |
۰٫۷۴۴ ± ۰٫۰۵۴ |
۰٫۸۳۲ ± ۰٫۰۲۳ |
|
شرایط بد آبوهوایی |
138 |
۰٫۷۹۱ ± ۰٫۲۴۲ |
۰٫۷۹۳ ± ۰٫۲۰۶ |
۰٫۸۶۰ ± ۰٫۲۰۵ |
|
جمپر |
137 |
۰٫۶۹۸ ± ۰٫۲۷۳ |
۰٫۷۱۱ ± ۰٫۲۴۶ |
۰٫۷۶۸ ± ۰٫۲۰۶ |
|
سرکابل |
132 |
۰٫۹۱۳ ± ۰٫۰۸۰ |
۰٫۸۳۳ ± ۰٫۰۵۰ |
۰٫۹۳۱ ± ۰٫۰۱۶ |
|
تجهیزات پست توزیع |
109 |
۰٫۷۳۱ ± ۰٫۱۹۳ |
۰٫۶۹۷ ± ۰٫۱۵۸ |
۰٫۷۹۲ ± ۰٫۰۴۰ |
|
ادوات کلیدزنی (بریکر و سکسیونر) |
104 |
۰٫۶۵۹ ± ۰٫۱۸ |
۰٫۶۷۴ ± ۰٫۱۵۹ |
۰٫۷۲۴ ± ۰٫۰۵۲ |
|
کابل |
104 |
۰٫۹۱۴ ± ۰٫۰۸۱ |
۰٫۸۵۹ ± ۰٫۰۵۵ |
۰٫۹۴۶ ± ۰٫۰۲۰ |
|
مشکلات سمت مشترکین |
76 |
۰٫۷۶۳ ± ۰٫۱۶۶ |
۰٫۷۲۹ ± ۰٫۱۳۸ |
۰٫۸۲۷ ± ۰٫۰۳۸ |
|
ترانسفورماتور |
72 |
۰٫۶۴۱ ± ۰٫۲۷۰ |
۰٫۶۸۰ ± ۰٫۲۴۳ |
۰٫۷۳۶ ± ۰٫۰۵۱ |
|
خط توزیع هوایی و متعلقات آن |
59 |
۰٫۷۰۱ ± ۰٫۱۹۸ |
۰٫۷۳۲ ± ۰٫۱۶۷ |
۰٫۷۸۳ ± ۰٫۰۴۸ |
|
پایه |
48 |
۰٫۷۲۸ ± ۰٫۲۰۴ |
۰٫۷۵۹ ± ۰٫۱۱۸ |
۰٫۸۱۳ ± ۰٫۰۵۷ |
|
مقره |
40 |
۰٫۷۵۱ ± ۰٫۲۲۷ |
۰٫۷۵۶ ± ۰٫۱۵۱ |
۰٫۸۳۲ ± ۰٫۰۵۰ |
|
پوشش گیاهی |
35 |
۰٫۷۹۸ ± ۰٫۱۷۸ |
۰٫۷۸۰ ± ۰٫۱۰۹ |
۰٫۸۵۳ ± ۰٫۰۵۷ |
|
برقگیر |
34 |
۰٫۶۳۶ ± ۰٫۳۱۷ |
۰٫۶۶۳ ± ۰٫۲۵۵ |
۰٫۷۱۵ ± ۰٫۰۸۳ |
جدول (5): عملکرد روش پیشنهادی برای شناسایی علت خاموشی و دقت حضور در اولویتهای اول در مجموعۀ آزمایش و مقایسه عملکرد آنها با روش پیشنهادیِ ]14[
|
علت خاموشی |
تعداد رکوردهای مثبت |
دقت شناسایی به عنوان اولویت اول (%) |
دقت حضور در 3 اولویت اول (%) |
دقت حضور در 5 اولویت اول (%) |
Recall (%) ]14[ |
|
کاتاوت فیوز |
7410 |
45/76 |
4/94 |
67/97 |
8/96 |
|
خاموشی گذرا |
1183 |
35/77 |
66/93 |
8/97 |
8/21 |
|
حیوانات |
244 |
46/52 |
74/80 |
02/84 |
5/13 |
|
شرایط بد آبوهوایی |
138 |
61/32 |
39/67 |
91/73 |
4/46 |
|
جمپر |
137 |
19/2 |
17/21 |
91/48 |
7/0 |
|
سرکابل |
132 |
7/19 |
15/65 |
3/80 |
4/11 |
|
پست توزیع |
109 |
1/21 |
56/71 |
65/81 |
0 |
|
کابل |
104 |
92/51 |
92/76 |
69/82 |
2/19 |
|
ادوات کلیدزنی |
104 |
0 |
19/20 |
15/46 |
0 |
|
مشترکین |
76 |
0 |
25 |
16/63 |
0 |
|
ترانسفورماتور |
72 |
17/4 |
50 |
17/79 |
0 |
|
خط توزیع هوایی |
59 |
0 |
47/8 |
9/33 |
0 |
|
پایه |
48 |
0 |
5/12 |
58/39 |
0 |
|
مقره |
40 |
0 |
5/22 |
5/42 |
0 |
|
پوشش گیاهی |
35 |
71/5 |
86/42 |
14/57 |
9/2 |
|
برقگیر |
34 |
0 |
59/20 |
50 |
0 |
همچنین، روش پیشنهادی اولویتدهی به علل خاموشی با روش ]14[ نیز مقایسه میشود که بر استفاده از ماتریس هزینه[23] تمرکز دارد. ]14[ بدون نمونهگیری مجدد، عدم تعادل کلاسها را تا حدی مدیریت و خطاهای با پیامدهای مهمتر، مانند تشخیص نادرست خاموشیهای ناشی از حیوانات، پوشش گیاهی یا شرایط جوی، را شدیدتر جریمه میکند. همچنین، با ترکیب خروجی درخت تصمیم و جنگل تصادفی در یک مدل گروهی، بدون آنکه متعادلسازی صریح دادهها انجام شود، سعی در بهبود عملکرد طبقهبندی داشته است.
مقایسۀ روش پیشنهادی با رویکرد ]14[ نشاندهندۀ برتری قابل ملاحظۀ آن، به ویژه در کلاسهای اقلیت و نامتعادل است. این بهبود عمدتاً به دلیل استفاده از مدلهای گروهی مبتنی بر LR با وزندهی بر اساس AUC، استخراج ویژگیهای غنیتر و مهمتر از همه، مقابله با نامتعادلی شدید داده از طریق استفاده از رهیافت One-vs-Rest و مدلهای گروهی است. در حالی که روش ]14[ بر جنگل تصادفی و درخت تصمیم تکیه دارد و در کلاسهای نادر عملکردی ضعیفتر دارد، روش پیشنهادی نه فقط دقت حضور در اولویت اول را افزایش میدهد، بلکه با اولویتبندی Top-3 و Top-5 (بالای 70 درصد در بسیاری از کلاسها)، کاربرد عملی بیشتری برای بهرهبردار فراهم میآورد. اجرای 100بارۀ فرایند آموزش و آزمایش نیز نشان داد عموماً کلاسهای پرجمعیت به علت تعداد زیاد رکوردشان در دقت تشخیص علت خاموشی به عنوان اولویت اول پایداری بسیار زیادی دارند (برای مثال، بازۀ اطمینان 95 درصد معادل ۰٫801 ± ۰٫039 برای دقت تشخیص اولویت اول برای کلاس خاموشیهای گذرا). البته، مشابه جدول (4)، دقت تشخیص علل اقلیت مانند پوشش گیاهی، تنوع بیشتری دارد (برای مثال، بازۀ اطمینان 95 درصد معادل ۰٫586 ± ۰٫189 برای کلاس پوشش گیاهی برای دقت حضور در 5 اولویت اول). این تنوع در دقت شناسایی این علت خاموشی به ویژه ناشی از تعداد بسیار کم آن در مجموعهدادۀ اصلی است.
خاموشیهای گذرا معمولاً بدون ثبت علت واقعی (فقط به عنوان «عیب گذرا») باقی میمانند، اما تکرار آنها پیشنشانگر خاموشیهای دائم است. شناسایی علت واقعی این خاموشیها امکان اقدامات پیشگیرانۀ هدفمند را فراهم میکند تا احتمال تبدیل به خاموشیهای پایدار کاهش یابد. در این بخش، مدل اولویتدهی علل خاموشی بر دادههای خاموشیهای گذرا اعمال میشود و علل محتمل اولویتبندی میشوند. نتایج نیز با روش ]16[ مقایسه میشود که مبتنی بر الگوریتم Aprioriبرای استخراج قواعد انجمنی و شباهتسنجی خاموشیهای دائم و گذراست. برای ارزیابی منصفانه با معیار یکسان، از کاهش احتمالی ENS، ناشی از علت حدس زدهشده در ۶۰ روز پس از خاموشی گذرا در همان فیدر استفاده شد. این همان معیاری است که در ]16[ نیز به کار رفته است. ایدۀ اصلی بر شباهت شرایط حاکم بر دو نوع خاموشی استوار است؛ رویکرد پیشنهادی سه علت برتر را برای هر خاموشی گذرا کشف میکند و در هدف نهایی مشابه ]16[ است. با وجود این، روش پیشنهادی از مدلهای گروهی به جای قواعد انجمنیِ ]16[ بهره میبرد.
نتایج مقایسۀ روش پیشنهادی در اولویتدهی به علل احتمالی خاموشیهای گذرا (5915 خاموشی گذرا در فاصلۀ سالهای 1399 تا 1403)، ENS حادثشده ناشی از خاموشی دائم در 60 روز بعد از وقوع خاموشی گذرا به همان علت شناساییشده در همان فیدر در روش پیشنهادی و روشِ ]16[ در جدول (6) آورده شده است. مجموع ENS سالهای 1399 تا 1403 مقدار 2/7638 مگاوات ساعت است. مشخصاً، بهرهبردار با استفاده از علل شناساییشده برای خاموشیهای گذرا میتوانسته از وقوع 2/1477 مگاوات ساعت (34/19 درصد ENS کل) و در صورت استفاده از روشِ ]16[ میتوانسته از وقوع 1166 مگاوات ساعت (27/15 درصد ENS کل) جلوگیری کند؛ زیرا احتمالاً این مقدار پس از گذشت زمانی کوتاه در همان فیدر به خاموشی دائم از همان نوع منجر میشده است. همچنین، جدول (6) نشان میدهد ترکیب اولویتهای روش پیشنهادی از نظر فنی و عملی کاملاً منطقی است. حضور عللی مانند مقره، پایه، جمپر، کلیدزنی و سمت مشترکین در سه اولویت اول با واقعیت شبکۀ توزیع و تجربۀ بهرهبرداران همخوانی دارد. توزیع نسبتاً یکنواخت علل در سه اولویت برتر، عدم قطعیت طبیعی شناسایی علت خاموشی گذرا را منعکس کرده و مهر تأییدی بر واقعبینانهبودن خروجی روش پیشنهادی است.
برتری روش پیشنهادی نسبت به ]16[ به تفاوت منطق مدلسازی برمیگردد. قواعد انجمنیِ ]16[ نیازمند تطابق دقیق پیشنیازها است و بر علل غالب تمرکز دارد، اما خاموشیهای گذرا تحت عوامل ناقص و ناپایدار رخ میدهند. مدلهای گروهی LR با مدلسازی احتمالاتی و لحاظ ویژگیهای جزئی، اولویتبندی واقعگرایانهتری ارائه میدهند و ENS را مؤثرتر کاهش میدهند که ارزش افزودهای برای تعمیرات پیشگیرانه ایجاد میکند.
جدول (6): عملکرد روش پیشنهادی برای شناسایی علل احتمالی خاموشیهای گذرا ، ENS احتمالیِ قابل پیشگیری و مقایسۀ عملکرد آنها با روش پیشنهادیِ ]16[
|
علت احتمالی خاموشی گذرا |
تعداد حضور در اولویت اول |
تعداد حضور در اولویت دوم |
تعداد حضور در اولویت سوم |
مجموع ENS احتمالی |
تعداد حضور در اولویت اول ]16[ |
تعداد حضور در اولویت دوم ]16[ |
تعداد حضور در اولویت سوم ]16[ |
مجموع ENS احتمالی ]16[ |
|
سرکابل |
1384 |
1005 |
580 |
7/372 |
5275 |
568 |
0 |
1/539 |
|
شرایط بد آبوهوایی |
1284 |
844 |
690 |
6/228 |
0 |
117 |
5495 |
2/311 |
|
کابل |
746 |
716 |
540 |
3/168 |
568 |
5158 |
117 |
7/310 |
|
مقره |
229 |
581 |
830 |
8/60 |
- |
- |
- |
- |
|
خط توزیع هوایی |
255 |
440 |
652 |
5/50 |
- |
- |
- |
- |
|
پایه |
646 |
688 |
861 |
3/120 |
- |
- |
- |
- |
|
مشترکین |
370 |
614 |
596 |
9/212 |
- |
- |
- |
- |
|
پوشش گیاهی |
794 |
656 |
683 |
1/55 |
0 |
0 |
231 |
5 |
|
کاتاوت فیوز |
42 |
8 |
3 |
4/10 |
- |
- |
- |
- |
|
جامپر |
0 |
5 |
9 |
8/3 |
- |
- |
- |
- |
|
ادوات کلیدزنی |
70 |
170 |
314 |
3/175 |
- |
- |
- |
- |
|
حیوانات |
84 |
154 |
112 |
7/17 |
- |
- |
- |
- |
|
ترانسفورماتور |
5 |
18 |
8 |
0 |
- |
- |
- |
- |
|
پست توزیع |
6 |
10 |
14 |
8/0 |
- |
- |
- |
- |
|
برقگیر |
0 |
6 |
23 |
0 |
- |
- |
- |
- |
در این مقاله، چارچوبی دادهمحور مبتنی بر مدلهای گروهی رگرسیون لجستیک برای شناسایی علت خاموشیهای دائم و گذرا در شبکه توزیع انرژی الکتریکی ارائه شد. ابتدا، با پیشپردازش و استخراج ویژگیهای غنی از دادههای واقعی (بیش از ۵۰ هزار رکورد خاموشی برنامهریزینشده، سوابق تعمیرات، بار ساعتی فیدرها و اطلاعات آبوهوایی)، مدلهای دودویی برای هر علت آموزش دیده و با رأیگیری نرم و وزندهی بر اساس AUC ترکیب گردیدند تا علل محتمل اولویتبندی شوند. نتایج دقت بالایی برای اولویت اول مانند46/52% برای حیوانات، 92/51% برای کابل و 35/77% برای خاموشیهای گذرا (باوجود تعداد بسیار پایین وقوع برخی از علل خاموشی) نشان داد. همچنین، برای خاموشیهای گذرا ENS احتمالی ناشی از تبدیل به خاموشی دائم را حدود 19% کاهش داد. دستاوردهای اصلی این مقاله شامل افزایش دقت شناسایی همزمان علل دائم و گذرا، تسهیل تعمیرات پیشگیرانه و بهبود شاخصهای قابلیت اطمینان با استفاده از دادههای عملیاتی موجود است.
برای پژوهشهای آینده نیز پیشنهاد میشود ادغام دادههای حسگرهای هوشمند و شکل موج خطا برای غنیسازی ویژگیها و بررسی مدلهای یادگیری عمیق به همراه روشهای هوش مصنوعی تفسیرپذیر برای مدیریت دادههای بزرگتر در پیش گرفته شوند.
سپاسگزاری
این پژوهش در قالب قرارداد پژوهشی و با حمایت شرکت توزیع نیروی برق شیراز انجام شده است. نویسندگان بر خود لازم میدانند از همکاریهای ارزشمند مجموعۀ شرکت توزیع برق شیراز، به ویژه معاونت بهرهبرداری و دیسپاچینگ، صمیمانه قدردانی کنند.
تاریخ پذیرش مقاله: 25/03/1405
نام نویسنده مسئول: علیرضا حامدی
نشانی نویسنده مسئول: ایران، فسا، دانشگاه فسا، دانشکده مهندسی،گروه برق
[1] System Average Interruption Duration Index (SAIDI)
[2] System Average Interruption Frequency Index (SAIFI)
[3] Association Rules
[4] Artificial Neural Network (ANN)
[5] Logistic Regression-LR
[6] Ensemble Learning with Resampling
[7] Soft Voting
[8] Area Uner the Curve (AUC)
[9] Energy Not Supplied (ENS)
[10] Binary Classification
[11] Ensemble Models
[12] Ove-vs-Rest Classification
[13] Meta-Learner
[14] Soft Voting
[15] Youden’s J statistic
[16]Anomaly Detection
[17] Isolation Forest
[18]Hyperparameter
[19] Grid Search
[20]Hard-Voting
[21] Inference
[22] Robustness
[23] Cost Matrix