توزیع کلاس نامتعادل یک مسئله مکرر و مشکل ساز در حوزه های مهندسی داده ها و یادگیری ماشین است. الگوریتم های طبقه بندی سنتی یا مدل های یادگیری ماشین اغلب در این شرایط دشوار ، نتایج طبقه بندی دقیق را برای کلاس اقلیت ارائه می دهند. برای بهبود عملکرد طبقه بندی برای کلاس اقلیت ، برخی از تحقیقات توصیه کرده اند که با استفاده از تکنیک بیش از حد ، نمونه های مصنوعی در کلاس اقلیت ایجاد کنند. با این حال ، در مدل ماشین آلات بردار پشتیبانی (SVM) ، به عنوان نمونه های جدید کلاس اقلیت در یک فضای داده اصلی ایجاد شده است ، پیشرفت های طبقه بندی با استفاده از این تکنیک های نمونه برداری محبوب ممکن است صحیح نباشد. در این مقاله ، ما یک روش نمونه برداری جدید به نام DB-MTD-SN (برای شبکه سیامی مگا-دیفون مبتنی بر فاصله) برای تولید نمونه های کلاس اقلیت مصنوعی برای افزایش دقت طبقه بندی مدل SVM برای مجموعه داده های نامتعادل ایجاد می کنیم. در روش پیشنهادی ، ما از تکنیک Mega-Trend-Diffusion (DB-MTD) مبتنی بر فاصله برای برآورد دامنه داده برای بردارهای پشتیبانی ریز برای تولید نمونه های مصنوعی با توزیع چند مدل کلاس اقلیت استفاده می کنیم. علاوه بر این ، ما یک مدل شبکه جدید سیامی را بر اساس عملکرد عضویت (SN مبتنی بر MF) می سازیم تا نمونه های کلاس اقلیت مصنوعی را پیدا کنیم. از مدل SN پیشنهادی برای ترسیم داده های اصلی بر روی یک فضای با ابعاد بالا استفاده می شود تا به راحتی الگوهای پیچیده بین کلاسهای اکثریت و اقلیت را بیاموزد. در مدل SN پیشنهادی ما ، از عملکرد از دست دادن متضاد مبتنی بر MF برای اندازه گیری شباهت بین یک مثال مصنوعی جدید و نمونه های اصلی برای جلوگیری از ایجاد نویز استفاده می شود.
برای نشان دادن اثربخشی رویکرد پیشنهادی DB-MTD-SN ، از ده مجموعه داده معیار در این مطالعه استفاده می شود. در دو نوع مدل SVM ، ما روش پیشنهادی را با سه روش نمونه برداری پیشرفته مقایسه می کنیم. علاوه بر این ، سه معیار ارزیابی: G-Mean ، F1 و از شاخص دقت متعادل (IBA) برای اندازه گیری عملکرد طبقه بندی SVM در مجموعه داده های نامتعادل استفاده می شود. مجموعه داده های تجربی در نسبت های مختلف نامتعادل (IRS) به عنوان 15 ، 20 و 30 تنظیم می شوند تا عملکرد طبقه بندی را با استفاده از پنج روش آزمایش کنند. برای مقدار IR بالا 30 ، در دو مدل SVM ، روش پیشنهادی به ترتیب از نظر G-میانگین (0. 865 و 0. 865) ، F1 (0. 785 و 0. 772) و IBA (0. 681 و 0. 689) به ترتیب میانگین به دست آورد. بشراز آزمون زوج Wilcoxon برای ارزیابی اینکه آیا رویکرد پیشنهادی از نظر آماری تفاوت معنی داری با چهار روش دیگر در سه معیار ارزیابی دارد ، استفاده می شود. نتایج آزمون نشان می دهد که نتایج طبقه بندی با استفاده از روش DB-MTD-SN پیشنهادی از پیشرفت های قابل توجهی برخوردار است (یعنی P-Value<0.05) in terms of G-mean, F1, and IBA indicators when compared to the other four methods. Our experimental results indicate the suggested DB-MTD-SN method outperforms other oversampling methods for imbalanced datasets.
چکیده گرافیکی

معرفی
مشکلات توزیع کلاس نامتوازن اغلب در چندین زمینه از جمله تشخیص پزشکی [1] ، [2] ، تشخیص گسل [3] ، [4] ، پیش بینی Chu [5] ، [6] ، تشخیص کلاهبرداری کارت اعتباری [7] ، [7] ، [7] ، [7] ، [7] ، [7] ، [7] ، [7]8] ، و شناسایی سوء استفاده هورمون [9]. مجموعه داده های نامتعادل یک ویژگی توزیع داده منحصر به فرد را نشان می دهد که در آن نمونه های کلاس اکثریت به طور چشمگیری از نمونه های مختلف از کلاس های اقلیت استفاده می کنند. در این زمینه ها ، به طور کلی ، محقق بیشتر علاقه مند به کاوش در الگوهای در کلاس اقلیت است ، به عنوان مثال ، شناسایی صحیح گاوها با استفاده از هورمون غیرقانونی [9]. از لحاظ تئوریکی ، تحت یک مجموعه داده ناچیز ، به دلیل کلاس اقلیت زیر نماینده برای یادگیری ، نتایج پیش بینی مدل های یادگیری ماشین کلاسیک یا طبقه بندی کننده های مبتنی بر قانون معمولاً به سمت کلاس اکثریت هدایت می شوند. در نتیجه ، این طبقه بندی ها یا مدل های یادگیری اغلب باعث طبقه بندی پایین در کلاس اقلیت می شوند.
در ادبیات ، تکنیک های مقابله با مشکل داده های نامتعادل می تواند به دو دسته تقسیم شود. یکی روش سطح الگوریتم و دیگری روش سطح نمونه گیری است. در میان روشهای سطح الگوریتم ، یادگیری گروه یکی از محبوب ترین روش ها است. دو نوع روش یادگیری گروه وجود دارد: یکی ، روش کیف کردن از یک استراتژی مبتنی بر رأی گیری برای ترکیب نتایج پیش بینی از طبقه بندی کننده های مختلف استفاده می کند. مورد دیگر ، روش تقویت با هدف اصلاح وزن یادگیری مدل ها برای داده های به راحتی طبقه بندی شده برای افزایش دقت طبقه بندی داده های نادرست طبقه بندی شده است. De La Calleja و همکاران.[10] ، به عنوان مثال ، SMMO (انتخاب نمونه های اقلیت از داده های نادرست برای نمونه برداری بیش از حد) را برای نمونه برداری از نمونه های نادرست برای افزایش عملکرد تکیه دهنده مدل ها برای داده های عدم تعادل پیشنهاد داد. Hsiao و همکاران.[11] روش MTSBAG را برای ادغام چندین طبقه بندی کننده سیستم Mahalanobis-Taguchi (MTS) برای کاهش طبقه بندی تعصب برای مجموعه داده های بسیار ناچیز پیشنهاد کرد. Taherkhani و همکاران.[12] یک الگوریتم تقویت کننده تطبیقی را برای شبکه های عصبی حلقوی (ADABOOST-CNN) ارائه داد که ترکیب Adaboost و یک مدل شبکه عصبی یک بعدی (CNN) برای بهبود عملکرد طبقه بندی برای داده های تصویر نامتعادل است. علاوه بر این ، یک الگوریتم Adaboost بهبود یافته توسط Wang و Sun [13] برای بهبود عملکرد طبقه بندی برای مجموعه داده های عددی کمرنگ پیشنهاد شده است. با وجود این واقعیت که با استفاده از روش های کیسه یا تقویت ، می توان قابلیت طبقه بندی را بهبود بخشید ، این روش ها معمولاً به الگوریتم های طبقه بندی ترفند نیاز دارند تا پیشرفت های بیشتری را برای انواع مختلف مجموعه داده های نامتعادل بدست آورند.
روش نمونه گیری در سطح یک تکنیک پیش پردازش داده ها برای برابر کردن اندازه های نمونه اریب در بین طبقات است. می توان آن را به روش های کم نمونه گیری و نمونه برداری بیش از حد تقسیم کرد. هدف روش نمونه گیری زیر کاهش درجه نفوذ طبقه اکثریت با حذف تعداد نمونه های کلاس اکثریت است. با این حال، حذف تصادفی نمونه ها ممکن است اطلاعات مهم را برای طبقه بندی در کلاس اکثریت از دست بدهد. برای مقابله با این مشکل، برخی از مطالعات یافتن نمونه های نماینده در کلاس اکثریت را برای اطمینان از اطلاعات بهتر نسبت به حذف تصادفی نمونه ها پیشنهاد کرده اند. تسای و همکارانبرای مثال، [14] از روش خوشه بندی k-means در نمونه های کلاس اکثریت استفاده کرد و از نقطه مرکزی هر خوشه به عنوان نمونه ای نماینده برای بهبود نتایج طبقه بندی استفاده کرد. با این حال، تجربه همچنین نشان می دهد که اطلاعات مهم برای بهبود طبقه بندی طبقات اقلیت را نمی توان از طریق روش نمونه گیری زیر افزایش داد.
در مقابل، روش نمونه گیری بیش از حد به منظور افزایش مستقیم تعداد نمونه های کلاس اقلیت برای گسترش اطلاعات یادگیری در کلاس اقلیت است. در بین روش ها، نمونه های تصادفی بیش از حد نمونه (ROSE) یک روش رایج برای ترسیم نمونه ها از داده های اصلی به عنوان نمونه های جدید در کلاس اقلیت است. با این حال، روش ROSE مستعد برازش بیش از حد برای مدل سازی است. برخی از مطالعات پیشنهاد کرده اند که نمونه های مصنوعی نزدیک به نمونه های کلاس اقلیت اصلی ایجاد شود که می تواند به طور موثر دقت پیش بینی را برای مجموعه داده های نامتعادل افزایش دهد. به عنوان مثال، روش نمونه برداری بیش از حد اقلیت مصنوعی (SMOTE) پیشنهاد شده توسط Chawla و همکاران.[15] برای ایجاد نقاط درونیابی خطی به عنوان نمونه های کلاس اقلیت جدید استفاده می شود. توجه داشته باشید که نمونه های تولید شده توسط SMOTE ممکن است در یک منطقه خطرناک قرار داشته باشند که در آن نمونه ای از کلاس اقلیت ممکن است توسط بسیاری از نمونه های کلاس اکثریت احاطه شده باشد. تحت این سناریو، نمونه های تولید شده به عنوان نویز در نظر گرفته می شوند که ممکن است به دقت طبقه بندی کلی آسیب برساند. برای مقابله با این مشکل، Bunkhumpopat و همکاران.[16] روش SMOTE سطح ایمن (SL_SMOTE) را برای اطمینان از اینکه نمونه های مجازی کلاس اقلیت در مناطق امن تولید می شوند، ارائه کرد.
در سالهای اخیر ، دستگاه بردار پشتیبانی (SVM) ارائه شده توسط Cortes و Vapnik [17] توانایی طبقه بندی برتر را در زمینه های مختلف ، مانند تشخیص گسل [18] ، تشخیص بیماری [19] ، تشخیص کلاهبرداری اعتباری [20] و مالی نشان داده است. پیش بینی [21]. SVM داده ها را بر روی یک فضای ویژگی با ابعاد بالا از طریق یک تابع هسته نقشه می کند تا Hypersphere بهینه برای طبقه بندی داده های غیر خطی پیدا شود. بر اساس اصل به حداقل رساندن ریسک ساختاری ، مرز تصمیم گیری از hypersphere با حداکثر حاشیه ساخته شده است ، که توسط بردارهای پشتیبانی تعریف می شود. توانایی طبقه بندی مرز تصمیم برای هر کلاس بستگی به مقدار بردارهای پشتیبانی یافت شده در آن کلاس دارد ، که با توجه به مقدار نمونه های آن در آن کلاس افزایش می یابد [22]. در نتیجه ، تحت سناریوهای مجموعه داده نامتعادل ، مرز تصمیم گیری شده توسط مدل SVM به دلیل تأثیر مقدار زیادی از نمونه های کلاس اکثریت به راحتی تحریف می شود. بنابراین ، ممکن است منجر به پیش بینی SVM به کلاس اکثریت شود [23] ، [24].
برای غلبه بر Drarwback SVM برای مجموعه داده های نامتعادل ، برخی از تحقیقات توصیه کرده اند که نمونه های مصنوعی کلاس اقلیت را با استفاده از تکنیک نمونه برداری برای تساوی توزیع بین کلاس ها و بهبود توانایی طبقه بندی SVM ایجاد کنند. با این حال ، تولید کورکورانه نمونه های مصنوعی از طبقه اقلیت ممکن است منجر به تغییر نامشخص در مرز تصمیم گیری Hypersphere شود. این برای بهبود عملکرد طبقه بندی SVM برای مجموعه داده های نامتعادل نامعتبر است. برای رسیدگی به این اشکال ، برخی از مطالعات توصیه کرده اند که مثالهای جدیدی را در نزدیکی مرز تصمیم گیری ایجاد کنند تا Hypersphere را به سمت کلاس اکثریت تغییر داده و حداکثر حاشیه را در سمت کلاس اقلیت گسترش دهد. ماتئو و همکاران.[25] ، به عنوان مثال ، روش SMOTE مبتنی بر هسته را برای تولید نمونه های مصنوعی از بردارهای پشتیبانی برای افزایش دقت طبقه بندی SVM در مجموعه داده های نامتعادل پیشنهاد کرد. در بردارهای پشتیبانی ، پیری و همکاران.[26] همچنین یک روش نمونه برداری برای تولید نمونه های مصنوعی کلاس اقلیت را برای تعادل یک مجموعه داده آموزشی برای یافتن مرز تصمیم بهینه از مدل SVM ارائه داد. با این حال ، تحت یک مجموعه داده بسیار ناچیز ، مقدار بردارهای پشتیبانی در کلاس اقلیت بسیار نادر می شود ، بنابراین تنوع نمونه های مصنوعی تولید شده کاهش می یابد و اثر یادگیری مدل SVM را خراب می کند. برای گسترش اندازه نمونه کلاس اقلیت ، برخی از مطالعات پیشنهاد کرده اند که با استفاده از تکنیک Mega-Trend-Diffusion (MTD) پیشنهاد شده توسط لی و همکاران.[27] برای برآورد دامنه کلاس اقلیت و تولید نمونه های مجازی در دامنه تخمین زده شده. مجید و همکاران.[28] ، به عنوان مثال ، از تکنیک MTD برای تعادل یک مجموعه داده آموزشی برای ساخت مدل های K-nearest (KNN) و SVM استفاده کرد. در مقاله خود ، دقت طبقه بندی توسط مدل MTD-KNN و MTD-SVM برای مجموعه داده های سرطان پستان و روده بزرگ انسان بهبود یافته است. علاوه بر این ، در مقاله امین و همکاران [6] ، تکنیک MTD با یک الگوریتم ژنتیکی (GA) ترکیب شد تا نمونه های مصنوعی بهتری پیدا کند. با توجه به آزمایش آنها ، عملکرد طبقه بندی با استفاده از روش MTD-GA بهتر از روشهای دیگر نمونه برداری است: Smote [15] ، Adasyn [29] ، Mwmote [30] ، ICOTE [31] و TPKNN با SMOTE ، روی خفاشپیش بینی. با این وجود ، برای یافتن موارد مناسب بهتر از طبقه اقلیت ، GA نمونه های مجازی را از طریق بسیاری از تکرارهای تکامل که کار وقت گیر است ، تکامل می دهد. برای مقابله با این کار ، وانگ و همکاران.
[1] روش SMOTE را با الگوریتم بهینه سازی Swarm (PSO) ترکیب کرد تا تسریع در تکامل نمونه های مجازی باشد. روش آنها تأثیر قابل توجهی در طبقه بندی کننده درخت تصمیم C5 برای پیش بینی بقا در بیماران 5 ساله سرطان پستان به دست آورد. علاوه بر این ، برای بهبود طبقه بندی SVM با داده های کلاس نامتعادل ، سروانتس و همکاران.[32] روش SMOTE-PSO را برای تولید نمونه های جدید بردارهای پشتیبانی در کلاس اقلیت توسط Smote پیشنهاد کرد تا نمونه های مصنوعی نماینده توسط الگوریتم PSO را پیدا کند.
تجربیات ما نشان می دهد که مطالعات ذکر شده در بالا دو نکته مهم را به وجود می آورد: یکی ، برای مجموعه داده های بسیار نامتعادل ، به دلیل تعداد بسیار کمی از بردارهای پشتیبانی ، روش های نمونه برداری مبتنی بر هسته ممکن است برای طبقه بندی SVM تحریف شود. مورد دیگر ، دامنه بردارهای پشتیبانی کوچک ممکن است با رویکرد MTD بیش از حد تخمین زده شود ، همانطور که در [33] مشاهده می شود ، جایی که نمونه های مصنوعی تولید شده معمولاً توسط بسیاری از نمونه های کلاس اکثریت احاطه شده است. در نتیجه ، نمونه جدید ممکن است به عنوان سر و صدا در نظر گرفته شود. علاوه بر این ، روش معمولی MTD در نظر گرفته شده است که داده ها از یک عملکرد مثلثی غیرقانونی ناشی می شوند. با این حال ، در برنامه های واقعی ، داده های واقعی ممکن است از توزیع های چند ماده ای حاصل شود. تحت این شرایط ، ژو و همکاران.[33] روش MTD را بر اساس توابع مثلثی چند ماده (MD-MTD) برای تولید نمونه های چند منظوره مجازی برای افزایش عملکرد پیش بینی شده برای مجموعه داده های کوچک ارائه داد. برای در نظر گرفتن توزیع های چند مدلی ، لین و همکاران.[34] تکنیک MTD مبتنی بر فاصله (DB-MTD) را برای ارزیابی میزان انتشار داده ها با تأثیرات کم از مقادیر شدید یا مسافت های شدید پیشنهاد کرد. با توجه به یافته های نمونه های مجازی ، در [1] ، [6] ، مقالات آنها از GA یا PSO برای تکامل نمونه های کلاس اقلیت مصنوعی و از بین بردن نویز استفاده می کردند. با این حال ، از آنجا که منطقه حاشیه نرم مدل SVM حساس و ظریف است ، GA یا PSO معمولاً هزینه های محاسباتی بالایی را برای یافتن نمونه های کلاس اقلیت قابل قبول خرج می کنند.
بر اساس مطالعات مرتبط که در بالا ذکر شد ، ما دو چالش مهم را یادداشت می کنیم: 1. تولید نمونه های مصنوعی در نزدیکی مرز تصمیم گیری برای تغییر مرز تصمیم گیری Hypersphere برای بهبود موثر توانایی طبقه بندی مدل SVM برای مجموعه داده های نامتعادل. 2. بیشترین روشهای نمونه برداری نمونه های مصنوعی را با فرض توزیع های یکپارچه تولید می کنند. با این حال ، با بردارهای پشتیبانی بسیار محدود از کلاس اقلیت ، تخمین دامنه داده به راحتی تحریف می شود و منجر به مثال جدید می شود که توسط نمونه های طبقاتی اکثریت احاطه شده است ، بنابراین اغلب به عنوان سر و صدا در نظر گرفته می شود. سر و صدا بر دقت پیش بینی مدل SVM برای نمونه هایی از کلاس اقلیت تأثیر می گذارد. بنابراین ، در این مقاله ، سه سؤال تحقیق (RQS) به شرح زیر ارائه شده است:
RQ1: در برنامه های واقعی ، معمول است که مجموعه داده های واقعی از توزیع های چند منظوره ناشی می شوند. با توجه به این فرض از توزیع های چند حالته ، از کدام روش می توان برای تولید نمونه های مصنوعی با توزیع چند حالته استفاده کرد؟
RQ2: چه نوع مدل هایی می تواند برای یادگیری توزیع بردارهای پشتیبانی بین کلاسهای مختلف مؤثر باشد؟
RQ3: برای اندازه گیری شباهت بین مثال جدید و مثال اصلی برای نمایش نمونه جدید با کیفیت بهتر ، از چه نوع توابع استفاده می شود؟
- به منظور مقابله با RQ1 ، RQ2 و RQ3 ، در این مقاله ، ما تلاش کردیم تا یک روش نمونه برداری جدید به نام DB-MTD-SN را بر اساس شبکه سیامی (SN) تهیه کنیم ، که می تواند عملکرد طبقه بندی مدل SVM را برای نامتعارف بهبود بخشد. مجموعه داده هاسهم عمده این مقاله به شرح زیر است:
- (1) برای پرداختن به RQ1 ، ما تکنیک DB-MTD را برای برآورد محدوده داده بردارهای پشتیبانی حداقل و تولید نمونه های مصنوعی با توزیع چند مدلی از کلاس اقلیت در محدوده تخمینی ایجاد کردیم.
- (2) برای پرداختن به RQ2 ، ما یک مدل SN منحصر به فرد را ارائه دادیم که داده های اصلی را بر روی یک فضای با ابعاد بالا برای یادگیری به راحتی توزیع توزیع غیر خطی و پیچیده بین کلاس اکثریت و کلاس اقلیت ارائه می دهیم. مدل SN مبتنی بر یک ساختار زوج ارائه شده توسط بروملی و همکاران.[35] برای شناسایی اینکه آیا داده های ورودی زوجی از همان کلاس تهیه می شوند ، استفاده می شود. در مدل SN ، کلاس داده های زوج از طریق یک عملکرد از دست دادن متضاد تبعیض می شود. از عملکرد از دست دادن متضاد برای اندازه گیری شباهت بین داده های زوج با کاهش فاصله داده های زوج کلاس مثبت و افزایش فاصله داده های زوج کلاس منفی استفاده می شود.
(3) برای پرداختن به RQ3، مدل SN پیشنهادی از یک تابع عضویت مثلثی فازی (MF) به عنوان تابع ضرر متضاد برای اندازه گیری شباهت بین داده های جفت شده از کلاس های مختلف استفاده می کند. مقدار MF داده ها در هر کلاس نشان دهنده این احتمال است که داده ها به آن کلاس تعلق دارند. با مدل SN مبتنی بر MF، می توانیم نمونه های مصنوعی بهتری را برای جلوگیری از ایجاد نویز غربال کنیم.
در این مقاله، ما کارایی روش پیشنهادی DB-MTD-SN را با استفاده از ده مجموعه داده به دست آمده در مخزن KEEL-dataset آزمایش می کنیم [36]. روش DB-MTD-SN با روش IMB (با استفاده از مجموعه داده های نامتعادل) و سه روش نمونه برداری بیش از حد: SL_SMOTE، SMMO و SMOTE-PSO برای ده مجموعه داده مقایسه شد. دو نوع توابع هسته SVM برای تأیید عملکرد طبقه بندی با استفاده از روش پیشنهادی برای مجموعه داده های نامتعادل استفاده می شود. سه شاخص ارزیابی، G-mean، F1، و شاخص دقت متعادل (IBA) برای اندازه گیری نتایج طبقه بندی برای مجموعه داده های نامتعادل در دو نوع تابع هسته SVM استفاده شد. علاوه بر این، از آزمون Wilcoxon زوجی برای بررسی اینکه آیا روش پیشنهادی از نظر آماری با روش های دیگر از نظر سه شاخص تفاوت دارد یا خیر، استفاده می شود. نتایج تجربی نشان می دهد که روش پیشنهادی DB-MTD-SN از سایر روش های نمونه برداری بیش از حد بهتر عمل می کند.
بخش باقی مانده از این مقاله به شرح زیر سازماندهی شده است: بخش 2 تکنیک های مرتبط و کارهای موجود برای طبقه بندی SVM داده های نامتعادل را توضیح می دهد. بخش 3 روش پیشنهادی DB-MTD-SN را به تفصیل و روش اجرای روش پیشنهادی را نشان می دهد. بخش 4 شرح مجموعه داده های تجربی و چندین معیار ارزیابی را برای طبقه بندی داده های نامتعادل و نتایج تجربی ارائه می دهد. و بخش 5 نتیجه گیری را ارائه می کند و کار آینده را پیشنهاد می کند.
قطعات بخش
کار مرتبط
در این بخش به معرفی کارهای مرتبط و تفاوت های روش پیشنهادی با کارهای موجود در مورد روش های نمونه برداری بیش از حد می پردازیم.
روش پیشنهادی
در این مقاله، ما یک تکنیک بیش نمونه برداری منحصر به فرد را با در نظر گرفتن مدل SN مبتنی بر MF برای ایجاد نمونه های مصنوعی نماینده برای بهبود عملکرد طبقه بندی برای مجموعه داده های اریب ایجاد کردیم. بخش های زیر روش نمونه گیری بیش از حد پیشنهادی را تشریح می کند.
آزمایش کنید
در این بخش مجموعه داده ها و نتایج تجربی را شرح خواهیم داد. این آزمایش بر روی رایانه شخصی مجهز به CPU Intel (R) هسته (TM) I7-10700 CPU @ 2. 90 گیگاهرتز و NVIDIA GEFORCE RTX 3060 انجام شد. در آزمایش ما ، زبان برنامه نویسی Python 3. 8. 10 برای پردازش داده ها و ساخت مدل طبقه بندی SVM اجرا شد.
نتیجه
رویکرد نمونه برداری یک روش پیش پردازش داده است ، که به طور مستقیم مقدار نمونه های کلاس اقلیت را گسترش می دهد و توانایی های طبقه بندی مدل های یادگیری را برای مجموعه داده های نامتعادل بهبود می بخشد. با در نظر گرفتن نتایج هنگامی که طبقه بندی SVM برای یادگیری در مجموعه داده های نامتعادل اعمال می شود ، برخی از مطالعات پیشنهاد کرده اند که از رویکردهای نمونه برداری مبتنی بر هسته برای تولید بردارهای پشتیبانی مصنوعی در کلاس اقلیت به عنوان موارد جدید برای تعادل یک مجموعه داده آموزشی با کلاس SKEWED استفاده کنند.
بیانیه مشارکت در نویسندگی اعتباری
Liang-Sian Lin: مفهوم سازی ، روش شناسی ، نوشتن-پیش نویس اصلی ، نرم افزار. یائو سان لین: اعتبار سنجی. der-Chiang Li: نوشتن-بررسی و ویرایش. yi-ting chen: تجزیه و تحلیل رسمی.
اعلام علاقه رقیب
نویسندگان اعلام می کنند که هیچ تضاد منافع وجود ندارد.
تصدیق
این مطالعه توسط شورای ملی علوم و فناوری ، تایوان و دانشگاه ملی پرستاری و علوم بهداشت تایپه ، تایوان پشتیبانی می شود. این تحقیق توسط شورای ملی علوم و فناوری تحت عنوان قرارداد اعطای کمک هزینه وزارت علوم و فناوری تایوان بیشتر 111-2221-E-227-001 تأمین شد.
اخبار رمز ارزها...
ما را در سایت اخبار رمز ارزها دنبال می کنید
برچسب :
نویسنده : منیژه سلیمی
بازدید : <-PostHit->
تاريخ : چهارشنبه
15 شهريور
1402 ساعت: 18:12