یادگیری عمیق برای تجارت cryptocurrency: رویکرد عملی برای پرداختن به پشتی…

ساخت وبلاگ

Deep Reinforcement Leaing for Cryptocurrency Trading: Practical Approach to Address Backtest…

این مقاله که توسط برند گورت نوشته شده است ، جزئیات پروژه ای را که وی به عنوان دستیار تحقیقاتی در دانشگاه کلمبیا کار کرده است ، شرح می دهد. این پروژه سخاوتمندانه به بنیاد منبع باز AI4Finance اهدا می شود ، که هدف آن ایجاد بنیادی شبیه به لینوکس و آپاچی در زمینه برش AI و دارایی است.

در این مقاله به بحث در مورد مقاله اخیراً برند می پردازیم. برند پس از خواندن پیشرفت های کتاب در یادگیری ماشین های مالی توسط مارکوس لوپز د پرادو [1] [2] ، الهام گرفته شد تا چارچوب های جدیدی را برای اندازه گیری بیش از حد در یادگیری تقویت کننده عمیق پیدا کند. مقاله حاصل در کارگاه ICAIF '22 ارائه شده است و در AAAI '23 بیشتر به نمایش گذاشته می شود. علاوه بر این ، این مقاله یک راهنمای جامع در مورد چگونگی تولید مثل نتایج ذکر شده در مقاله ارائه می دهد ، با چارچوب منبع باز که به راحتی در لینک ارائه شده در دسترس است:

تصور کنید که شما یک دزد دریایی در دریاهای بلند بازار رمزنگاری هستید و به دنبال گنج (سود با نام مستعار) هستید. اما ، دقیقاً مانند هر شکار گنج ، موانعی برای غلبه بر آن وجود دارد. یک مشکل بزرگ نوسانات بازار است - مانند دریای طوفانی است که می تواند هر لحظه کشتی شما را غرق کند. محققان قبلی سعی کرده اند برای حرکت به بازار از روشهای یادگیری تقویت کننده عمیق استفاده کنند (به آنها به عنوان نقشه گنج فکر کنید) و در پشتی خود موفقیت هایی پیدا کردند (یک تمرین عملی از شکار گنج). اما در اینجا صید وجود دارد: این نقشه ها ممکن است دقیق نباشند زیرا می توانند تحت تأثیر چیزی به نام بیش از حد (مانند نقشه گنج جعلی) قرار بگیرند.

این جایی است که ما وارد می شویم! ما یک راه حل برای کمک به شما در جلوگیری از بیش از حد و افزایش شانس موفقیت خود در شکار گنج رمزنگاری خود داریم. ما از روشی به نام تست فرضیه (مانند یک بررسی صحت نقشه گنج) برای تشخیص بیش از حد استفاده می کنیم ، سپس عوامل DRL خود (نقشه های گنج) را آموزش داده و هرگونه آزمایش را رد می کنیم. پس از آن ، ما روش خود را در آزمایش قرار دادیم. و حدس بزنید چه؟عوامل DRL کم مصرف ما در مقایسه با عوامل بیش از حد بیش از حد ، یک استراتژی وزن برابر و حتی معیار بازار بازده بالاتری داشتند. این به ما اطمینان می دهد که می توان از رویکرد ما در بازار واقعی (یافتن گنج واقعی) استفاده کرد.

انگیزه اصلی برای پرداختن به مسئله بیش از حد در یادگیری ماشین ، این واقعیت است که مدل ها به راحتی می توانند برای داده هایی که در آن آموزش داده شده بیش از حد اختصاصی می شوند. این امر به ویژه در یادگیری ماشین های مالی مشکل ساز است ، زیرا عملکرد مدل ها باید در بازار آینده آزمایش شود و نه در همان توزیع داده های آموزش. به عنوان مثال ، در طبقه بندی تصویر ، مسئله بیش از حد به دلیل در دسترس بودن مجموعه داده های بزرگ مانند Imagenet شدیدتر است. با این حال ، در یادگیری ماشین های مالی ، اطمینان از اینکه مدل ها قادر به تعمیم و عملکرد خوب در بازار آینده هستند و نه فقط بر روی داده های تاریخی بسیار مهم است. برای پرداختن به این مسئله ، می توان از تکنیک هایی مانند تنظیم مجدد و اعتبارسنجی متقاطع برای جلوگیری از استفاده بیش از حد و بهبود تعمیم مدل ها استفاده کرد.

بنابراین ، کیف های خود را بسته بندی کنید ، نقشه گنج خود را بگیرید و با رویکرد ما بادبان را در بازار رمزنگاری قرار دهید ، و ممکن است فقط آن را غنی کنید!

معرفی

در مقاله ما ، ما با هدف پرداختن به مشکل بیش از حد در روشهای یادگیری عمیق (DRL) برای تجارت رمزنگاری. بیش از حد هنگامی اتفاق می افتد که یک مدل بیش از حد روی داده های آموزش آموزش دیده باشد و در مورد داده های جدید و غیب ضعیف عمل کند. ما یک روش عملی برای تشخیص و پرداختن به بیش از حد با استفاده از آزمایش فرضیه پیشنهاد دادیم. ما روش خود را با استفاده از 10 ارز رمزنگاری مختلف در طی یک دوره زمانی آزمایش کردیم که بازار دو تصادف را تجربه کرد و دریافتیم که عوامل DRL کم مصرف کمتر در مقایسه با عوامل بیش از حد بیش از حد ، یک استراتژی وزن برابر و شاخص S& P DBM بازده بالاتری دارند (معیار بازار). این به ما اطمینان می دهد که می توان از رویکرد ما در بازار واقعی استفاده کرد. به طور خلاصه ، مقاله ما با هدف ارائه روشی برای اطمینان از اینكه عوامل منتخب پزشکان DRL در طول دوره آموزش بیش از حد نپیوندند ، و نتایج آنها را قابل اطمینان تر و قابل اعتماد تر می کند.

کارهای مرتبط

چرا نماینده DRL به پشتی نیاز داشت؟برای اثبات این فقط یک تعجب یک ضربه ای نبود!

مقاله ما روشهای مختلفی را برای پشتوانه عملکرد یک عامل یادگیری عمیق (DRL) برای تجارت مالی مورد بحث قرار می دهد.

روش اول ، به نام روش Walk-Forward (WF) ، بسیار کاربردی ترین عمل است. با این حال ، این پتانسیل بیش از حد را دارد ، به این معنی که ممکن است به خوبی در موقعیت های بازار آینده تعمیم یابد.

روش دوم که اعتبارسنجی متقاطع k-fold (KCV) نامیده می شود، با تقسیم کردن مجموعه داده به k زیر مجموعه و آموزش عامل بر روی زیرمجموعه های مختلف، مشکل اضافه برازش را کاهش می دهد. با این حال، این روش همچنان دارای خطرات بیش از حد و نشت اطلاعات است.

برای پرداختن به این مسائل، روش سومی به نام تأیید متقاطع پاکسازی شده ترکیبی (CPCV) را پیشنهاد می کنیم که طیف وسیع تری از موقعیت های بازار را برای کاهش بیش برازش و کنترل های نشتی شبیه سازی می کند.

در زمینه بک تست یک عامل DRL، نشت اطلاعات به موقعیتی اشاره دارد که دانش مجموعه آزمایشی (که قرار است توسط عامل در طول آموزش دیده نشود) بر آموزش عامل تأثیر می گذارد. اگر مجموعه تست و مجموعه آموزشی به درستی از هم تفکیک نشده باشند یا اگر معیار ارزیابی مورد استفاده در تست نیز در طول آموزش استفاده شود، می تواند اتفاق بیفتد. این می تواند منجر به یک مشکل بیش از حد برازش شود که در آن عامل در مجموعه آزمایشی به خوبی عمل می کند اما در داده های نادیده جدید نه.

به نظر می رسد که این عامل DRL، آزمون خود را با موفقیت پشت سر گذاشته است. فقط از آن نخواهید که در یک روز بارانی اجرا کند!

کار معامله ارز دیجیتال را مدل کنید

فرآیند تصمیم گیری مارکوف

ما از روشی به نام فرآیند تصمیم گیری مارکوف (MDP) برای مدل سازی این مشکل استفاده می کنیم. در این روش، وضعیت فعلی برنامه با اطلاعاتی مانند مبلغ نقدی موجود در حساب، سهام ارزهای مختلف، قیمت ها در یک زمان معین و مجموعه ای از شاخص های فنی نشان داده می شود که به ما ایده ای از وضعیت بازار می دهد. در حال انجام.

با فرض اینکه ارزهای دیجیتال D و مهرهای زمانی T وجود دارد، t = 0، 1، ...، T - 1. ما از یک عامل یادگیری تقویتی عمیق برای انجام اقدامات معاملاتی استفاده می کنیم، که می تواند خرید، فروش یا نگهداری باشد. یک نماینده وضعیت بازار را مشاهده می کند، به عنوان مثال، قیمت ها و شاخص های فنی، و اقداماتی را برای به حداکثر رساندن بازده انباشته انجام می دهد. ما یک کار معاملاتی را به عنوان فرآیند تصمیم گیری مارکوف (MDP) مدل می کنیم:

ما 15 ویژگی را در نظر می گیریم که توسط مقالات موجود استفاده می شود اما تعدادی از آنها را فیلتر می کنیم. همانطور که در شکل 1 نشان داده شده است، اگر دو ویژگی دارای همبستگی بیش از 60٪ باشند، یکی از این دو را حذف می کنیم. در نهایت، 6 ویژگی نامرتبط در بردار ویژگی نگهداری می شوند که عبارتند از: حجم معاملات، RSI، DX، ULTSOC، OBV و HT.

محیط بازار ساختمان

توضیحات زیر در محیط آلپاکا پیاده سازی شده است.

چرا عامل DRL ویژگی های مرتبط را فیلتر کرد؟تا استراتژی معاملاتی خود را مانند یک گل مروارید تازه نگه دارد!

ما با پخش مجدد داده های تاریخی ، به دنبال سبک Openai Gym ، یک محیط بازار ایجاد می کنیم. یک نماینده بازرگانی در قسمت های مختلف با محیط بازار در تعامل است ، جایی که یک قسمت دوباره داده های بازار (سری زمانی) را به صورت زمان محور از t = 0 تا t = t-1. در آغاز (T = 0) تکرار می کند. محیط یک حالت اولیه S 0 را به نماینده ارسال می کند که یک عمل A 0 را برمی گرداند. سپس ، محیط عمل A را اجرا می کند و یک مقدار پاداش R T و یک حالت جدید S T+1 را به عامل ارسال می کند ، برای t = 0 ، ... T - 1. سرانجام ، S T-1 به عنوان حالت ترمینال تنظیم شده است. محیط بازار دارای سه عملکرد زیر است:

هزینه معاملاتهر تجارت دارای هزینه معامله است و کارگزاران مختلف کمیسیون های مختلف را پرداخت می کنند. برای معاملات cryptocurrency ، فرض می کنیم که هزینه معامله 0. 3 ٪ از ارزش هر تجارت است. بنابراین ، (2) می شود

هزینه معامله را می توان در محیط ALPACA FOU (در حدود خطوط 131 و 148) یافت. علاوه بر این ، تعادل منفی یا فروش وجود ندارد. بنابراین ، در محیط ، برخی از ادعا ها برای اطمینان از محیط زیست بدون اشکال قرار می گیرند.

مسئله بیش از حد Backtest

یک پشتی از داده های تاریخی برای شبیه سازی بازار استفاده می کند و عملکرد یک عامل را ارزیابی می کند ، یعنی نحوه عملکرد یک عامل در صورت اجرای یک دوره زمانی گذشته ، چگونه یک عامل انجام می داد. محققان غالباً با تقسیم داده ها به دو مجموعه زمانی انجام می دهند: یک مجموعه آموزش و یک مجموعه اعتبار سنجی. با این حال ، یک عامل DRL معمولاً از یک مجموعه اعتبار سنجی فردی که نشان دهنده یک وضعیت بازار است ، غلبه می کند. بنابراین ، عملکرد واقعی تجارت مورد سوال است.

Backtest بیش از حد هنگامی اتفاق می افتد که یک عامل DRL متناسب با داده های آموزش تاریخی تا حد مضر باشد. عامل DRL با نوسانات تصادفی در داده های آموزش سازگار است و این نوسانات را به عنوان مفاهیم می آموزد. با این حال ، این مفاهیم وجود ندارند و به عملکرد عامل DRL در کشورهای غیب آسیب می رسانند.

چرا عامل DRL پشتی خود را شکست داد؟خیلی شلوغ بود!

رویکرد عملی برای پرداختن به پشتی بیش از حد

ما یک رویکرد عملی را برای پرداختن به مسئله بیش از حد پشتیبانان پیشنهاد می کنیم. اول ، ما مسئله را به عنوان یک آزمون فرضیه تدوین می کنیم و عوامل را که از آزمون عبور نمی کنند ، رد می کنیم. سپس ، ما مراحل مفصلی را برای برآورد احتمال افزایش بیش از حد ، P در محدوده [0،1] شرح می دهیم.

آزمون فرضیه برای رد عوامل بیش از حد

ما یک آزمون فرضیه را برای رد عوامل بیش از حد تدوین می کنیم. از نظر ریاضی ، به شرح زیر بیان شده است:

Where α>0 سطح اهمیت است. انتظار می رود آزمون فرضیه (7) دو نوع عوامل DRL مثبت کاذب را رد کند. 1) روشهای موجود ممکن است نتایج بیش از حد را گزارش کرده باشد زیرا بسیاری از نویسندگان وسوسه شده اند که بین دوره های آموزش و آزمایش به عقب و جلو بروند. این نوع نشت اطلاعات یک دلیل شایع برای بیش از حد در پشت است. 2)احتمالاً آموزش عامل بیش از حد افزایش می یابد زیرا الگوریتم های DRL نسبت به پارامترهای بیش از حد حساس هستند. به عنوان مثال ، می توان عوامل را با الگوریتم PPO ، TD3 یا SAC آموزش داد و سپس عوامل را که از این آزمون عبور نمی کنند رد کنید.

عامل DRL آزمایش فرضیه ای را انجام داد و این یک بوستر بیش از حد واقعی بود!

تخمین احتمال بیش از حد

توضیحات زیر در کلاس CPCV اجرا شده است.

اعتبار سنجی متقاطع ترکیبی امکان آموزش و اعتبارسنجی را در شرایط مختلف بازار فراهم می کند. با توجه به یک دوره زمانی آموزش ، مراحل زیر انجام می شود:

مرحله 1 (تقسیم داده های اعتبار سنجی آموزش): شکل 2 را ببینید. دوره آموزش را با نقاط داده T به گروههای N با اندازه مساوی تقسیم کنید. k خارج از گروه های N یک مجموعه اعتبار سنجی و بقیه گروه های N-K را به عنوان یک مجموعه آموزش ایجاد می کنند و در نتیجه شکاف های ترکیبی J = (N/N-K) ایجاد می شود. مجموعه های آموزش و اعتبار سنجی به ترتیب دارای نقاط داده (N-K) (T/N) و T '= K (T/N) هستند.

مرحله 2 (یک آزمایش از HyperParameters): مجموعه جدیدی از پارامترها را برای تنظیم HyperParameter تنظیم کنید.

مرحله 3: در هر تقسیم داده های معتبر آموزش ، ما یک عامل را با استفاده از مجموعه آموزش آموزش می دهیم و سپس متریک عملکرد عامل را برای هر مجموعه اعتبار سنجی ، I = 1 ، ... ، H. ارزیابی می کنیم. مجموعه های اعتبار سنجی کلی متریک.

مرحله 2) و مرحله 3) یک آزمایش Hyperparameter را تشکیل می دهد. حلقه برای آزمایشات H و مجموعه ای از HyperParameters (یا عامل DRL) را انتخاب کنید که از نظر میانگین تقسیمات کلی متریک عملکرد بهترین عملکرد را انجام می دهد. این روش شرایط مختلف بازار را در نظر می گیرد و در نتیجه بهترین عملکرد DRL در شرایط مختلف بازار ایجاد می شود. با این حال ، یک فرایند آموزش شامل آزمایشات متعدد منجر به بیش از حد می شود.

بنابراین ، ما می خواهیم یک متریک برای بیش از حد داشته باشیم ...

احتمال بیش از حد

توضیحات زیر در کلاس PBO اجرا شده است.

ما احتمال افزایش بیش از حد با استفاده از بردار بازگشت را تخمین می زنیم. بردار برگشتی به عنوان rt = v (t)- v (t-1) تعریف شده است ، جایی که v (t) مقدار نمونه کارها در مرحله t t است. ما احتمال افزایش بیش از حد از طریق سه مرحله کلی را تخمین می زنیم:

مرحله 1: برای هر آزمایش HyperParameter ، میانگین بازده در مجموعه های اعتبار سنجی (از طول t) و به دست آوردن r_avg در r^t.

مرحله 2: برای آزمایشات H ، R_AVG را در یک ماتریس M در r^t’xh قرار دهید.

مرحله 3: بر اساس M ، ما احتمال افزایش بیش از حد P را محاسبه می کنیم

Pick the number of splits, the more splits, the more accurate the probability of overfitting will be. With 16 splits or higher, the probability of overfitting will have a>فاصله اطمینان 95 ٪. برای سادگی ، ما Splits S = 4 را می گیریم:

اکنون ما تمام ترکیبات ممکن را بین شکافها ایجاد می کنیم ، جایی که بدون یک نوار نشانگر مجموعه درون نمونه و با یک نوار ، نمونه خارج از نمونه است.

بیایید فقط با اشتراک 1 مثال را بگیریم و محاسبه PBO را انجام دهیم. ابتدا مجموعه قطار (بدون نوار) و مجموعه آزمون (با استفاده از روشی به نام فرایند تصمیم گیری مارکوف (MDP) را برای الگوبرداری از این مشکل تشکیل دهید. در این روش ، وضعیت فعلی برنامه توسط اطلاعاتی مانند مبلغ نقدی در نمایش داده می شودحساب ، سهام ارزهای مختلف ، قیمت ها در یک زمان معین و یک دسته از شاخص های فنی که به ما ایده ای می دهد که بازار چگونه انجام می دهد.

با فرض اینکه ارزهای دیجیتال D و مهرهای زمانی T وجود دارد، t = 0، 1، ...، T - 1. ما از یک عامل یادگیری تقویتی عمیق برای انجام اقدامات معاملاتی استفاده می کنیم، که می تواند خرید، فروش یا نگهداری باشد. یک نماینده وضعیت بازار را مشاهده می کند، به عنوان مثال، قیمت ها و شاخص های فنی، و اقداماتی را برای به حداکثر رساندن بازده انباشته انجام می دهد. ما یک کار معاملاتی را به عنوان فرآیند تصمیم گیری مارکوف (MDP) مدل می کنیم:

تصویر توسط نویسنده. ما 15 ویژگی را در نظر می گیریم که توسط مقالات موجود استفاده می شود اما چند مورد را فیلتر می کنیم. همانطور که در شکل 1 نشان داده شده است ، اگر دو ویژگی همبستگی بیش از 60 ٪ داشته باشد ، ما یکی از این دو را رها می کنیم. سرانجام ، 6 ویژگی غیر مرتبط در بردار ویژگی ، که حجم معاملات ، RSI ، DX ، Ultsoc ، Obv و HT هستند ، نگهداری می شوند. بار):

سپس ، ما نسبت شارپ (یا هر متریک مورد نظر خود را) محاسبه می کنیم و تعداد ستون های حاصل را بر اساس نسبت شارپ رتبه بندی می کنیم. توجه داشته باشید که مقدار ستون ها برابر با تعداد آزمایشات هایپرپارامتر است. تصور کنید که رتبه بندی دو بردار زیر را تشکیل می دهد:

سپس وکتور دوم را در آن شاخص 3 بررسی می کنیم ، که 5 است. اکنون می توانیم رتبه نسبی را محاسبه کنیم:

فرمول از (N + 1) به عنوان مخرج W̄ استفاده می کند تا از W = 1. 0 جلوگیری شود. این منجر به Infinity In Logits می شود. نمی توان 100 ٪ مطمئن بود زیرا همه نمونه ها از آن بهتر عمل کرده اند.

اکنون ما از عملکرد logit برای تبدیل این موارد به یک احتمال استفاده می کنیم:

ما این کار را اکنون فقط برای یک نمونه انجام داده ایم ، یعنی نمونه 1! ما این گزارش ها را از هر نمونه C1 - C6 جمع می کنیم ، و سپس به سادگی تعداد ورود به سیستم را می شماریم<0 divided by the total number of logits. This is our probability of overfitting. This is what constitutes the next formula:

ارزیابی عملکرد

برای اولین مورد ، ما از روش پیاده روی برای آموزش یک عامل معمولی با استفاده از الگوریتم PPO و تقسیم داده های تست اعتبار سنجی آموزش استفاده می کنیم. سپس احتمال افزایش بیش از حد (P) را برای این عامل محاسبه می کنیم. در مرحله بعد ، ما یک عامل معمولی دیگر را با استفاده از الگوریتم PPO و روش اعتبار سنجی متقاطع K با K = 5 آموزش می دهیم.

برای مورد دوم ، ما از احتمال استفاده بیش از حد استفاده می کنیم تا احتمال اینکه یک عامل هنگام تنظیم بیش از حد پارامترها برای سه عامل مختلف بیش از حد باشد: TD3 ، SAC و PPO. ما P را برای هر عامل با هر مجموعه ای از hyperparameters برای آزمایش H = 50 محاسبه می کنیم.

برای اندازه گیری عملکرد یک عامل ، از سه معیار استفاده می کنیم: بازگشت تجمعی ، نوسانات و احتمال افزایش بیش از حد. بازده تجمعی سود را اندازه گیری می کند ، نوسانات میزان تغییر یک سری قیمت معاملات را با گذشت زمان اندازه گیری می کند ، و احتمال اقدامات بیش از حد احتمال وجود بیش از حد یک عامل را نشان می دهد.

ما همچنین عملکرد روش پیشنهادی خود را با دو روش معیار مقایسه می کنیم: یک نمونه کارها با وزن برابر و شاخص بازار دیجیتال گسترده S& P Cryptocurrency (شاخص S& P BDM). استراتژی وزن برابر ، پول نقد موجود را به طور مساوی در بین همه ارزهای رمزپایه موجود در زمان T0 توزیع می کند ، در حالی که شاخص S& P BDM عملکرد ارزهای رمزنگاری شده را با یک سرمایه بازار بیش از 10 میلیون دلار دنبال می کند.

رد عوامل بیش از حد

در این بخش ، عملکرد عوامل یادگیری تقویت کننده معمولی و عمیق (DRL) را بررسی می کنیم. ما از یک تابع توزیع logit برای اندازه گیری احتمال بیش از حد استفاده ، که توسط منطقه زیر منحنی برای دامنه نشان داده شده است استفاده می کنیم [- Infty ، 0].

شکل 4 در زیر نتایج برای عوامل معمولی را نشان می دهد ، جایی که ما رویکرد PPO خود را با روش های WF و KCV مقایسه می کنیم. ما می دانیم که روش WF احتمال بیشتری برای افزایش بیش از 17. 5 ٪ دارد ، در حالی که روش KCV احتمال کمتری در 7. 9 ٪ دارد. رویکرد PPO ما احتمال کمتری در 8. 0 ٪ دارد.

شکل 5 نتایج را برای عوامل DRL ، به ویژه PPO ، TD3 و SAC ارائه می دهد. ما می دانیم که روش SAC بیشترین احتمال افزایش بیش از حد در 21. 3 ٪ را دارد ، در حالی که PPO و TD3 به ترتیب 8. 0 ٪ و 6 /9 ٪ از احتمال کمتری دارند. جدول ref هاپرپارامترهای خاص مورد استفاده برای هر عامل را نشان می دهد.

به طور کلی ، این نتایج حاکی از آن است که روشهای PPO و TD3 ما در مقایسه با روشهای معمولی و سایر DRL احتمال کمتری برای استفاده بیش از حد دارند و می توانند برای استفاده در برنامه های عملی مناسب تر باشند.

عملکرد پشتی

In this section, we present the results of our backtest performance. We utilized two figures, Fig.6 and Fig. 7, to show the results of our agent’s performance. Our agent utilizes a CVIX indicator, which, when surpassing $90$, causes the agent to stop buying and selling all cryptocurrency holdings. We compare the performance of our agent with conventional agents, market benchmarks, and our approach. The results show that our method significantly outperforms the other two agents, PPO WF and PPO KCV, with at least a 15% increase in cumulative retu. Additionally, our method also demonstrates lower volatility, indicating that it is more robust to risk. Furthermore, when comparing our approach to the DRL agents, TD3 and SAC, our PPO agent outperforms them with a significant increase in cumulative retu (>24 ٪) و نوسانات پایین تر. سرانجام ، در مقایسه با معیارها ، رویکرد ما از نظر بازده تجمعی و نوسانات بهتر است. بر اساس این نتایج ، نتیجه می گیریم که عامل PPO عامل برتر در بین موارد آزمایش شده است.

نتیجه

آهوی ماتیز! در این مقاله در اینجا ، ما در سفری برای کشف گنج پرداختن به مسئله بیش از حد پشتوانه در تجارت cryptocurrency با یادگیری عمیق تقویت شده ، قایقرانی کردیم. و بگذارید به شما بگویم. ما به طلا زدیم! یافته های ما نشان می دهد که عامل PPO (با روش CV ترکیبی قابل اعتماد خود) از سایر زمین های زمینی ، از جمله عوامل معمولی ، سایر عوامل DRL و حتی شاخص S& P DBM در هر دو بازگشت تجمعی و نوسانات ، بهتر است. و فراموش نکنیماین قدرتمند نیز قوی است!

در مورد سفرهای آینده ، ما در 1 برنامه ریزی شده ایم). هانتین برای تکامل احتمال بیش از حد در طول آموزش و برای عوامل مختلف. 2)تنظیم سفارش محدود و بسته شدن تجارت ؛3)Explorin 'دریاهای وسیع داده های در مقیاس بزرگ ، مانند کلیه ارزهای مربوط به شاخص S& P BDM. و 4)Takin در غنیمت بیشتر ، مانند اصول و ویژگی های احساسات برای فضای دولت. بنابراین ، لنگر را بلند کنید و بادبان را برای دریاهای عالی تجارت cryptocurrency با ما قرار دهید!

~با تشکر از خواندن

ارجاع

  1. Bailey ، D. H. ، Borwein ، J. M. ، López de Prado ، M. ، & Zhu ، Q. J. (2017). احتمال بروز بیش از حد پشتی. مجله مالی محاسباتی ، 20 (4) ، 39-69. https://doi. org/10. 21314/jcf. 2016. 322

2. Prado ، M. L. De.(2018). پیشرفت در یادگیری ماشین مالی.

یادگیری تقویت عمیق برای تجارت cryptocurrency: رویکرد عملی برای پرداختن به پشتی ... در ابتدا به سمت هوش مصنوعی در رسانه منتشر شد ، جایی که مردم با برجسته کردن و پاسخ دادن به این داستان ، مکالمه را ادامه می دهند.

به هزاران رهبر داده در خبرنامه هوش مصنوعی بپیوندید. به بیش از 80،000 مشترک بپیوندید و با آخرین تحولات در هوش مصنوعی به روز باشید. از تحقیق گرفته تا پروژه ها و ایده ها. اگر در حال ساخت یک استارتاپ هوش مصنوعی ، یک محصول مرتبط با هوش مصنوعی یا یک سرویس هستید ، ما از شما دعوت می کنیم تا حامی شوید.

اخبار رمز ارزها...
ما را در سایت اخبار رمز ارزها دنبال می کنید

برچسب : نویسنده : منیژه سلیمی بازدید : <-PostHit-> تاريخ : چهارشنبه 15 شهريور 1402 ساعت: 17:22