آموزش تخمین خطای طبقه بندی یا کلاسیفایر در داده کاوی
1 ساعت
0.0
در این فرادرس، در ابتدای بحث، به خود موضوع تخمین خطا و اهمیت آن اشاره می شود. در ادامه می بینیم که بایاس و واریانس یک تخمین گر خطا چگونه نمایشی کمی و خلاصه شده از کیفیت آن را به ما می دهد و این که چگونه این دو فاکتور به صورت یکجا و واحد خود را در RMS مرتبط با یک تخمین گر نشان می دهند. در ادامه به مفهوم فاکتورهای تصادفی درونی (Internal Random Factors) و تفاوت تخمین گر Randomized و Non-Randomized اشاره خواهد شد و این که چگونه تخمین گرها در یکی از این دو دسته قرار می گیرند. پرداختن به تخمین گر Holdout و ویژگی های آن موضوع ادامه بحث است. همان طور که می دانیم تخمین گر Holdout در زمان هایی که داده کافی وجود داشته باشد، انتخاب مناسب و کارایی هستند. اما مشکل این تخمین گر زمانی خود را نشان می دهد که ما با کمبود در داده مواجه هستیم. به عبارت دیگر مساله طبقه بندی ما یک مساله با تعداد داده کم (Small Sample Problem) است (موضوع بسیاری از مسائل حوزه سلامت). این جا است که نیاز به روش هایی که استفاده بهینه تری از داده ها دارند، ایجاد و مطرح می شود و این نقطه شروع بحث روی روش های دیگر تخمین خطا همانند تخمین گر Resubstitution، تخمین گر Cross-Validation، تخمین گر Leave-One-Out، تخمین گر Bootstrap خواهد بود. در ادامه تک تک این روشهای مورد بررسی قرار گرفته و نقاط ضعف و قوت هر یک بیان می شود. نتیجه گیری و خلاصه سازی بحث، آخرین قسمت از این فرادرس را تشکیل می دهد. توجه کنید که در این فرادرس به مباحث تئوری مرتبط با هر روش تخمین خطای کلاسیفایر پرداخته شده و به نحوه پیاده سازی و کدنویسی هر یک از آن ها اشاره می شود. اما کدنویسی و پیاده سازی در قالب نوشتن کد هر یک از روش ها جزو اهداف آموزشی این فرادرس نیست.