حفظ جواب با یادگیری فرق دارد
دانشآموزی که جواب امتحان را حفظ کرده ممکن است نمره خوب بگیرد، ولی مسئله تازه را حل نکند. انتخاب تنظیمات ربات از بهترین نتیجه گذشته همین خطر را دارد. امروز داده انتخاب را از داده ارزیابی جدا میکنیم. جدولها فرضیاند و عکسها زمینه بصریاند. نمودار سود بهتنهایی نشان نمیدهد برنامه در شرایط تازه چه میکند. سؤال این است: آیا ارزیابی واقعاً از تصمیمهایی که برای انتخاب تنظیمات گرفتهایم مستقل بوده است؟
توسعه و ارزیابی را جدا کن
مرز را از قبل بنویس
در مثال آموزشی، دوازده ماه را به هشت ماه توسعه و چهار ماه ارزیابی تقسیم میکنیم. این نسبت مناسب همه نیست؛ مهم ثبت مرز و دلیل آن قبل از دیدن نتیجه است. داده گرمکردن اندیکاتور و معامله عبوری از مرز هم قاعده لازم دارند. اگر بارها ارزیابی را برای اصلاح تنظیمات نگاه کنی، دیگر امتحان نهایی دستنخورده نیست. اسم آزمون باید استفاده واقعی از داده را نشان دهد. مرزها و تمام تغییرها را نگه دار.
مثال: ۸ ماه توسعه + ۴ ماه ارزیابی
سه گزینه و یک معیار
سه گزینه فرضی داریم. الف سود هشت و افت نه واحد دارد؛ ب سود شش و افت سه؛ پ سود پنج و افت دو. قبل از اجرا نوشتهایم افت بیشتر از چهار رد شود و سپس بیشترین سود بین باقیماندهها انتخاب شود. الف رد و ب انتخاب میشود. اگر بعد از دیدن جدول معیار را به نفع الف تغییر دهیم، این دیگر همان آزمایش نیست. شرط انتخاب و نتایج ردشده نیز باید در گزارش دیده شوند.
A: سود8، افت9 B: سود6، افت3 C: سود5، افت2 → B
بعد از انتخاب ثابت نگه دار
نسخه انتخابشده را با تنظیمات ثبتشده ارزیابی میکنیم. اگر نتیجه بد شد، نباید بیسروصدا گزینه بهتر روی همان بخش را جایگزین و فقط آن را نمایش بدهیم. پژوهش تازه ممکن است، ولی باید بنویسیم این داده در انتخاب دخالت کرده است. آزمون بعدی دوباره طراحی میشود. نتیجه نامطلوب هم مدرک تصمیم است. حذفش گزارش را زیباتر میکند، نه برنامه را قابل اعتمادتر. فهرست آزمایشهای انجامشده بخشی از شواهد است.
نسخه را ثابت کن شکست ارزیابی را پنهان نکن
فوروارد تاریخی و دمو
فوروارد در تستر متاتریدر میتواند بخش بعدی داده تاریخی باشد. اجرای رو به جلو در دمو از امروز به بعد مشاهده جمع میکند. این دو یک چیز نیستند و پرسش متفاوتی دارند. داده، هزینه و رفتار سفارش را روشن بنویس. موفقیت خارج از نمونه، کنترل قطع اتصال یا سود آینده را تضمین نمیکند. اعتبارسنجی مجموعه شواهد است، نه یک برچسب. اگر چند خروجی فوروارد را مقایسه و بهترین را انتخاب کنی، همان انتخاب را نیز باید گزارش کنی.
فوروارد تاریخی ≠ دمو آینده
تعداد انتخابها را ثبت کن
آزمایش صدها ترکیب به نویز گذشته فرصت بیشتری میدهد که جذاب دیده شود. تعداد آزمون، تغییر دستی و معیارها را ثبت کن. ناحیه تنظیمات با رفتار مشابه میتواند از یک نقطه درخشان قابل بررسیتر باشد، ولی اثبات نیست. تغییر کنترلشده و آزمون حذف نشان میدهد نتیجه به کدام تصمیم وابسته است. هدف کاهش ناشناختههاست، نه ساختن تضمین آینده. تعداد پارامتر کمتر هم بهتنهایی کافی نیست؛ روش انتخاب و استفاده از داده مهم است.
تعداد آزمون + تغییرهای دستی یک نقطه درخشان = سؤال بیشتر
تمرین و پاسخ
جدول سه گزینه را حل کن: افت حداکثر چهار، سپس بیشترین سود؛ پاسخ ب است. ستون ارزیابی جدا اضافه کن و نتیجه منفی را هم حفظ کن. در فایل تمرین مرز، معیار، نسخه و استفاده مجدد از داده ثبت میشود. برای شکست توضیح بده ادامه، اصلاح یا توقف چرا مناسبتر است. جلسه بعد سراغ دمو، سفارش تکراری و قطع ارتباط میرویم. این تمرین فقط چارچوب بررسی را آموزش میدهد و هیچ سودی را پیشبینی نمیکند.
پاسخ انتخاب: B مرز + معیار + نسخه + سابقه