چرا دقت بالا همیشه به معنی مدل خوب نیست؟

اعتبارسنجی مکانی در یادگیری ماشین برای بررسی توان مدل در پیش‌بینی موقعیت‌های تازه اهمیت دارد. در داده‌های جغرافیایی، نمونه‌های نزدیک ممکن است ویژگی و پاسخ مشابه داشته باشند. اگر نمونه‌های بسیار نزدیک در آموزش و آزمون پخش شوند، مدل با آزمونی آسان‌تر از کاربرد واقعی روبه‌رو می‌شود. دقت گزارش‌شده می‌تواند بالا باشد، در حالی که مدل در منطقه جدید عملکرد ضعیف‌تری دارد.

این مسئله در طبقه‌بندی کاربری زمین، برآورد آلودگی، پیش‌بینی فرونشست و مدل‌سازی کشاورزی دیده می‌شود. هدف این آموزش، معرفی یک چارچوب ارزیابی قابل دفاع است. قرار نیست همه پروژه‌ها را با یک روش یکسان بسنجیم؛ روش ارزیابی باید با محل و زمان استفاده آینده هماهنگ باشد. مثال‌ها فرضی و آموزشی‌اند و عدد عملکرد واقعی برای هیچ منطقه‌ای ادعا نمی‌کنند.

اول مشخص کنید مدل کجا استفاده خواهد شد

پیش از تقسیم داده، سؤال کاربردی را بنویسید. آیا مدل قرار است نقاط جدید در همان منطقه را پیش‌بینی کند؟ آیا قرار است به شهر یا حوضه دیگری منتقل شود؟ آیا هدف پیش‌بینی سال بعد است؟ این سه کاربرد به آزمون‌های متفاوتی نیاز دارند.

اگر قرار است مدل بیرون از محدوده آموزش استفاده شود، تقسیم تصادفی ممکن است شرایط انتقال را بازنمایی نکند. اگر هدف آینده است، ترتیب زمانی اهمیت دارد. در برخی پروژه‌ها باید جداسازی مکانی و زمانی را ترکیب کنید. تعریف کاربرد، مبنای انتخاب روش ارزیابی است. بدون آن، مقایسه چند عدد دقت می‌تواند گمراه‌کننده باشد. در گزارش، کاربرد مورد انتظار را پیش از معرفی الگوریتم توضیح دهید تا مخاطب بداند آزمون چه توانایی را می‌سنجد.

خودهمبستگی مکانی چگونه آزمون را تحت تأثیر قرار می‌دهد؟

خودهمبستگی مکانی یعنی مقادیر یا ویژگی‌های نزدیک از نظر مکان می‌توانند به هم وابسته باشند. وجود این رابطه برای تحلیل مکانی مهم است، اما استقلال ساده نمونه‌ها را زیر سؤال می‌برد. دو پیکسل مجاور از یک تصویر، الزاماً دو مشاهده کاملاً مستقل نیستند.

اگر هر دو پیکسل در دو بخش آموزش و آزمون باشند، مدل ممکن است از شباهت شدید همسایگی بهره ببرد. این شرایط با پیش‌بینی در یک منطقه دور متفاوت است. درجه و دامنه وابستگی را با شناخت پدیده و تحلیل اکتشافی بررسی کنید. فاصله جداسازی نباید فقط بر اساس اندازه پیکسل انتخاب شود؛ فرایند موضوعی ممکن است در مقیاس بسیار بزرگ‌تری وابستگی ایجاد کند. هدف، ساخت آزمونی نزدیک‌تر به وضعیت واقعی استفاده است.

نشت داده فقط تکرار یک رکورد نیست

نشت داده زمانی رخ می‌دهد که اطلاعاتی خارج از شرایط مجاز آموزش، به فرایند یادگیری یا انتخاب مدل راه پیدا کند. تکرار یک نمونه در آموزش و آزمون یک نمونه روشن است، اما نشت می‌تواند از پیش‌پردازش، انتخاب ویژگی یا تنظیم پارامترها نیز ایجاد شود.

برای مثال، اگر مقیاس‌بندی متغیرها با همه داده‌ها قبل از تقسیم انجام شود، اطلاعات آزمون وارد محاسبه شده است. اگر بهترین ویژگی‌ها با مشاهده پاسخ همه نمونه‌ها انتخاب شوند، ارزیابی مستقل نیست. داده‌های مشتق‌شده از متغیر هدف نیز باید بررسی شوند. یک نقشه یا شاخص که پس از زمان پیش‌بینی تولید شده، ممکن است در کاربرد واقعی در دسترس نباشد. فهرست ویژگی‌ها را از نظر زمان تولید و منشأ اطلاعات بازبینی کنید.

تقسیم تصادفی چه زمانی مفید است؟

تقسیم تصادفی ساده و برای برخی اهداف مناسب است، اما باید بدانید چه سؤال را پاسخ می‌دهد. اگر هدف ارزیابی در میان نمونه‌هایی با شرایط مشابه مجموعه موجود باشد، می‌تواند یک خط مبنای مفید ارائه کند. با این حال، نتیجه آن را نباید خودکار به تعمیم جغرافیایی گسترده نسبت دهید.

یک رویکرد روشن این است که تقسیم تصادفی را همراه یک ارزیابی مکانی گزارش کنید و تفاوت آن‌ها را توضیح دهید. اگر اختلاف زیاد است، درباره وابستگی نمونه‌ها و دشواری انتقال بحث کنید. تفاوت عددها، به خودی خود اثبات خطا در یکی از روش‌ها نیست؛ ممکن است دو آزمون توانایی‌های متفاوتی را بسنجند. نام روش و هدف آن باید کنار مقدار عملکرد نوشته شود.

بلوک‌بندی مکانی چیست؟

در بلوک‌بندی، محدوده به گروه‌های مکانی تقسیم می‌شود و بخش‌هایی برای آزمون کنار گذاشته می‌شوند. نمونه‌های یک گروه معمولاً با هم به یک بخش تخصیص می‌یابند تا پخش‌شدن نزدیک‌ترین همسایه‌ها کاهش یابد. طراحی بلوک‌ها می‌تواند با شبکه، مناطق طبیعی یا واحدهای کاربردی انجام شود.

اندازه و شکل بلوک‌ها بر نتیجه اثر می‌گذارد. بلوک خیلی کوچک ممکن است جداسازی کافی ایجاد نکند؛ بلوک بسیار بزرگ ممکن است تعداد گروه‌ها را کم کند یا کلاس‌های خاص را از آموزش حذف نماید. انتخاب باید با دامنه وابستگی، تراکم نمونه و کاربرد مدل هماهنگ باشد. نقشه گروه‌ها را در گزارش نشان دهید. ارزیاب باید بتواند ببیند کدام مناطق آموزش و کدام آزمون بوده‌اند و آیا پوشش مناسب وجود دارد.

فاصله حائل میان آموزش و آزمون

در بعضی طراحی‌ها، ناحیه حائل میان نمونه‌های آزمون و آموزش در نظر گرفته می‌شود. هدف، کاهش نزدیکی مستقیم است. این روش می‌تواند آزمون را به انتقال مکانی نزدیک‌تر کند، اما بخشی از داده آموزش را کنار می‌گذارد و ممکن است توزیع نمونه‌ها را تغییر دهد.

فاصله حائل را بدون توجیه انتخاب نکنید. چند مقدار منطقی را بررسی کنید و اثر آن بر تعداد نمونه‌ها و عملکرد را گزارش دهید. اگر با افزایش فاصله، عملکرد کاهش می‌یابد، این نتیجه درباره محدودیت تعمیم مکانی مدل اطلاعات می‌دهد. نباید فاصله را صرفاً برای رسیدن به عدد دقت مطلوب تنظیم کنید. معیار انتخاب باید پیش از نگاه به نتیجه نهایی روشن باشد یا فرایند انتخاب به شکل مستقل انجام شود.

جداسازی داده‌ها در سطح واحد واقعی

گاهی چند رکورد به یک واحد واقعی تعلق دارند؛ مثلاً چند پیکسل از یک قطعه کشاورزی، چند تصویر از یک ساختمان یا چند زمان از یک ایستگاه. تقسیم رکوردها بدون توجه به این گروه‌ها ممکن است اطلاعات همان واحد را در آموزش و آزمون پخش کند.

شناسه گروه را نگه دارید و تقسیم را در سطح مناسب انجام دهید. اگر هدف پیش‌بینی قطعات جدید است، نمونه‌های یک قطعه باید با هم تخصیص یابند. اگر هدف زمان جدید در ایستگاه‌های موجود است، طراحی متفاوتی لازم است. سطح استقلال را با سؤال پژوهش هماهنگ کنید. راهنمای ذخیره و تحویل داده GIS نشان می‌دهد چرا شناسه پایدار برای مدیریت رابطه نمونه‌ها مهم است.

پیش‌پردازش باید داخل هر دور آموزش انجام شود

جایگزینی مقدارهای خالی، مقیاس‌بندی، انتخاب ویژگی و سایر مراحل یادگیری‌پذیر باید با داده آموزش همان دور تنظیم شوند. سپس همان تبدیل روی آزمون اعمال شود. انجام این مراحل روی کل مجموعه، پیش از ارزیابی، استقلال آزمون را تضعیف می‌کند.

مسیر پردازش را به صورت یک زنجیره روشن طراحی کنید. هر مرحله باید ورودی، پارامتر و خروجی مشخص داشته باشد. اگر از چند الگوریتم استفاده می‌کنید، پیش‌پردازش مورد نیاز آن‌ها را جداگانه بررسی کنید. نگهداری تنظیمات هر دور کمک می‌کند علت تفاوت نتایج مشخص شود. اگر تعداد نمونه کم است، حساسیت به پیش‌پردازش می‌تواند زیاد باشد؛ این محدودیت را در گزارش ذکر کنید و از پنهان کردن دورهای ناموفق پرهیز کنید.

تنظیم پارامتر با آزمون نهایی فرق دارد

آزمون نهایی باید برای ارزیابی باقی بماند، نه برای انتخاب مکرر مدل. اگر ده‌ها تنظیم را روی یک مجموعه آزمون بررسی و بهترین را انتخاب کنید، آن مجموعه عملاً در تصمیم یادگیری نقش گرفته است. عدد نهایی دیگر همان استقلال اولیه را ندارد.

برای انتخاب پارامتر، از تقسیم‌های داخلی آموزش استفاده کنید و ارزیابی نهایی را جدا نگه دارید. در طراحی‌های پیچیده، اعتبارسنجی تو در تو می‌تواند این تفکیک را روشن کند. روش داخلی نیز باید با ساختار مکانی داده تناسب داشته باشد. جزئیات انتخاب الگوریتم و دامنه پارامترها را ثبت کنید. گزارش فقط بهترین عدد، بدون توضیح تعداد آزمون‌ها، تصویر کاملی از فرایند ارائه نمی‌دهد.

معیار مناسب برای رگرسیون

در مسئله پیوسته، خطا را با معیارهایی متناسب با کاربرد بسنجید. خطای مطلق میانگین به اندازه معمول اختلاف اشاره می‌کند و ریشه میانگین مربع خطا به خطاهای بزرگ حساس‌تر است. واحد معیار باید همان واحد پاسخ یا به شکلی روشن قابل تفسیر باشد.

سوگیری را نیز بررسی کنید. مدلی ممکن است خطای متوسط قابل قبول داشته باشد ولی در مقادیر بزرگ مرتباً کم‌برآورد کند. نمودار مقدار مشاهده‌شده و پیش‌بینی‌شده، توزیع باقیمانده‌ها و نقشه خطا را ببینید. معیار تجمیعی می‌تواند تفاوت عملکرد مناطق را پنهان کند. اگر تصمیم پروژه به نقاط بحرانی وابسته است، عملکرد در آن دامنه را جداگانه گزارش کنید. هدف، انتخاب عددی است که اثر خطا را برای کاربرد واقعی روشن کند.

معیار مناسب برای طبقه‌بندی

در طبقه‌بندی، دقت کلی به تنهایی کافی نیست؛ به ویژه وقتی فراوانی کلاس‌ها متفاوت است. مدلی که کلاس غالب را خوب تشخیص می‌دهد ممکن است کلاس کمیاب ولی مهم را از دست بدهد. ماتریس خطا و معیارهای هر کلاس را بررسی کنید.

برای کاربردی مانند شناسایی ناحیه پرخطر، هزینه خطای از دست دادن و هشدار اشتباه متفاوت است. انتخاب آستانه تصمیم باید این تفاوت را در نظر بگیرد. اگر احتمال خروجی مدل را گزارش می‌کنید، تفسیر آن را نیز بررسی کنید و احتمال را صرفاً با امتیاز الگوریتم یکسان ندانید. توزیع کلاس‌ها در هر بخش مکانی را ثبت کنید؛ یک دور که یک کلاس را در آموزش ندارد، به توضیح جداگانه نیاز دارد.

مثال آموزشی کشاورزی دقیق

فرض کنید می‌خواهید عملکرد محصول را از ویژگی‌های مکانی و زمانی پیش‌بینی کنید. چند نمونه از هر مزرعه دارید و مزارع در چند منطقه قرار گرفته‌اند. اگر نمونه‌های یک مزرعه در آموزش و آزمون پخش شوند، مدل از شرایط همان مزرعه اطلاعات زیادی دارد.

اگر هدف استفاده در مزرعه جدید است، تقسیم را در سطح مزرعه یا گروه مکانی مناسب طراحی کنید. اگر هدف انتقال به منطقه دیگر است، یک منطقه را برای آزمون مستقل کنار بگذارید. ویژگی‌هایی که پس از برداشت تولید شده‌اند را برای پیش‌بینی پیش از برداشت استفاده نکنید. این مثال نشان می‌دهد زمان دسترسی ویژگی و واحد تقسیم باید همزمان مشخص شوند. نتیجه آموزش در یک منطقه، بدون آزمون انتقال، تضمین عملکرد در منطقه دیگر نیست.

مثال آموزشی طبقه‌بندی کاربری

در طبقه‌بندی تصویر، نمونه‌های آموزشی ممکن است به صورت چندضلعی جمع‌آوری شوند. پیکسل‌های داخل یک چندضلعی به شدت مشابه‌اند. تقسیم تصادفی همه پیکسل‌ها می‌تواند آزمون را آسان کند، زیرا مدل نمونه‌های نزدیک و هم‌موضوع را قبلاً دیده است.

نمونه‌ها را در سطح قطعه یا نواحی مکانی مستقل تقسیم کنید. مرزها و مناطق مختلط را جداگانه بررسی کنید. پیش از تحلیل، هم‌ترازی رسترها را کنترل کنید تا اختلاف هندسی با خطای مدل اشتباه نشود. برچسب مرجع باید مستقل و دارای کیفیت مشخص باشد. اگر مرجع خود از همان تصویر و همان روش مشتق شده است، درباره وابستگی ارزیابی توضیح دهید و از ادعای استقلال کامل خودداری کنید.

نقشه خطا و ناحیه خارج از دامنه

پس از ارزیابی، خطاها را روی نقشه ببینید. تجمع خطا در یک منطقه می‌تواند به کمبود نمونه، تفاوت محیطی یا ویژگی حذف‌شده مربوط باشد. نقشه خطا مکمل معیار کلی است و به طراحی نمونه‌برداری بعدی کمک می‌کند.

همچنین مناطقی را مشخص کنید که ویژگی‌های آن‌ها بیرون از دامنه آموزش‌اند. مدل ممکن است در این مناطق برون‌یابی کند و عدم قطعیت بیشتری داشته باشد. نمایش یک نقشه پیش‌بینی بدون اشاره به پوشش آموزش، می‌تواند اعتماد بیش از حد ایجاد کند. محدودیت انتقال را به زبان کاربردی بیان کنید: برای کدام محیط‌ها شواهد ارزیابی داریم و برای کدام نداریم. این توضیح باید همراه خروجی بماند، نه فقط در یادداشت داخلی تحلیلگر.

چک‌لیست گزارش پژوهش

روش تقسیم، سطح گروه‌بندی، اندازه بلوک، فاصله حائل، تعداد دورها و توزیع کلاس‌ها را بنویسید. توضیح دهید پیش‌پردازش چگونه در هر دور انجام شده و پارامترها با کدام داده انتخاب شده‌اند. معیارها را با واحد و پراکندگی میان دورها گزارش کنید.

اگر برای مقاله علمی کار می‌کنید، راهنمای مقاله نویسی GIS به تنظیم گزارش روش کمک می‌کند. کد، تنظیمات و نسخه داده را در حد مجاز نگه دارید. عدد عملکرد باید به طراحی آزمون مرتبط شود؛ عبارت «دقت مدل» بدون توضیح شرایط آزمون ناقص است. گزارش محدودیت‌ها نشانه ضعف کار نیست؛ به مخاطب کمک می‌کند خروجی را در همان دامنه‌ای استفاده کند که شواهد آن وجود دارد.

پرسش‌های متداول و تمرین پیشنهادی

آیا اعتبارسنجی مکانی همیشه عدد پایین‌تری می‌دهد؟ چنین نتیجه‌ای را نباید از پیش قطعی بدانید؛ طراحی و داده تعیین‌کننده‌اند. آیا تقسیم تصادفی غلط است؟ برای برخی اهداف مفید است، اما باید محدودیت تعمیم آن روشن باشد. آیا اندازه بلوک ثابت برای همه پروژه‌ها وجود دارد؟ خیر؛ به وابستگی، تراکم نمونه و کاربرد بستگی دارد.

برای تمرین، یک مدل ساده را با تقسیم تصادفی و تقسیم گروهی مکانی اجرا کنید و نقشه گروه‌ها را نگه دارید. تفاوت معیارها و توزیع خطا را توضیح دهید. برای طراحی پروژه کاربردی، نیازسنجی GIS و مشاوره GIS و سنجش از دور می‌توانند به روشن شدن هدف پیش‌بینی و روش ارزیابی کمک کنند.

مطالب مرتبط

منابع و مستندات

مستندات ارزیابی پیش‌بینی با اعتبارسنجی در ArcGIS Pro

بدون دیدگاه

دیدگاهتان را بنویسید