مبدأ الانحدار الخطي (linear regression)
سحابة نقاط، وخط يلائمها
كثيرا ما يبدأ التعلم الآلي بمسألة بسيطة جدا: لدينا جدول بيانات، ونريد التنبؤ بقيمة انطلاقا من قيمة أخرى.
لنأخذ مثالا ملموسا. إليك وزن (بالآلاف من الأرطال) واستهلاك الوقود (بالميل لكل غالون، MPG) لسبع سيارات:
| الوزن (x1) | الاستهلاك الفعلي (MPG) |
|---|---|
| 3.50 | 18 |
| 3.69 | 15 |
| 3.44 | 18 |
| 3.43 | 16 |
| 4.34 | 15 |
| 4.42 | 14 |
| 2.37 | 24 |
نلاحظ اتجاها واضحا: كلما زاد وزن السيارة قلّ عدد الأميال لكل غالون. يبحث نموذج الانحدار الخطي (linear regression) عن خط يلخص هذا الاتجاه، بالصيغة:
y' = b + w1 * x1حيث y' هي القيمة المتوقَّعة، وx1 هي المدخل (هنا الوزن)، وw1 هو الوزن (weight) الذي يتعلمه النموذج (ميل الخط)، وb هو الانحياز (bias) (نقطة تقاطع الخط مع المحور).
نموذج مدرَّب على هذه البيانات
بملاءمة خط على سحابة النقاط هذه، يمكن الحصول مثلا على:
y' = 34 + (-4.6) * x1هنا b = 34 وw1 = -4.6. الوزن السالب يعكس بالضبط ما نلاحظه: كل ألف رطل إضافي يخفّض الاستهلاك المتوقَّع بمقدار 4.6 MPG.
لنأخذ سيارة وزنها 4000 رطل، إذن x1 = 4:
y' = 34 + (-4.6 * 4)
y' = 34 - 18.4
y' = 15.6يتوقّع النموذج نحو 15.6 MPG لهذه السيارة. يمكنك إعادة هذا الحساب بقلم عادي: هذا كل ما يفعله نموذج الانحدار الخطي، في كل تنبؤ.
لماذا خط، لا رقم واحد؟
الخط يلتقط علاقة، لا حالة معزولة. فبدلا من حفظ سبعة أزواج من القيم، يتعلم النموذج قاعدة عامة (ميل ونقطة تقاطع) يمكنها بعد ذلك التنبؤ باستهلاك سيارة لم تكن في الجدول الأصلي. هذا هو الوعد الأساسي للتعلم الآلي الموجَّه (supervised machine learning): التعميم انطلاقا من أمثلة.
والسؤال المفتوح الذي يعالجه الدرس التالي هو: كيف نعرف أن b = 34 وw1 = -4.6 قيمتان جيدتان، بدل b = 20 وw1 = -1 مثلا؟
جرّب بنفسك
باستخدام النموذج y' = 34 + (-4.6) * x1، ما الاستهلاك الذي يتوقعه هذا النموذج لسيارة وزنها 3000 رطل (x1 = 3)؟
التصحيح: y' = 34 + (-4.6 * 3) = 34 - 13.8 = 20.2 MPG.للتذكر: نموذج انحدار خطي بسيط يختصر في رقمين، وزن وانحياز، يُطبَّقان عبر معادلة يمكنك حسابها يدويا.