Le principe de la régression linéaire
Un nuage de points, une droite qui s'ajuste
Le machine learning commence souvent par un problème très simple : on a un tableau de données, et on veut prédire une valeur à partir d'une autre.
Prenons un exemple concret. Voici le poids (en milliers de livres) et la consommation (en miles par gallon, MPG) de sept voitures :
| Poids (x1) | Consommation réelle (MPG) |
|---|---|
| 3,50 | 18 |
| 3,69 | 15 |
| 3,44 | 18 |
| 3,43 | 16 |
| 4,34 | 15 |
| 4,42 | 14 |
| 2,37 | 24 |
On voit une tendance : plus une voiture est lourde, moins elle fait de miles par gallon. Un modèle de régression linéaire cherche une droite qui résume cette tendance, de la forme :
y' = b + w1 * x1où y' est la valeur prédite, x1 est la donnée d'entrée (ici le poids), w1 est le poids appris par le modèle (la pente de la droite), et b est le biais (l'ordonnée à l'origine).
Un modèle entraîné sur ces données
En ajustant une droite sur ce nuage de points, on peut obtenir par exemple :
y' = 34 + (-4.6) * x1Ici b = 34 et w1 = -4.6. Le poids négatif traduit exactement ce qu'on observe : chaque millier de livres supplémentaire fait baisser la consommation prédite de 4,6 MPG.
Prenons une voiture de 4 000 livres, donc x1 = 4 :
y' = 34 + (-4.6 * 4)
y' = 34 - 18.4
y' = 15.6Le modèle prédit environ 15,6 MPG pour cette voiture. Tu peux refaire ce calcul avec un simple crayon : c'est tout ce qu'un modèle de régression linéaire fait, à chaque prédiction.
Pourquoi une droite, et pas un chiffre unique ?
Une droite capture une relation, pas un cas isolé. Au lieu de mémoriser sept couples de valeurs, le modèle apprend une règle générale (une pente et une ordonnée à l'origine) qui peut ensuite prédire la consommation d'une voiture qui n'était pas dans le tableau de départ. C'est la promesse centrale du machine learning supervisé : généraliser à partir d'exemples.
La question qui reste ouverte, et qu'on traite dans la leçon suivante, est : comment sait-on que b = 34 et w1 = -4.6 sont de bonnes valeurs, plutôt que b = 20 et w1 = -1 ?
À toi
Avec le modèle y' = 34 + (-4.6) * x1, quelle consommation ce modèle prédit-il pour une voiture de 3 000 livres (x1 = 3) ?
Correction : y' = 34 + (-4.6 * 3) = 34 - 13.8 = 20.2 MPG.À retenir : un modèle de régression linéaire simple se résume à deux nombres, un poids et un biais, appliqués à une formule que tu peux calculer à la main.