AWS AI Practitioner - Fondamentaux de l'IA et du ML
🎯 Objectifs
Ce module couvre le domaine Fondamentaux de l'IA et du ML (22% de l'examen). Tu vas :
- ✅ Comprendre les concepts fondamentaux du machine learning
- ✅ Distinguer l'apprentissage supervisé, non-supervisé et par renforcement
- ✅ Connaître les types de problèmes ML courants (classification, régression, clustering)
- ✅ Apprendre les métriques d'évaluation essentielles
- ✅ Identifier les défis du ML (overfitting, underfitting, qualité des données)
📋 Prérequis
- Avoir complété le module AWS AI Practitioner - Guide Complet
- Compréhension générale des données et statistiques
- Pas besoin d'expertise en programmation
📖 Les 3 types d'apprentissage
1️⃣ Apprentissage Supervisé (Supervised Learning)
Pourquoi ?
Tu as besoin de prédire quelque chose basé sur des données historiques. Par exemple :
- Prédire le prix d'une maison
- Classifier un email comme spam ou pas spam
- Diagnostiquer une maladie
Concept
Dans l'apprentissage supervisé, tu fournis au modèle des exemples avec les réponses correctes. Le modèle apprend à reproduire ce pattern.
Analogie : C'est comme apprendre à un enfant à reconnaître les fruits. Tu lui montres des images de pommes en disant "c'est une pomme", des oranges en disant "c'est une orange", etc. Après de nombreux exemples, il peut reconnaître un fruit qu'il n'a jamais vu.
Deux sous-catégories
Régression - Prédire une valeur numérique continue
- Prédire le prix d'une maison → [500,000€]
- Prédire la température demain → [22°C]
- Prédire les ventes du trimestre → [1,500,000€]
Classification - Prédire une catégorie discrète
- Email = Spam ou Pas Spam (2 classes)
- Sentiment = Positif, Négatif ou Neutre (3 classes)
- Diagnostic = Maladie A, Maladie B, Pas de maladie (3 classes)
2️⃣ Apprentissage Non-Supervisé (Unsupervised Learning)
Pourquoi ?
Tu as besoin de découvrir des patterns cachés dans les données, sans avoir des réponses correctes pour chaque exemple.
Concept
Le modèle explore les données tout seul et trouve des groupes naturels ou des structures.
Analogie : Imagine une boîte de fruits mélangés (pommes, oranges, bananes) et un enfant qui ne connaît rien aux fruits. Il va naturellement les regrouper par couleur, taille ou forme, sans qu'on lui dise "c'est un groupe".
Clustering (Regroupement)
Le modèle regroupe les données similaires ensemble.
Exemples réels :
- Segmenter les clients par comportement d'achat
- Identifier les groupes de mots similaires en traitement de texte
- Détecter les sous-groupes dans une population
Algorithmes courants : K-Means, DBSCAN, Hierarchical Clustering
Réduction de dimension
Transformer des données complexes en dimensions réduites pour mieux les visualiser ou les traiter.
Exemples réels :
- Visualiser 100 variables en 2-3 dimensions
- Réduire la taille des images avant traitement
Algorithmes courants : PCA (Principal Component Analysis), t-SNE
3️⃣ Apprentissage par Renforcement (Reinforcement Learning)
Pourquoi ?
Tu veux qu'un agent apprenne par essai-erreur, en maximisant une récompense.
Concept
L'agent prend des actions, reçoit des récompenses ou des pénalités, et apprend à optimiser ses décisions.
Analogie : Dresser un chien. Quand il fait ce qu'on veut, on le récompense. Quand il désobéit, il n'a pas de friandise. Après plusieurs expériences, il apprend le bon comportement.
Cas d'usage
- Robots apprenant à marcher
- Jeux d'IA (AlphaGo, jeux vidéo)
- Optimisation de systèmes de contrôle (voitures autonomes, drones)
💡 L'apprentissage par renforcement est rarement couvert dans cette certification (focus AWS sur services managés)
📊 Tableau comparatif : Les 3 types d'apprentissage
| Critère | Supervisé | Non-supervisé | Par Renforcement |
|---|---|---|---|
| Données d'entrée | Données + Réponses correctes | Données seules | Observations + Récompenses |
| Objectif | Prédire ou classifier | Découvrir des patterns | Apprendre une stratégie |
| Exemples AWS | SageMaker (entraînement custom) | Personalize (clustering) | Pas couvert en AWS managé |
| Cas d'usage | Prédiction, classification | Segmentation client | Rare en entreprise |
🔍 Métriques d'évaluation
Pour la régression (prédire une valeur)
Mean Absolute Error (MAE) - Erreur moyenne en valeur absolue
- Exemple : Si tu prédis 105€ et le vrai prix est 100€, l'erreur est 5€
- Facile à interpréter : "en moyenne, je me trompe de X€"
Root Mean Square Error (RMSE) - Racine de la moyenne des erreurs au carré
- Pénalise plus les grandes erreurs que MAE
- Utilise : quand les gros écarts sont très coûteux
Pour la classification (prédire une catégorie)
Accuracy (Exactitude) - % de prédictions correctes
- Exemple : 95% des emails sont correctement classés spam/pas spam
- ⚠️ Problème : si 99% des emails ne sont pas spam, un modèle qui dit "pas spam partout" aura 99% d'exactitude
Precision - Parmi les prédictions positives, combien sont vraiment positives ?
- "Si je dis c'est du spam, quelle est la probabilité que ce soit vraiment du spam ?"
- Utiliser quand les faux positifs coûtent cher (ex: bloquer un email important)
Recall - Parmi les vrais positifs, combien je détecte ?
- "Quelle proportion des vrais spams je détecte ?"
- Utiliser quand les faux négatifs coûtent cher (ex: laisser passer du spam)
F1-Score - Moyenne harmonique de Precision et Recall
- Utiliser quand tu veux équilibrer les deux
💡 Concepts clés du ML
Surapprentissage (Overfitting)
Problème : Le modèle apprend par cœur les données d'entraînement, y compris le bruit. Il performe très bien en entraînement mais mal sur des données nouvelles.
Cause : Trop d'exemples d'entraînement utilisés, modèle trop complexe, pas assez de régularisation
Solution :
- Utiliser plus de données variées
- Simplifier le modèle
- Utiliser la régularisation (L1, L2)
- Utiliser la validation croisée
Sous-apprentissage (Underfitting)
Problème : Le modèle est trop simple pour capturer la complexité des données. Il performe mal en entraînement ET en test.
Cause : Modèle trop simple, pas assez de données d'entraînement, features insuffisantes
Solution :
- Augmenter la complexité du modèle
- Ajouter plus de features
- Réduire la régularisation
- Collecter plus de données
Qualité des données
Le principe : "Garbage in, garbage out" (déchets à l'entrée = déchets à la sortie)
Défis courants :
- Données manquantes → Imputations (remplir avec la moyenne, etc.)
- Données incorrectes → Nettoyage et validation
- Données déséquilibrées → Une classe domine (99% négatif, 1% positif) → Techniques de rééquilibrage
- Données biaisées → Certains groupes sous-représentés → Affecte la fairness du modèle
🎓 Processus typique du ML
1. Problème défini
↓
2. Collecte de données
↓
3. Exploration des données (EDA - Exploratory Data Analysis)
↓
4. Nettoyage et préparation
↓
5. Sélection des features (variables pertinentes)
↓
6. Division en train/test
↓
7. Entraînement du modèle
↓
8. Évaluation sur l'ensemble de test
↓
9. Ajustement / Itération ← Revenir à l'étape 5-7
↓
10. Déploiement en production
↓
11. Monitoring et maintenance📚 Concepts clés à retenir pour l'examen
| Concept | Clé de rétention |
|---|---|
| Supervisé | J'ai les réponses pour enseigner au modèle |
| Non-supervisé | Je veux découvrir des patterns, pas prédire |
| Classification | Prédire une catégorie (Spam? Oui/Non) |
| Régression | Prédire un nombre (Prix? 500,000€) |
| Overfitting | Modèle trop bien adapté à l'entraînement → Mauvaise généralisation |
| Validation croisée | Diviser les données en K portions pour tester |
| Accuracy | Simple mais peut être trompeur avec données déséquilibrées |
| Precision vs Recall | Précision = Fiabilité / Recall = Couverture |
📝 Questions type de l'examen
Q1 : Tu dois prédire si un client va acheter ou pas. Quel type d'apprentissage ?
- Réponse : Apprentissage supervisé - Classification (deux classes : achète / n'achète pas)
Q2 : Une entreprise veut segmenter ses clients en groupes pour du marketing ciblé. Quel type d'apprentissage ?
- Réponse : Apprentissage non-supervisé - Clustering (découvrir les groupes naturels)
Q3 : Un modèle a 99% d'exactitude sur l'entraînement mais 60% en test. Quel est le problème ?
- Réponse : Overfitting (le modèle a appris le bruit des données d'entraînement)
🚀 Prochaines étapes
Après maîtriser ce domaine, continue avec :
- AWS AI Practitioner - Services AWS AI/ML
- AWS AI Practitioner - IA Responsable et Éthique
- AWS AI Practitioner - Applications et Considérations
📚 Ressources
- AWS ML Learning Path
- ML Basics - AWS Educate
- Andrew Ng - Machine Learning Specialization (Coursera) - pour approfondissement