1 septembre 2026 · publié par Gianni
DCSS328 Deep Learning – Tendances IA en 2026 (1/2)
Réviser
Fiche de révision
Tous les mots du cours
22 mots, dans l'ordre de la note.
- Question d'ouverture du coursPourquoi une IA peut résoudre des problèmes olympiques de maths, mais galère encore à ranger une chambre ?Le monde réel est bruité, suit des règles physiques continues, exige une action en temps réel et une planification longue, et pose des questions de sécurité — contrairement à un problème à règle simple et réponse claire.
- Les 5 mots-clés de l'IA modernePERCEIVE (images/audio/3D) GENERATE (texte/image/vidéo/mouvement) REASON (chercher/vérifier/réviser) ACT (outils/APIs) INTERACT (mondes/avatars/robots).Boucle agent/environnement (sensors/percepts/actions/effectors).
- Évolution des capacités de l'IA (2012 → 2026)CNN (2012, reconnaître) → Transformer (2017, attention) → Foundation Models (2020, pré-entraînement) → IA générative (2022) → Reasoning / inference-time compute (2024) → Agents (2025) → World / Physical AI (2026).La capacité des modèles est passée de la reconnaissance de motifs à des systèmes qui raisonnent, utilisent des outils et interagissent avec leur environnement.
- Foundation ModelModèle pré-entraîné à grande échelle sur des données massives, puis adapté (prompting, RAG, fine-tuning) à de nombreuses tâches, au lieu d'entraîner un modèle spécifique par tâche.Ancien paradigme : Dataset A → Modèle A → Tâche A (coût d'entraînement répété à chaque fois). Nouveau paradigme : le modèle devient une couche de capacité réutilisable.
- Les 5 couches de la stack IA modernePRETRAIN (représentations générales) → POST-TRAIN (instruction tuning, RL) → ADAPT (prompt / RAG / LoRA) → INFER (raisonnement, recherche, vérification) → SYSTEM (outils, mémoire, environnement, sécurité).L'ingénierie IA moderne consiste à choisir où injecter l'information spécifique à la tâche et où dépenser le calcul, plutôt que de se concentrer uniquement sur la qualité de l'entraînement du modèle.
- Les 4 axes du scaling (mise à l'échelle)Model Scale (nombre de paramètres) Data Scale (qualité/quantité) Training Compute (durée d'entraînement) Inference Compute (calcul au moment de l'usage : échantillonnage, recherche, vérification, outils).Un modèle ne doit pas dépenser le même calcul pour chaque question : réponse rapide pour une question simple, plus de raisonnement pour une question difficile.
- Mixture-of-Experts (MoE)Architecture où un routeur n'active qu'une partie des 'experts' (sous-réseaux) du modèle par requête, au lieu d'utiliser tout le réseau.Plus de capacité totale pour un coût de calcul actif plus faible (paramètres totaux ≠ paramètres actifs). Utile pour le cloud, l'edge, la XR et la robotique.
- Boîte à outils d'adaptation d'un modèlePrompting (changer les instructions) RAG (connaissances externes à l'inférence) LoRA/PEFT (mettre à jour une petite partie des poids) Quantization (réduire mémoire/calcul) Distillation (transférer vers un modèle plus petit) Routing (choisir le bon modèle/budget).Ce ne sont que des outils : on choisit où injecter l'information selon le problème et les contraintes système, pas une hiérarchie figée.
- SOTA (State of the Art) et fiabilité des benchmarksLe SOTA (état de l'art) ne peut pas être défini par un seul chiffre : les benchmarks deviennent plus durs, saturent avec le temps, et certains contiennent des questions invalides (taux d'erreur observé de 2% à 42% selon les benchmarks).L'état de l'art dépend du benchmark ET du protocole d'évaluation utilisé.
- Jagged Intelligence (intelligence 'en dents de scie')Un même système peut être extraordinaire sur une tâche (médaille d'or aux Olympiades de maths 2025 avec Gemini Deep Think) et étonnamment faible sur une autre (lire une horloge analogique : 50,6% pour la meilleure IA vs 90,1% pour l'humain sur ClockBench).Ne jamais déduire une compétence générale à partir d'une seule démonstration spectaculaire.
- Fast response vs Deliberate responseRéponse rapide : une seule génération directe, bien pour les tâches routinières. Réponse délibérée : propose → teste → révise → vérifie ; dépense plus de calcul quand la difficulté ou l'incertitude est élevée.Le raisonnement peut être vu comme une stratégie d'inférence : dépenser plus de calcul quand le problème le nécessite.
- Train-Time Scaling vs Test-Time ScalingTrain-time : plus de pré-entraînement / RL / post-training → une meilleure politique avant déploiement. Test-time : plus de recherche / échantillonnage / vérification / outils au moment de la requête → potentiellement une meilleure réponse pour CETTE requête précise.Question clé : combien de calcul faut-il allouer à cette requête spécifique ?
- Le raisonnement comme boucle systèmeUn 'raisonneur' moderne orchestre génération, vérification, outils et retries sélectifs : un Générateur propose une solution, un Vérificateur la contrôle, un Réviseur corrige si besoin.(exemple : Aletheia de Google DeepMind, agent de recherche en mathématiques).
- Limites du raisonnement (5 points)1) Vérification erronée (un vérificateur confiant peut valider un chemin faux) 2) Calcul excessif (plus de tokens sans meilleure qualité) 3) Erreur d'outil (browsing/code/API qui échoue) 4) Problèmes de benchmark (fuite, ambiguïté) 5) Monitorabilité limitée (les traces de raisonnement interne restent un sujet de recherche actif pour la sécurité).
- IA multimodale nativeAvant : modules séparés par modalité (encodeur image → texte, ASR → LLM → TTS, vidéo → captioner), avec latence/erreurs possibles à chaque conversion. Aujourd'hui : texte + image + audio + vidéo + code partagent une seule couche de raisonnement/outils, sans forcément tout convertir en texte d'abord.
- Historique de la génération d'images/vidéosGAN (2014, entraînement adversarial) → Diffusion (2020, débruitage inverse) → Diffusion latente (2022, génération dans un espace compressé) → hybrides Flow/AR (2024) → World Models (2025-26, génération conditionnée par des actions).Trajectoire globale : échantillons statiques → séquences cohérentes → environnements conditionnés par l'action.
- Fidélité visuelle vs comportement physique (génération vidéo)Le réalisme visuel (images nettes, cohérence temporelle, qualité cinématique) et la 'justesse du monde' (flottaison, collisions, navigation persistante) ne sont pas la même chose.La génération vidéo devient un problème d'apprentissage du monde : la vraie question est de savoir si la vidéo reflète le comportement du monde, pas juste si elle est belle (ex : NVIDIA Veo).
- SAM (Segment Anything Model)Modèle de perception 'promptable' : on peut isoler n'importe quel objet dans une image/vidéo via du texte, un point/une boîte, ou un exemplaire. SAM 3/3.1 ajoute detect → segment → track.Illustre comment un modèle spécialiste (perception) devient un outil appelable à l'intérieur d'un système agentique plus large.
- Workflow vs AgentWorkflow : chemins prédéfinis (if/else), prévisible, debuggable, peu coûteux. Agent : décisions dynamiques (le modèle choisit lui-même l'outil et l'approche), flexible et adaptatif, mais plus coûteux et imprévisible.Les agents ne sont pas automatiquement meilleurs : utiliser le système le plus simple qui suffit à la tâche.
- Boucle d'agent minimaleSense/Observe (collecter les entrées de l'environnement) → Think (interpréter et choisir une action) → Act (exécuter l'action : appel API, génération, outil) → Learn/Reflect (améliorer via le feedback) → retour à Sense.
- Pourquoi utiliser plusieurs agents ?Pour les tâches complexes : un agent 'lead' décompose le problème, l'assigne à des agents spécialistes (recherche, code, critique) puis intègre les résultats.Bénéfices : exploration parallèle, spécialisation, vérifications indépendantes. Coûts : coordination, duplication de contexte, propagation d'erreurs.
- Modes de défaillance des agentsDérive de planification (perte de l'objectif initial) Erreurs qui s'accumulent (irréversibles en aval) Mauvaise utilisation d'un outil Explosion des coûts (boucles/retries) Sécurité (injection de prompt, exfiltration) Évaluation difficile (le succès d'une tâche est plus dur à mesurer que la précision next-token).Les agents en production ont besoin de permissions, de sandboxes, d'un état observable, de conditions d'arrêt et de vérifications déterministes quand c'est possible.
| Question d'ouverture du cours | Pourquoi une IA peut résoudre des problèmes olympiques de maths, mais galère encore à ranger une chambre ?Le monde réel est bruité, suit des règles physiques continues, exige une action en temps réel et une planification longue, et pose des questions de sécurité — contrairement à un problème à règle simple et réponse claire. | ||
| Les 5 mots-clés de l'IA moderne | PERCEIVE (images/audio/3D) GENERATE (texte/image/vidéo/mouvement) REASON (chercher/vérifier/réviser) ACT (outils/APIs) INTERACT (mondes/avatars/robots).Boucle agent/environnement (sensors/percepts/actions/effectors). | ||
| Évolution des capacités de l'IA (2012 → 2026) | CNN (2012, reconnaître) → Transformer (2017, attention) → Foundation Models (2020, pré-entraînement) → IA générative (2022) → Reasoning / inference-time compute (2024) → Agents (2025) → World / Physical AI (2026).La capacité des modèles est passée de la reconnaissance de motifs à des systèmes qui raisonnent, utilisent des outils et interagissent avec leur environnement. | ||
| Foundation Model | Modèle pré-entraîné à grande échelle sur des données massives, puis adapté (prompting, RAG, fine-tuning) à de nombreuses tâches, au lieu d'entraîner un modèle spécifique par tâche.Ancien paradigme : Dataset A → Modèle A → Tâche A (coût d'entraînement répété à chaque fois). Nouveau paradigme : le modèle devient une couche de capacité réutilisable. | ||
| Les 5 couches de la stack IA moderne | PRETRAIN (représentations générales) → POST-TRAIN (instruction tuning, RL) → ADAPT (prompt / RAG / LoRA) → INFER (raisonnement, recherche, vérification) → SYSTEM (outils, mémoire, environnement, sécurité).L'ingénierie IA moderne consiste à choisir où injecter l'information spécifique à la tâche et où dépenser le calcul, plutôt que de se concentrer uniquement sur la qualité de l'entraînement du modèle. | ||
| Les 4 axes du scaling (mise à l'échelle) | Model Scale (nombre de paramètres) Data Scale (qualité/quantité) Training Compute (durée d'entraînement) Inference Compute (calcul au moment de l'usage : échantillonnage, recherche, vérification, outils).Un modèle ne doit pas dépenser le même calcul pour chaque question : réponse rapide pour une question simple, plus de raisonnement pour une question difficile. | ||
| Mixture-of-Experts (MoE) | Architecture où un routeur n'active qu'une partie des 'experts' (sous-réseaux) du modèle par requête, au lieu d'utiliser tout le réseau.Plus de capacité totale pour un coût de calcul actif plus faible (paramètres totaux ≠ paramètres actifs). Utile pour le cloud, l'edge, la XR et la robotique. | ||
| Boîte à outils d'adaptation d'un modèle | Prompting (changer les instructions) RAG (connaissances externes à l'inférence) LoRA/PEFT (mettre à jour une petite partie des poids) Quantization (réduire mémoire/calcul) Distillation (transférer vers un modèle plus petit) Routing (choisir le bon modèle/budget).Ce ne sont que des outils : on choisit où injecter l'information selon le problème et les contraintes système, pas une hiérarchie figée. | ||
| SOTA (State of the Art) et fiabilité des benchmarks | Le SOTA (état de l'art) ne peut pas être défini par un seul chiffre : les benchmarks deviennent plus durs, saturent avec le temps, et certains contiennent des questions invalides (taux d'erreur observé de 2% à 42% selon les benchmarks).L'état de l'art dépend du benchmark ET du protocole d'évaluation utilisé. | ||
| Jagged Intelligence (intelligence 'en dents de scie') | Un même système peut être extraordinaire sur une tâche (médaille d'or aux Olympiades de maths 2025 avec Gemini Deep Think) et étonnamment faible sur une autre (lire une horloge analogique : 50,6% pour la meilleure IA vs 90,1% pour l'humain sur ClockBench).Ne jamais déduire une compétence générale à partir d'une seule démonstration spectaculaire. | ||
| Fast response vs Deliberate response | Réponse rapide : une seule génération directe, bien pour les tâches routinières. Réponse délibérée : propose → teste → révise → vérifie ; dépense plus de calcul quand la difficulté ou l'incertitude est élevée.Le raisonnement peut être vu comme une stratégie d'inférence : dépenser plus de calcul quand le problème le nécessite. | ||
| Train-Time Scaling vs Test-Time Scaling | Train-time : plus de pré-entraînement / RL / post-training → une meilleure politique avant déploiement. Test-time : plus de recherche / échantillonnage / vérification / outils au moment de la requête → potentiellement une meilleure réponse pour CETTE requête précise.Question clé : combien de calcul faut-il allouer à cette requête spécifique ? | ||
| Le raisonnement comme boucle système | Un 'raisonneur' moderne orchestre génération, vérification, outils et retries sélectifs : un Générateur propose une solution, un Vérificateur la contrôle, un Réviseur corrige si besoin.(exemple : Aletheia de Google DeepMind, agent de recherche en mathématiques). | ||
| Limites du raisonnement (5 points) | 1) Vérification erronée (un vérificateur confiant peut valider un chemin faux) 2) Calcul excessif (plus de tokens sans meilleure qualité) 3) Erreur d'outil (browsing/code/API qui échoue) 4) Problèmes de benchmark (fuite, ambiguïté) 5) Monitorabilité limitée (les traces de raisonnement interne restent un sujet de recherche actif pour la sécurité). | ||
| IA multimodale native | Avant : modules séparés par modalité (encodeur image → texte, ASR → LLM → TTS, vidéo → captioner), avec latence/erreurs possibles à chaque conversion. Aujourd'hui : texte + image + audio + vidéo + code partagent une seule couche de raisonnement/outils, sans forcément tout convertir en texte d'abord. | ||
| Historique de la génération d'images/vidéos | GAN (2014, entraînement adversarial) → Diffusion (2020, débruitage inverse) → Diffusion latente (2022, génération dans un espace compressé) → hybrides Flow/AR (2024) → World Models (2025-26, génération conditionnée par des actions).Trajectoire globale : échantillons statiques → séquences cohérentes → environnements conditionnés par l'action. | ||
| Fidélité visuelle vs comportement physique (génération vidéo) | Le réalisme visuel (images nettes, cohérence temporelle, qualité cinématique) et la 'justesse du monde' (flottaison, collisions, navigation persistante) ne sont pas la même chose.La génération vidéo devient un problème d'apprentissage du monde : la vraie question est de savoir si la vidéo reflète le comportement du monde, pas juste si elle est belle (ex : NVIDIA Veo). | ||
| SAM (Segment Anything Model) | Modèle de perception 'promptable' : on peut isoler n'importe quel objet dans une image/vidéo via du texte, un point/une boîte, ou un exemplaire. SAM 3/3.1 ajoute detect → segment → track.Illustre comment un modèle spécialiste (perception) devient un outil appelable à l'intérieur d'un système agentique plus large. | ||
| Workflow vs Agent | Workflow : chemins prédéfinis (if/else), prévisible, debuggable, peu coûteux. Agent : décisions dynamiques (le modèle choisit lui-même l'outil et l'approche), flexible et adaptatif, mais plus coûteux et imprévisible.Les agents ne sont pas automatiquement meilleurs : utiliser le système le plus simple qui suffit à la tâche. | ||
| Boucle d'agent minimale | Sense/Observe (collecter les entrées de l'environnement) → Think (interpréter et choisir une action) → Act (exécuter l'action : appel API, génération, outil) → Learn/Reflect (améliorer via le feedback) → retour à Sense. | ||
| Pourquoi utiliser plusieurs agents ? | Pour les tâches complexes : un agent 'lead' décompose le problème, l'assigne à des agents spécialistes (recherche, code, critique) puis intègre les résultats.Bénéfices : exploration parallèle, spécialisation, vérifications indépendantes. Coûts : coordination, duplication de contexte, propagation d'erreurs. | ||
| Modes de défaillance des agents | Dérive de planification (perte de l'objectif initial) Erreurs qui s'accumulent (irréversibles en aval) Mauvaise utilisation d'un outil Explosion des coûts (boucles/retries) Sécurité (injection de prompt, exfiltration) Évaluation difficile (le succès d'une tâche est plus dur à mesurer que la précision next-token).Les agents en production ont besoin de permissions, de sandboxes, d'un état observable, de conditions d'arrêt et de vérifications déterministes quand c'est possible. |