7 septembre 2026 · publié par Gianni
DCSS328 Deep Learning – Tendances IA en 2026 (2/2)
Réviser
Fiche de révision
Tous les mots du cours
18 mots, dans l'ordre de la note.
- La stack d'intelligence interactive (5 couches)WORLD (NeRF, 3D Gaussian Splatting) → HUMAN (génération 3D, rigging) → MOTION (RL, imitation, mouvement génératif) → VOICE (ASR, TTS, clonage vocal) → INTELLIGENCE (LLM, RAG, raisonnement, agents).L'intégration de ces couches — pas un modèle isolé — est l'artefact final visé par le projet de fin de semestre : combiner plusieurs capacités IA en un système XR interactif fonctionnel.
- NeRF (Neural Radiance Field)Un réseau de neurones apprend un champ de radiance continu à partir de plusieurs photos d'une scène, ce qui permet de générer (render) de nouveaux points de vue jamais observés, par volume rendering.Schéma : 09_nerf_pipeline-56.png. Mildenhall et al., 2020, ECCV. Pipeline : images d'entrée → optimiser le NeRF (position 3D + direction de vue → couleur et densité) → rendre de nouvelles vues.
- 3D Gaussian Splatting (3DGS)La scène est représentée explicitement par des millions de gaussiennes 3D (chacune avec position μ, forme/rotation Σ, couleur c, opacité α), projetées (splat) et mélangées sur le plan image pour un rendu très rapide.Schéma : 10_3d_gaussian_splatting-44.png. Contrairement au NeRF (champ implicite), le 3DGS est explicite et se rend en temps réel — important pour la XR.
- Tendance 2026 en reconstruction 3D (Spatial AI)NeRF → 3DGS → reconstruction 3D 'feed-forward' généralisable (un seul passage, sans ré-optimisation par scène) → 4D (espace + temps) → 3D physique (géométrie + propriétés physiques).Exemple : SHARP (Apple, ICLR 2026) prédit une représentation 3D gaussienne en un seul passage à partir d'UNE SEULE photo, en moins d'une seconde sur GPU standard.
- Reconstruction 4D (D4RT)Reconstruire la géométrie ET suivre (tracker) le mouvement dans l'espace ET le temps, dans un seul modèle (Google DeepMind, 2026).La reconstruction évolue de 'faire une jolie vue' vers une perception persistante pour des systèmes interactifs.
- Digital Human = Body + SoulBody : apparence (modélisation 3D + rendu) et mouvement (animation). Soul : perception (vision/audio/haptique), cognition (langage, décision), création, personnalité/émotion.Schéma : 11_digital_human_body_soul-62.png. Les réseaux profonds et grands modèles génératifs sont puissants, mais l'humain reste 'aux commandes' (in the driver's seat).
- Direction 2026 pour les avatars numériquesOn passe de la reconstruction statique (une pose figée) vers des avatars animables : à partir d'une ou quelques images, un modèle génératif/prior 3D humain produit un avatar posable qui modélise aussi le vêtement et les effets dépendants du mouvement.
- RiggingProcessus qui transforme une géométrie (mesh/body) en un corps contrôlable, en ajoutant un squelette + poids de peau (skeleton + skin weights), ce qui expose des variables de contrôle (pose) permettant l'animation.Schéma : 12_rigging_pipeline-64.png. Une représentation devient utile pour l'interaction quand elle expose des variables de contrôle — ce principe revient aussi dans les world models et la robotique.
- DeepMimicMarque la transition de la simple 'lecture' d'un mouvement enregistré (mocap → retarget → playback) vers l'apprentissage d'une politique de contrôle : reward basé sur un mouvement de référence + simulation physique → le personnage APPREND à agir.Schéma : 13_deepmimic_pipeline-65.png. SIGGRAPH 2018. Le contrôleur apprend des actions, il ne rejoue pas juste une animation enregistrée.
- Génération de mouvement en 2026 (ex. NVIDIA ARDY)Génération de mouvement humain en temps réel et contrôlable à partir de prompts texte, de waypoints ou de keyframes, via diffusion autorégressive en streaming.Direction de recherche : combiner des a priori génératifs de mouvement avec des boucles de contrôle réactives.
- Pipeline Speech AI classique vs modèle natifClassique : Speech → ASR → Texte → LLM → Texte → TTS → Speech (conversion à chaque étape). Natif : le modèle écoute (audio + contexte), comprend (raisonnement multimodal) et parle directement, en gérant latence, prosodie, tour de parole et interruptions.Schéma : 14_speech_ai_pipeline-68.png. Convertir en texte à chaque étape peut introduire de la latence et des erreurs.
- Clonage vocal contrôlable en 2026Séparer ce qui est dit (contenu), comment c'est dit (prosodie) et qui parle (timbre) : un modèle à tokens de codec + langage continue la prosodie à partir d'un style, et injecte le timbre cible au décodage.Le clonage vocal n'est plus juste 'copier une voix' : la contrôlabilité et le consentement du locuteur deviennent des enjeux de conception système.
- World Model (modèle du monde)Définition minimale : un modèle qui prédit comment le monde change quand une action est prise. Boucle : état courant + action → prédire l'état suivant → interagir et continuer.Schéma : 15_world_model_loop-72.png. Différence avec un simple générateur vidéo : le générateur produit une séquence à regarder ('est-ce cohérent ?'), le world model répond à une action en boucle fermée ('le monde répond-il de façon cohérente dans le temps ?').
- Boucle complète d'un système world modelPERCEIVE → PREDICT → PLAN → ACT → OBSERVE → repeat, avec un Agent (exécute la politique), un Evaluator (vérifie le risque/les échecs) et le World Model (simulateur interne, proposeur de tâches) connectés via des données de trajectoire (état / action / feedback).
- Genie 3 (Google DeepMind)Modèle de monde généraliste : à partir d'une simple description texte (ou image), il génère en continu un environnement explorable qui s'étend en réponse aux actions de l'utilisateur (marcher, rouler, voler, conduire).Produit une trajectoire interactive, pas juste un clip pré-rendu.
- SIMA 2Un agent généraliste qui perçoit un monde 3D via l'écran, raisonne sur l'instruction utilisateur, et agit via des contrôles ordinaires (clavier/souris), même dans des mondes 3D jamais vus auparavant.Boucle : observe → reason → act → observe. Pont entre l'IA agentique et les environnements 3D de type XR.
- Vision-Language-Action (VLA)Un modèle qui prend en entrée la vision (où sont les choses ?) et un objectif en langage (que doit-il se passer ?), et produit une action motrice (trajectoire/contrôle) au lieu de texte.Schéma : 16_vla_diagram-76.png. Le 'token de sortie' peut encoder une trajectoire d'action, pas seulement du texte. Exemple 2026 : Gemini Robotics 2 (contrôle corps entier).
- Question de clôture : pourquoi l'IA physique reste dureLe monde physique est bruité et incertain, les objets suivent une physique continue, les actions doivent se faire en temps réel, les petites erreurs s'accumulent sur de longues séquences, les erreurs ont des conséquences physiques, et chaque environnement (chaque maison) est différent.Un système numérique peut souvent réessayer (retry) ; un agent physique doit survivre aux conséquences de ses actions. L'écart entre intelligence digitale et intelligence incarnée (embodied) est l'une des frontières de recherche les plus importantes.
| La stack d'intelligence interactive (5 couches) | WORLD (NeRF, 3D Gaussian Splatting) → HUMAN (génération 3D, rigging) → MOTION (RL, imitation, mouvement génératif) → VOICE (ASR, TTS, clonage vocal) → INTELLIGENCE (LLM, RAG, raisonnement, agents).L'intégration de ces couches — pas un modèle isolé — est l'artefact final visé par le projet de fin de semestre : combiner plusieurs capacités IA en un système XR interactif fonctionnel. | ||
| NeRF (Neural Radiance Field) | Un réseau de neurones apprend un champ de radiance continu à partir de plusieurs photos d'une scène, ce qui permet de générer (render) de nouveaux points de vue jamais observés, par volume rendering.Schéma : 09_nerf_pipeline-56.png. Mildenhall et al., 2020, ECCV. Pipeline : images d'entrée → optimiser le NeRF (position 3D + direction de vue → couleur et densité) → rendre de nouvelles vues. | ||
| 3D Gaussian Splatting (3DGS) | La scène est représentée explicitement par des millions de gaussiennes 3D (chacune avec position μ, forme/rotation Σ, couleur c, opacité α), projetées (splat) et mélangées sur le plan image pour un rendu très rapide.Schéma : 10_3d_gaussian_splatting-44.png. Contrairement au NeRF (champ implicite), le 3DGS est explicite et se rend en temps réel — important pour la XR. | ||
| Tendance 2026 en reconstruction 3D (Spatial AI) | NeRF → 3DGS → reconstruction 3D 'feed-forward' généralisable (un seul passage, sans ré-optimisation par scène) → 4D (espace + temps) → 3D physique (géométrie + propriétés physiques).Exemple : SHARP (Apple, ICLR 2026) prédit une représentation 3D gaussienne en un seul passage à partir d'UNE SEULE photo, en moins d'une seconde sur GPU standard. | ||
| Reconstruction 4D (D4RT) | Reconstruire la géométrie ET suivre (tracker) le mouvement dans l'espace ET le temps, dans un seul modèle (Google DeepMind, 2026).La reconstruction évolue de 'faire une jolie vue' vers une perception persistante pour des systèmes interactifs. | ||
| Digital Human = Body + Soul | Body : apparence (modélisation 3D + rendu) et mouvement (animation). Soul : perception (vision/audio/haptique), cognition (langage, décision), création, personnalité/émotion.Schéma : 11_digital_human_body_soul-62.png. Les réseaux profonds et grands modèles génératifs sont puissants, mais l'humain reste 'aux commandes' (in the driver's seat). | ||
| Direction 2026 pour les avatars numériques | On passe de la reconstruction statique (une pose figée) vers des avatars animables : à partir d'une ou quelques images, un modèle génératif/prior 3D humain produit un avatar posable qui modélise aussi le vêtement et les effets dépendants du mouvement. | ||
| Rigging | Processus qui transforme une géométrie (mesh/body) en un corps contrôlable, en ajoutant un squelette + poids de peau (skeleton + skin weights), ce qui expose des variables de contrôle (pose) permettant l'animation.Schéma : 12_rigging_pipeline-64.png. Une représentation devient utile pour l'interaction quand elle expose des variables de contrôle — ce principe revient aussi dans les world models et la robotique. | ||
| DeepMimic | Marque la transition de la simple 'lecture' d'un mouvement enregistré (mocap → retarget → playback) vers l'apprentissage d'une politique de contrôle : reward basé sur un mouvement de référence + simulation physique → le personnage APPREND à agir.Schéma : 13_deepmimic_pipeline-65.png. SIGGRAPH 2018. Le contrôleur apprend des actions, il ne rejoue pas juste une animation enregistrée. | ||
| Génération de mouvement en 2026 (ex. NVIDIA ARDY) | Génération de mouvement humain en temps réel et contrôlable à partir de prompts texte, de waypoints ou de keyframes, via diffusion autorégressive en streaming.Direction de recherche : combiner des a priori génératifs de mouvement avec des boucles de contrôle réactives. | ||
| Pipeline Speech AI classique vs modèle natif | Classique : Speech → ASR → Texte → LLM → Texte → TTS → Speech (conversion à chaque étape). Natif : le modèle écoute (audio + contexte), comprend (raisonnement multimodal) et parle directement, en gérant latence, prosodie, tour de parole et interruptions.Schéma : 14_speech_ai_pipeline-68.png. Convertir en texte à chaque étape peut introduire de la latence et des erreurs. | ||
| Clonage vocal contrôlable en 2026 | Séparer ce qui est dit (contenu), comment c'est dit (prosodie) et qui parle (timbre) : un modèle à tokens de codec + langage continue la prosodie à partir d'un style, et injecte le timbre cible au décodage.Le clonage vocal n'est plus juste 'copier une voix' : la contrôlabilité et le consentement du locuteur deviennent des enjeux de conception système. | ||
| World Model (modèle du monde) | Définition minimale : un modèle qui prédit comment le monde change quand une action est prise. Boucle : état courant + action → prédire l'état suivant → interagir et continuer.Schéma : 15_world_model_loop-72.png. Différence avec un simple générateur vidéo : le générateur produit une séquence à regarder ('est-ce cohérent ?'), le world model répond à une action en boucle fermée ('le monde répond-il de façon cohérente dans le temps ?'). | ||
| Boucle complète d'un système world model | PERCEIVE → PREDICT → PLAN → ACT → OBSERVE → repeat, avec un Agent (exécute la politique), un Evaluator (vérifie le risque/les échecs) et le World Model (simulateur interne, proposeur de tâches) connectés via des données de trajectoire (état / action / feedback). | ||
| Genie 3 (Google DeepMind) | Modèle de monde généraliste : à partir d'une simple description texte (ou image), il génère en continu un environnement explorable qui s'étend en réponse aux actions de l'utilisateur (marcher, rouler, voler, conduire).Produit une trajectoire interactive, pas juste un clip pré-rendu. | ||
| SIMA 2 | Un agent généraliste qui perçoit un monde 3D via l'écran, raisonne sur l'instruction utilisateur, et agit via des contrôles ordinaires (clavier/souris), même dans des mondes 3D jamais vus auparavant.Boucle : observe → reason → act → observe. Pont entre l'IA agentique et les environnements 3D de type XR. | ||
| Vision-Language-Action (VLA) | Un modèle qui prend en entrée la vision (où sont les choses ?) et un objectif en langage (que doit-il se passer ?), et produit une action motrice (trajectoire/contrôle) au lieu de texte.Schéma : 16_vla_diagram-76.png. Le 'token de sortie' peut encoder une trajectoire d'action, pas seulement du texte. Exemple 2026 : Gemini Robotics 2 (contrôle corps entier). | ||
| Question de clôture : pourquoi l'IA physique reste dure | Le monde physique est bruité et incertain, les objets suivent une physique continue, les actions doivent se faire en temps réel, les petites erreurs s'accumulent sur de longues séquences, les erreurs ont des conséquences physiques, et chaque environnement (chaque maison) est différent.Un système numérique peut souvent réessayer (retry) ; un agent physique doit survivre aux conséquences de ses actions. L'écart entre intelligence digitale et intelligence incarnée (embodied) est l'une des frontières de recherche les plus importantes. |