Les systèmes éducatifs se transforment à plusieurs endroits à la fois : dans leur financement, leurs formats, leurs outils, mais aussi dans la manière même dont l’apprentissage est organisé. Dans le premier volet de cette série, nous nous étions intéressés au financement des études et à l’apparition de modèles qui déplacent une partie du risque économique de l’étudiant vers l’institution. Ce deuxième volet s’intéresse à une autre transformation : celle de la relation pédagogique elle-même.
L’école de masse repose depuis toujours sur une contrainte difficilement compressible : le temps et l’attention d’un enseignant doivent être partagés entre plusieurs élèves. Le tutorat individuel permet en partie de contourner cette limite, mais son coût en temps humain empêche sa généralisation. L’intelligence artificielle change potentiellement cette équation : pour la première fois, une interaction individuelle, disponible en permanence et capable de s’adapter à l’élève, peut être reproduite à très grande échelle.
Mais rendre l’aide abondante ne signifie pas nécessairement rendre l’apprentissage meilleur. Un système capable de répondre à toutes les questions peut aussi éviter à l’élève l’effort précisément nécessaire pour apprendre. Ce deuxième volet de la série Les évolutions des systèmes éducatifs explore donc une question plus exigeante que celle de la simple disponibilité d’un tuteur IA : quelles fonctions du tutorat peuvent réellement être confiées à la machine, lesquelles doivent rester humaines, et selon quelles formes d’hybridation ?
L’école pour tous subit une contrainte structurelle : le temps et l’attention d’un enseignant doivent être partagés entre tous ses élèves.
Il peut faire cours à une classe entière, corriger les erreurs les plus fréquentes, reprendre une notion mal intégrée… mais il lui est beaucoup plus difficile de suivre simultanément le raisonnement de chacun, d’identifier précisément l’origine d’une incompréhension, de reformuler autant de fois que nécessaire ou de choisir, pour chaque élève, le bon niveau d’aide au moment opportun.
Le tutorat individuel contourne précisément cette limite. Son efficacité est largement documentée. Ainsi, lorsqu’il est régulier, structuré et articulé autour du travail réalisé en classe, il peut produire des gains d’apprentissage substantiels. Malheureusement, sa généralisation bute sur la même ressource : le temps humain.
Dans cet article, le terme « tuteur » désigne toute personne qui accompagne un élève individuellement ou en très petit groupe dans ses apprentissages. Ce rôle peut être assuré par un enseignant, un professionnel du soutien scolaire ou un autre professionnel de l’éducation.
L’intelligence artificielle générative pourrait-elle résoudre cette équation en banalisant l’accès à l’interaction individuelle pour tous ?
Avec l’IA, pour la première fois, un élève peut disposer d’un interlocuteur capable de reformuler une explication, de produire un exercice de plus, d’identifier une erreur, de proposer un indice ou de poursuivre une conversation, et ce, aussi longtemps que nécessaire.
Pour autant, un système capable de répondre à toutes les questions des élèves n’est pas forcément un bon tuteur. De même, réussir des exercices grâce à l’IA n’est pas gage d’un meilleur apprentissage. Dans certaines conditions, une assistance mal conçue pourrait même s’avérer contre-productive.
La question n’est donc pas seulement de savoir si l’IA peut offrir un tuteur à chaque élève, mais de comprendre ce qui fait réellement la qualité du tutorat et quelles fonctions l’IA pourrait reproduire efficacement.
Le tutorat fonctionne parce qu’il individualise — mais pas seulement
Dans les années 1980, les travaux de Benjamin Bloom ont largement contribué à installer le tutorat individuel comme référence en matière d’efficacité pédagogique, notamment avec son célèbre « problème des deux sigma ». Selon ses résultats, un élève tutoré obtenait des performances supérieures d’environ 2 écarts-types à celles d’un camarade suivant un enseignement traditionnel.
Les travaux contemporains invitent toutefois à davantage de réserve. En effet, aucune étude ultérieure n’a retrouvé un effet de cette ampleur. Les expériences synthétisées par Bloom reposaient sur des effectifs limités et des conditions pédagogiques très encadrées, combinant notamment tutorat, feedback et procédures correctives.
Selon la méta-analyse de Nickow, Oreopoulos et Quan, le tutorat ne produit pas les gains spectaculaires associés aux « deux sigma » de Bloom, mais son effet reste significatif : de l’ordre de 0,29 sigma. À titre indicatif, un élève situé au milieu du groupe pourrait, après tutorat, se retrouver devant 60% des élèves.
Surtout, ces travaux montrent qu’un tutorat efficace ne consiste pas simplement à placer un adulte supplémentaire à côté d’un élève. La fréquence compte, la continuité compte et l’articulation avec ce qui est appris en classe compte. La connaissance du niveau réel de l’élève, la rapidité du feedback, la capacité à identifier une erreur et à ajuster la difficulté comptent également.
Autrement dit, le tutorat n’est pas seulement du temps supplémentaire. C’est de l’ajustement pédagogique calibré à un élève en particulier.
Un bon tuteur ne se contente pas de connaître la bonne réponse. Il observe la manière dont l’élève arrive à une réponse fausse. Il distingue une erreur d’inattention d’une incompréhension conceptuelle. Il peut choisir de réexpliquer, de fournir un exemple, de donner un indice ou simplement de laisser l’élève réfléchir.
Bien avant l’arrivée de ChatGPT, les Intelligent Tutoring Systems (ITS) avaient déjà montré qu’une partie des interactions caractéristiques du tutorat pouvait être reproduite par logiciel. Ces systèmes étaient toutefois généralement spécialisés. Ils s’appliquaient surtout à des domaines où la progression et les erreurs pouvaient être relativement bien modélisées, comme les mathématiques ou certaines matières scientifiques.
L'IA générative, et notamment les grands modèles de langage (LLM), ouvre une nouvelle perspective. Là où les ITS reposaient généralement sur des modèles spécialisés, elle introduit la conversation ouverte et une polyvalence beaucoup plus importante. Et surtout, elle permet de reproduire à très faible coût une interaction individuelle qui, jusque-là, exigeait du temps humain.
Un même système peut théoriquement expliquer une équation, interroger un raisonnement historique ou demander à un élève de défendre son interprétation d'un texte.
Mais cette polyvalence ne garantit ni la qualité du diagnostic pédagogique ni la pertinence des interventions. Savoir converser avec un élève ne signifie pas nécessairement savoir organiser sa progression.
Un système capable de répondre à presque tout sait-il pour autant comment faire apprendre quelque chose à un humain ?
Une aide abondante ne favorise pas forcément l’apprentissage
L’une des expériences les plus parlantes sur ce paradoxe a été menée sur près de 1 000 lycéens travaillant sur des problèmes de mathématiques. Lors d’une première phase d’entraînement, certains élèves travaillaient sans IA, d’autres pouvaient utiliser une version généraliste de GPT-4, proche de ChatGPT, et un troisième groupe disposait d’une version conçue comme un véritable tuteur, chargée de guider l’élève sans lui donner directement la solution.
Pendant ces exercices, l’IA a semblé particulièrement efficace. Les élèves utilisant la version généraliste obtenaient des résultats 48 % supérieurs au groupe sans IA, et ceux utilisant GPT Tutor 127 % supérieurs. Mais dans la seconde phase, lorsque tous les élèves devaient résoudre seuls et sans aucune assistance de nouveaux problèmes portant sur les mêmes notions, le constat changeait radicalement. Les élèves qui s’étaient entraînés avec la version généraliste obtenaient des résultats 17 % inférieurs à ceux qui avaient travaillé sans IA. Ceux accompagnés par GPT Tutor retrouvaient, eux, un niveau comparable au groupe sans IA — ni meilleur, ni pire. Le tuteur le mieux conçu de l'expérience n'a donc pas amélioré les performances autonomes mesurées à l'issue de la séance. En revanche, il a permis d'éviter la dégradation observée chez les élèves utilisant l'assistant généraliste.
L’IA a donc considérablement amélioré la réussite des élèves pendant l’entraînement mais sans nécessairement améliorer ce que les élèves étaient ensuite capables de faire seuls.
Cette différence permet de distinguer trois notions que le débat sur l'IA éducative tend à confondre : l'assistance, la performance immédiate et l'apprentissage durable.
Les résultats de cette expérience portent sur les deux premières dimensions et sur la capacité des élèves à résoudre seuls de nouveaux problèmes immédiatement après leur entraînement. Ils ne permettent pas, en revanche, de déterminer ce que les élèves auront réellement retenu plusieurs semaines ou plusieurs mois plus tard.
Ainsi, une IA peut aider un élève à résoudre une tâche — et cette aide peut améliorer sensiblement sa performance. Mais cela ne signifie pas nécessairement qu’il saura ensuite résoudre sans aide une tâche comparable.
Le problème est presque inhérent aux assistants génératifs actuels. Ils sont construits pour être utiles et rendre service. Un élève pose une question, ils répondent. S’il hésite, ils complètent. S’il bloque, ils offrent une solution.
Or l’apprentissage peut parfois nécessiter l’inverse. Le bon geste pédagogique peut être de ne donner qu’un indice, de demander à l’élève pourquoi il a choisi cette méthode, de lui signaler qu’une erreur existe sans la corriger, de le laisser chercher encore quelques minutes ou de l’amener à faire l’effort de se remémorer.
Le défi pour le « tuteur IA » n’est donc pas de savoir davantage aider mais de savoir quand justement ne pas le faire.
En effet, une partie de l’apprentissage naît de l’effort. Inutile de récupérer une information en mémoire, de rédiger une réponse, de tester une hypothèse, de se tromper, ou de corriger son raisonnement quand l’IA le fait à votre place.
Des travaux récents ont également mis en évidence un autre risque : l’élève peut avoir le sentiment d’avoir beaucoup appris parce que son interaction avec l’IA est fluide, que les explications paraissent claires et que les réponses obtenues sont satisfaisantes, alors même que ses performances autonomes ne progressent pas dans les mêmes proportions.
Qui plus est, l’IA ne se contente pas d’expliquer. Elle rassure, encourage et félicite beaucoup l’élève. À force de valider chaque étape, elle peut aussi donner à l’élève le sentiment de mieux maîtriser le sujet qu’il ne le maîtrise réellement.
L’abondance de l’aide déplace la chaîne de valeur.
Avec l’IA, la capacité de décider quelle explication fournir, à quel moment, en quelle quantité et quand ne rien fournir du tout devient donc la ressource rare.
Dans l’expérience citée, le problème n’était pas l’intelligence du modèle, mais sa manière d’aider. En encadrant son comportement — ne pas donner directement la réponse, privilégier les indices, anticiper les erreurs fréquentes — les chercheurs ont neutralisé l’effet négatif observé avec l’assistant généraliste. L’expertise pédagogique ne disparaît donc pas mais est déplacée vers la conception du système. On passerait, par conséquent, de milliers de tuteurs à quelques concepteurs.
Il n’existera probablement pas un tuteur IA universel
Les disciplines ne se prêtent pas de la même manière au tutorat automatisé.
Les mathématiques et la physique constituent un terrain particulièrement propice. Le raisonnement peut souvent y être décomposé en étapes, les erreurs y sont localisables, un résultat peut être vérifié, des exercices analogues peuvent être générés et le niveau de difficulté progressivement ajusté.
Ce n’est donc pas un hasard si les systèmes de tutorat intelligents se sont historiquement beaucoup plus développés dans ces disciplines.
La situation devient plus complexe dans des matières comme la biologie. Certaines connaissances et certains raisonnements peuvent y être fortement structurés. Mais l’étude de systèmes complexes, la compréhension des causalités ou l’interprétation d’un protocole expérimental exigent davantage qu’une succession d’étapes vérifiables.
Et lorsque l’on passe à la littérature, à l’histoire ou à la philosophie, la fonction du tuteur change encore. Le professeur qui accompagne l’interprétation d’un roman ne conduit pas nécessairement l’élève vers une réponse correcte prédéterminée. Il lui demande de justifier sa lecture du texte et ses points de vue, de retourner au texte, de confronter son hypothèse à une autre interprétation, de préciser un concept ou de distinguer une intuition d’un argument.
Dans ce contexte, une IA — capable de rédiger rapidement une excellente analyse — serait pédagogiquement catastrophique car elle réaliserait à la place de l’élève le travail qu’il devait précisément apprendre à accomplir par lui-même.
Mais cette même IA pourrait devenir intéressante si elle était capable d’adopter une posture différente : Pourquoi interprètes-tu ce passage ainsi ? Quel élément du texte soutient ton argument ? Quelle autre analyse serait possible ? Comment la réfuterais-tu ? Quel autre texte pourrait venir soutenir la thèse de cet auteur ?
L’opposition pertinente n’est donc pas entre sciences « automatisables » et sciences « humaines ». Elle se situe plutôt sur un continuum entre des apprentissages dont les objectifs et les chemins de résolution peuvent être fortement structurés et d’autres où l’apprentissage repose davantage sur l’interprétation, l’argumentation et le jugement.
Le futur du tutorat IA pourrait ainsi être profondément différencié selon les disciplines et les matières enseignées. Il n’y aurait alors pas un futur du tutorat IA, mais plusieurs.
Trois trajectoires se dessinent
Le tuteur artificiel
Dans ce scénario, chaque élève disposerait d’un système capable d’expliquer, d’entraîner, de diagnostiquer et d’adapter progressivement les exercices à son niveau. Cette trajectoire est aussi celle qui alimente le plus facilement l’imaginaire d’une école entièrement automatisée où le professeur est entouré de trente élèves, chacun accompagné par son propre tuteur numérique.
Cette trajectoire ne relève plus entièrement de la science-fiction. En France, MIA Seconde, commande publique du ministère de l’Éducation nationale, est ouverte depuis septembre 2025 à toutes les classes de seconde — plus de 20 000 exercices adaptatifs en français et en mathématiques. Le dispositif relève encore de la logique des ITS plutôt que des agents conversationnels. Une évaluation randomisée portant sur environ 500 lycées et 20 000 élèves a été conduite en 2024-2025.
Ses résultats d'impact ne sont pas publics.
Le Tutor CoPilot
Cette deuxième trajectoire est moins spectaculaire, mais pourrait être plus immédiatement transformatrice.
Elle ne consiste plus à placer l’IA entre le professeur et l’élève, mais aux côtés du tuteur humain qui accompagne l’élève.
Dans ce dispositif, l’IA ne répond donc pas directement à l’élève. Elle accompagne le tuteur humain pendant l’interaction et peut lui suggérer une question, un indice ou une stratégie pédagogique.
L’effet reste modeste : sur 100 élèves, environ quatre de plus réussissent l’exercice de fin de séance lorsque leur tuteur utilise Tutor CoPilot. L’écart monte à neuf élèves sur 100 lorsque l’outil assiste les tuteurs initialement les moins bien notés. Et cela pour un coût d’environ 20 dollars par tuteur et par an. L’IA semble aussi modifier la manière de tutorer : davantage de questions pour guider l’élève, et moins de réponses données directement.
Ces résultats doivent toutefois être interprétés avec prudence. L’étude mesure la réussite des élèves à la fin de la séance, alors qu’ils viennent d’être accompagnés par le tuteur. Elle ne permet pas de savoir si cet avantage persiste lorsque l’élève doit, plus tard, résoudre seul un problème comparable. Autrement dit, Tutor CoPilot améliore la qualité de l’accompagnement observé pendant la séance, mais son effet sur l’apprentissage durable reste à démontrer.
Jusqu’ici, généraliser le tutorat signifiait essentiellement multiplier le nombre de tuteurs. Tutor CoPilot suggère une autre possibilité : diffuser à grande échelle les pratiques des meilleurs tuteurs.
La ressource rare serait, au-delà du nombre d’adultes disponibles, l’expertise, c’est-à-dire moins ce qu’un bon tuteur sait que ce qu’il fait au bon moment.
L’hybridation fonctionnelle.
C’est le troisième scénario qui se dessine en ce moment. Dans celui-ci, il est question de décider de ce qui est délégué à la machine et de ce qui ne l’est pas.
L’IA prendrait en charge ce qu’elle fait correctement — entraînement, répétition, génération d’exercices, reformulation, feedback de premier niveau, détection de certaines erreurs —tandis que le professionnel de l’éducation se concentrerait là où le savoir-faire humain est important — motivation, relation, autorité, jugement, compréhension du contexte et organisation du collectif.
Aux États-Unis, Alpha School pousse déjà cette logique plus loin. Son modèle concentre les apprentissages académiques sur environ deux heures par jour, à l’aide d’outils adaptatifs et de tuteurs IA. Les adultes, appelés « guides », ne sont plus chargés en priorité de transmettre les contenus : ils se concentrent sur la motivation, le coaching et l’accompagnement des élèves, tandis que le reste de la journée est consacré notamment à des ateliers et au développement de compétences pratiques. Alpha School constitue ainsi moins une preuve de l’efficacité de ce modèle qu’un laboratoire de cette hybridation fonctionnelle.
Et la frontière entre les deux pourrait varier selon l’âge de l’élève, son autonomie, ses difficultés ou la discipline enseignée.
Les critères d’évaluation
Ces trois trajectoires ne se départageront pas par la théorie, mais par l’expérimentation et les résultats.
La première trajectoire, celle du tuteur IA, devra être jugée à la persistance de l’enseignement qu’il dispense — les gains obtenus avec assistance doivent survivre à son retrait et doivent être mesurés sur des évaluations différées et non pendant l’entraînement lui-même.
La deuxième trajectoire, celle du Tutor CoPilot, devra être évaluée sur sa capacité à transposer son aide d’une discipline à l’autre. L'effet positif devra notamment être confirmé hors des mathématiques, sur des apprentissages où la bonne réponse n'est pas toujours vérifiable.
La troisième trajectoire devra définir de manière explicite la frontière entre les fonctions confiées à la machine et celles qui restent sous responsabilité humaine. L'établissement, l'académie ou le ministère concerné devra préciser les fonctions pouvant être déléguées à la machine, les conditions de cette délégation et les responsabilités qui doivent rester humaines. Ce cadre devra permettre de rendre leurs effets mesurables et comparables.
Conclusion
Aucun de ces trois futurs n'est acquis. Leur développement dépendra autant des résultats des expérimentations que des choix institutionnels qui accompagneront leur déploiement.
La question n'est donc pas de savoir si l'intelligence artificielle permettra d'offrir un tuteur à chaque élève, mais de déterminer ce que nous attendons réellement d’un tel tuteur : aider à réussir ponctuellement un exercice ou permettre à l'élève de progresser réellement en se passant de son aide.
L'IA pourrait effectivement rendre le tutorat individuel accessible à une échelle inédite. Mais cette abondance ne garantit pas, à elle seule, une amélioration qualitative de l’apprentissage.
Le véritable enjeu sera de transformer cette capacité technique en une ressource pédagogique efficace, sans confondre l'assistance apportée à l'élève avec les connaissances et les compétences qu'il acquiert réellement.
La question la plus fine qui devra nous guider reste ainsi : quelles fonctions pédagogiques peuvent être déléguées à la machine, lesquelles doivent rester sous contrôle humain, et selon quels critères d’arbitrage.







