Correction automatique des copies : ce que l'IA peut vraiment faire pour vous
Entre la génération du sujet, la correction de 30 copies et la saisie des notes, un seul devoir représente souvent 6 à 8 heures de travail hors classe. La correction automatique par IA ne supprime pas votre jugement pédagogique : elle prépare le travail pour que vous n'ayez qu'à valider.
3 à 6 h
récupérées par devoir pour une classe de 30 élèves
< 30 s
pour générer un devoir complet depuis votre cours
100 %
de contrôle enseignant, la note IA est toujours ajustable
0 donnée
transmise à des tiers, vos cours restent confidentiels
Comment fonctionne la correction automatique sur Devoirs
- 1
Importez votre cours
Copiez-collez votre texte ou déposez votre PDF. Devoirs extrait le contenu pédagogique automatiquement.
- 2
Générez les questions
En quelques secondes, Devoirs propose un jeu de questions adapté à votre cours. Sélectionnez celles qui vous conviennent.
- 3
Partagez le lien
Un lien sécurisé est généré. Envoyez-le à vos élèves, ils répondent depuis n'importe quel appareil, sans installation.
- 4
Révisez les notes
Chaque copie est corrigée et notée automatiquement. Vous voyez la note proposée et les commentaires ; ajustez si nécessaire.
- 5
Publiez et informez
Validez les notes en un clic. Vos élèves reçoivent leurs résultats et commentaires directement par email.
Avantages et limites : ce que dit réellement l'expérience terrain
Ce que l'IA fait bien
Ce qui reste à l'enseignant
Ce que dit la recherche sur la correction automatique
La notation automatique n'est ni une nouveauté ni une baguette magique. Vingt ans de recherche en dessinent le bon usage : une aide puissante, sous supervision humaine.
Elle peut approcher la note d'un correcteur humain
Sur de grands corpus à enjeux, les moteurs de notation égalent les correcteurs humains sur la plupart des critères mesurés.[1, 2] Les modèles récents (GPT-4) améliorent encore la précision, y compris sur des copies d'apprenants non natifs.[6]
Mais elle « ne lit pas le sens » et se laisse tromper
Le principal prédicteur d'un score automatique reste souvent la longueur du texte.[3] Ces systèmes sont à la fois « surstables » (ils maintiennent une note élevée sur un texte dégradé) et « hypersensibles » (une retouche minime fait chuter le score), donc manipulables.[4]
Un LLM seul ne suffit pas : tout dépend de la consigne
Utilisé seul, GPT-4 reste inconstant et souvent inférieur à l'humain ; sa fiabilité dépend fortement de la rubrique et des exemples fournis, ce qui justifie de garder une supervision.[5, 7, 8]
Le bon modèle : l'IA propose, l'enseignant tranche
Des essais contrôlés randomisés montrent que l'assistance IA permet à un enseignant de grande cohorte d'offrir un retour personnalisé comparable à celui d'une petite classe.[9] D'autant que la notation humaine elle-même varie fortement d'un correcteur à l'autre.[10]
Mode Intégrité : correction et anti-triche dans le même outil
Devoirs intègre un module anti-triche passif : chaque changement d'onglet, tentative de copier-coller et sortie de plein écran est horodaté et remontée à l'enseignant. Combiné à l'Indice d'Authenticité Rédactionnelle, cela vous donne une vision complète de la passation, sans accuser un élève sans preuve.
Questions fréquentes
La correction automatique par IA est-elle fiable pour des copies de lycée ?+
Combien de temps gagne-t-on avec la correction automatique ?+
L'IA peut-elle corriger toutes les matières ?+
Comment Devoirs génère-t-il les questions du devoir ?+
Les élèves peuvent-ils tricher sur un devoir corrigé automatiquement ?+
À lire aussi
Références
Publications scientifiques et sources primaires citées dans cet article. Chaque lien renvoie vers la source d'origine.
- [1]Attali, Y., & Burstein, J. (2006). Automated Essay Scoring With e-rater V.2. The Journal of Technology, Learning, and Assessment, 4(3). ejournals.bc.edu/index.php/jtla/article/view/1650
- [2]Shermis, M. D. (2014). State-of-the-art automated essay scoring: Competition, results, and future directions from a United States demonstration. Assessing Writing, 20, 53-76. doi.org/10.1016/j.asw.2013.04.001
- [3]Perelman, L. (2014). When « the state of the art » is counting words. Assessing Writing, 21, 104-111. doi.org/10.1016/j.asw.2014.05.001
- [4]Kumar, Y., Parekh, S., Singh, S., Li, J. J., Shah, R. R., & Chen, C. (2023). Automatic Essay Scoring Systems Are Both Overstable and Oversensitive: Explaining Why and Proposing Defenses. Dialogue & Discourse, 14(1), 1-33. journals.uic.edu/ojs/index.php/dad/article/view/12448
- [5]Kim, S., & Jo, M. (2024). Is GPT-4 Alone Sufficient for Automated Essay Scoring? A Comparative Judgment Approach Based on Rater Cognition. Proceedings of the Eleventh ACM Conference on Learning @ Scale (L@S). doi.org/10.1145/3657604.3664703
- [6]Li, W., & Liu, H. (2024). Applying large language models for automated essay scoring for non-native Japanese. Humanities and Social Sciences Communications, 11(1). doi.org/10.1057/s41599-024-03209-9
- [7]Shermis, M. D. (2024). Using ChatGPT to score essays and short-form constructed responses. arXiv:2408.09540. arxiv.org/abs/2408.09540
- [8]Kim, Y. (2025). Automated Essay Scoring With GPT-4 for a Local Placement Test: Prompting Strategies, Intra-Rater Reliability, and Alignment With Human Scores. TESOL Quarterly, 59(S1), S318-S329. doi.org/10.1002/tesq.3405
- [9]Heinrich, T., Baily, S., Chen, K.-W., DeOliveira, J., Park, S., & Wang, N. C.-H. (2025). AI-assisted grading and personalized feedback in large political science classes: Results from randomized controlled trials. PLoS ONE, 20(8), e0328041. doi.org/10.1371/journal.pone.0328041
- [10]Lopera-Oquendo, C., Lipnevich, A. A., & Mañez, I. (2024). Rating writing: Comparison of holistic and analytic grading approaches in pre-service teachers. Studies in Educational Evaluation, 83. www.sciencedirect.com/science/article/abs/pii/S0959475224001191
Créez votre premier devoir corrigé automatiquement
Essai gratuit 30 jours. Aucune carte bancaire. Importez votre cours, générez vos questions et partagez le lien à vos élèves en moins de 5 minutes.