Transparence
Notre méthode, ses forces et ses limites
Un outil qui touche à l'évaluation des élèves doit expliquer ce qu'il fait. Voici, sans jargon, ce que Vraiment calcule, ce qu'il ne sait pas faire, et comment lire ses résultats.
L'idée directrice
Plutôt que de chercher qui a écrit un devoir, question à laquelle personne ne peut répondre avec certitude, Vraiment cherche si le contenu est compris. Un élève qui s'est aidé d'une IA mais qui maîtrise son sujet n'a pas de problème de compréhension. Un élève dont le devoir est brillant mais qui ne sait répondre à aucune question dessus mérite, lui, une conversation avec son enseignant.
1. L'analyse du devoir : un indice, jamais une preuve
Le rapport d'analyse combine trois familles de signaux :
- Le style du texte : régularité des phrases, richesse du vocabulaire, formules très fréquentes dans les textes générés. Ces calculs sont reproductibles et expliqués un à un.
- Une lecture par un modèle de langage, qui évalue le texte selon une grille fixe et doit citer les passages sur lesquels il s'appuie. Les citations sont vérifiées dans le texte.
- Les traces techniques : caractères invisibles, métadonnées du fichier, résidus de mise en forme.
Le résultat est toujours présenté avec un intervalle et un niveau de fiabilité. Les détecteurs de ce type se trompent : ils peuvent signaler à tort un texte humain, en particulier chez les élèves qui écrivent dans une langue qui n'est pas leur langue maternelle, ou dont le style est très scolaire. C'est pourquoi ce score n'est jamais utilisé seul.
L'attribution à un modèle précis (ChatGPT, Claude, Gemini…) est donnée à titre purement indicatif : elle est statistiquement fragile. Vraiment ne prétend pas non plus lire les filigranes propriétaires que certains fournisseurs ajoutent à leurs textes.
2. Le questionnaire de compréhension : le signal fort
À partir du devoir, l'enseignant génère un questionnaire de 5 à 30 questions : vrai/faux, choix multiples, réponses courtes. Certaines portent sur le devoir lui-même, d'autres sur son raisonnement ou sa démarche, d'autres encore sur le contexte du sujet, c'est-à-dire des connaissances qu'un élève qui a réellement travaillé la question devrait avoir. Chaque question est relue et modifiable par l'enseignant avant publication.
Les réponses fermées sont corrigées automatiquement. Les réponses libres sont notées sur trois critères (exactitude, précision, pertinence), puis contrôlées par un second calcul indépendant. Quand les deux avis divergent fortement, la réponse est marquée à relire et n'entre pas dans la note tant que l'enseignant ne l'a pas tranchée.
3. L'indice de cohérence
Vraiment compare la note du devoir (si l'enseignant la renseigne), la compréhension démontrée et le niveau de la classe. Il en tire l'un de quatre constats : compréhension confirmée, compréhension partielle, écart à discuter ou écart important à discuter. Ces formules décrivent un écart, pas une faute. Elles ne dépendent jamais du seul score d'assistance IA.
4. Ce que l'enseignant décide
Vraiment n'applique aucune sanction et ne prend aucune décision automatique. L'enseignant voit les résultats, peut modifier chaque note, et reste seul responsable de ce qu'il en fait.
5. Ce que voit l'élève
Avant le questionnaire, l'élève lit un texte clair sur le but de l'exercice et sur les informations recueillies : son nom, ses réponses, le temps passé, et le fait que la fenêtre ait été quittée ou qu'un texte ait été collé dans une réponse libre. Ces éléments sont des informations pour l'enseignant, jamais des verdicts. La correction est affichée à l'élève si l'enseignant l'a choisi.
Limites connues
- Un questionnaire court a une marge d'erreur : une mauvaise journée, du stress ou une question mal comprise peuvent peser sur un résultat.
- Les questions de contexte mesurent la culture du sujet, pas uniquement la compréhension du devoir ; elles comptent donc un peu moins dans la note.
- Les photos de copies, les PDF scannés et les images de présentations sont lus par reconnaissance de texte (OCR) ou, si l'établissement l'a choisi, par une IA de lecture d'images : la lecture peut contenir des erreurs (surtout pour l'écriture manuscrite). Ces passages sont relus par le professeur, exclus de l'analyse de style, et l'analyse d'un devoir entièrement manuscrit est signalée comme peu fiable.
- L'analyse de style est moins fiable sur les textes courts et dans les langues autres que le français et l'anglais.
Un résultat de Vraiment est une invitation à discuter, pas une conclusion.