The Meta Intelligence IndexMéthode

Fondements et prédictions

Ce qui a informé ce test, et ce qu’il reste à prouver.

Cette page distingue les travaux scientifiques qui ont guidé la conception du test des preuves nécessaires pour montrer qu’il mesure bien ce qu’il annonce. Les choix de conception sont expliqués ci-dessous. Les preuves restent à produire ; nous indiquons aussi quels résultats contrediraient nos hypothèses.

État actuel

Ce que le M.I. n’a pas encore.

  • Aucune étude de validation n’a été menée sur ce test. Aucune corrélation avec les résultats d’un test existant n’a encore été mesurée.
  • Les questions sont originales. Elles s’inspirent de principes établis, mais ne reprennent ni les questions, ni les normes, ni les propriétés psychométriques d’aucune batterie de tests validée.
  • Les pondérations entre les cinq domaines sont pour l’instant égales, par défaut. Aucune donnée ne les justifie encore.
  • Les normes utilisent d’abord une distribution simulée, puis accordent progressivement plus de poids aux données observées.
  • L’échantillon est auto-sélectionné et le test n’est pas surveillé.
Passations retenues pour les normes
0
Référence active
development-3
Part de la référence encore simulée
100%

Ces trois chiffres sont calculés à partir des données actuelles. Le percentile situe le score dans la référence simulée active : il ne mesure pas un rang dans la population humaine.

Addendum à la version 7 — Le protocole préenregistré ci-dessous portait sur les quatre dimensions initiales. L’empathie a ensuite été ajoutée comme cinquième dimension. Depuis la banque 3.0, les cinq dimensions sont équilibrées. Les hypothèses originales n’ont pas été modifiées après coup : les analyses de la version 7 seront publiées séparément et versionnées.

Ce qui a informé chaque décision

Chaque entrée indique la décision de conception, les travaux qui l’ont guidée, et ce que ces travaux ne permettent pas d’affirmer. La dernière ligne compte autant que les deux premières.

Un score global accompagné de sous-scores, plutôt qu’un chiffre unique

Selon la théorie du chevauchement des processus, un facteur général peut émerger de plusieurs processus partiellement communs. Le M.I. combine donc cinq dimensions au lieu de prétendre mesurer une capacité mentale unique.

  • Kovács, K., & Conway, A. R. A. (2016). Process Overlap Theory: A Unified Account of the General Factor of Intelligence. Psychological Inquiry, 27(3), 151–177.DOI 10.1080/1047840X.2016.1153946
  • Hao, H., Conway, A. R. A., Kovács, K., & Snijder, J.-P. (2025). Simulating the process overlap theory of intelligence. Personality and Individual Differences, 233, 112865.DOI 10.1016/j.paid.2024.112865
  • WAIS-5, Pearson (2024) — documentation officielle, non universitaire.

Ce que cela ne permet pas d’affirmerLa séparation des domaines s’inspire du WAIS-5 mais le M.I. n’en reprend ni les questions, ni les normes, et ne prétend à aucune équivalence avec lui.

Des questions qui demandent de retenir, manipuler, inhiber et changer de règle

Les modèles de la mémoire de travail distinguent le stockage, l’attention exécutive et l’actualisation. Les deux dernières sont les plus liées aux mesures d’intelligence. Les questions d’intelligence de travail s’appuient sur ces trois opérations plutôt que sur le seul empan.

  • Hao, H. et al. (2025). The latent structure of working memory: A large sample factor model of working memory capacity. Cognitive, Affective, & Behavioral Neuroscience, 25, 1378–1399.DOI 10.3758/s13415-025-01310-3
  • Past reflections, present insights: A systematic review and new empirical research into the working memory capacity–fluid intelligence relationship (2025). Intelligence, 108, 101874.DOI 10.1016/j.intell.2024.101874

Ce que cela ne permet pas d’affirmerMémoire de travail et intelligence fluide sont fortement liées sans être réductibles l’une à l’autre : les tâches de manipulation immédiate restent séparées des tâches de raisonnement.

Séparer la mémorisation du rappel par des questions intermédiaires

La séquence — exposition, tâche intermédiaire, rappel libre, puis reconnaissance — vient des méthodes classiques de neuropsychologie cognitive. Elle distingue l’encodage, la conservation et la récupération de l’information au lieu de réduire la mémoire à un seul score.

  • Méthodes classiques d’évaluation de la mémoire épisodique (encodage, interférence, rappel, reconnaissance).
  • Documentation WAIS-5 / WMS-5 (Pearson, 2024) pour la séparation intelligence / mémoire.

Ce que cela ne permet pas d’affirmerReprendre une structure de tâche ne transfère aucune norme clinique : le M.I. ne produit pas d’indice de mémoire interprétable au sens neuropsychologique.

Des séquences où l’on apprend d’un retour, pas seulement où l’on réussit

Les tests dynamiques mesurent la performance initiale, l’effet d’une aide ou d’un retour, puis la progression. C’est la logique des séquences d’adaptation : découverte d’une règle, retour après erreur, nouvelle tentative, transfert vers une variante, changement imprévu.

  • Boosman, H. et al. (2016). Dynamic testing of learning potential in adults with cognitive impairments. Journal of Neuropsychology, 10(2), 186–210.DOI 10.1111/jnp.12063
  • Dixon, C., Oxley, E., Gellert, A. S., & Nash, H. (2023). Dynamic assessment as a predictor of reading development. Reading and Writing, 36, 673–698.DOI 10.1007/s11145-022-10312-3

Ce que cela ne permet pas d’affirmerLes méthodes d’évaluation dynamique restent très hétérogènes, et l’étude de Dixon porte sur la lecture chez l’enfant : son application ici est conceptuelle, pas une validation.

Un rythme comparé au temps de référence de chaque question

Le temps de réponse dépend à la fois de la capacité, de la prudence, de la perception et de la vitesse d’exécution. Lorsque le temps est pertinent, la valeur de la réponse est multipliée par un coefficient compris entre 0,75 et 1,25, centré sur le temps de référence de la question. Aucun ajustement n’est appliqué lorsque l’interface impose déjà le rythme.

  • Kyllonen, P. C., & Zu, J. (2016). Use of Response Time for Measuring Cognitive Ability. Journal of Intelligence, 4(4), 14.DOI 10.3390/jintelligence4040014
  • Theisen, M. et al. (2021). Age differences in diffusion model parameters: A meta-analysis. Psychological Research, 85, 2012–2021.

Ce que cela ne permet pas d’affirmerSans modèle de diffusion ajusté sur les données, le test ne sait pas encore distinguer lenteur, prudence et difficulté réelle. Le facteur ±25 % est un choix expérimental à valider, pas une propriété psychométrique établie.

Enregistrer la correction d’une réponse, pas seulement le premier clic

Ne regarder que le premier choix fait perdre l’information contenue dans les corrections. Le test enregistre la première sélection, les changements d’avis, le délai de correction et la confiance déclarée. La confiance modifie le score selon une règle quadratique conçue pour rendre l’estimation honnête optimale.

  • Markovitch, B., Evans, N. J., & Birk, M. V. (2024). The value of error-correcting responses for cognitive assessment in games. Scientific Reports, 14, 20657.DOI 10.1038/s41598-024-71762-z

Ce que cela ne permet pas d’affirmerLe poids de la confiance et l’interprétation des changements d’avis n’ont pas encore été étalonnés sur des données humaines. Le fait que la règle soit mathématiquement cohérente ne valide ni son poids dans le score ni la capacité qu’elle est censée mesurer.

Un contrôle « aucune réponse correcte n’est proposée »

Des modèles de langage reconnaissent moins bien qu’une bonne réponse manque qu’ils ne sélectionnent une réponse ordinaire. Ce constat a motivé le contrôle permettant de signaler qu’une question est mal posée plutôt que d’y répondre quand même.

  • Groot & Colombo (2024). Large Language Models lack essential metacognition for reliable medical reasoning.

Ce que cela ne permet pas d’affirmerL’étude porte sur le raisonnement médical de modèles de langage, pas sur l’intelligence humaine. Le mécanisme reste expérimental dans ce test.

Un format bref, visuel et interactif

L’évaluation gamifiée peut produire des données cognitives utiles à grande échelle, avec une validité convergente et une fidélité test-retest mesurables.

  • Leutner, F., Codreanu, S.-C., Brink, S., & Bitsakis, T. (2023). Game based assessments of cognitive ability in recruitment. Frontiers in Psychology, 13, 942662.DOI 10.3389/fpsyg.2022.942662
  • Bhargava, Y., Kottapalli, A., & Baths, V. (2024). Validation and comparison of virtual reality and 3D mobile games for cognitive assessment against ACE-III. Scientific Reports, 14, 23918.DOI 10.1038/s41598-024-75065-1

Ce que cela ne permet pas d’affirmerLa gamification ne transforme pas un test en instrument valide. Ces travaux rappellent au contraire que des normes par âge et une validation restent indispensables.

Un score affiché en 100 ± 15, calculé sur des scores standardisés

On ne peut pas moyenner directement un temps de réponse, un nombre de bonnes réponses et un score de mémoire. Chaque mesure est d’abord ramenée en score z, puis combinée. L’affichage suit la convention M.I. = 100 + 15z.

  • Andrade, C. (2021). Z Scores, Standard Scores, and Composite Test Scores Explained. Indian Journal of Psychological Medicine, 43(6), 555–557.DOI 10.1177/02537176211046525

Ce que cela ne permet pas d’affirmerCette méthode justifie la mise à l’échelle, pas la pondération des domaines. Les poids sont aujourd’hui égaux par défaut et devront être estimés sur les données du test.

La lucidité est une hypothèse, pas une capacité établie

Les questions portant sur les erreurs de catégorie, les pronoms ambigus ou la fausse précision sont une création originale. Elles s’appuient sur des principes classiques : distinguer validité logique et plausibilité, repérer une erreur de catégorie, différencier information absurde et information insuffisante, et résister à l’envie de répondre sans preuve. Aucune étude n’a encore validé cette capacité sous cette forme.

Ce qu’il faudra démontrer pour l’appeler une dimension

  • Que les résultats à ces questions soient corrélés entre eux.
  • Qu’ils restent relativement stables dans le temps.
  • Qu’ils ne mesurent pas seulement le niveau d’études, l’habitude de la philosophie ou la méfiance.
  • Qu’ils prédisent un comportement externe pertinent.
  • Qu’ils forment un facteur distinct, ou au moins utile.

Tant que ces cinq points ne sont pas établis, « lucidité » est un nom de travail pour une hypothèse de recherche. La page le dira aussi longtemps qu’il le faudra.

L’hypothèse de travail

Un test de QI classique repose surtout sur le nombre de réponses exactes. Notre hypothèse est que deux signaux supplémentaires — la confiance et le rythme — apportent une information que l’exactitude seule ne fournit pas.

  1. La calibrationL’écart entre la certitude déclarée et la réussite réelle. Deux personnes ayant le même score peuvent pourtant avoir des niveaux de confiance très différents. Cet écart compte lorsqu’elles prennent une décision dans l’incertitude.
  2. La régulation du rythmeLa différence entre le temps passé sur une question évidente et sur une anomalie. Ralentir au bon endroit est le signal ; répondre vite partout ne l’est pas.
  3. Si cette hypothèse est fausseSi ces deux signaux n’apportent rien au-delà de l’exactitude, le M.I. n’est qu’un test de bonnes réponses assorti d’étapes supplémentaires. Nous le signalerons clairement.

Prédictions à vérifier

Écrites avant d’avoir les données, pour ne pas pouvoir être ajustées après coup. Chacune indique ce qui la falsifierait. Toutes sont mesurables avec les données que le produit collecte déjà.

P1

Les résultats des quatre dimensions sont corrélés positivement sans se confondre.

Mesure
Corrélations deux à deux entre dimensions, sur les premières passations retenues.
Hypothèse rejetée si
Une corrélation nulle ou négative, ou une corrélation moyenne supérieure à 0,75 — auquel cas les quatre dimensions n’en sont qu’une.

P2

Les questions de lucidité forment un ensemble cohérent.

Mesure
Cohérence interne des questions portant sur les erreurs de catégorie, l’ambiguïté et la fausse précision, ainsi que leur corrélation avec le niveau d’études déclaré.
Hypothèse rejetée si
Une cohérence interne faible, ou une corrélation avec le niveau d’études plus forte que la cohérence entre les questions elles-mêmes.

P3

La calibration n’est pas un doublon de l’exactitude.

Mesure
Corrélation entre le score de calibration et l’exactitude normalisée.
Hypothèse rejetée si
Une corrélation absolue supérieure à 0,30 : la calibration ne mesurerait alors rien de nouveau.

P4

Ralentir face à une anomalie est associé à la lucidité, pas à la remémoration.

Mesure
Corrélation entre le rapport de temps anomalie/évidence et chaque dimension.
Hypothèse rejetée si
Association avec la lucidité inférieure à 0,15, ou association plus forte avec la remémoration.

P5

L’excès de confiance décroît quand l’exactitude augmente.

Mesure
Écart moyen entre confiance déclarée et réussite, comparé entre le quartile inférieur et le quartile supérieur d’exactitude.
Hypothèse rejetée si
Un écart entre quartiles inférieur à 10 points.

P6

Corriger une première réponse apporte une information propre.

Mesure
Contribution des changements d’avis et du délai de correction à la prédiction du score, au-delà de l’exactitude seule.
Hypothèse rejetée si
Aucune contribution mesurable une fois l’exactitude prise en compte.

P7

Repasser le test améliore le score, ce qui justifie d’exclure les reprises.

Mesure
Différence moyenne entre la première tentative d’un appareil et ses suivantes.
Hypothèse rejetée si
Un gain moyen inférieur à 4 points de M.I.

P8

Les normes se stabilisent quand l’échantillon grandit.

Mesure
Déplacement de la moyenne de chaque dimension entre deux jeux de normes successifs, au-delà de mille passations.
Hypothèse rejetée si
Un déplacement supérieur à 0,01 en score brut d’un jeu au suivant.

P9

Les modèles de langage produisent un profil différent de celui des humains.

Mesure
Comparaison des quatre dimensions entre les exécutions de modèles via l’API et l’échantillon humain.
Hypothèse rejetée si
Un profil modèle situé à moins d’un demi écart-type du profil humain sur les quatre dimensions.

Ces prédictions seront évaluées publiquement, y compris celles qui échouent. Une prédiction qu’on ne publierait qu’en cas de succès ne vaut rien.

Prévu, mais pas encore en place

Ces éléments sont documentés parce qu’ils orientent la suite. Ils ne sont pas dans le test actuel, et la page ne prétendra pas le contraire.

  1. Sélection adaptative des questionsChoisir les questions suivantes en fonction des réponses précédentes peut améliorer la précision, mais seulement si la difficulté de chaque question est correctement estimée. Un étalonnage fondé sur un petit échantillon biaiserait le test. La version actuelle n’est donc pas adaptative : tout le monde reçoit un parcours de même longueur. (Sorrel, M. A., Barrada, J. R., de la Torre, J., & Abad, F. J., 2020, PLOS ONE, 15(1), e0227196.)
  2. Score de stabilité sur plusieurs passationsDes évaluations brèves répétées à différents moments sont faisables sur smartphone et permettraient un indice de stabilité. Ce n’est aujourd’hui qu’une recommandation de seconde passation, pas une fonctionnalité. (Fifield, K. et al., 2025, Assessment, 32(8), 1175–1194.)

La barre à franchir

Les Standards for Educational and Psychological Testing ne fournissent aucune question. Ils définissent les preuves à réunir avant de considérer une évaluation comme un test solide. Le projet devra être jugé selon ces critères : accumuler des utilisateurs ne suffit pas à valider un test.

  • Validité
  • Fidélité
  • Équité
  • Normes
  • Documentation
  • Interprétation
  • Sécurité des questions
  • Usage approprié des résultats

AERA, APA & NCME — Standards for Educational and Psychological Testing.

Pourquoi cette page existe

Un test cognitif en ligne peut se contenter d’afficher un nombre et d’avoir l’air sérieux. Nous préférons publier ce qui a guidé chaque décision, ce que ces travaux ne permettent pas d’affirmer, et des prédictions datées que vous pourrez nous opposer. Chaque passation apporte des données pour répondre à ces questions.