Choisir son critère de jugement principal
Le maillon le plus souvent fragilisé d’un protocole de recherche clinique
Le maillon le plus souvent fragilisé d'un protocole
Après la question PICO et la rédaction du synopsis, le choix du critère de jugement principal est l'une des décisions les plus structurantes d'un projet de recherche clinique. C'est aussi l'une des sections les plus fréquemment incohérentes dans les protocoles soumis aux DRCI : critère mal défini, non validé dans la population cible, composite sans justification, ou déconnecté de l'objectif principal.
Un critère de jugement mal construit fragilise à la fois la recevabilité scientifique du dossier et le calcul du NSN, dont il est le paramètre central.
Qu'est-ce qu'un critère de jugement principal ?
Le critère de jugement principal, ou endpoint primaire, est la mesure qui permet de répondre directement à l'objectif principal de l'étude. C'est sur lui que repose le calcul du nombre de sujets nécessaires, que sera testée l'hypothèse principale, et que seront interprétés les résultats.
Sa nature dépend du type d'étude. Dans un essai comparatif, il s'agit d'un indicateur d'efficacité ou de tolérance mesuré dans chaque bras. Dans une étude diagnostique, c'est un indicateur de performance (sensibilité, spécificité, aire sous la courbe). Dans une étude descriptive, c'est un indicateur de fréquence ou de distribution. Le vocabulaire est le même, la construction diffère : les développements ci-dessous portent principalement sur le cadre comparatif interventionnel, le plus fréquent en recherche académique.
Un seul critère principal, sauf construction explicitement assumée
La règle de référence est celle d'un critère de jugement principal unique. Certains protocoles retiennent des critères co-primaires, c'est-à-dire deux critères devant tous deux être satisfaits pour conclure, ou entre lesquels le risque alpha est réparti. Cette construction est méthodologiquement admise, mais elle n'est jamais neutre : elle modifie la règle de décision et augmente l'effectif nécessaire. Elle doit être décrite comme telle dans le protocole et dans le plan d'analyse statistique.
Ce qui n'est pas recevable, c'est la présence de deux critères présentés l'un et l'autre comme principaux, sans que la règle de décision ni la gestion du risque alpha soient explicitées. C'est un motif classique de retour en commission.
Les types de critères de jugement
Critères cliniques directs
Ils mesurent un bénéfice clinique directement perceptible par le patient : décès, rechute, hospitalisation, survie sans progression. Ils sont les plus robustes et les plus valorisés par les jurys d'évaluation, mais leur mesure nécessite souvent des effectifs importants et un suivi prolongé.
Critères biologiques ou paracliniques
Mesures biologiques (biomarqueurs, paramètres biologiques), imagerie, paramètres physiologiques. Leur pertinence clinique doit être démontrée ou argumentée : un critère biologique isolé, sans corrélation établie avec un bénéfice clinique, sera systématiquement questionné.
Critères rapportés par le patient (PRO)
Les Patient-Reported Outcomes mesurent des dimensions perçues par le patient : qualité de vie, douleur, fatigue, satisfaction. Ils nécessitent l'utilisation d'instruments validés dans la population cible (langue, pathologie, âge). Utiliser un score maison non validé est un motif fréquent de retour CPP et de rejet en comité scientifique.
Critères de substitution (surrogate endpoints)
Un critère de substitution est un critère biologique ou paraclinique utilisé à la place d'un critère clinique difficile à mesurer directement. Il est acceptable à condition que la relation entre ce critère et le critère clinique final soit biologiquement et cliniquement établie. Dans le cas contraire, le jury questionnera la pertinence clinique de l'ensemble du projet.
Critères composites
Un critère composite regroupe plusieurs événements en un seul endpoint, par exemple décès cardiovasculaire, infarctus du myocarde et accident vasculaire cérébral. Il augmente le nombre d'événements observés, ce qui réduit l'effectif nécessaire à puissance égale, mais pose des questions d'interprétation : les composantes doivent être d'importance clinique comparable, de fréquence attendue du même ordre, et l'effet de l'intervention doit être cohérent sur l'ensemble des composantes.
Le risque classique est un résultat porté par la composante la plus fréquente et la moins grave, ce qui rend la conclusion difficilement transposable en pratique. L'analyse des composantes prises séparément doit être prévue dès le protocole, à titre descriptif.
Les 4 conditions d'un critère robuste
| Condition | Ce qu'elle implique | Erreur fréquente |
|---|---|---|
| Mesurabilité | Le critère est objectivement mesurable avec une méthode de recueil clairement définie | Une amélioration clinique sans définition opérationnelle, donc non quantifiable |
| Validité dans la population cible | L'instrument utilisé a été validé dans la même population (langue, pathologie, âge) | Extrapoler un score validé dans une autre population sans justification |
| Temporalité définie | Le moment de la mesure est précisé : visite, délai, fenêtre temporelle | Critère défini sans temps de mesure, ce qui laisse une ambiguïté interprétative |
| Cohérence avec l'objectif principal | Le critère répond directement à l'objectif, ni en deçà, ni au-delà | Critère mesurant un bénéfice que l'étude n'est pas dimensionnée pour démontrer |
Critères secondaires : ce que demande la méthode, ce que fait la pratique
Les critères secondaires explorent des objectifs complémentaires : effets sur d'autres dimensions cliniques, tolérance, qualité de vie, analyses médico-économiques. Sur ce point précis, il existe un écart connu entre la règle méthodologique et la pratique courante en recherche académique. Autant le nommer clairement, parce que c'est cet écart qui explique la plupart des critiques formulées après coup sur les publications.
Ce que demande la méthode
Les référentiels de rédaction et d'analyse de protocole demandent que les critères secondaires soient définis a priori, rattachés chacun à un objectif secondaire, et que leur statut soit précisé dans le plan d'analyse statistique. Lorsqu'un critère secondaire est destiné à porter une conclusion, il doit s'inscrire dans une procédure de test hiérarchique ou dans une stratégie de contrôle du risque alpha global, définie avant l'analyse des données.
Ce qui se passe en pratique
Dans la majorité des protocoles académiques, la hiérarchisation des critères secondaires reste formelle. Aucune correction de multiplicité n'est appliquée, l'ensemble des critères est analysé, et tout résultat exploitable est valorisé. L'investigateur est légitimement intéressé par toutes les dimensions qu'il a mesurées. Ce constat est réel et il n'a pas grand intérêt à être nié : la numérotation des critères secondaires sert le plus souvent à établir le lien avec les objectifs, pas à organiser une séquence de tests.
Ce qu'il faut en retenir
La conséquence pratique n'est pas qu'il faudrait s'interdire d'analyser ces critères. C'est que leur statut doit être qualifié honnêtement. En l'absence de contrôle de la multiplicité, les analyses secondaires sont exploratoires : elles génèrent des hypothèses, elles ne les confirment pas. Un résultat significatif obtenu sur le huitième critère secondaire d'un essai de 80 participants n'a pas le même poids qu'un résultat sur le critère principal, et le présenter comme équivalent dans une publication ou dans un dossier de financement expose à une critique immédiate.
Deux réflexes opérationnels en découlent :
- Rattacher chaque critère secondaire à un objectif secondaire explicite. C'est là que l'exercice conserve une valeur réelle, y compris quand la hiérarchisation reste formelle : un critère qui ne se rattache à aucun objectif est un critère à retirer du protocole.
- Identifier, s'il existe, le critère secondaire susceptible de porter une conclusion, et lui appliquer un traitement dédié : séquence de test hiérarchique, ou prise en compte dans le dimensionnement de l'étude. Dans ce dernier cas, le NSN peut être calculé sur le critère principal et sur ce critère secondaire, l'effectif retenu étant le maximum des deux.
Lien avec le calcul du NSN
Le critère de jugement principal est le paramètre central du calcul du NSN. Toute modification du critère principal après le calcul invalide ce calcul. C'est pourquoi le choix du critère doit être finalisé avant de solliciter le biostatisticien, et non ajusté a posteriori pour obtenir un effectif plus favorable.
Deux précisions utiles :
- Le calcul mobilise non seulement la définition du critère, mais aussi sa variabilité attendue : écart-type pour un critère quantitatif, taux attendu pour un critère binaire. Un critère bien choisi mais dépourvu de données de littérature exploitables ne permet pas de dimensionner l'étude, et oriente vers une phase pilote préalable.
- Lorsqu'un critère secondaire est jugé structurant, le NSN peut être établi sur les deux critères, le maximum étant retenu. Ce choix doit être justifié dans le protocole.
Cette contrainte renforce la logique de progression recommandée : question PICO, revue de littérature, choix du critère de jugement, calcul du NSN avec le biostatisticien, rédaction du synopsis.
Marie De Solère
Coordinatrice de la promotion à la DRCI du GHICL. Articles de fond rédigés à partir de son expérience terrain en recherche clinique académique.
À lire également