Introduction : Chaque génome, une bibliothèque, chaque variant, une note de bas de page
Dans la pratique quotidienne du diagnostic moléculaire, la question de la fréquence d’un variant – tel un fil conducteur entre séquençage et phénotypage – se pose inlassablement. Doit-on s’inquiéter de ce changement ponctuel retrouvé chez un patient ? Est-il rare, fréquent, compatible avec une pathologie ? Pour y répondre, nous disposons d’un outil pédagogique et incontournable : les bases de données populationnelles.
Que l’on explore l’exome comme un vaste roman dont chaque page pourrait contenir des indices cruciaux, ou un panel ciblé comme une boîte à outils raffinée, l’accès à la fréquence allelique d’un variant dans la « population générale » s’impose comme un critère fondamental de l’interprétation clinique.
Pourquoi la fréquence allelique est-elle centrale en génétique clinique ?
Si un variant était une faute de frappe dans la bibliothèque génomique, sa fréquence dans l’ensemble des livres de la population déterminerait sa pertinence. Un variant retrouvé plusieurs milliers de fois dans les catalogues des individus en bonne santé a peu de chances d’être le protagoniste d’une maladie rare.
- En pathologie mendélienne dominante : Un variant au-delà d’un certain seuil de fréquence publique n’est généralement plus compatible avec une ségrégation autosomique dominante à pénétrance complète.
- Autres scénarios : La pertinence varie avec la pénétrance, le mode de transmission et le contexte clinique.
Cette notion s’appuie principalement sur les recommandations de l’ACMG/AMP (Richards et al., 2015) : la fréquence d’un variant est un argument majeur pour sa classification, de « variant probablement bénin » à « variant de signification inconnue ».
Panorama des bases de données populationnelles majeures
Avant d’aller plus loin, quelques points de repères concrets sur les principales bases utilisées en routine :
- gnomAD (Genome Aggregation Database) : Le plus vaste catalogue public à ce jour, comprenant plus de 140 000 exomes et génomes issus de multiples ancestries (site officiel). Il offre des fréquences globales et par sous-population, ainsi que des mesures de constraintes gènes-variants.
- ExAC : Précurseur de gnomAD, contenant 60 700 exomes, aujourd’hui dépassé mais ses filtres spécifiques peuvent encore dépanner pour des cohortes particulières.
- 1000 Genomes Project : Utile pour les fréquences dans des sous-populations géographiques ou anthropologiques spécifiques. Moins profond mais pertinent sur certaines ancestries sous-représentées.
- dbSNP : Base plus ancienne, utile en complément pour un spectre large d’annotations et d’historique de validation des variants.
En France, la base « Frenchexome » (Institut Imagine), bien que non publique, propose aux cliniciens des données ciblées sur les populations françaises ou européennes.
Frequence : notions pratiques à toujours rappeler
- Allèle mineur (allele frequency, AF) : Quotient du nombre d’occurrences de l’allèle étudié par le nombre total de chromosomes testés.
- Total allele count (AC), allele number (AN) : AC=nombre d’occurrences du variant ; AN=nombre total d’allèles séquencés.
- Homozygotie/hétérozygotie: Un variant vu en homozygotie dans la population rend une pathogénicité dominante peu probable (sauf exceptions, cf. maladies à pénétrance incomplète ou mosaïcisme germinal).
| Base |
Nombre d'individus |
Précision phénotypique |
Représentation ancestrale |
| gnomAD |
> 140 000 |
Non phénotypée (exclusion maladies sévères pédiatriques) |
Variable, meilleure sur EUR/AFR/EAS, moins sur MidEast |
| 1000G |
~2 500 |
Aucune |
Large, mais moins profond |
Critères de choix et seuils de fréquence : quand un variant devient-il trop fréquent ?
La fréquence seuil au-delà de laquelle un variant ne peut être considéré comme pathogène dépend...
- Du mode de transmission
- De la prévalence de la maladie
- De la pénétrance attendue
Un seuil « manuel » souvent cité pour les maladies autosomiques dominantes sévères à pénétrance complète :
- Fréquence < 0,01% (ou 1:10 000)
- Pour les maladies autosomiques récessives : la présence d’un variant rare dans les deux copies est attendue (exemple CFTR pour la mucoviscidose, <0,1%).
Dans tous les cas, ces seuils sont strictement indicatifs et doivent être adaptés au contexte clinique, notamment pour les maladies à début tardif, à pénétrance réduite, ou variable selon l’ancestrie.
Pour illustrer, on ne considérera pas pathogène un variant retrouvé dans 1% de la population européenne lorsqu’on évalue une maladie extrêmement rare (prévalence 1/100 000).
Décryptons ensemble : méthodologie pas à pas d’analyse de fréquence d’un variant
Pour tout praticien devant interpréter rapidement la fréquence d’un variant, voici une démarche structurée et pragmatique :
-
Vérifier la fréquence globale et par population sur gnomAD :
- Un variant absent des bases publiques : ce constat est argument fort, mais pas définitif, pour la rareté d’un variant.
- Un variant très rare (<0.01%) mais présent sur plusieurs ancestries : à discuter avec le contexte clinique.
- Des variantes fréquentes (>1%, SNP courants) : à rejeter comme cause monogénique dominante en pathologie rare.
-
Rechercher l’homozygotie : un variant retrouvé chez plusieurs individus en homozygotie et asymptomatiques est difficilement pathogène sauf exceptions (récessivité, pénétrance incomplète).
-
Interroger la pertinence populationnelle : un variant absent dans une population majoritaire mais présent dans une minorité (exemple : variant fondateur d’une population juive ashkénaze pour la Tay-Sachs disease) : nécessité de connaître l’ancestrie et la pertinence démographique.
-
Corréler à la prévalence de la maladie : la fréquence du variant doit rester compatible avec l’incidence de la maladie.
-
Vérifier la robustesse des données : nombre d'allèles testés, profondeur de séquençage sur la région concernée, existance de biais d’échantillonnage.
Biais et limites des bases populationnelles : ce que l’on ne doit jamais perdre de vue
- Mélange démographique : gnomAD intègre souvent plus d’individus européens, biaisant la détection de variants rares dans d’autres populations. Ce déséquilibre peut masquer ou surinterpréter (variants « privés » ou artefacts de population).
- Absence d’informations phénotypiques détaillées : la plupart des bases éliminent les individus avec maladies pédiatriques sévères, mais n’excluent pas toujours totalement les hétérozygotes dominants pour des phénotypes à faible pénétrance ou à révélation tardive.
- Qualité du séquençage : certaines régions (répétitives, riches en GC) restent mal couvertes ; un variant « absent » peut ne pas avoir été correctement testé.
- Risques d’artefacts : variantes de séquençage, erreurs d’annotation : prudence sur les variants très rares (« singleton ») détectés une seule fois.
- Effet goulot d’étranglement : certains variants sont « fondateurs », surreprésentés dans une cohorte restreinte (ex : Saarinen et al., 2023 : variants du gène LRRK2 chez les finlandais).
Application pratique : cas illustratif et discussion clinique
Imaginons une situation fréquente : séquençage d’un panel lié à l’épilepsie génétique. Un variant missense du gène SCN1A est détecté (p.Arg1648His). Consultation de gnomAD : le variant est reporté 2 fois sur 120 000 allèles de population européenne, aucun cas en homozygotie, fréquence : 0,0017%. Pour l'épilepsie Dravet (prévalence : ~1/15 000), ce niveau de rareté reste compatible – mais il est insuffisant seul pour conclure à la pathogénicité. En revanche, si un variant différent du même gène apparaît avec une fréquence de 0,2% (soit 1/500), il est alors peu probable qu'il soit responsable d’une forme sévère à pénétrance complète.
Une même démarche peut s’appliquer vers des CNV (copy number variants) rares : absence dans les bases publiques (DGV, gnomAD-SV) est un argument fort, mais prudence pour les régions complexes (ex : 22q11.2).
Perspectives et ressources pour aller plus loin : affiner la démarche, anticiper les évolutions
- Intégration des bases de données cliniques (ClinVar, LOVD) : corréler la fréquence au statut clinico-génotypique, proposer une lecture croisée entre informations populationnelles et données vérifiées cliniquement.
- Diversification des cohortes : nécessité de contribuer à l’enrichissement des bases pour des populations sous-représentées (projets SANTHE, Amériques, Maghreb… : cf. Osei-Kuffour et al., 2022).
- Utilisation raisonnée des outils automatisés : ACMG classification tools (Varsome, Franklin-Genomenon) proposent des intégrations automatiques : aides à l’interprétation mais vigilance requise, l’expertise humaine restant nécessaire pour pondérer les résultats.
- Publication et partage : signaler les variants nouveaux, avec phénotypage précis, dans les grandes bases internationales, reste un enjeu de progrès collectif (consortium ClinGen, recommandations nationales et internationales).
Vers une interprétation éclairée et éthique de la fréquence des variants
Les bases populationnelles sont notre boussole pour naviguer entre rareté génétique et pertinence clinique. La fréquence d’un variant, interprétée à l’aune de la prévalence de la maladie, du contexte familial et biologique, et des limitations inhérentes aux bases, offre une sécurité pour éviter les diagnostics erronés mais requiert un discernement permanent.
La collaboration interdisciplinaire, la formation continue à l’analyse des fréquences et l’amélioration de la représentation de la diversité génomique constituent trois piliers pour progresser tous ensemble, cliniciens, biologistes et chercheurs, dans la bonne pratique du diagnostic moléculaire.
Pour approfondir :