Pourquoi l’analyse des variants d’épissage est-elle un défi particulier ?
Dans la pratique clinique, l’identification des variants responsables de maladies génétiques ne relève plus simplement du séquençage de l’exome ou du génome : elle exige une interprétation fine, notamment des altérations de l’épissage (spliceogenic variants). Un variant d’épissage peut modifier la structure des ARN messagers, conduisant à la production de protéines tronquées ou non fonctionnelles.
- Environ 10 à 15% des variants pathogènes humains identifiés modifient l’épissage (Human Gene Mutation Database, 2022).
- Une portion significative (jusqu’à 35%) des variants « introniques profonds » reste sous-diagnostiquée, car leurs conséquences sont difficilement prévisibles sans outils adaptés (Vaz-Drago et al., Nature Genetics, 2017).
La difficulté majeure : la majorité de ces variants n’affecte pas les sites canoniques (AG-GT) mais touche des motifs régulateurs plus éloignés ou subtils (ESS, ESE, silencers, enhancers, acceptor/donor cryptiques). Les tests bio-informatiques deviennent alors le stéthoscope moléculaire essentiel du clinicien-généticien.
Qu’attendons-nous d’un outil fiable pour l’analyse des variants d’épissage ?
- Sensibilité : capacité à détecter l’ensemble des variants d’épissage réels, y compris ceux situés hors des sites consensus.
- Spécificité : réduction des faux positifs, particulièrement dans un contexte de diagnostic différentiel.
- Interprétabilité : restitution de l’analyse sous une forme compréhensible et exploitable en filière clinique.
- Intégration multi-source : croisement des prédictions « in silico » avec les bases de données publiques (ClinVar, gnomAD), modèles ARN, et – lorsque possible – résultats expérimentaux (RT-PCR, minigene assays).
- Évolutivité : adaptation aux mises à jour des recommandations (ex : ACMG/AMP 2020, recommandations nationales françaises FiGéM).
Panorama des outils bio-informatiques : nuances, performances et perspectives
Le marché des outils de prédiction de l’effet des variants sur l’épissage est hétérogène. Nous proposons ici une cartographie structurée, nourrie par la littérature récente et notre expérience de terrain.
1. Outils traditionnels fondés sur les motifs consensus
- MaxEntScan
- Algorithme probabiliste basé sur les modèles maximaux d’entropie.
- Très utilisé depuis 2004 ; sensible à la modification des sites donneurs et accepteurs canoniques.
- Limite : performances moindres en cas de variants non canoniques ou excentrés.
- Source
- Human Splicing Finder (HSF)
- Outil hybride combinant matrices de scores et identification des sites régulateurs d’épissage (ESE, ESS, etc.).
- Bonne couverture des effets sur des régions plus étendues, appréciée dans l’évaluation du « deep intronic ».
- Source
2. Outils « machine learning » et réseaux de neurones
- SpliceAI
- Développé par l’équipe d’Eric Lander et DeepMind (2019), basé sur des réseaux neuronaux profonds.
- Prédiction du gain/perte de site d’épissage jusqu’à 50 kb autour d’un variant.
- Sensibilité dépassant les 90% sur certains jeux de validation (Jaganathan et al., Cell, 2019).
- Limite : Score unique à interpréter en contexte, parfois difficile à calibrer sur des mutations très rares.
- MMSplice
3. Outils spécialisés et combinés pour une approche clinique
- SpliceAid2
- Couvre les facteurs de liaison RBP (RNA binding proteins) et modules régulateurs subtils.
- Utile pour la prédiction de variants dans les UTR, exons alternatifs et motifs non canoniques.
- Source
- Alamut Visual (Sophia Genetics)
- Permet la visualisation et l’intégration simultanée de plusieurs algorithmes prédictifs dont MaxEntScan, NNSplice, HSF, GeneSplicer, etc.
- Utilisé dans de nombreux laboratoires agréés pour le diagnostic moléculaire en France et en Europe.
- Force : restitution graphique claire pour le clinicien non spécialiste en bio-informatique.
| Outil |
Type d’algorithme |
Capacités clés |
Limites |
Accès |
| MaxEntScan |
Consensus/motif |
Sites canoniques |
Sensible seul – faible pour motifs distants |
Libre |
| HSF |
Hybride |
Sites + régulateurs ESE/ESS |
Peu de mise à jour depuis 2016 |
Libre |
| SpliceAI |
Deep learning |
Larges régions, haute sensibilité |
Score unique à contextualiser |
Libre (CLI) |
| MMSplice |
Machine Learning |
Annotation combinée, extensible |
Moins robuste sur UTR |
Libre |
| Alamut Visual |
Interface combinée |
Visualisation multi-algo, intégration labo |
Licence commerciale |
Commercial |
Forces et limites : ce que montrent les études comparatives
De nombreuses études internationales comparant la performance des outils ont dégagé quelques axes majeurs :
- Combinaison d’outils recommandée : L’usage d’au moins deux ou trois algorithmes indépendants permet d’atteindre une valeur prédictive négative >95% (Naito et al., BMC Med Genomics, 2019).
- Les faux négatifs persistent pour les variants situés dans les régions profondes (deep intronic) ou affectant des éléments régulateurs distaux non-mappés.
- L’intégration de données transcriptomiques (RNA-seq) augmente la confiance, surtout si le contexte tissulaire est accessible dans le diagnostic (cf. Van der Auwera GA et al., Genomics, 2022).
Cas pratiques cliniques : choix stratégique selon le contexte
Pour illustrer l’approche pragmatique, mobilisable au quotidien, voici trois scénarios fréquemment rencontrés au sein des filières maladies rares :
- Variant suspect à l’interface exonic-intronique (±2 pb) :
- Débuter par MaxEntScan/HSF et compléter par SpliceAI, limite la probabilité de sous- ou surestimation.
- Variant situé au sein d’un grand intron (deep intronic, >+20bp ou <-20bp) :
- SpliceAI, HSF et interrogation de SpliceAid2 (si motif RBP suspecté) sont privilégiés.
- L’association avec l’analyse RNA-seq (en recherche ou diagnostic spécialisé) est recommandée si le phénotype est atypique.
- Plusieurs variants hétérozygotes sur un même gène :
- Comparaison systématique de l’ensemble des scores dérivés + contextualisation selon la base ClinVar.
- Utilisation d’Alamut Visual pour la présentation pluridisciplinaire (RCP moléculaire, CRP).
Normes, recommandations et évolutions attendues
- Les recommandations ACMG (American College of Medical Genetics) 2020 et les travaux FiGéM en France suggèrent l’intégration, pour chaque variant d’épissage candidat, d’au moins deux scores bio-informatiques + documentation d’un test expérimental direct lorsque possible (mini-gène, RT-PCR sur tissu patient).
- L’arrivée du machine learning va de pair avec la nécessité de rendre les scores compréhensibles et d’outiller les laboratoires pour documenter la reclassification des variants d’incertitude signification (VUS), enjeu éthique et clinique majeur.
- Les pipelines intégrés (Alamut, InterVar, VarSome) facilitent l’application systématique et le suivi longitudinal des variants lors de l’évolution des bases de connaissance.
Vers une analyse de plus en plus intégrée : perspectives pour la pratique médicale
L’étendue des possibles offerte par l’analyse bio-informatique de l’épissage ne saurait masquer la nécessité d’une interprétation collégiale et contextualisée de chaque variant. Aucun algorithme, isolé ou sophistiqué, ne remplace l’expertise clinique multicritères et la confrontation aux phénotypes. Les outils présentés ici sont nos boussoles : leur force réside dans leur usage combiné et raisonné, pour restreindre le champ des variants suspects, prioriser l’analyse fonctionnelle, éviter les impasses diagnostiques et, surtout, soutenir la décision médicale partagée.
L’avenir se dessine déjà vers l’automatisation des workflows, l’intégration de données multi-omiques et l’aide à la relecture dynamique en génétique moléculaire. Un outil bio-informatique fiable n’est pas une boule de cristal, mais, de plus en plus, un compagnon de route pour la fabrique du diagnostic de demain. À chaque nouvel algorithme, une promesse renouvelée : mieux comprendre, pour mieux soigner.
- Pour approfondir :
- Jaganathan et al., "Predicting Splicing from Primary Sequence with Deep Learning", Cell, 2019
- Cheng et al., "MMSplice: modular modeling improves the predictions of genetic variant effects on splicing", Nature Communications, 2019
- BMC Med Genomics, "Comparative analysis of in silico tools for splicing variant prediction", 2019
- Guidelines ACMG/AMP, 2020. Recommendations for splicing variant interpretation.
- FiGéM, Recommandations nationales françaises pour l’interprétation des variants d’épissage.