Liste des ressources

La plateforme BiGEst-ICube met à disposition de la communauté un ensemble de bases de données, d'outils et de services bioinformatiques pour l'analyse des séquences et des structures biologiques.

BAliBASE

https://bigest-icube.fr/balibase/

Base de données de référence pour l'évaluation des méthodes d'alignement multiple de séquences.

base de données

alignement de séquences

BAliBASE : une base de données de référence pour l’évaluation des programmes d’alignement multiple


BAliBASE 3.0 est la dernière version de la base de référence la plus utilisée pour évaluer les méthodes d’alignement multiple de séquences. Pilier de la biologie moléculaire moderne, l’alignement multiple de séquences est indispensable pour identifier des motifs conservés, déterminer des domaines protéiques, prédire les structures 2D/3D par homologie et réaliser des études évolutives. Face à l’explosion des données de séquences et de structures issues des technologies à haut débit, comme le séquençage du génome et la protéomique structurale, de nouvelles méthodes d’alignement ont vu le jour pour améliorer à la fois l’efficacité et la qualité.

BAliBASE 3.0 répond à cette évolution en proposant des alignements de référence de haute qualité, affînés manuellement à partir de superpositions structurales 3D. Cette version introduit de nouveaux cas de test plus exigeants, reflétant les défis réels rencontrés lors de l’alignement de grands ensembles de séquences complexes. Grâce à un protocole de mise à jour semi-automatique, le nombre de familles de protéines a été augmenté, et des cas de test représentatifs couvrent désormais la majorité de l’espace des repliements protéiques. Le nombre total de protéines dans la base est passé de 1 444 à 6 255 séquences. Par ailleurs, des séquences complètes sont désormais fournies pour tous les cas de test, proposant des scénarios difficiles pour les programmes d’alignement global et local.

Bio databases

https://bigest-icube.fr/banbi/

Liste de nos miroirs locaux des bases de données biologiques publiques.

base de données

Banbi: bioinformatics banks


BiGEst-ICube maintains local copies of public databases, with automatic updates and versioning. The data is also structured and indexed for simplified and efficient access.

Feel free to contact us if you need customized access to these databases.

This system powers our public REST APIs.

BLUR

https://bigest-icube.fr/blur/

Détection à l'échelle du protéome des schémas de conservation différentielle aux niveaux des protéines et des sous-protéines.

logiciel

évolution

MiSynPat : Une base de connaissances intégrée

Lien entre données cliniques, génétiques et structurales pour les mutations pathogènes dans les aminoacyl-ARNt synthétases mitochondriales humaines


De nombreuses mutations dans chacune des aminoacyl-ARNt synthétases (aaRSs) mitochondriales ont été impliquées dans des maladies humaines. Ces mutations sont autosomiques et récessives, et conduisent principalement à des troubles neurologiques, bien qu'avec des effets pléiotropiques. Les processus et interactions qui sous-tendent l'étiologie des troubles associés aux aaRSs mitochondriales (mt-aaRSs) sont loin d'être compris.

La complexité des données cliniques, génétiques et structurales nécessite des efforts concertés et interdisciplinaires pour comprendre la biologie moléculaire de ces troubles. Dans cette optique, nous avons conçu MiSynPat, une base de connaissances complète associée à un serveur Web ergonomique, destinés à organiser et à accéder à toutes les informations pertinentes sur les mt-aaRSs humaines liées aux maladies :

  • Séquences
  • Alignements de séquences multiples
  • Structures
  • Descriptions des maladies
  • Caractéristiques des mutations
  • Littérature originale

Avec MiSynPat, un utilisateur peut également évaluer l'impact d'une mutation potentielle sur la conservation de séquence et la structure, afin de favoriser les liens entre chercheurs fondamentaux et cliniciens et de faciliter les diagnostics futurs.

La vision intégrée proposée, couplée à la recherche sur les mt-aaRSs liées aux maladies, contribuera à révéler de nouvelles fonctions pour ces enzymes et à ouvrir de nouvelles perspectives en biologie moléculaire cellulaire. MiSynPat a vocation à constituer une ressource de référence et de convergence pour les scientifiques et les cliniciens.

ID Mapping

https://bigest-icube.fr/idmapping/

Service miroir pour la conversion d'identifiants bioinformatiques.

service web

ID Mapping


Ce service fournit un mappage entre les identifiants de gènes et de protéines pour les organismes humains et modèles. Il permet de convertir des identifiants provenant de différentes bases de données, telles que NCBI Gene, UniProt, Ensembl, et d'autres, facilitant ainsi l'intégration et l'analyse des données biologiques.

La plateforme BiGEst-ICube fournit un miroir local de l'API.

LEON-BIS

https://github.com/BiGEst-ICube/leonbis

Outil d'évaluation des relations homologues dans les alignements multiples de séquences.

logiciel

alignement de séquences

LEON-BIS : évaluation d’alignement multiple de séquences voisines par système d’inférence bayésienne


LEON-BIS emploie un système bayésien robuste pour estimer les relations homologues entre les séquences dans un alignement multiple de protéines. Les séquences sont regroupées en sous-familles et les relations sont prédites à différents niveaux, y compris les « blocs centraux », les « régions » et les protéines de longueur complète.

Macsims

https://github.com/BiGEst-ICube/macsims

Système de gestion de l'information basé sur l'alignement de séquences multiples qui intègre les connaissances des bases de données et les prédictions ab initio pour annoter les familles de protéines.

logiciel

alignement de séquences

Spliceator : prédiction des sites d'épissage multi-espèces à l'aide de réseaux neuronaux convolutifs


Spliceator est un nouvel outil d’apprentissage profond conçu pour la prédiction ab initio des sites d’épissage, une étape essentielle dans l’annotation des génomes eucaryotes. Alors que les prédicteurs récents exploitent l’apprentissage profond et les structures géniques fiables des organismes modèles, Spliceator étend cette capacité à une large gamme d’espèces, y compris les organismes non modèles. Basé sur un réseau de neurones convolutif, Spliceator est entraîné sur des données soigneusement validées provenant de plus de 100 organismes. Il atteint une précision élevée de manière constante (89–92 %) sur des tests indépendants couvrant diverses espèces, telles que l’humain, le poisson, la mouche, le ver, la plante et les protistes, surpassant ainsi les méthodes existantes.

Spliceator offre donc une solution robuste et universelle pour la prédiction des sites d’épissage, aussi bien chez les organismes modèles que non modèles.

Misynpat

https://misynpat.org

Une base de connaissances intégrée reliant les données cliniques, génétiques et structurales des mutations pathogènes des aminoacyl-ARNt synthétases mitochondriales humaines.

base de données

MiSynPat : Une base de connaissances intégrée

Lien entre données cliniques, génétiques et structurales pour les mutations pathogènes dans les aminoacyl-ARNt synthétases mitochondriales humaines


De nombreuses mutations dans chacune des aminoacyl-ARNt synthétases (aaRSs) mitochondriales ont été impliquées dans des maladies humaines. Ces mutations sont autosomiques et récessives, et conduisent principalement à des troubles neurologiques, bien qu'avec des effets pléiotropiques. Les processus et interactions qui sous-tendent l'étiologie des troubles associés aux aaRSs mitochondriales (mt-aaRSs) sont loin d'être compris.

La complexité des données cliniques, génétiques et structurales nécessite des efforts concertés et interdisciplinaires pour comprendre la biologie moléculaire de ces troubles. Dans cette optique, nous avons conçu MiSynPat, une base de connaissances complète associée à un serveur Web ergonomique, destinés à organiser et à accéder à toutes les informations pertinentes sur les mt-aaRSs humaines liées aux maladies :

  • Séquences
  • Alignements de séquences multiples
  • Structures
  • Descriptions des maladies
  • Caractéristiques des mutations
  • Littérature originale

Avec MiSynPat, un utilisateur peut également évaluer l'impact d'une mutation potentielle sur la conservation de séquence et la structure, afin de favoriser les liens entre chercheurs fondamentaux et cliniciens et de faciliter les diagnostics futurs.

La vision intégrée proposée, couplée à la recherche sur les mt-aaRSs liées aux maladies, contribuera à révéler de nouvelles fonctions pour ces enzymes et à ouvrir de nouvelles perspectives en biologie moléculaire cellulaire. MiSynPat a vocation à constituer une ressource de référence et de convergence pour les scientifiques et les cliniciens.

Ordalie

https://bigest-icube.fr/ordalie/

Outil interactif pour la modification et l'analyse d'alignements multiples de séquences.

logiciel

alignement de séquences

Ordalie : Ordered Alignment Expert Information


Ordalie (Ordered Alignment Expert Information) est dédié à l'analyse et à l'exploitation, en temps réel, de l'information évolutive et structurale dans un alignement multiple de séquences complètes.

OrthoInspector

https://bigest-icube.fr/orthoinspector/

Portail pour OrthoInspector, un logiciel d'inférence de relations d'orthologie et ses bases de données publiques associées.

logiciel

évolution

OrthoInspector : un portail pour la génomique comparative


OrthoInspector est l’un des principaux logiciels pour l’inférence des relations d’orthologie. Dans cet article, nous décrivons une refonte majeure de la ressource en ligne OrthoInspector ainsi qu’une augmentation significative du nombre d’espèces : 4753 organismes sont désormais couverts à travers les trois domaines de la vie, faisant d’OrthoInspector la ressource d’orthologie la plus exhaustive à ce jour en termes d’espèces couvertes (à l’exclusion des virus). Le nouveau site Web intègre des outils originaux d’exploration et de visualisation des données dans une interface ergonomique.

Les distributions des orthologues protéiques sont représentées par des cartes thermiques résumant leurs histoires évolutives, et les protéines ayant des profils similaires peuvent être directement accessibles. Deux nouveaux outils ont été mis en œuvre pour la génomique comparative : une recherche de profil phylogénétique qui peut être utilisée pour trouver des protéines avec un profil de présence-absence spécifique et enquêter sur leurs fonctions et, inversement, un outil de profilage GO visant à déchiffrer les histoires évolutives des fonctions moléculaires, des processus ou des composants cellulaires. En plus du site Web repensé, la ressource OrthoInspector fournit désormais une interface REST pour un accès programmatique.

PipeAlign

https://bigest-icube.fr/pipealign/

Workflow pour la création d'alignements multiples de séquences.

service web

alignement de séquences

PipeAlign : un nouvel outil pour l’analyse des familles de protéines


PipeAlign est un outil complet et automatisé pour l’analyse des familles de protéines, conçu pour rationaliser l’ensemble du flux de travail, depuis l’identification des homologues de séquences dans les bases de données de protéines et de structures 3D jusqu’à la définition des relations hiérarchiques au sein et entre les sous-familles. Le pipeline accepte une seule séquence ou un ensemble de séquences en entrée et produit un Alignement Multiple de Séquences Complètes (MACS) de haute qualité et validé, avec des séquences regroupées en sous-groupes fonctionnels potentiels.

Pour les utilisateurs avancés, le serveur PipeAlign offre une flexibilité : les utilisateurs peuvent exécuter des parties spécifiques de l’analyse, ajuster les paramètres par défaut pour chaque module logiciel, ou même affiner, valider et regrouper des séquences à partir d’un alignement multiple de séquences existant. L’objectif est de fournir un environnement de travail interactif pour la validation, l’intégration et la présentation des familles de protéines aux niveaux séquentiel, structurel et fonctionnel.

Probe

https://bigest-icube.fr/probe/

Outil d'analyse et de visualisation de l'évolution des protéins à l'échelle des blocs.

logiciel

évolution

PROBE : analyse et visualisation de l'évolution des protéines à l'échelle des blocs


Les études comparatives des séquences de protéines sont largement utilisées dans les études évolutives et la génomique comparative, mais il existe un manque d'outils efficaces pour identifier de manière ab initio les régions conservées au sein d'un alignement multiple de protéines. PROBE fournit une analyse entièrement automatique de la conservation des familles de protéines, afin d'identifier les régions conservées, ou « blocs », qui peuvent correspondre à des domaines ou motifs structurels/fonctionnels. Les blocs conservés sont identifiés à deux niveaux différents : (i) les blocs au niveau de la famille indiquent des sites probablement d'une importance centrale pour la structure ou la fonction de la protéine, et (ii) les blocs au niveau de la sous-famille mettent en évidence des régions qui peuvent signifier une spécialisation fonctionnelle, telle que les partenaires de liaison, etc. Tous les blocs conservés sont cartographiés sur un arbre phylogénétique et peuvent également être visualisés dans le contexte de l'alignement multiple des séquences. PROBE facilite ainsi des études approfondies des relations séquence-structure-fonction-évolution et ouvre la voie à un profilage phylogénétique à l'échelle des blocs.

RASCAL

https://github.com/BiGEst-ICube/rascal

Outil de correction rapide d'alignements multiples de séquences

logiciel

alignement de séquences

RASCAL : correction rapide d'alignements multiples de séquences


RASCAL introduit une alternative basée sur la connaissance aux méthodes heuristiques et itératives traditionnelles pour corriger les erreurs dans les alignements multiples de séquences. Contrairement aux approches conventionnelles qui reposent sur la maximisation d'une fonction objective, RASCAL utilise un processus de raffinement en deux étapes : l'alignement est divisé à la fois horizontalement et verticalement pour former une "grille", permettant de distinguer les régions bien alignées des régions moins fiables. En se concentrant uniquement sur les régions peu fiables, RASCAL atteint une stratégie de raffinement plus fiable et efficace.

SIBIS

https://bigest-icube.fr/sibis/

Détecteur d'erreurs de prédiction de séquence utilisant un système d'inférence bayésien.

logiciel

alignement de séquences

SIBIS : un modèle bayésien pour l’estimation des séquences protéiques inconsistantes


SIBIS est une nouvelle méthode conçue pour répondre au défi crucial de détecter les incohérences dans les bases de données de protéines, causées à la fois par des variantes naturelles et des erreurs de prédiction de séquences. Ces incohérences proviennent des défis liés à la qualité du séquençage du génome, à la précision des modèles de gènes et à la complexité du processus d’épissage générant plusieurs variantes protéiques.

SIBIS exploite les informations évolutives issues des alignements multiples de séquences, en utilisant un cadre bayésien combiné à des modèles de mélange de Dirichlet pour estimer la probabilité d’acides aminés spécifiques et identifier les segments de séquences incohérents ou erronés. Évaluée sur un ensemble de référence de séquences protéiques avec des erreurs validées expérimentalement, SIBIS montre une sensibilité significativement plus élevée que les méthodes précédentes, au prix d’une légère perte de spécificité. Appliquée à un grand ensemble de séquences humaines de la base de données UniProt, SIBIS a révélé des preuves d’incohérence dans 48 % des séquences précédemment non caractérisées.

L’intégration d’outils de contrôle qualité comme SIBIS dans les pipelines d’analyse automatique est essentielle pour garantir une inférence robuste des informations structurelles, fonctionnelles et phylogénétiques à partir des séquences protéiques.

Spliceator

https://bigest-icube.fr/spliceator/

Outil de prédiction de sites d'épissage basé sur l'apprentissage profond.

logiciel

génomique

Spliceator : prédiction des sites d'épissage multispecies à l'aide de réseaux neuronaux convolutifs


Spliceator est un nouvel outil d'apprentissage profond conçu pour la prédiction ab initio des sites d'épissage, une étape critique de l'annotation des génomes eucaryotes. Alors que les prédicteurs récents ont exploité l'apprentissage profond et des structures géniques fiables provenant d'organismes modèles, Spliceator étend cette capacité à un large éventail d'espèces, y compris des organismes non modèles. Alimenté par un réseau neuronal convolutif, Spliceator est entraîné sur des données soigneusement validées provenant de plus de 100 organismes. Il atteint systématiquement une précision élevée (89–92 %) sur des benchmarks indépendants couvrant diverses espèces, telles que l'humain, le poisson, la drosophile, le ver, la plante et le protiste, en surpassant les méthodes existantes.

Spliceator fournit ainsi une solution robuste et universelle pour la prédiction des sites d'épissage chez les organismes modèles comme non modèles.

StopKB

https://bigest-icube.fr/stopkb/

Une base de connaissances exhaustive consacrée aux thérapies de suppression des séquences non-sens.

base de données

génomique

santé

StopKB : une base de connaissances complète pour les thérapies de suppression des variations non-sens


Les variations non-sens, caractérisées par des codons de terminaison prématurés, jouent un rôle majeur dans les maladies génétiques humaines ainsi que dans la susceptibilité au cancer. Malgré leur prévalence élevée, les stratégies thérapeutiques efficaces ciblant les codons de terminaison prématurés restent un défi. Pour comprendre et explorer les mécanismes complexes impliqués, nous avons développé StopKB, une base de connaissances complète regroupant des données provenant de plusieurs sources sur les variations de non-sens, les gènes associés, les maladies et les phénotypes. StopKB identifie 637 317 variations de non-sens uniques, réparties sur 18 022 gènes humains et liées à 3206 maladies et 7765 phénotypes. Notamment, ∼32% de ces variations sont classées comme insensibles à la dégradation médiée par l'ARNm de non-sens, représentant potentiellement des cibles appropriées pour les thérapies de suppression des non-sens. Nous fournissons également une interface web interactive pour faciliter l'exploration efficace et intuitive des données, permettant aux chercheurs et aux cliniciens de naviguer dans le paysage complexe des variations de non-sens. StopKB représente une ressource précieuse pour faire progresser la recherche en médecine de précision et plus spécifiquement, le développement d'interventions thérapeutiques ciblées pour les maladies génétiques associées aux variations de non-sens.