Au cours des dernières années, un nombre croissant d’opérateurs de serveurs à grande échelle ont rapporté une augmentation marquée d’un type de panne particulier : les corruptions silencieuses de données. Il s’agit d’un type de panne de processeur où, en raison d’une défaillance matérielle, des données corrompues sont générées sans être immédiatement détectées. Ces corruptions de données peuvent alors se propager un certain temps sans être détectées et ne seront généralement décelées que lorsqu’elles causeront un problème, comme des pertes de données. La nature silencieuse de ces pannes complexifie le processus d’isolation.
Les travaux présentés ont pour but d’élaborer et de mettre en place des méthodologies in situ d’identification de corruptions silencieuses de données dans un processeur. Pour ce faire, trois sous-objectifs ont été définis : (1) le développement d’une méthodologie d’identification se basant sur l’utilisation de programmes préexistants, (2) le développement d’une méthodologie d’identification se basant sur la génération de programmes de tests et (3) le développement d’une méthodologie d’émulation de pannes permettant de mettre en application les méthodologies d’identification précédemment évoquées. Au final, deux méthodologies d’identification ont été développées. L’une se base sur la comparaison de l’exécution fautive d’un programme préexistant avec la simulation de l’exécution de ce programme. L’autre se base sur la comparaison entre la fréquence de manifestation des pannes et la fréquence d’utilisation de certaines ressources du processeur en utilisant des programmes générés spécifiquement pour ce test. De plus, une méthodologie d’émulation de pannes fondée sur l’utilisation d’injecteurs de pannes dans un processeur RISC-V implémenté dans un FPGA a été développée.
La méthodologie d’émulation a permis de mettre à l’essai les deux méthodologies d’identification de pannes. Pour ce faire, des pannes sur certaines opérations arithmétiques et logiques ainsi que sur l’entrée du banc de registres du processeur RISC-V ont été émulées. Ces tests ont permis de confirmer le fonctionnement des deux méthodologies. La méthodologie basée sur la fréquence de manifestation des pannes est pleinement automatisée et ne nécessite pas d’intervention manuelle. Lors de la mise en pratique, cette méthodologie a permis un taux d’identification de 100 % des sources de pannes. La méthodologie est toutefois limitée dans le nombre de pannes qu’elle peut détecter. Il s’agit de la méthodologie principale d’identification. Dans le cas de la méthodologie basée sur la simulation du programme, les résultats montrent qu’un certain travail d’interprétation manuelle est nécessaire. Dans le futur, la méthodologie de test basée sur la fréquence de manifestation des pannes pourrait être élargie afin de permettre l’identification de pannes plus complexes. De plus, les méthodologies d’identification pourraient être testées avec d’autres types de pannes, notamment des pannes temporelles.
| Date | 12 août 2026 |
|---|
| langue originale | Français |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Claude Thibeault (Directeur(-trice)) & Pascal Giard (Codirecteur(-trice)) |
|---|
- circuits intégrés
- pannes
- corruptions silencieuses de données
- RISC-V
Juteau-Desjardins, O. (Auteur(e)),
Thibeault (Directeur(-trice)) &
Giard (Codirecteur(-trice)),
12 août 2026Thèses et mémoires: Mémoire de maîtrise › Maîtrise en ingénierie: Génie électrique