Transformer-Based Visual Odometry and DepthEstimation for Wireless Capsule Endoscopy

L'estimation précise de la pose et de la profondeur pour l'endoscopie par capsule (Wireless Capsule Endoscopy, WCE) demeure un défi majeur en raison de la nature non structurée et pauvre en textures du tractus gastro-intestinal (GI). Cette thèse explore l'utilisation d'architectu...

وصف كامل

محفوظ في:
التفاصيل البيبلوغرافية
المؤلف الرئيسي: Nazifi, Nahid, 1987-
مؤلفون آخرون: Boutat, Driss, 19..- (مرشد الأطروحة, الخصم), Araújo, Helder (مرشد الأطروحة, الخصم), Tahri, Omar, 2004- (مرشد الأطروحة, الخصم), Mériaudeau, Fabrice, 19..-...., chercheur en informatique (الخصم), Sidibé, Dro Désiré, 19..-...., chercheur en informatique (الخصم), Faye, Ibrahima (الخصم), Othmani, Alice Ahlem, 1986- (الخصم)
التنسيق: Thèse numérique
اللغة:Anglais
منشور في: 2025.
الموضوعات:
الوصول للمادة أونلاين:Accès au texte intégral
http://www.theses.fr/2025ISAB0002/abes
ملاحظة: Thèse soutenue en co-tutelle
Titre provenant de l'écran-titre
Ecole(s) Doctorale(s) : École doctorale Mathématiques, Informatique, Physique Théorique et Ingénierie des Systèmes (Centre-Val de Loire ; 2012-....)
Partenaire(s) de recherche : Laboratoire Pluridisciplinaire de recherche en ingénierie des systèmes, mécanique et énergétique (Orléans ; 2008-....) (Laboratoire)
Autre(s) contribution(s) : Fabrice Mériaudeau (Président du jury) ; Driss Boutat, Helder Araújo , Omar Tahri, Fabrice Mériaudeau, Dro Désiré Sidibé, Ibrahima Faye, Alice Ahlem Othmani (Membre(s) du jury) ; Dro Désiré Sidibé, Ibrahima Faye (Rapporteur(s))
Autres localisations: Voir dans le Sudoc
Variante du titre:Estimation Visuelle de l'Odométrie et de la Profondeur Basée sur les Transformateurs pour l'Endoscopie Capsulaire Sans Fil
LEADER 08789nam a22004217a 4500
001 1301029
008 250520s2025 xxe ||| |||| 00| 0 eng d
009 PPN284948578
041 0 |a eng  |b fre  |b eng 
084 |a 004 
100 1 |a Nazifi, Nahid,  |d 1987- 
240 1 0 |a Estimation Visuelle de l'Odométrie et de la Profondeur Basée sur les Transformateurs pour l'Endoscopie Capsulaire Sans Fil 
245 1 0 |a Transformer-Based Visual Odometry and DepthEstimation for Wireless Capsule Endoscopy   |c Nahid Nazifi ; sous la direction de Driss Boutat et de Helder Araújo et de Omar Tahri. 
256 |a Données textuelles 
260 |c 2025. 
500 |a Thèse soutenue en co-tutelle 
500 |a Titre provenant de l'écran-titre 
500 |a Ecole(s) Doctorale(s) : École doctorale Mathématiques, Informatique, Physique Théorique et Ingénierie des Systèmes (Centre-Val de Loire ; 2012-....) 
500 |a Partenaire(s) de recherche : Laboratoire Pluridisciplinaire de recherche en ingénierie des systèmes, mécanique et énergétique (Orléans ; 2008-....) (Laboratoire) 
500 |a Autre(s) contribution(s) : Fabrice Mériaudeau (Président du jury) ; Driss Boutat, Helder Araújo , Omar Tahri, Fabrice Mériaudeau, Dro Désiré Sidibé, Ibrahima Faye, Alice Ahlem Othmani (Membre(s) du jury) ; Dro Désiré Sidibé, Ibrahima Faye (Rapporteur(s)) 
502 |a Thèse de doctorat. Sciences et Technologies Industrielles. Bourges, INSA Centre Val de Loire. 2025 
502 |a Thèse de doctorat. Sciences et Technologies Industrielles. Universidade de Coimbra (Portugal). 2025 
506 |a Thèse soumise à l'embargo de l'auteur jusqu'au 01 septembre 2025 
520 |a L'estimation précise de la pose et de la profondeur pour l'endoscopie par capsule (Wireless Capsule Endoscopy, WCE) demeure un défi majeur en raison de la nature non structurée et pauvre en textures du tractus gastro-intestinal (GI). Cette thèse explore l'utilisation d'architectures basées sur les transformateurs pour l'estimation auto-supervisée de la profondeur et de la pose monoculaires en WCE. Contrairement aux méthodes traditionnelles d'odométrie visuelle, qui reposent sur des techniques basées sur des points d'intérêt, les approches proposées exploitent le Pyramid Vision Transformer (PVT) et le Swin Transformer pour extraire des caractéristiques hiérarchiques multi-échelles, renforçant ainsi la robustesse de la localisation visuelle dans des environnements complexes du GI.Le premier cadre, EndoTranSfm, utilise l'architecture PVTv2 comme base pour l'estimation de la pose et de la profondeur. Il intègre des pertes photométriques adaptées à la luminosité, une perte de cohérence géométrique et une régularisation de la douceur pour affiner les prédictions sans nécessiter de données annotées. EndoTranSfm démontre des performances compétitives par rapport à EndoSfMLearner, notamment dans des scénarios de faible éclairage et de textures répétitives.En s'appuyant sur ces bases, la deuxième approche explore l'intégration du Swin Transformer. Cette architecture introduit un mécanisme d'attention basé sur des fenêtres glissantes, améliorant l'efficacité computationnelle et la scalabilité. Les versions améliorées du modèle basé sur Swin intègrent des mécanismes d'attention spatiale pour se concentrer sur les régions anatomiques significatives, améliorant ainsi l'estimation de la profondeur et de la pose. Les évaluations comparatives sur les ensembles de données EndoSLAM, SimCol et ColonDepth mettent en évidence les atouts de ces méthodes, notamment leur capacité à généraliser sur des données synthétiques et réelles.Les résultats montrent que les méthodes basées sur les transformateurs sont comparables aux performances de pointe dans les tâches d'odométrie visuelle pour la WCE, avec des améliorations notables en précision de rotation et en prédiction de profondeur. Cette recherche souligne le potentiel de l'apprentissage auto-supervisé et des architectures basées sur les transformateurs pour faire progresser les technologies d'imagerie médicale. 
520 |a Accurate pose and depth estimation for Wireless Capsule Endoscopy (WCE) remains a significant challenge due to the unstructured and texture-poor nature of the gastrointestinal (GI) tract. Unlike traditional endoscopy, WCE is a minimally invasive procedure, providing a comprehensive view of the GI tract through a small, ingestible capsule equipped with a camera. However, this technological advancement introduces unique challenges in accurately determining the capsule's pose and depth due to the absence of external localization mechanisms such as GPS or magnetic tracking. These limitations make visual odometry (VO) techniques critical for enabling autonomous navigation, 3D mapping, and localization in WCE applications.In this thesis, we investigate the use of transformer-based architectures for self-supervised monocular depth and pose estimation in WCE. Traditional visual odometry methods, which rely on feature-based techniques such as keypoint detection, optical flow, or feature matching, often struggle in the complex and deformable GI environment. These methods face significant challenges due to the low-texture surfaces, dynamic tissue deformations, specular reflections, and poor illumination conditions inherent to endoscopic imagery. To address these limitations, we used the strengths of transformer-based architectures, which have demonstrated remarkable success in various computer vision tasks due to their ability to model global and local dependencies effectively.In our first framework, we proposed, that EndoTranSfm, employs the Pyramid Vision Transformer v2 (PVTv2) as the backbone for both pose and depth estimation. The PVTv2 architecture introduces a hierarchical structure, enabling multi-scale feature extraction critical for dense prediction tasks like depth and pose estimation. EndoTranSfm utilizes a combination of losses, including brightness-aware photometric loss, geometry consistency loss, and smoothness loss, to train the model in a self-supervised manner without requiring labelled ground truth data. This framework demonstrates competitive performance compared to the existing state-of-the-art EndoSfMLearner, particularly in scenarios involving repetitive textures and variable lighting conditions, where traditional methods typically fail.In the second approach, we explored the integration of the Swin Transformer, which introduces several architectural innovations. The Swin Transformer uses a shifted window-based self-attention mechanism, enabling it to efficiently handle high-resolution images while capturing both local and global contextual information. We integrated the spatial attention module into enhanced versions of the Swin-based model, which allowed the network to focus on anatomically significant regions, thereby improving the accuracy of depth and pose estimation.The frameworks are evaluated on benchmark datasets, including EndoSLAM, SimCol, and ColonDepth, which provide synthetic and real-world data for WCE applications. Comparative evaluations demonstrate the strengths of transformer-based approaches in generalizing across different datasets. Notably, these models are compared with state-of-the-art performance in various metrics, including rotational accuracy, relative translation error, and depth prediction.The results of this research reveal the potential of transformer architectures in overcoming the challenges of WCE localization. Transformer-based methods are inherently robust to complex lighting conditions, repetitive textures, and large-scale variations in the GI tract. Additionally, the use of self-supervised learning eliminates the dependency on extensive labelled datasets, which is one of the major problems in medical imaging research. 
538 |a Configuration requise : un logiciel capable de lire un fichier au format : PDF 
650 |a Thèses et écrits académiques 
700 1 |a Boutat, Driss,  |d 19..-  |4 ths  |4 opn 
700 1 |a Araújo, Helder.  |4 ths  |4 opn 
700 1 |a Tahri, Omar,  |d 2004-  |4 ths  |4 opn 
700 1 |a Mériaudeau, Fabrice,  |d 19..-....,  |c chercheur en informatique.  |4 opn 
700 1 |a Sidibé, Dro Désiré,  |d 19..-....,  |c chercheur en informatique.  |4 opn 
700 1 |a Faye, Ibrahima.  |4 opn 
700 1 |a Othmani, Alice Ahlem,  |d 1986-  |4 opn 
710 2 |a Institut national des sciences appliquées.  |4 dgg 
856 4 |q PDF  |s 13092940  |u http://www.theses.fr/2025ISAB0002/document  |z Accès au texte intégral 
856 4 |u http://www.theses.fr/2025ISAB0002/abes 
997 |0 1301029  |1 Thèse numérique  |a Ressource numérique  |b INSA  |b ENSA  |c 0/Bibliothèque numérique/  |c 1/Bibliothèque numérique/Autre ressource numérique/