Transformer-Based Visual Odometry and DepthEstimation for Wireless Capsule Endoscopy

L'estimation précise de la pose et de la profondeur pour l'endoscopie par capsule (Wireless Capsule Endoscopy, WCE) demeure un défi majeur en raison de la nature non structurée et pauvre en textures du tractus gastro-intestinal (GI). Cette thèse explore l'utilisation d'architectu...

Description complète

Enregistré dans:
Détails bibliographiques
Auteur principal: Nazifi, Nahid, 1987-
Autres auteurs: Boutat, Driss, 19..- (Directeur de thèse, Membre du jury), Araújo, Helder (Directeur de thèse, Membre du jury), Tahri, Omar, 2004- (Directeur de thèse, Membre du jury), Mériaudeau, Fabrice, 19..-...., chercheur en informatique (Membre du jury), Sidibé, Dro Désiré, 19..-...., chercheur en informatique (Membre du jury), Faye, Ibrahima (Membre du jury), Othmani, Alice Ahlem, 1986- (Membre du jury)
Format: Thèse numérique
Langue:Anglais
Publié: 2025.
Sujets:
Accès en ligne:Accès au texte intégral
http://www.theses.fr/2025ISAB0002/abes
Note: Thèse soutenue en co-tutelle
Titre provenant de l'écran-titre
Ecole(s) Doctorale(s) : École doctorale Mathématiques, Informatique, Physique Théorique et Ingénierie des Systèmes (Centre-Val de Loire ; 2012-....)
Partenaire(s) de recherche : Laboratoire Pluridisciplinaire de recherche en ingénierie des systèmes, mécanique et énergétique (Orléans ; 2008-....) (Laboratoire)
Autre(s) contribution(s) : Fabrice Mériaudeau (Président du jury) ; Driss Boutat, Helder Araújo , Omar Tahri, Fabrice Mériaudeau, Dro Désiré Sidibé, Ibrahima Faye, Alice Ahlem Othmani (Membre(s) du jury) ; Dro Désiré Sidibé, Ibrahima Faye (Rapporteur(s))
Autres localisations: Voir dans le Sudoc
Variante du titre:Estimation Visuelle de l'Odométrie et de la Profondeur Basée sur les Transformateurs pour l'Endoscopie Capsulaire Sans Fil
Description
Résumé:L'estimation précise de la pose et de la profondeur pour l'endoscopie par capsule (Wireless Capsule Endoscopy, WCE) demeure un défi majeur en raison de la nature non structurée et pauvre en textures du tractus gastro-intestinal (GI). Cette thèse explore l'utilisation d'architectures basées sur les transformateurs pour l'estimation auto-supervisée de la profondeur et de la pose monoculaires en WCE. Contrairement aux méthodes traditionnelles d'odométrie visuelle, qui reposent sur des techniques basées sur des points d'intérêt, les approches proposées exploitent le Pyramid Vision Transformer (PVT) et le Swin Transformer pour extraire des caractéristiques hiérarchiques multi-échelles, renforçant ainsi la robustesse de la localisation visuelle dans des environnements complexes du GI.Le premier cadre, EndoTranSfm, utilise l'architecture PVTv2 comme base pour l'estimation de la pose et de la profondeur. Il intègre des pertes photométriques adaptées à la luminosité, une perte de cohérence géométrique et une régularisation de la douceur pour affiner les prédictions sans nécessiter de données annotées. EndoTranSfm démontre des performances compétitives par rapport à EndoSfMLearner, notamment dans des scénarios de faible éclairage et de textures répétitives.En s'appuyant sur ces bases, la deuxième approche explore l'intégration du Swin Transformer. Cette architecture introduit un mécanisme d'attention basé sur des fenêtres glissantes, améliorant l'efficacité computationnelle et la scalabilité. Les versions améliorées du modèle basé sur Swin intègrent des mécanismes d'attention spatiale pour se concentrer sur les régions anatomiques significatives, améliorant ainsi l'estimation de la profondeur et de la pose. Les évaluations comparatives sur les ensembles de données EndoSLAM, SimCol et ColonDepth mettent en évidence les atouts de ces méthodes, notamment leur capacité à généraliser sur des données synthétiques et réelles.Les résultats montrent que les méthodes basées sur les transformateurs sont comparables aux performances de pointe dans les tâches d'odométrie visuelle pour la WCE, avec des améliorations notables en précision de rotation et en prédiction de profondeur. Cette recherche souligne le potentiel de l'apprentissage auto-supervisé et des architectures basées sur les transformateurs pour faire progresser les technologies d'imagerie médicale.
Accurate pose and depth estimation for Wireless Capsule Endoscopy (WCE) remains a significant challenge due to the unstructured and texture-poor nature of the gastrointestinal (GI) tract. Unlike traditional endoscopy, WCE is a minimally invasive procedure, providing a comprehensive view of the GI tract through a small, ingestible capsule equipped with a camera. However, this technological advancement introduces unique challenges in accurately determining the capsule's pose and depth due to the absence of external localization mechanisms such as GPS or magnetic tracking. These limitations make visual odometry (VO) techniques critical for enabling autonomous navigation, 3D mapping, and localization in WCE applications.In this thesis, we investigate the use of transformer-based architectures for self-supervised monocular depth and pose estimation in WCE. Traditional visual odometry methods, which rely on feature-based techniques such as keypoint detection, optical flow, or feature matching, often struggle in the complex and deformable GI environment. These methods face significant challenges due to the low-texture surfaces, dynamic tissue deformations, specular reflections, and poor illumination conditions inherent to endoscopic imagery. To address these limitations, we used the strengths of transformer-based architectures, which have demonstrated remarkable success in various computer vision tasks due to their ability to model global and local dependencies effectively.In our first framework, we proposed, that EndoTranSfm, employs the Pyramid Vision Transformer v2 (PVTv2) as the backbone for both pose and depth estimation. The PVTv2 architecture introduces a hierarchical structure, enabling multi-scale feature extraction critical for dense prediction tasks like depth and pose estimation. EndoTranSfm utilizes a combination of losses, including brightness-aware photometric loss, geometry consistency loss, and smoothness loss, to train the model in a self-supervised manner without requiring labelled ground truth data. This framework demonstrates competitive performance compared to the existing state-of-the-art EndoSfMLearner, particularly in scenarios involving repetitive textures and variable lighting conditions, where traditional methods typically fail.In the second approach, we explored the integration of the Swin Transformer, which introduces several architectural innovations. The Swin Transformer uses a shifted window-based self-attention mechanism, enabling it to efficiently handle high-resolution images while capturing both local and global contextual information. We integrated the spatial attention module into enhanced versions of the Swin-based model, which allowed the network to focus on anatomically significant regions, thereby improving the accuracy of depth and pose estimation.The frameworks are evaluated on benchmark datasets, including EndoSLAM, SimCol, and ColonDepth, which provide synthetic and real-world data for WCE applications. Comparative evaluations demonstrate the strengths of transformer-based approaches in generalizing across different datasets. Notably, these models are compared with state-of-the-art performance in various metrics, including rotational accuracy, relative translation error, and depth prediction.The results of this research reveal the potential of transformer architectures in overcoming the challenges of WCE localization. Transformer-based methods are inherently robust to complex lighting conditions, repetitive textures, and large-scale variations in the GI tract. Additionally, the use of self-supervised learning eliminates the dependency on extensive labelled datasets, which is one of the major problems in medical imaging research.
Description:Thèse soutenue en co-tutelle
Titre provenant de l'écran-titre
Ecole(s) Doctorale(s) : École doctorale Mathématiques, Informatique, Physique Théorique et Ingénierie des Systèmes (Centre-Val de Loire ; 2012-....)
Partenaire(s) de recherche : Laboratoire Pluridisciplinaire de recherche en ingénierie des systèmes, mécanique et énergétique (Orléans ; 2008-....) (Laboratoire)
Autre(s) contribution(s) : Fabrice Mériaudeau (Président du jury) ; Driss Boutat, Helder Araújo , Omar Tahri, Fabrice Mériaudeau, Dro Désiré Sidibé, Ibrahima Faye, Alice Ahlem Othmani (Membre(s) du jury) ; Dro Désiré Sidibé, Ibrahima Faye (Rapporteur(s))
Format:Configuration requise : un logiciel capable de lire un fichier au format : PDF
Accès:Thèse soumise à l'embargo de l'auteur jusqu'au 01 septembre 2025