L'apprentissage fédéré (FL) est devenu un paradigme prometteur pour l'apprentissage automatique collaboratif, permettant à plusieurs participants d'entraîner des modèles partagés tout en préservant la confidentialité des données. Malgré son potentiel, le FL fait face à des défis importants notamment la surcharge de communication, l'hétérogénéité des données, l'hétérogénéité des modèles, et la dégradation des performances dans des conditions de données non-indépendantes et non-identiquement distribuées (non-IID). Ces défis sont particulièrement critiques dans des domaines sensibles tels que la santé, la finance et l'informatique mobile, où la préservation de la vie privée et la précision du modèle sont essentielles. Cette thèse aborde ces défis par l'intégration de techniques de distillation de connaissances (KD) dans les cadres d'apprentissage fédéré. La distillation de connaissances, qui transfert les connaissances de modèles enseignants complexes vers des modèles étudiants plus simples, offre une approche puissante pour atténuer les coûts de communication et gérer les environnements hétérogènes tout en maintenant les performances du modèle. La première contribution introduit FedFB, un cadre d'apprentissage fédéré efficace en communication conçu pour les applications d'imagerie médicale. FedFB utilise la distillation de connaissances d'ensemble en ligne avec un module d'attention-convolution auxiliaire pour permettre une collaboration efficace dans des conditions de distribution de données non-IID. Le cadre démontre une réduction substantielle de la surcharge de communication tout en maintenant une précision de classification élevée dans l'analyse d'échographie cérébrale fœtale. La seconde contribution propose FedAK, un cadre d’apprentissage fédéré semi-supervisé en un seul tour de communication (one-shot), combinant des mécanismes d’attention au niveau des caractéristiques avec la distillation de connaissances. Contrairement aux approches classiques d’apprentissage fédéré multi-tours, FedAK ne nécessite qu’un seul tour de communication, réduisant ainsi considérablement le trafic réseau. Le module d’agrégation basé sur l’attention gère efficacement l’hétérogénéité des modèles et génère des caractéristiques d’ensemble informatives pour l’entraînement d’un modèle étudiant global. Dans l’ensemble, à travers une validation expérimentale approfondie sur plusieurs jeux de données de référence et des scénarios réels en imagerie médicale, cette thèse démontre que les approches basées sur la distillation de connaissances permettent de répondre efficacement aux défis fondamentaux de l’apprentissage fédéré. Les cadres proposés offrent des solutions pratiques améliorant l’efficacité de la communication, la robustesse face à l’hétérogénéité des données et des modèles, ainsi que les performances globales d’apprentissage dans des contextes d’imagerie médicale.