Cette thèse étudie l’apprentissage sur graphes à grande échelle à partir de l’idée que la performance d’une méthode dépend non seulement du modèle utilisé, mais aussi de la manière dont l’information est organisée, préservée et enrichie au cours de l’apprentissage.
Les travaux portent sur trois tâches : la classification de nœuds sur de grands graphes homogènes, la prédiction de liens sur des graphes de connaissances et le typage d’entités. Les contributions proposées concernent respectivement le partitionnement structurel des graphes, le partitionnement sémantique des graphes de connaissances et l’enrichissement sélectif du contexte pour les entités disposant de peu d’informations locales.
Les résultats montrent que l’organisation des données et la construction du contexte influencent fortement la qualité et le passage à l’échelle des méthodes d’apprentissage sur graphes. Plus généralement, cette thèse défend l’idée que l’apprentissage sur graphes est aussi un problème d’organisation de l’information.