Système RAG pour documents scientifiques en XML-TEI

Ce projet propose un système de question-réponse avancé basé sur l’approche RAG (Retrieval-Augmented Generation), dédié à l’exploration et à l’analyse de documents scientifiques historiques encodés au format XML-TEI.

Conçu pour répondre aux exigences de la recherche en sciences humaines et en histoire des sciences, le système permet d’interroger des corpus complexes en langage naturel et de générer des réponses contextualisées, accompagnées de citations précises issues des documents sources.

L’architecture repose sur une combinaison de techniques de recherche vectorielle (via FAISS), intégrant des stratégies de similarité cosinus et de diversification des résultats (MMR – Maximal Marginal Relevance), afin d’assurer à la fois pertinence et couverture informationnelle.

Le projet se distingue par sa flexibilité en matière de modèles de langage, avec la prise en charge :

  • de modèles distants (HuggingFace, OpenRouter),

  • et de modèles locaux via Ollama (notamment DeepSeek-R1, Llama, Mistral), garantissant un meilleur contrôle des données et des performances adaptées aux environnements de recherche.

Afin d’optimiser les performances, le système s’appuie sur des embeddings pré-calculés permettant un chargement rapide et une interaction fluide. Il propose également une interface utilisateur moderne et intuitive développée avec Streamlit, facilitant l’exploration du corpus.

Multilingue et particulièrement optimisé pour le français, ce projet constitue un outil robuste pour la valorisation, l’analyse et l’exploitation de documents scientifiques structurés, en combinant standards documentaires (TEI) et intelligence artificielle.

Lien vers le dépôt GitHub

Lien vers la publication

Lien vers l’application