Ce projet vise à transformer un corpus unique de documents océanographiques datant du XVIIIe au XXe siècle, issus de l’Observatoire Océanologique de Banyuls-sur-Mer, en une base de connaissances intelligente, interrogeable et exploitable par les chercheurs.
Pour relever les défis liés à la qualité variable des documents anciens, le pipeline développé combine des techniques avancées de reconnaissance optique de caractères (OCR) multi-modèles avec des méthodes de post-correction contextuelle, permettant d’améliorer significativement la précision du texte extrait (jusqu’à 67,02 % de précision au mot).
Le système intègre également une architecture de type RAG (Retrieval-Augmented Generation) hybride, combinant recherche vectorielle et recherche par mots-clés, enrichie par des mécanismes de re-classement pour garantir la pertinence des résultats.
L’ensemble est accessible via une interface web interactive développée avec Streamlit, permettant à la fois :
-
l’exploration du corpus par requêtes en langage naturel,
-
et l’annotation experte pour enrichir et affiner les données.
Ce projet contribue ainsi à la préservation, à la valorisation et à l’exploitation scientifique de fonds documentaires historiques en océanographie, en les rendant accessibles à travers des outils d’intelligence artificielle modernes.
Lien vers le dépôt GitHub : obtic-sorbonne/RAG_Banyuls
