Valorisation de documents océanographiques historiques

Ce projet vise à transformer un corpus unique de documents océanographiques datant du XVIIIe au XXe siècle, issus de l’Observatoire Océanologique de Banyuls-sur-Mer, en une base de connaissances intelligente, interrogeable et exploitable par les chercheurs.

Pour relever les défis liés à la qualité variable des documents anciens, le pipeline développé combine des techniques avancées de reconnaissance optique de caractères (OCR) multi-modèles avec des méthodes de post-correction contextuelle, permettant d’améliorer significativement la précision du texte extrait (jusqu’à 67,02 % de précision au mot).

Le système intègre également une architecture de type RAG (Retrieval-Augmented Generation) hybride, combinant recherche vectorielle et recherche par mots-clés, enrichie par des mécanismes de re-classement pour garantir la pertinence des résultats.

L’ensemble est accessible via une interface web interactive développée avec Streamlit, permettant à la fois :

  • l’exploration du corpus par requêtes en langage naturel,

  • et l’annotation experte pour enrichir et affiner les données.

Ce projet contribue ainsi à la préservation, à la valorisation et à l’exploitation scientifique de fonds documentaires historiques en océanographie, en les rendant accessibles à travers des outils d’intelligence artificielle modernes.

Lien vers le dépôt GitHub : obtic-sorbonne/RAG_Banyuls