Présentation et contexte institutionnel:
Le projet Delacroix numérique (https://delacroix.sorbonne-universite.fr/) vise à renouveler la compréhension de l’œuvre d’Eugène Delacroix grâce à l’intelligence artificielle, à la visualisation 3D et aux analyses physico-chimiques.
Cette initiative pluridisciplinaire, qui mobilise plusieurs laboratoires de Sorbonne Université, a pour ambition de développer de nouveaux outils d’analyse et d’exploration de l’œuvre du peintre. Elle s’appuie sur un vaste corpus numérique réunissant les écrits, les peintures, les dessins et les estampes de Delacroix, ainsi que les données issues de la récente restauration de la bibliothèque de l’Assemblée nationale. Le programme bénéficie d’un soutien important du Schmidt Sciences Humanities and AI Virtual Institute (HAVI).
L’un des objectifs du projet est la constitution d’une édition numérique structurée de la correspondance d’Eugène Delacroix, à partir de sources hétérogènes (pages HTML, fichiers Word, images de lettres provenant de collections particulières). Il s’agit de produire un corpus homogène en XML-TEI, exploitable à la fois pour l’édition scientifique, la recherche en humanités numériques et diverses applications en traitement automatique des langues.
Objectifs du stage
- Prise en main du corpus et des standards
• Se familiariser avec le projet Delacroix numérique (organisation du corpus, typologie des sources, enjeux scientifiques et éditoriaux).
• Prendre en main les recommandations TEI pour la correspondance (métadonnées, structure textuelle, gestion des variantes) et les adapter aux besoins spécifiques du projet. - Traitement et encodage des lettres en XML-TEI
- Participer à la préparation, au classement et au suivi de lettres au format image issues de collections particulières, ainsi que de lettres déjà disponibles en HTML ou en Word.
- Exécuter une chaîne d’OCR fournie par l’équipe pour extraire le texte à partir des images, puis assurer la post-correction et la normalisation des transcriptions (relecture, harmonisation minimale, vérification avec les sources).
- Transformer les lettres au format HTML et Word vers un format XML-TEI conforme aux spécifications du projet.
- Vérifier systématiquement la qualité de l’encodage (structure, métadonnées, balisage sémantique minimal) et la fidélité du contenu (alignement texte/source, respect de l’orthographe et de la ponctuation d’origine).
- Contribuer à la définition et à la mise en œuvre de chaînes de conversion (modèles, macros, scripts, XSLT ou Python) pour limiter les interventions manuelles.
- Harmoniser les encodages existants avec les conventions et les schémas TEI adoptés pour le projet, de façon à constituer un corpus XML-TEI homogène.
- Industrialisation et documentation de la chaîne de traitement
• Concevoir, stabiliser et documenter une chaîne de traitement reproductible pour l’ensemble du corpus (scripts, gabarits, procédures, bonnes pratiques de nommage et d’archivage).
• Rédiger une documentation technique claire et réutilisable (workflow, outils utilisés, choix d’encodage) à destination de l’équipe projet et des futurs contributeurs.
Apports du stage
- Pratique avancée du standard XML-TEI sur un corpus réel et volumineux.
- Expérience concrète en édition numérique de sources et en humanités numériques.
- Utilisation de workflows de numérisation et d’OCR (Gemini Pro, MistralOCR…) appliqués à des documents patrimoniaux.
- Sensibilisation aux enjeux de la qualité des données textuelles pour la recherche et le TAL.
- Travail au sein d’une équipe pluridisciplinaire (humanités numériques, linguistique, informatique).
Profil recherché
- Étudiant en Master 2 ou diplôme équivalent en humanités numériques, linguistique, informatique, traitement automatique des langues, documentation, ou domaine proche.
- Intérêt marqué pour l’édition de sources, la philologie numérique et/ou les humanités numériques.
- Compétences souhaitées :
- Connaissances en XML et, idéalement, en TEI.
- Rigueur dans la manipulation de textes (relecture, normalisation, gestion variantes).
- Aisance avec les outils bureautiques et formats de documents (HTML, PDF, images).
- Pratique de Python, XSLT ou d’outils de transformation de données est un plus.
- Familiarité avec l’OCR, les LLM ou les outils de post-correction constitue un atout.
- Excellente maîtrise du français écrit.
Conditions du stage
- Lieu de travail : Sorbonne Université, campus Pierre et Marie Curie (ObTIC-SCAI).
- Temps de travail hebdomadaire : jusqu’à 35 h, selon la convention de stage.
- Durée du stage : 4 à 6 mois.
- Début du stage : à partir de février 2026 (date négociable).
- Gratification : conforme au taux légal en vigueur.
Modalités de recrutement
Envoyer un CV et une lettre de motivation (mettant en avant les expériences pertinentes en humanités numériques, encodage, TAL ou édition de textes) par courriel à :
gaelle.lafage@sorbonne-universite.fr et motasem.alrahabi@sorbonne-universite.fr
Date limite de candidature : 31 janvier 2026.
