Présentation et contexte institutionnel
Dans le cadre d’un projet de recherche sur le paludisme chez l’enfant, nous disposons d’un fonds d’archives
médicales papier à valoriser sous forme de données exploitables. Le corpus comprend environ 800 dossiers patients
(≈ 8000 pages numérisées). Chaque dossier est structuré en sous-dossiers temporels : J1 (prise en charge initiale) ;
J3–J5 (suivi précoce) ; J30 (suivi à distance)
Chaque sous-dossier contient un compte-rendu textuel (clinique) et des résultats d’examens complémentaires
chiffrés (biologie, constantes, etc.).
Objectifs du stage
L’objectif du stage est de contribuer à la chaîne de valorisation des archives médicales :
- Anonymiser les données : définition des règles, application (semi-)automatique, contrôles
(suppression/masquage des identifiants directs et indirects), traçabilité. - Extraire les informations des documents numérisés :
o OCR (notamment Mistral OCR)
o Extraction des champs cliniques et des valeurs chiffrées (travail en collaboration avec l’équipe) - Construire une base de données basique pour l’analyse :
o modèle « patients en lignes » et « variables en colonnes »
o variables par temps (J1, J3–J5, J30) + métadonnées (qualité OCR, provenance, complétude,
dates relatives, etc.)
o production d’un dictionnaire de variables et de règles de normalisation (unités, valeurs
manquantes, formats)
Livrables attendus
- Procédure d’anonymisation + logs/traçabilité + échantillons de validation
- Pipeline d’extraction (OCR → parsing → structuration) + évaluation (taux d’erreur, champs manquants)
- Base de données finale (format à définir : CSV/Parquet/SQL) + dictionnaire de données
Apports du stage
- Mise en œuvre d’un workflow complet de valorisation d’archives médicales
- Expérience concrète en anonymisation et gestion de données sensibles
- Utilisation d’outils OCR et de méthodes d’extraction (NLP, règles, normalisation)
- Contribution directe à une étude clinique/épidémiologique sur le paludisme pédiatrique
Profil recherché
Étudiant en Master 2 (ou diplôme équivalent) : data science, informatique, biomédical, humanités
numériques, NLP, santé publique quantitative, etc.
Compétences souhaitées :
o Python (pandas, regex, parsing de texte)
o Notions de bases de données (SQL, conception de schémas, qualité des données)
o Intérêt pour OCR/NLP (expérience appréciée)
o Rigueur méthodologique (contrôle qualité, documentation, reproductibilité)
o Sensibilité aux enjeux RGPD / confidentialité (un plus)
Conditions du stage
- Lieu : Campus Jussieu
- Durée : 4 à 6 mois
- Début : dès que possible
- Temps de travail : 35 h / semaine
- Gratification : conforme au taux légal en vigueur
Modalités de candidature
Envoyer CV + lettre de motivation (et éventuellement un lien vers un dépôt/projets) par mail à:
frederick.gay@sorbonne-universite.fr et motasem.alrahabi@sorbonne-universite.fr
