|

Offre de stage (Master 2 / Ingénieur) : Étude du paludisme chez l’enfant – numérisation, anonymisation et structuration de données cliniques

Présentation et contexte institutionnel

Dans le cadre d’un projet de recherche sur le paludisme chez l’enfant, nous disposons d’un fonds d’archives
médicales papier à valoriser sous forme de données exploitables. Le corpus comprend environ 800 dossiers patients
(≈ 8000 pages numérisées). Chaque dossier est structuré en sous-dossiers temporels : J1 (prise en charge initiale) ;
J3–J5 (suivi précoce) ; J30 (suivi à distance)
Chaque sous-dossier contient un compte-rendu textuel (clinique) et des résultats d’examens complémentaires
chiffrés (biologie, constantes, etc.).

 

Objectifs du stage

L’objectif du stage est de contribuer à la chaîne de valorisation des archives médicales :

  • Anonymiser les données : définition des règles, application (semi-)automatique, contrôles
    (suppression/masquage des identifiants directs et indirects), traçabilité.
  • Extraire les informations des documents numérisés :
    o OCR (notamment Mistral OCR)
    o Extraction des champs cliniques et des valeurs chiffrées (travail en collaboration avec l’équipe)
  • Construire une base de données basique pour l’analyse :
    o modèle « patients en lignes » et « variables en colonnes »
    o variables par temps (J1, J3–J5, J30) + métadonnées (qualité OCR, provenance, complétude,
    dates relatives, etc.)
    o production d’un dictionnaire de variables et de règles de normalisation (unités, valeurs
    manquantes, formats)

 

Livrables attendus

  • Procédure d’anonymisation + logs/traçabilité + échantillons de validation
  • Pipeline d’extraction (OCR → parsing → structuration) + évaluation (taux d’erreur, champs manquants)
  • Base de données finale (format à définir : CSV/Parquet/SQL) + dictionnaire de données

 

Apports du stage

  • Mise en œuvre d’un workflow complet de valorisation d’archives médicales
  • Expérience concrète en anonymisation et gestion de données sensibles
  • Utilisation d’outils OCR et de méthodes d’extraction (NLP, règles, normalisation)
  • Contribution directe à une étude clinique/épidémiologique sur le paludisme pédiatrique

 

Profil recherché

Étudiant en Master 2 (ou diplôme équivalent) : data science, informatique, biomédical, humanités
numériques, NLP, santé publique quantitative, etc.

Compétences souhaitées :

o Python (pandas, regex, parsing de texte)
o Notions de bases de données (SQL, conception de schémas, qualité des données)
o Intérêt pour OCR/NLP (expérience appréciée)
o Rigueur méthodologique (contrôle qualité, documentation, reproductibilité)
o Sensibilité aux enjeux RGPD / confidentialité (un plus)

 

Conditions du stage

  • Lieu : Campus Jussieu
  • Durée : 4 à 6 mois
  • Début : dès que possible
  • Temps de travail : 35 h / semaine
  • Gratification : conforme au taux légal en vigueur

 

Modalités de candidature

Envoyer CV + lettre de motivation (et éventuellement un lien vers un dépôt/projets) par mail à:
frederick.gay@sorbonne-universite.fr et motasem.alrahabi@sorbonne-universite.fr