Aller au contenu

Stage PFE Data Quality Challenge : fiabiliser la donnée avec l'IA générative (Qualité de la donnée, Deep Learning, Modèles de diffusion, Data Science)

Stage 4 à 6 mois

Boulogne-Billancourt, Hauts-de-Seine (France)

Publiée le 23 septembre 2026

  • Contrat

    Stage 4 à 6 mois

  • Lieu

    Boulogne-Billancourt, Hauts-de-Seine (France)

  • Date de début

    Dès que possible

  • Salaire

    1400 EUR - 1700 EUR / mois

  • Télétravail

    Partiel

Ce sujet de stage est rattaché au lab'Innov d'Aubay. il s'agit de la cellulle d'innovation du groupe Aubay. Tu pourras intervenir sur des projets en mode R&D adoptant une approche agile. À Paris ou à Lyon, nous te proposons des sujets Innovants notamment sur l’IA, la Data, le numérique responsable ... et encore pleins d’autres à découvrir !

ici, nous te proposons le stage "Data Quality Challenge"

Et si on rendait la donnée irréprochable ? Benchmarke les algorithmes les plus récents – des statistiques classiques aux modèles de diffusion – pour imputer les valeurs manquantes et détecter les anomalies.

LE SUJET :

La qualité de la donnée est un élément essentiel en entreprise : pour la prise de décisions, un pilotage efficace, ou être le point de départ d'un projet réussi. C'est pourquoi le Lab'Innov d'Aubay en a fait un axe de recherche majeur, adossé à une thèse en cours sur le sujet.

Ta mission : explorer et confronter trois familles d'approches – méthodes statistiques, réseaux profonds et modèles de diffusion – pour imputer les données manquantes et détecter les anomalies. L'objectif n'est pas seulement la performance : nous cherchons la solution la plus sobre et la plus rapide, capable d'être industrialisée dans nos pipelines de données.

Tu travailleras au cœur d'une équipe R&D, avec un vrai sujet ouvert, des moyens de calcul et la liberté de proposer tes propres pistes.

TA CONTRIBUTION :

Il te faudra :

• Établir un état de l'art structuré des trois familles d'algorithmes (statistiques, profonds, diffusion) pour l'imputation et la détection d'anomalies.

• Concevoir un protocole d'évaluation commun mesurant performance, robustesse, temps de calcul et consommation énergétique.

• Implémenter et comparer des algorithmes représentatifs de chaque famille sur des jeux de données de référence.

• Identifier les conditions dans lesquelles les modèles de diffusion apportent un gain réel face à des méthodes plus simples – et à quel coût.

• Restituer tes résultats à l'équipe et contribuer aux publications / livrables du Lab'Innov.

POUR TOI :

• Une immersion dans un projet de recherche.

• La maîtrise de modèles de pointe (dont les modèles de diffusion) sur un cas d'usage concret, pas un exercice d'école.

• Une compétence très recherchée : savoir évaluer et industrialiser un modèle, pas seulement l'entraîner.

• Un livrable valorisable (benchmark, article, soutenance) et une porte d'entrée vers un CDI chez Aubay.

Mots clés : Data Quality, Imputation, Détection d'anomalies, Modèles de diffusion, Deep Learning, Stack technique : Benchmark, R&D, Thèse, Frugalité numérique

Python, PyTorch, scikit-learn, Pandas / NumPy, modèles de diffusion, Git, Jupyter / MLflow

QUI ES-TU ?

Tu es en dernière année d'école d'ingénieur ou équivalent, et tu recherches un stage de fin d'études de 4 à 6 mois, pour démarrer entre février et avril 2027.

Tu es une personne motivée, dynamique et autonome. Avec un attrait pour la R&D et l'innovation. Tu aimes le travail en équipe.

Opportunité de CDI à la fin du stage.

Date limite de candidature

Tant que l’offre est en ligne

Niveau d'étude

Niveau Master, MSc ou Programme Grande Ecole

Fonction

Statistiques, Data & Math App

Plus d’infos sur l’entreprise

AUBAY

Des experts au service d’une transformation digitale réussie