Data Engineer & Agentic AI — 4 ans d'expérience — Île-de-France

Je construis des systèmes fiables où les agents IA rencontrent la donnée d'entreprise.

Data engineer spécialisé dans l'industrialisation de pipelines et la modélisation d'entrepôts cloud sur GCP. Aujourd'hui, je déploie des agents autonomes et des serveurs MCP qui connectent Claude à des workflows, bases SQL et outils internes — de l'ingestion jusqu'à la production.

01

Profil

Passionné par l'exploitation de la donnée pour créer des solutions à impact, je conçois et déploie des pipelines complets, de l'ingestion à la production, en intégrant les bonnes pratiques MLOps et CI/CD.

Ma spécialité aujourd'hui : les agents IA autonomes et les serveurs MCP qui sécurisent et industrialisent les opérations métier — en connectant les modèles de langage directement à la donnée et aux outils de l'entreprise. Ouvert aux échanges autour des projets Data, IA et innovation.

02

Stack

Langages

PythonPySparkPandasSQLScala

Data & orchestration

SparkKafkaHadoop / HDFSdbtDataikuAirflow

Cloud & bases

BigQueryGCPAzureSnowflakePostgreSQLMongoDBElasticsearch

IA & agentic

Serveurs MCPClaude (Anthropic)Vertex AINLPPyTorchTensorFlow

DevOps & CI/CD

DockerGitGitLabGitHubAnsible

Visualisation

Power BITableau
03

Expérience

Data Engineer & Agentic AI · Agence 79

Janv. 2026 → Aujourd'hui
  • Pipelines de données et workflows automatisés sur GCP, dédiés à l'automatisation des campagnes publicitaires clients.
  • Optimisation de l'architecture BigQuery via dbt : modularisation, tests de qualité, gains de performance et réduction des coûts sur de gros volumes.
  • Conception et déploiement d'agents IA autonomes en Python pour lancer et vérifier les campagnes, réduisant drastiquement le risque d'erreur humaine.
  • Écosystème de serveurs MCP connectant Claude à des workflows, bases SQL et outils internes — automatisant les diagnostics complexes et l'exécution d'actions.
  • Déploiement continu (GitLab CI/CD), documentation technique et accompagnement des équipes métiers à l'adoption des outils d'IA.

Data Engineer · Orange Business

Sept. 2022 → Déc. 2025
  • Pipelines de bout en bout pour prédire les délais de déploiement Fibre, intégrant des sources variées (API, bases SQL).
  • Architectures Data Warehouse et modélisation de schémas analytiques garantissant qualité et fiabilité de la donnée.
  • Orchestration automatisée des flux (Dataiku, SQL, Python) et bonnes pratiques CI/CD (Docker, Git) pour la supervision et la reproductibilité en production.
  • Dashboards Power BI stratégiques et collaboration étroite avec les directions métiers pour transformer la donnée en insights actionnables.

Développeur automatisation · Orange Business · Stage

Mars 2022 → Sept. 2022
  • Scripts Python / SQL et flux Dataiku pour la préparation, le nettoyage et la fiabilisation des jeux de données opérationnels.
  • Première approche de la modélisation de données et de l'intégration de briques algorithmiques dans les workflows métier.
04

Projets personnels

P.01

RAG_Ollama

Agentic AI
ObjectifChatbot RAG fonctionnant 100% en local : aucune API externe, aucune donnée qui quitte la machine — une réponse aux contraintes RGPD et de confidentialité des entreprises.
ApprocheIndexation vectorielle des documents avec FAISS, récupération des passages pertinents par similarité, génération contrainte au contexte via llama3.2 (Ollama), interface de chat Streamlit.
StackPython FAISS Ollama Streamlit
P.02

HealthDataWarehousing

Data Warehouse
ObjectifConstruire un entrepôt de données dimensionnel sur les passages aux urgences COVID-19 (données ouvertes Santé publique France), du fichier brut à la table analytique.
ApprochePipeline ETL orchestré par un DAG Airflow conteneurisé : extraction et nettoyage pandas, modèle en étoile chargé dans PostgreSQL, notification email et notebook d'analyse.
StackAirflow PostgreSQL Docker Python Modélisation DWH
P.03

UrbanMobIDF

Data Engineering
ObjectifOptimiser les itinéraires sur le réseau de transport d'Île-de-France à partir des flux GTFS officiels d'Île-de-France Mobilités.
ApprocheIngestion automatisée des données GTFS (rafraîchies 3×/jour), modélisation du réseau en graphe orienté pondéré, calcul de plus court chemin (Dijkstra), app Streamlit avec alertes et calculateur CO2. Déploiement CI/CD sur Azure.
StackPython NetworkX SQLite Streamlit GitHub Actions
P.04

bank-churn-prediction

Machine Learning
ObjectifPrédire quels clients d'une banque risquent de résilier leur carte de crédit, sur un jeu de données fortement déséquilibré (~16% de churners).
ApprocheRandom Forest avec rééchantillonnage du train, sélection de features par RFECV et optimisation des hyperparamètres orientée recall — 85% des vrais partants détectés, AUC-ROC 0.99.
Stackscikit-learn imbalanced-learn Python Jupyter
Tous les dépôts sur GitHub ↗
05

Certifications

Google Cloud

Build Data Lakes and Data Warehouses on Google Cloud

2026
DataCamp

Data Engineer Associate

2025
06

Contact

À l'écoute de nouvelles opportunités autour de la data engineering et des systèmes agentic. Le mail ou LinkedIn sont les meilleures portes d'entrée.

Langues : Français (natif) · Anglais (TOEIC 800)