Description du poste
Notre client, acteur majeur de l'édition, recherche un(e) Expert Data & Retrieval pour rejoindre son équipe "AI Service", au cœur des enjeux d'intelligence artificielle appliquée au domaines réglementés.
Votre mission : concevoir des pipelines de données robustes capables d'ingérer, nettoyer et indexer d'énormes corpus juridiques, puis d'exposer une recherche rapide et pertinente (sémantique et hybride) au service de plusieurs équipes à travers l'Europe. Vous garantirez la fraîcheur des index et la qualité du retrieval, tout en pilotant une complexité technique de haut niveau : volumétrie, hétérogénéité des sources, évaluation de la pertinence, scalabilité.
Vos missions principales :
1. Collecte, ingestion & indexation
-
Concevoir des pipelines d'ingestion de sources hétérogènes (édition, open data, bases juridiques) : parsing, nettoyage, chunking, normalisation
-
Choisir et industrialiser les modèles d'embeddings, alimenter et maintenir les bases vectorielles
-
Garantir la scalabilité de l'indexation sur des corpus massifs et la traçabilité des données (lignage, versioning)
2. Recherche & pertinence (Retrieval)
-
Combiner recherche lexicale et sémantique (BM25 + embeddings) avec reranking et filtrage par métadonnées
-
Mettre en place des jeux de tests et métriques de pertinence (recall, precision, nDCG, MRR)
-
Structurer la phase de retrieval alimentant les LLM (contexte, citations, dé-duplication, gestion des fenêtres de contexte)
-
Instrumenter les pipelines (observabilité) et garantir la sécurité/conformité des données (RGPD, cloisonnement par pays)
3. Leadership technique & gouvernance
-
Promouvoir les pratiques Clean Code, SOLID, tests automatisés
-
Contribuer au rayonnement technique du groupe (veille, articles, meetups, open-source)
Pourquoi cette mission est unique :
-
Intervention au moment de décisions structurantes, réel pouvoir d'influence sur la stack finale
-
Défi data rare : indexer et rendre pertinent un patrimoine juridique massif et hétérogène au service de l'IA
-
Vision long terme — création d'un standard industriel pour le groupe, pas une simple feature à livrer
-
Équipe d'experts soudée et bienveillante, préembauche pensée pour une intégration durable
Profil recherché
Formation : Master, PhD, ou équivalent.
Compétences techniques requises :
-
Langages : Python 3.11+ (maîtrise requise), Go
-
Indexation : bases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25
-
Embeddings & NLP : sentence-transformers, modèles d'embeddings, tokenisation, parsing de documents
-
RAG & LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock
-
Data & infra : PostgreSQL, Airflow/Spark (ou équivalent), Kafka, Redis, Docker, CI/CD, K8S
-
Tests & évaluation : Pytest, métriques de pertinence (recall, nDCG, MRR)
Expérience attendue :
-
Expérience avérée en data engineering / information retrieval sur des volumes massifs en production
-
Expertise retrieval confirmée : indexation, embeddings, recherche hybride, capacité à mesurer et améliorer la pertinence
-
Culture data solide : pipelines reproductibles, qualité et lignage des données, versioning
-
Bonne culture IA/ML : embeddings, NLP, compréhension des LLM (sans nécessairement en être l'expert serving)
-
Polyvalence appréciée : appétence pour d'autres langages (Java notamment) pour du transverse
-
Anglais fluide (contexte européen quotidien)
Soft skills :
-
Vision produit — gérer son moteur de recherche comme un produit, au service des autres développeurs
-
Leadership technique & pédagogie — capacité à évangéliser les bonnes pratiques
-
Obsession de la qualité — rigueur sur la sécurité des données (legaltech) et la fiabilité des services
-
Esprit d'innovation et curiosité pour l'écosystème IA/NLP/data
-
Communication — savoir vulgariser des concepts complexes