Bonjour,
Je suis actuellement à la recherche d’un(e) Expert ELK/ DevOps orienté RUN pour un poste en CDD basé à Sophia Antipolis.
Informations :
- Démarrage : ASAP
- Durée: 6 mois renouvelable
- Rythme : temps plein (3 jours sur site / 2 jours TT)
- Lieu : Sophia Antipolis, France
Description :
Priorité du besoin : l’analyse applicative est plus importante que la partie administration Elastic.
Répartition indicative :
· Administration ELK logs : ~30 %
· Analyse/ interprétation des logs ELK, check des erreurs récurrentes, proactivité pour réduire les incidents : ~50 %
· Montée en compétences des équipes N2 pour réduire le RUN niveau 3 : ~20 %
Profil idéal : un expert ELK + développement, idéalement un ancien développeur qui apprécie les activités de RUN.
Lecture du Java : gros plus.
Le profil devra aimer le RUN au quotidien, avec une forte dimension de gestion et d’analyse des problématiques en lien avec les SDM (Service Delivery Managers).
Il sera un point d’entrée en amont des incidents, avec pour objectif d'identifier et traiter les problématiques avant qu'elles ne deviennent des incidents majeurs.
Enjeu majeur :
Réduire le support N3 et faire monter le N2 en compétences, notamment en leur donnant les outils et méthodes pour être plus réactifs et autonomes.
Aujourd’hui, il existe une rupture entre les niveaux N2/N3 : le besoin est d’avoir quelqu’un qui réalise une analyse quotidienne et préventive plutôt que d’intervenir uniquement lorsqu’un problème important est remonté par le SDM.
Objectif final : maintenir la qualité applicative, anticiper les problèmes et limiter les escalades vers le N3.
Qualifications requises
· Profil senior, idéalement Bac+5 / école d’ingénieur, avec une forte expérience en production et environnements critiques.
· Expertise indispensable sur la stack Elastic : Elasticsearch, Kibana, Logstash, Filebeat → administration, gestion des index/ILM, pipelines, alerting.
· Forte compétence en analyse de logs et diagnostic production : corrélation des signaux, identification de patterns récurrents, détection des signaux faibles et recherche de root cause.
· Dimension Observabilité importante : APM / OpenTelemetry, dashboards, alerting préventif, SLI/SLO.
· Capable de faire le lien entre les logs et le code applicatif, avec une bonne maîtrise de Java.
· Connaissances complémentaires : Python, JMeter, Kubernetes, PostgreSQL, Cassandra, Jenkins, Sonar, Nexus, CI/CD.
· Profil avec une vraie posture de coach/pédagogue : accompagnement des équipes support et DEV, création de runbooks, montée en autonomie et réduction des escalades N3.
· Capable de travailler à la fois sur le RUN et le préventif, avec une approche fiabilité / amélioration continue.
· À l’aise pour présenter ses analyses et recommandations auprès des équipes techniques comme des instances de pilotage (SAFe / PI Planning).