Critères de l'offre
Métiers :
- Expert Exploitation DevOps & SRE (H/F)
Expérience min :
- 1 à 2 ans
Compétences :
- Anglais
Lieux :
- Thános
Conditions :
- Indépendant / Franchisé
- Salaire non précisé
- Temps Plein
Description du poste
Notre client final : un grand groupe multi-entités, construit par croissance externe. Résultat classique : plusieurs équipes, plusieurs façons de faire, et une plateforme Grafana Cloud qui a fait ses preuves sur 2 équipes pilotes. Objectif maintenant : passer à l'échelle sur 10 équipes supplémentaires (périmètre total 20-25 équipes, 300 ingénieurs).
Ce n'est pas un poste de 'je configure des dashboards toute la journée'. C'est un poste d'ingénieur de production qui sait qu'une alerte inutile un dimanche à 3h coûte plus cher qu'une heure d'instrumentation bien faite.
Ce que tu vas faire :
Déployer et industrialiser Grafana Cloud équipe par équipe : connecteurs, dashboards, alerting, healthchecks, avec des setups standardisés réutilisables
Instrumenter aux côtés des devs : métriques, logs structurés, traces distribuées, RUM
Construire les processus d'incident : routage, escalade, runbooks, passer de la détection passive à la détection proactive
Définir les SLI/SLO avec les équipes et faire vivre les error budgets comme outil d'arbitrage, pas comme gadget de reporting
Réduire le bruit d'alerting et maîtriser la cardinalité / les volumes d'ingestion
Accompagner chaque équipe de bout en bout, jusqu'à la montée en maturité réelle
Ce qu'on ne veut pas :
Un profil qui a 'vu du Grafana' sur un POC. On veut quelqu'un qui a déjà déployé une plateforme d'observabilité en conditions réelles, qui a géré des incidents en prod, et qui sait pourquoi 80% des alertes qu'on configure au début finissent par être coupées six mois plus tard.
Description du profil
Prérequis fermes :
8 ans minimum en ingénierie de production, dont une expérience récente et solide sur l'observabilité
Mise en place réelle d'une plateforme Grafana (Cloud ou self-hosted), pas juste de l'usage
Maîtrise opérationnelle d'au moins 3 briques de la suite : Loki, Tempo, Mimir/Thanos, Alloy, Faro, k6
Prometheus + OpenTelemetry, PromQL à l'aise
Expérience réelle de gestion d'incidents en prod, diagnostic et RCA - non négociable
Kubernetes + AWS (EC2, EKS, RDS)
Anglais courant (doc en anglais, équipes anglophones)
Salaire et avantages
Recommandé pour vous
