Senior Lead Site Reliability Engineer — Intégration de plateforme
Amadeus IT Group
janv. 2024 – déc. 2025 · Munich, Allemagne
Pilotage de l’intégration, sous l’angle de la fiabilité, d’un produit hôtelier nouvellement acquis vers les standards d’ingénierie du groupe — migration de son outillage, de ses processus et de sa plateforme afin d’assurer une transition en douceur et une continuité de service sans interruption.
- Définition de SLO volontairement plus exigeants que les SLA contractuels — 99,95 % de disponibilité et 300 ms de temps de réponse, contre 99,9 % et 500 ms — afin de conserver une marge avant que les engagements clients ne soient menacés.
- Introduction des RCA et des post-mortems, jusque-là inexistants, animation personnelle des revues pour donner l’exemple, suivi des correctifs jusqu’à leur clôture et blocage des releases tant qu’ils n’étaient pas livrés, selon la règle « un incident ne doit pas se reproduire ».
- Intégration d’une observabilité de bout en bout — métriques et supervision avec Prometheus, alerting avec Alertmanager et logs centralisés avec Splunk — ramenant la latence des logs de 15 minutes, avec pertes occasionnelles, à un quasi-temps réel afin de rendre l’atteinte des SLO réellement visible.
- Mise en place de pipelines CI/CD avec Jenkins et GitHub Actions pour produire des livraisons cohérentes et reproductibles — faisant passer les releases d’une par mois à une par semaine.
- Standardisation des déploiements en utilisant Helm umbrella charts et ArgoCD (GitOps), et évaluation d’un remplacement du processus historique de promotion logicielle.
- Migration d’une quarantaine de microservices de machines virtuelles vers Kubernetes, répartis sur quatre clusters de production — on-premise et cloud, chacun scindé PCI et non-PCI — plus deux clusters de test, et planification des évolutions majeures de la plateforme, dont la création et la migration de clusters.
- Intégration du produit au processus de gestion des changements du groupe et maintien de la conformité des environnements PCI — application régulière des correctifs de sécurité sur l’infrastructure comme sur les applications, et appui aux équipes de développement sur leurs scans Black Duck et SonarQube et leur reporting sécurité.
- Refonte des contrôles d’accès à la plateforme — plus de visibilité pour les développeurs, plus de contrôle pour les SRE — et mise à disposition d’environnements éphémères en libre-service pour les tests d’intégration des développeurs.
- Définition de la matrice RACI, jusqu’alors inexistante — répartition des responsabilités entre les équipes plateforme, SRE et applicatives — puis accompagnement des équipes issues de l’acquisition, sans pratique SRE préalable, en documentant et en diffusant les standards derrière chaque nouveau processus plutôt qu’en l’imposant.
- Travail au sein d’une équipe de 10 personnes répartie sur trois régions (Amériques, Europe, Asie) avec une astreinte en follow-the-sun par rotation hebdomadaire, et participation au recrutement de deux ingénieurs en Inde.
- SLI/SLO/SLA
- Kubernetes
- Helm
- ArgoCD
- GitOps
- Jenkins
- GitHub Actions
- Prometheus
- Alertmanager
- Zabbix
- Datadog
- Splunk
- CI/CD
- PCI
- SonarQube
- Black Duck