Cinq types de mission.
On peut prendre un seul sujet ou tout reprendre. Dans les deux cas, on regarde d’abord comment vous fonctionnez avant de proposer quoi que ce soit.
Mise en place du monitoring
On met en place une stack de monitoring qui repère les problèmes avant vos clients. On fixe les SLO à partir de ce que vivent vos utilisateurs, puis on règle les alertes dessus. Si ça sonne la nuit, il y a vraiment quelque chose à faire.
Ce qui est inclus
- SLI et SLO définis sur vos parcours utilisateurs critiques
- Alerting sur les symptômes et la consommation du budget d’erreur, pas sur le CPU à 80 %
- Dashboards par service, plus une vue d’ensemble pour l’astreinte
- Nettoyage des alertes existantes : on garde, on corrige ou on supprime
Observabilité
Le monitoring vous dit que quelque chose casse. L’observabilité vous dit pourquoi. On met en place des logs structurés et du tracing distribué, pour qu’un ingénieur puisse suivre une requête en erreur à travers chaque service qu’elle touche.
Ce qui est inclus
- Logs structurés, corrélés par request ID et trace ID d’un service à l’autre
- Instrumentation OpenTelemetry et tracing distribué
- Choix d’outillage adapté à votre taille et votre budget, sans dogme éditeur
- Maîtrise des coûts : échantillonnage, rétention, cardinalité
Conception & mise en place des processus
Quand un incident éclate, chacun devrait savoir quoi faire sans fouiller Slack. On écrit vos process de réponse à incident, d’astreinte, d’escalade et de triage. Puis on les fait tourner avec vos équipes jusqu’à ce qu’ils tiennent sans nous.
Ce qui est inclus
- Réponse à incident : rôles, niveaux de sévérité, communication
- Rotations d’astreinte soutenables et chemins d’escalade clairs
- Workflows de triage des tickets avec des SLA internes réalistes
- Post-mortems sans blâme, avec des actions suivies jusqu’au bout
Restructuration de l’équipe support
Votre équipe a grandi plus vite que son organisation. On revoit les rôles, les niveaux de support, le dimensionnement et les flux de travail pour que l’équipe tienne la charge quand l’activité augmente, sans que les gens s’épuisent.
Ce qui est inclus
- Design organisationnel : niveaux L1/L2/L3, rôles et responsabilités
- Modèle de dimensionnement basé sur vos volumes réels
- Interfaces claires entre support, SRE et équipes produit
- Plan de transition progressif, qui ne casse pas ce qui marche
Audit de la fonction support
Un état des lieux de votre organisation support ou SRE : outillage, process, santé de l’équipe et métriques. Vous recevez un rapport écrit et la liste de ce qu’il faut corriger en premier. Il est à vous, que vous travailliez avec nous ensuite ou pas.
Ce qui est inclus
- Entretiens avec l’équipe et revue de l’outillage en place
- Analyse des tickets, incidents et alertes des derniers mois
- Rapport écrit : constats, risques, quick wins
- Feuille de route priorisée par impact et par effort
Si tout le monde ignore vos alertes, votre astreinte ne protège plus rien.
Un premier audit gratuit. On repère ce qui casse et on vous dit par où commencer.
Demander un audit gratuit