Le résultat attendu
Disposer d’une vision factuelle des causes de dégradation, des risques de continuité et des décisions à prendre. L’intervention distingue les quick wins réversibles, les corrections applicatives, les évolutions d’architecture et les investissements de capacité.
Le périmètre analysé
| Domaine | Questions traitées |
|---|---|
| Charge et service | Quels services sont critiques ? Quels SLO, pics, fenêtres et dépendances faut-il protéger ? |
| Moteur | Attentes, CPU, mémoire, I/O, tempdb, parallélisme, configuration et contention. |
| Requêtes | Query Store, régressions de plans, cardinalités, paramètres, statistiques, index et SQL à fort impact. |
| Résilience | Always On, sauvegardes, restauration, RTO/RPO, corruption, bascule et reprise applicative. |
| Sécurité | Chiffrement, certificats, privilèges, comptes techniques, patching et auditabilité. |
| Coûts | Capacité, éditions, virtualisation, parc installé et cohérence avec les droits de licence. |
Notre méthode
1. Cadrage et instrumentation
Nous relions les symptômes aux parcours métier, préparons la collecte et définissons les indicateurs de succès. L’observation doit couvrir des périodes représentatives, pas seulement l’instant de l’incident.
2. Analyse croisée
Les données Query Store, DMVs, journaux, plans, métriques système et historiques d’incidents sont croisées. Un problème applicatif, une contention et une configuration peuvent se renforcer mutuellement.
3. Validation contrôlée
Les recommandations sont testées sur un périmètre maîtrisé avec mesure avant/après, critères d’arrêt et retour arrière. Les changements de compatibilité ou de plans sont gouvernés comme des mises en production.
4. Industrialisation
Nous livrons les runbooks, alertes, seuils, tableaux de bord, responsabilités et rituels de pilotage nécessaires pour éviter le retour au mode crise.
Livrables
- executive summary pour la DSI ;
- baseline et cartographie des principaux goulots ;
- backlog priorisé par valeur, risque, effort et réversibilité ;
- recommandations Query Store, plans, index, statistiques et configuration ;
- matrice de résilience avec RTO/RPO, sauvegardes et scénarios de panne ;
- runbooks et plan de gouvernance à 90 jours.
Indicateurs de réussite
Variabilité des temps de réponse, requêtes à fort impact, incidents, blocages, files Always On, succès de restauration, respect des fenêtres, marge de capacité et actions clôturées sont suivis avec les propriétaires du service.