Disponibilité & exploitation
Ce qui protège la continuité de service
| Mécanisme | Ce qu'il couvre |
|---|---|
| Supervision continue des instances | Une instance qui ne répond plus est redémarrée automatiquement |
| Réplication des volumes | Perte d'un disque ou d'un nœud sans perte de données |
| Réplication des bases | Bascule automatique sur la réplique en cas de panne du primaire |
| Réconciliation GitOps | Toute dérive de configuration est corrigée automatiquement |
| Sauvegardes chiffrées | Recours en cas d'incident majeur ou d'erreur humaine |
| Renouvellement automatique des certificats | Pas d'expiration TLS surprise |
Ce que vous voyez depuis le tableau de bord
- L'état de chaque outil : en cours de déploiement, prêt, indisponible.
- Les journaux d'exécution de vos instances, utiles pour qualifier un problème avant de nous contacter (formules à infrastructure dédiée).
- La possibilité de relancer une instance qui se comporte anormalement.
Maintenance
Les mises à jour des outils sont déployées par le pipeline d'intégration continue de la plateforme. Elles se font instance par instance ; une interruption courte est possible sur l'outil concerné le temps du redémarrage.
Les opérations à impact notable sont annoncées à l'avance aux administrateurs des structures concernées.
En cas d'incident
- Vérifiez l'état de l'outil dans le tableau de bord.
- Consultez les journaux : ils indiquent souvent la cause (erreur de configuration côté outil, dépendance externe, etc.).
- Si le problème persiste ou concerne plusieurs outils, contactez-nous en précisant l'outil, l'heure et le comportement observé.
Vos leviers pour limiter les interruptions
| Situation | Réflexe |
|---|---|
| Opération risquée (import, changement lourd) | Créer un instantané avant |
| Montée en charge prévue (campagne, lancement) | Nous prévenir en amont |
| Dépendance à un service tiers | Documenter le contact et le contrat côté tiers |
| Données critiques | Exporter régulièrement, en plus des sauvegardes |