Aller au contenu principal

Disponibilité & exploitation

Ce qui protège la continuité de service

MécanismeCe qu'il couvre
Supervision continue des instancesUne instance qui ne répond plus est redémarrée automatiquement
Réplication des volumesPerte d'un disque ou d'un nœud sans perte de données
Réplication des basesBascule automatique sur la réplique en cas de panne du primaire
Réconciliation GitOpsToute dérive de configuration est corrigée automatiquement
Sauvegardes chiffréesRecours en cas d'incident majeur ou d'erreur humaine
Renouvellement automatique des certificatsPas d'expiration TLS surprise

Ce que vous voyez depuis le tableau de bord

  • L'état de chaque outil : en cours de déploiement, prêt, indisponible.
  • Les journaux d'exécution de vos instances, utiles pour qualifier un problème avant de nous contacter (formules à infrastructure dédiée).
  • La possibilité de relancer une instance qui se comporte anormalement.

Maintenance

Les mises à jour des outils sont déployées par le pipeline d'intégration continue de la plateforme. Elles se font instance par instance ; une interruption courte est possible sur l'outil concerné le temps du redémarrage.

Les opérations à impact notable sont annoncées à l'avance aux administrateurs des structures concernées.

En cas d'incident

  1. Vérifiez l'état de l'outil dans le tableau de bord.
  2. Consultez les journaux : ils indiquent souvent la cause (erreur de configuration côté outil, dépendance externe, etc.).
  3. Si le problème persiste ou concerne plusieurs outils, contactez-nous en précisant l'outil, l'heure et le comportement observé.

Vos leviers pour limiter les interruptions

SituationRéflexe
Opération risquée (import, changement lourd)Créer un instantané avant
Montée en charge prévue (campagne, lancement)Nous prévenir en amont
Dépendance à un service tiersDocumenter le contact et le contrat côté tiers
Données critiquesExporter régulièrement, en plus des sauvegardes