Cadrage stratégique 2026 (mai 2026) — PIVOT PRODUIT
Observabilité pour produit multi-tenant à N réplicas. Sans elle, opérer
à l'échelle est aveugle.
Voir `.claude/memory/VISION_ALIGNMENT.md §0.6`.
Contexte
Aujourd'hui : Prometheus + Grafana + Alertmanager (Wave 7 platform hardening).
Métriques infrastructure OK pour mono-tenant.
Manque pour produit multi-tenant :
- Distributed tracing : suivi d'une request à travers backend → DB → ML → cache
- Log aggregation : logs structurés agrégés et requêtables (Loki / Elasticsearch)
- Tags multi-tenant : chaque métrique / log / trace porte `tenant_id` pour requêtes ciblées
- SLO / SLI par tenant : disponibilité, latence, erreurs mesurées par tenant, pas globalement
- Audit AI Act observable : queries d'audit par tenant exposables aux Notified Bodies
Cible
- OpenTelemetry : instrumentation traces + métriques + logs unifiée (standard CNCF, vendor-neutral)
- Backend traces collector : OpenTelemetry Collector → Jaeger ou Tempo
- Log aggregation : Loki + Promtail (lightweight) OU stack ELK selon volume
- SLO framework : Pyrra OU Sloth pour générer alertes Prometheus à partir de SLOs déclarés
- Dashboards Grafana : un set de dashboards par tenant + un dashboard "multi-tenant overview"
- Conformité RGPD : pas de PHI dans les logs/traces, vérification automatisée
Approche technique proposée
- Backend :
- Ajouter `opentelemetry-api`, `opentelemetry-sdk`, `opentelemetry-instrumentation-fastapi`, `opentelemetry-instrumentation-sqlalchemy` à `requirements.txt`
- Tag automatique `tenant_id` injecté via middleware (extracted from JWT)
- Logs JSON structurés (déjà partiellement en place via `audit`) avec champ `tenant_id`
- Stack ops : ajouter Tempo (traces) + Loki (logs) à `docker-compose.yml --profile monitoring`
- OpenTelemetry Collector : config qui route traces → Tempo, logs → Loki, métriques → Prometheus
- Frontend : @opentelemetry/sdk-web pour traces UI (clic → API → DB) — optionnel
- SLO : 4 SLO de référence par tenant (availability 99.9%, P95 latency tile, P95 latency annotation API, error rate < 1%)
Acceptance criteria
Dépendances
Aval
Références
Cadrage stratégique 2026 (mai 2026) — PIVOT PRODUIT
Contexte
Aujourd'hui : Prometheus + Grafana + Alertmanager (Wave 7 platform hardening).
Métriques infrastructure OK pour mono-tenant.
Manque pour produit multi-tenant :
Cible
Approche technique proposée
Acceptance criteria
Dépendances
Aval
Références