Systèmes de production & architecture

Projets

Études de cas d’ingénierie de plateforme en production, infrastructure bare-metal et systèmes de télémétrie IA souverains.

Filtrer l’archive
01● Plateforme en production

Production MCP Telemetry Suite

Problème

Les agents de codage IA (Claude, Cursor) manquent de contexte d’infrastructure en temps réel et de visibilité sur les pannes de fournisseurs.

Architecture

Démon open source Model Context Protocol (MCP) diffusant en direct l’état AWS/Vercel/GitHub, la télémétrie DNS DoH et la vérification SSL.

Résultat

Exécution d’outils en moins de 50 ms pour les boucles agentiques, sans faux positifs de diagnostic.

TypeScriptProtocole MCPProduction activeSystèmesSupervision
02● Architecture de production

Cluster CrowdSec Hub-and-Spoke multi-nœuds

Problème

Journaux de serveurs edge cloisonnés et blocage d’IP retardé sur des reverse proxies distribués.

Architecture

Hub CrowdSec centralisé avec Local API (LAPI) dans un LXC Proxmox isolé, orchestrant des bouncers edge multi-nœuds via mTLS.

Résultat

Remédiation des menaces en temps réel sur tous les points d’entrée en moins de 100 ms ; aucun blocage faussement positif.

Python/GoApache-2.0Production vérifiéeSécuritéSystèmesProxmox LXC
03● 92 % de réduction de coût

Stack Kubernetes bare-metal auto-réparatrice

Problème

Surcoût extrême d’AWS EKS en gestion et calcul (1 420 $/mois) avec dérive de configuration OS.

Architecture

Talos Linux immuable sur bare-metal chez Hetzner avec routage hôte Cilium eBPF et pipelines GitOps ArgoCD.

Résultat

Coût mensuel ramené à 108 $/mois (92 % de réduction) tout en améliorant le débit réseau et en éliminant les vulnérabilités de l’OS.

Linux/TalosOpenTofuArchitecture vérifiéeSystèmesKubernetesCilium eBPF
04● RPO < 1 min

Reprise après sinistre PostgreSQL sans interruption

Problème

Risque d’indisponibilité catastrophique et restaurations de snapshots lentes sous forte charge transactionnelle.

Architecture

Diffusion continue des journaux Write-Ahead via WAL-G vers un stockage objet S3, avec restauration ponctuelle automatisée et pooling PgBouncer.

Résultat

RPO inférieur à la minute atteint ; restauration vérifiée de plus de 100 Go en moins de 12 minutes sans corruption de données.

SQL/PythonWAL-GVérifié en productionSystèmesSécuritéSupervision