architecture
2026
16 min de lecture
Servir des LLMs en local sans monopoliser le GPU
Comment on a remplacé l'API OpenAI par une gateway locale à l'UPPA : un GPU partagé, des modèles chargés à la demande, une file VRAM, une gateway étudiante et un mode cluster, sans monopoliser l'infrastructure.
9 min de lecture
L'inférence, c'est un problème de mémoire
Et si la source de tous nos problemes n'est pas le computing qu'on dispose, mais la mémoire ? On decouvre ce que c'est la VRAM et compagnie
7 min de lecture
C'est quoi l'inférence ?
On découvre la deuxième vie d'un modèle IA, l'inférence, et les enjeux qui y sont liés.
7 min de lecture
CRIU : L'art de la résurrection de processus
Et si on arrêtait de tuer nos conteneurs ? Exploration de la mobilité d’état dans les systèmes cloud-native à travers CRIU.
2025
4 min de lecture
Mais en fait, on a rien compris au Zero Trust
On a rien compris au Zero Trust, on se mélange les pinceaux avec les définitions et on finit par construire des infra fragiles.