16 min de lecture
Servir des LLMs en local sans monopoliser le GPU
Comment on a remplacé l'API OpenAI par une gateway locale à l'UPPA : un GPU partagé, des modèles chargés à la demande, une file VRAM, une gateway étudiante et un mode cluster, sans monopoliser l'infrastructure.
12 min de lecture
J'ai failli installer OpenClaw. J'ai pris Hermes. Voici pourquoi.
345 000 étoiles, 24 plateformes, un marketplace. Et 12% des skills disponibles étaient malveillantes. J'ai comparé les deux agents IA qui font le buzz en 2026, et le choix est moins évident qu'il n'y paraît.
13 min de lecture
Ceph : le stockage distribué ne pardonne pas
Quand Ceph vaut le coup, les pièges de la CRUSH map, le coût réel et la checklist avant de se lancer.
9 min de lecture
L'inférence, c'est un problème de mémoire
Et si la source de tous nos problemes n'est pas le computing qu'on dispose, mais la mémoire ? On decouvre ce que c'est la VRAM et compagnie
7 min de lecture
C'est quoi l'inférence ?
On découvre la deuxième vie d'un modèle IA, l'inférence, et les enjeux qui y sont liés.
6 min de lecture
AgenticBlog : Le futur de la création de contenu
On parle de mon projet OpenSource AgenticBlog, une plateforme de blogging alimentée par l'IA pour créer du contenu de qualité sans effort.