15 min de lecture
GLM-5.3-Flash sur mes deux PGX : la suite de mes essais en IA locale
Après DeepSeek, j’ai continué mes essais sur les deux PGX avec GLM-5.3-Flash. Installation, décodage spéculatif et usage à plusieurs requêtes : ce que j’ai appris en cherchant une configuration utilisable au quotidien.
11 min de lecture
DeepSeek-V4-Flash sur deux PGX : ce que donnent 68 tok/s en vrai
J'ai fait tourner un modèle de 284 milliards de paramètres sur deux boîtiers de bureau, relancé cinq fois. Benchmarks à l'appui, avec un vrai point faible : plus de 15 minutes de cold start.
16 min de lecture
Servir des LLMs en local sans monopoliser le GPU
Comment on a remplacé l'API OpenAI par une gateway locale à l'UPPA : un GPU partagé, des modèles chargés à la demande, une file VRAM, une gateway étudiante et un mode cluster, sans monopoliser l'infrastructure.
12 min de lecture
J'ai failli installer OpenClaw. J'ai pris Hermes. Voici pourquoi.
345 000 étoiles, 24 plateformes, un marketplace. Et 12% des skills disponibles étaient malveillantes. J'ai comparé les deux agents IA qui font le buzz en 2026, et le choix est moins évident qu'il n'y paraît.
13 min de lecture
Ceph : le stockage distribué ne pardonne pas
Quand Ceph vaut le coup, les pièges de la CRUSH map, le coût réel et la checklist avant de se lancer.
9 min de lecture
L'inférence, c'est un problème de mémoire
Et si la source de tous nos problemes n'est pas le computing qu'on dispose, mais la mémoire ? On decouvre ce que c'est la VRAM et compagnie