llm
2026
11 min de lecture
DeepSeek-V4-Flash sur deux PGX : ce que donnent 68 tok/s en vrai
J'ai fait tourner un modèle de 284 milliards de paramètres sur deux boîtiers de bureau, relancé cinq fois. Benchmarks à l'appui, avec un vrai point faible : plus de 15 minutes de cold start.
16 min de lecture
Servir des LLMs en local sans monopoliser le GPU
Comment on a remplacé l'API OpenAI par une gateway locale à l'UPPA : un GPU partagé, des modèles chargés à la demande, une file VRAM, une gateway étudiante et un mode cluster, sans monopoliser l'infrastructure.
9 min de lecture
L'inférence, c'est un problème de mémoire
Et si la source de tous nos problemes n'est pas le computing qu'on dispose, mais la mémoire ? On decouvre ce que c'est la VRAM et compagnie
7 min de lecture
C'est quoi l'inférence ?
On découvre la deuxième vie d'un modèle IA, l'inférence, et les enjeux qui y sont liés.