16 min de lecture
Servir des LLMs en local sans monopoliser le GPU
Comment on a remplacé l'API OpenAI par une gateway locale à l'UPPA : un GPU partagé, des modèles chargés à la demande, une file VRAM, une gateway étudiante et un mode cluster, sans monopoliser l'infrastructure.