Oui : un modèle ouvert (Mistral Small, Llama, Qwen) peut tourner sur un serveur installé dans vos locaux, sans qu'aucune donnée ne sorte vers un fournisseur américain. Pour un usage PME (assistant interne, recherche dans vos documents, résumé de courriels), comptez une station équipée d'une carte graphique de 24 à 32 Go de mémoire, soit environ 4 000 à 6 000 € HT, qui sert confortablement une dizaine d'utilisateurs simultanés avec un modèle de 20 à 30 milliards de paramètres.
Les limites à connaître avant d'investir :
- La taille du modèle dicte le matériel : un modèle de 70 milliards de paramètres, même compressé en 4 bits, demande environ 40 Go de mémoire vidéo, donc deux cartes ou une carte professionnelle de 48 Go.
- La qualité reste en retrait des modèles de pointe hébergés pour le raisonnement complexe ; elle suffit en revanche pour l'extraction, la classification et le RAG sur vos documents.
- L'outillage est mûr : Ollama ou LM Studio pour tester sur un poste, vLLM et Open WebUI pour un service partagé avec comptes utilisateurs.
L'alternative intermédiaire est un hébergement souverain (cloud français qualifié SecNumCloud), sans matériel à maintenir. Pulsar Forge vous aide à choisir entre local et hébergé selon vos volumes et la sensibilité de vos données.