Ce n’est pas un nuage.
C’est un atelier.
Toute intelligence artificielle a besoin de machines, entretenues et surveillées par une équipe qui les connaît. Chez nous, c’est la même équipe qui gère le réseau, le matériel et le modèle, du premier câble jusqu’au dernier prompt.
Une seule équipe,
du câble jusqu’au modèle.
Toute intelligence artificielle, où qu’elle tourne, a besoin de machines pour fonctionner, en cloud comme en local. Ces machines doivent être entretenues, surveillées, gérées : ce n’est pas une servitude propre à l’IA privée, c’est une réalité universelle qu’on choisit simplement de regarder en face plutôt que de la déléguer sans la voir.
Une équipe, un seul métier
Chez nous, une seule et même équipe gère l’ensemble de la chaîne, du câble réseau jusqu’au modèle d’intelligence artificielle lui-même. Plus les intervenants se multiplient, plus les zones d’ombre s’accumulent : chaque maillon supplémentaire est un interlocuteur de plus, et un maillon de plus à qui faire confiance.
Ce n’est pas un empilement de prestataires. C’est un seul métier, exercé par les mêmes mains, du début à la fin.
Coûts maîtrisés, évolution assurée
C’est là un point fort de notre vision : la partie matérielle s’appuie sur notre société sœur FSYS Informatique, spécialisée depuis longtemps dans le hardware professionnel recertifié. Résultat concret : un coût d’achat réduit dès le départ, et une architecture modulable que nous faisons évoluer par la suite sans jamais tout reconstruire.
Nous réduisons vos coûts d’achat, et nous assurons l’évolution de votre installation dans la durée.
Confier l’ensemble à une seule équipe pourrait ressembler à une nouvelle dépendance. C’est exactement l’inverse. Parce que la totalité de l’installation vous appartient, le matériel, les modèles, la documentation, les configurations, vous n’êtes jamais captif de nous. Tout est à vous, et reste chez vous. Nous sommes, par construction, facilement remplaçables. C’est la meilleure preuve que vous restez libre.
Ce qu’il y a vraiment dans la machine.
On parle beaucoup d’intelligence artificielle, rarement de ce qui la fait tourner. Voici, de bas en haut, ce qui compose un serveur d’IA privée : d’abord le matériel, ensuite les couches logicielles qui s’empilent par-dessus (les proportions sont volontairement exagérées, à but didactique).
CPU Matériel
Le chef d’orchestre. Il coordonne les opérations et prépare le travail, mais laisse le gros du calcul de l’IA au GPU.
RAM Matériel
La mémoire de travail immédiate, où vivent les données en cours d’utilisation. Rapide, mais temporaire.
NVMe Matériel
Les disques ultra-rapides. Ils chargent un modèle ou ouvrent un gros volume de documents en une fraction du temps habituel.
GPU Matériel
La force de calcul de l’IA. C’est ici que le modèle réfléchit vraiment.
Noyau Linux Logiciel
La première couche logicielle, posée sur le matériel. La fondation libre et éprouvée sur laquelle tout le reste s’installe.
Modèles (LLM) Logiciel
Les grands modèles de langage eux-mêmes, ouverts et installés chez vous. Le cerveau du système.
Moteur d’inférence Logiciel
Le logiciel qui fait tourner le modèle pour produire ses réponses. L’outil qui exécute le calcul.
Interface Logiciel
La couche que vos équipes voient et utilisent au quotidien, là où l’on pose ses questions et lit les réponses.
Chaque terme technique employé ici est défini juste en dessous, dans le lexique.
Vingt-trois mots pour s’y retrouver.
Ce que recouvrent, concrètement, les termes qui reviennent le plus souvent quand on parle d’IA privée.
- LLM
- Sigle de « Large Language Model », grand modèle de langage. Le moteur qui lit, comprend et rédige : Mistral, Llama, ou un équivalent open source, le cerveau de l’ensemble.
- Inférence
- Le calcul que le modèle effectue pour produire une réponse à une question donnée. Par opposition à l’entraînement (la phase antérieure où il a appris), c’est l’inférence qui tourne en continu sur votre serveur.
- Moteur d’inférence
- Le logiciel qui fait réellement tourner le modèle pour produire ses réponses, par exemple vLLM ou Ollama. À distinguer de l’inférence, qui est le calcul lui-même : le moteur est l’outil, l’inférence est l’opération.
- Noyau Linux
- La couche logicielle de base, posée directement sur le matériel, qui fait tourner toute la machine. Libre et éprouvé, il constitue la fondation sur laquelle s’installent les briques d’IA.
- Entraînement, affinage (fine-tuning)
- La phase où un modèle apprend à partir de grandes quantités de données. Un modèle open source arrive déjà entraîné ; l’affiner (le « fine-tuner ») consiste à le spécialiser sur le vocabulaire ou les documents propres à votre métier.
- Brique
- Dans notre vocabulaire, un module ajouté autour du modèle pour lui donner une capacité précise : mémoire documentaire, outil métier, automatisation.
- RAG
- Sigle de « Retrieval-Augmented Generation », génération augmentée par récupération. La technique qui permet au modèle d’aller chercher la bonne information dans vos documents avant de répondre, plutôt que d’improviser sur ce qu’il ne sait pas.
- Agent (IA agentique)
- Un modèle capable d’enchaîner plusieurs actions de façon autonome pour accomplir une tâche (consulter un document, appeler un outil, rédiger, vérifier), plutôt que de se limiter à répondre une seule fois à une seule question.
- GPU et VRAM
- Le GPU (carte graphique) est le composant qui exécute les calculs du modèle ; sa VRAM, la mémoire qui lui est dédiée, détermine la taille de modèle qu’il peut faire tourner. Le choix des deux conditionne ce que votre serveur peut réellement faire.
- CPU (processeur central)
- Le chef d’orchestre de la machine. Il coordonne l’ensemble des opérations et prépare le travail, mais ce n’est pas lui qui effectue le gros des calculs de l’IA : ce rôle revient au GPU.
- RAM (mémoire vive)
- La mémoire de travail immédiate de la machine, où sont gardées les données en cours d’utilisation. Rapide mais temporaire : elle s’efface à l’extinction. À distinguer de la VRAM, propre au GPU.
- NVMe
- Un type de disque de stockage ultra-rapide, bien plus véloce qu’un disque dur classique. Il permet de charger un modèle ou d’ouvrir un gros volume de documents en une fraction du temps habituel.
- Bus PCIe
- Les voies de communication à haut débit de la carte mère, par lesquelles le processeur, la mémoire et les cartes GPU échangent leurs données. Plus le débit est élevé, plus les composants dialoguent vite.
- Token
- La plus petite unité de texte que le modèle traite, un mot ou un fragment de mot. La vitesse de calcul et la taille de la fenêtre de contexte se comptent en tokens.
- Prompt
- L’instruction donnée au modèle en langage naturel. Sa formulation précise change beaucoup la qualité de ce qu’il renvoie.
- Fenêtre de contexte
- La quantité de texte (mesurée en tokens) que le modèle peut prendre en compte en une seule fois. Trop courte, il oublie le début d’une conversation ou d’un document long.
- API
- Sigle de « Application Programming Interface », interface de programmation. Le point d’accès technique qui permet à un logiciel (le vôtre, ou l’un de nos outils) d’interroger le modèle ou une brique sans passer par une interface visuelle.
- On-premise
- Littéralement « sur site » : hébergé chez vous, sur votre propre matériel, plutôt que sur les serveurs d’un tiers.
- Open source
- Un modèle dont le fonctionnement (souvent jusqu’au code et aux poids du réseau de neurones) est public et librement réutilisable, sans dépendre d’une licence fermée ni d’un éditeur unique.
- Latence
- Le temps d’attente entre la question posée et le début de la réponse.
- Chiffrement
- Le procédé qui rend une donnée illisible sans une clé spécifique, au repos sur le disque comme pendant son transport sur le réseau.
- Cloud Act
- Loi américaine de 2018 qui autorise les autorités des États-Unis à exiger l’accès aux données hébergées par une entreprise américaine, même si les serveurs se trouvent hors du territoire américain. Un argument central en faveur d’une infrastructure qui échappe à ce périmètre.
- Souveraineté des données
- Le fait que vos données restent, à tout moment, sous votre contrôle légal et physique, plutôt que soumises au droit d’un pays tiers.
Parlons de votre projet.
Un premier échange suffit pour situer, chez vous, ce qui relève du réseau, du matériel, ou de l’IA elle-même.
Réponse sous 24h ouvrées.