À l’atelier

Ce n’est pas un nuage.
C’est un atelier.

Toute intelligence artificielle a besoin de machines, entretenues et surveillées par une équipe qui les connaît. Chez nous, c’est la même équipe qui gère le réseau, le matériel et le modèle, du premier câble jusqu’au dernier prompt.

Ce que « propriétaire » veut vraiment dire

Une seule équipe,
du câble jusqu’au modèle.

Toute intelligence artificielle, où qu’elle tourne, a besoin de machines pour fonctionner, en cloud comme en local. Ces machines doivent être entretenues, surveillées, gérées : ce n’est pas une servitude propre à l’IA privée, c’est une réalité universelle qu’on choisit simplement de regarder en face plutôt que de la déléguer sans la voir.

Une équipe, un seul métier

Chez nous, une seule et même équipe gère l’ensemble de la chaîne, du câble réseau jusqu’au modèle d’intelligence artificielle lui-même. Plus les intervenants se multiplient, plus les zones d’ombre s’accumulent : chaque maillon supplémentaire est un interlocuteur de plus, et un maillon de plus à qui faire confiance.

Ce n’est pas un empilement de prestataires. C’est un seul métier, exercé par les mêmes mains, du début à la fin.

Coûts maîtrisés, évolution assurée

C’est là un point fort de notre vision : la partie matérielle s’appuie sur notre société sœur FSYS Informatique, spécialisée depuis longtemps dans le hardware professionnel recertifié. Résultat concret : un coût d’achat réduit dès le départ, et une architecture modulable que nous faisons évoluer par la suite sans jamais tout reconstruire.

Nous réduisons vos coûts d’achat, et nous assurons l’évolution de votre installation dans la durée.

Confier l’ensemble à une seule équipe pourrait ressembler à une nouvelle dépendance. C’est exactement l’inverse. Parce que la totalité de l’installation vous appartient, le matériel, les modèles, la documentation, les configurations, vous n’êtes jamais captif de nous. Tout est à vous, et reste chez vous. Nous sommes, par construction, facilement remplaçables. C’est la meilleure preuve que vous restez libre.

Sous le capot, sans mystère

Ce qu’il y a vraiment dans la machine.

On parle beaucoup d’intelligence artificielle, rarement de ce qui la fait tourner. Voici, de bas en haut, ce qui compose un serveur d’IA privée : d’abord le matériel, ensuite les couches logicielles qui s’empilent par-dessus (les proportions sont volontairement exagérées, à but didactique).

Le matériel, de la carte mère aux GPU

CPU Matériel

Le chef d’orchestre. Il coordonne les opérations et prépare le travail, mais laisse le gros du calcul de l’IA au GPU.

RAM Matériel

La mémoire de travail immédiate, où vivent les données en cours d’utilisation. Rapide, mais temporaire.

NVMe Matériel

Les disques ultra-rapides. Ils chargent un modèle ou ouvrent un gros volume de documents en une fraction du temps habituel.

GPU Matériel

La force de calcul de l’IA. C’est ici que le modèle réfléchit vraiment.

Les couches logicielles, empilées par-dessus

Noyau Linux Logiciel

La première couche logicielle, posée sur le matériel. La fondation libre et éprouvée sur laquelle tout le reste s’installe.

Modèles (LLM) Logiciel

Les grands modèles de langage eux-mêmes, ouverts et installés chez vous. Le cerveau du système.

Moteur d’inférence Logiciel

Le logiciel qui fait tourner le modèle pour produire ses réponses. L’outil qui exécute le calcul.

Interface Logiciel

La couche que vos équipes voient et utilisent au quotidien, là où l’on pose ses questions et lit les réponses.

Chaque terme technique employé ici est défini juste en dessous, dans le lexique.

Le vocabulaire, en clair

Vingt-trois mots pour s’y retrouver.

Ce que recouvrent, concrètement, les termes qui reviennent le plus souvent quand on parle d’IA privée.

LLM
Sigle de « Large Language Model », grand modèle de langage. Le moteur qui lit, comprend et rédige : Mistral, Llama, ou un équivalent open source, le cerveau de l’ensemble.
Inférence
Le calcul que le modèle effectue pour produire une réponse à une question donnée. Par opposition à l’entraînement (la phase antérieure où il a appris), c’est l’inférence qui tourne en continu sur votre serveur.
Moteur d’inférence
Le logiciel qui fait réellement tourner le modèle pour produire ses réponses, par exemple vLLM ou Ollama. À distinguer de l’inférence, qui est le calcul lui-même : le moteur est l’outil, l’inférence est l’opération.
Noyau Linux
La couche logicielle de base, posée directement sur le matériel, qui fait tourner toute la machine. Libre et éprouvé, il constitue la fondation sur laquelle s’installent les briques d’IA.
Entraînement, affinage (fine-tuning)
La phase où un modèle apprend à partir de grandes quantités de données. Un modèle open source arrive déjà entraîné ; l’affiner (le « fine-tuner ») consiste à le spécialiser sur le vocabulaire ou les documents propres à votre métier.
Brique
Dans notre vocabulaire, un module ajouté autour du modèle pour lui donner une capacité précise : mémoire documentaire, outil métier, automatisation.
RAG
Sigle de « Retrieval-Augmented Generation », génération augmentée par récupération. La technique qui permet au modèle d’aller chercher la bonne information dans vos documents avant de répondre, plutôt que d’improviser sur ce qu’il ne sait pas.
Agent (IA agentique)
Un modèle capable d’enchaîner plusieurs actions de façon autonome pour accomplir une tâche (consulter un document, appeler un outil, rédiger, vérifier), plutôt que de se limiter à répondre une seule fois à une seule question.
GPU et VRAM
Le GPU (carte graphique) est le composant qui exécute les calculs du modèle ; sa VRAM, la mémoire qui lui est dédiée, détermine la taille de modèle qu’il peut faire tourner. Le choix des deux conditionne ce que votre serveur peut réellement faire.
CPU (processeur central)
Le chef d’orchestre de la machine. Il coordonne l’ensemble des opérations et prépare le travail, mais ce n’est pas lui qui effectue le gros des calculs de l’IA : ce rôle revient au GPU.
RAM (mémoire vive)
La mémoire de travail immédiate de la machine, où sont gardées les données en cours d’utilisation. Rapide mais temporaire : elle s’efface à l’extinction. À distinguer de la VRAM, propre au GPU.
NVMe
Un type de disque de stockage ultra-rapide, bien plus véloce qu’un disque dur classique. Il permet de charger un modèle ou d’ouvrir un gros volume de documents en une fraction du temps habituel.
Bus PCIe
Les voies de communication à haut débit de la carte mère, par lesquelles le processeur, la mémoire et les cartes GPU échangent leurs données. Plus le débit est élevé, plus les composants dialoguent vite.
Token
La plus petite unité de texte que le modèle traite, un mot ou un fragment de mot. La vitesse de calcul et la taille de la fenêtre de contexte se comptent en tokens.
Prompt
L’instruction donnée au modèle en langage naturel. Sa formulation précise change beaucoup la qualité de ce qu’il renvoie.
Fenêtre de contexte
La quantité de texte (mesurée en tokens) que le modèle peut prendre en compte en une seule fois. Trop courte, il oublie le début d’une conversation ou d’un document long.
API
Sigle de « Application Programming Interface », interface de programmation. Le point d’accès technique qui permet à un logiciel (le vôtre, ou l’un de nos outils) d’interroger le modèle ou une brique sans passer par une interface visuelle.
On-premise
Littéralement « sur site » : hébergé chez vous, sur votre propre matériel, plutôt que sur les serveurs d’un tiers.
Open source
Un modèle dont le fonctionnement (souvent jusqu’au code et aux poids du réseau de neurones) est public et librement réutilisable, sans dépendre d’une licence fermée ni d’un éditeur unique.
Latence
Le temps d’attente entre la question posée et le début de la réponse.
Chiffrement
Le procédé qui rend une donnée illisible sans une clé spécifique, au repos sur le disque comme pendant son transport sur le réseau.
Cloud Act
Loi américaine de 2018 qui autorise les autorités des États-Unis à exiger l’accès aux données hébergées par une entreprise américaine, même si les serveurs se trouvent hors du territoire américain. Un argument central en faveur d’une infrastructure qui échappe à ce périmètre.
Souveraineté des données
Le fait que vos données restent, à tout moment, sous votre contrôle légal et physique, plutôt que soumises au droit d’un pays tiers.
Nous contacter

Parlons de votre projet.

Un premier échange suffit pour situer, chez vous, ce qui relève du réseau, du matériel, ou de l’IA elle-même.

Nous trouver

F6 Ingénieurs Sàrl
Rue du Conseil-Général 18
1205 Genève, Suisse

Voir sur Google Maps ↗

Nous écrire

Réponse sous 24h ouvrées.