Intelligence artificielle / Architectures / On-premises
L’intelligence artificielle dans vos locaux : données, modèles et calcul restent dans vos locaux
Quand le service en ligne est exclu, rien ne sort — ni les documents, ni les requêtes, ni le modèle.Un contrat qui l’interdit, un secret de fabrication, un dossier réglementé, du code source, ou des volumes qui rendraient le service en ligne trop cher : certains cas d’usage exigent que le modèle fonctionne dans votre datacenter. Nous concevons alors l’infrastructure qui leur correspond — le serveur avec processeurs graphiques, l’identité, l’intégration — et nous la tenons ensuite. Ce n’est pas un serveur qu’on vous vend : c’est un système qu’on exploite.
Trois situations où l’hébergement dans vos locaux n’est pas un choix
Nous ne recommandons pas le local par principe. Mais dans ces trois cas, la question ne se pose plus : la contrainte est écrite quelque part, et elle passe avant tout le reste.
Un texte interdit que les données sortent
Un contrat avec un client, une obligation de secret professionnel, une directive interne sur les données de recherche, une réglementation sectorielle. Peu importe la qualité du service en ligne : l’envoi lui-même est le problème. La contrainte réglementaire est la seule qui ne se négocie pas.
On ne discute pas avec une clause.
Ce que le modèle lit est l’actif de l’entreprise
Le code source d’un éditeur, les procédés d’un fabricant, les dossiers d’un cabinet, les résultats d’un laboratoire. Même traité dans un tenant qui ne l’entraîne pas, un tel corpus ne se confie pas à un service que l’on ne contrôle pas de bout en bout.
Le risque n’est pas l’usage, c’est l’exposition.
Le volume rend le service en ligne trop cher
Relire des millions de pages chaque mois, transcrire des milliers d’heures d’appels, servir des centaines de requêtes par minute : facturé à l’usage, cela finit par coûter plus qu’un serveur et son exploitation. Le seuil se calcule sur trois ans, et il arrive plus tôt qu’on le croit.
Au-delà du seuil, le local est l’option économique.
Les cas d’usage qui la justifient
Trois pages détaillées aujourd’hui, et trois qui s’écrivent au fil des projets. Chacune dit ce qui reste humain, et ce que le local demande en plus.
RAG privé
Interroger un corpus confidentiel en langage courant, avec la source citée, sur un modèle qui tourne dans vos locaux parce que le service en ligne est exclu.
PossibleAssistant d’entreprise hébergé en privé
L’assistant conversationnel de l’entreprise, avec Teams pour interface et un modèle qui ne voit jamais un document sortir.
PossibleTraitement intelligent des documents
Quand les documents sont réglementés, les services de lecture de Microsoft s’exécutent en conteneurs dans vos locaux, sur Azure Local.
Assistant de développement privé
Un modèle de code qui tourne sur vos processeurs graphiques, pour un code source qui ne doit pas sortir.
Voix et transcription en local
Enregistrer, transcrire et résumer des appels sans qu’une minute de voix quitte votre réseau.
Analyse de documents à grande échelle
Des millions de pages relues chaque mois : au-delà du seuil, le calcul local est le moins cher.
Ce que « tout dans vos locaux » demande vraiment
Un serveur avec processeurs graphiques, oui. Mais le serveur est la partie facile. Six choses viennent avec, et c’est sur elles que les projets locaux réussissent ou échouent.
Le calcul, dimensionné sur la charge réelle
Le nombre d’utilisateurs simultanés, la taille du modèle, la longueur des documents et le temps de réponse acceptable fixent le nombre et le type de processeurs graphiques. Pas l’inverse.
L’alimentation, le refroidissement, le châssis
Un serveur d’inférence ne se glisse pas dans un châssis prévu pour de la virtualisation. Il s’ajoute à côté, avec ses propres exigences — c’est la chaîne de dimensionnement de nos serveurs Dell PowerEdge.
Le stockage des corpus et des index
Un corpus documentaire et son index vectoriel se comptent en millions de petits fichiers. Le stockage se choisit pour ce profil-là, et pour la vitesse à laquelle le modèle doit y lire.
L’identité et les droits
Un assistant local ne doit pas voir plus qu’un utilisateur : Entra ID reste la source des droits, et chaque réponse respecte ce que la personne a le droit de lire. Sans cela, le local est une fuite interne bien rangée.
Les modèles, et leur mise à jour
Un modèle à poids ouverts se remplace tous les quelques mois. Quelqu’un doit tester le nouveau sur vos questions, comparer, décider, et déployer sans interrompre le service.
La supervision et le retour arrière
Qui voit que les réponses dérivent, que la latence monte, que le disque se remplit ? Qui revient à la version d’avant ? Ces deux questions se règlent avant la mise en service, pas après.
Ce que vous mesurez décide de ce que vous achetez
La chaîne de dimensionnement — les cœurs, la mémoire, les accès disque, les accélérateurs, la croissance — est décrite sur la page des serveurs Dell PowerEdge. Elle vaut mot pour mot pour une plateforme d’intelligence artificielle.
Ce qui fait tourner une intelligence artificielle privée
Les technologies viennent en dernier, et elles se choisissent par projet. Ce que nous mettons en œuvre selon le cas, et ce que chacune fait.
Microsoft Foundry Local
Exécuter des modèles du catalogue Microsoft localement, sans abonnement Azure dans le chemin de la requête : sur un poste de travail, sur Windows Server 2025, et sur Azure Local — cette dernière déclinaison est en préversion chez Microsoft, avec ordonnancement sur plusieurs nœuds et inférence qui continue si la liaison tombe.
C’est la voie qui garde l’outillage Microsoft — mêmes interfaces, mêmes agents — avec le calcul dans vos locaux.
Azure Local
Du matériel que vous possédez, dans vos murs, gouverné et mis à jour depuis Azure — y compris en opérations déconnectées, disponibles depuis février 2026. C’est le socle sur lequel Foundry Local, Edge RAG et les services de lecture de documents s’exécutent en local.
Le matériel doit figurer sur une liste validée : les nœuds Dell pour Azure Local en font partie.
Les modèles à poids ouverts
Des modèles publiés par leurs auteurs, que l’on télécharge et exécute soi-même. Ils permettent de choisir la taille du modèle en fonction du matériel, de le figer dans une version, et de le tester sur vos propres questions avant de le mettre en service.
Le choix du modèle fait partie du projet ; il se refait tous les quelques mois.
Dell PowerEdge avec processeurs graphiques NVIDIA
Des serveurs généralistes qui acceptent un ou deux accélérateurs pour l’inférence, jusqu’aux serveurs de la gamme XE conçus pour plusieurs processeurs graphiques et un refroidissement adapté. Le bon modèle se déduit de la charge mesurée, pas du catalogue.
Avec le stockage Dell pour les corpus, le réseau pour relier les nœuds, et la protection des données pour ne pas perdre trois mois d’index.
Microsoft Entra ID, et vos systèmes
L’identité reste celle que vous avez. Les droits que l’assistant respecte sont les droits de vos partages. Et l’intégration — Teams pour l’interface, SharePoint pour les documents, Dynamics 365 ou l’ERP pour les actions — se fait sans copier vos données ailleurs.
Les capacités de Foundry Local, d’Azure Local et des serveurs PowerEdge sont documentées par Microsoft et par Dell Technologies, et revérifiées avant chaque proposition : elles évoluent d’un trimestre à l’autre, et cette architecture plus vite que les autres.
Le message n’est pas « achetez un serveur »
Beaucoup d’acteurs vendent un serveur avec un modèle dedans, installée en deux jours. Nous vendons autre chose : le choix de l’architecture, puis le système complet, puis son exploitation.
Ce que fait un revendeur de matériel
- Il livre un serveur avec un modèle préinstallé et une interface de conversation.
- Il branche vos documents dessus, tels qu’ils sont.
- Il vous laisse l’exploitation, les mises à jour et la question des droits.
- Il ne vous dira jamais que Copilot suffisait, ou qu’un découpage hybride coûtait moins cher : il ne sait faire que le serveur.
Ce que nous faisons
- Nous choisissons l’architecture d’abord, et nous savons faire les quatre — c’est ce qui rend le conseil possible.
- Nous relions l’assistant à vos droits et à vos systèmes : Entra ID, Teams, SharePoint, Dynamics 365, l’ERP.
- Nous dimensionnons et fournissons le matériel, préparé avant la livraison, en Suisse comme sur vos sites à l’étranger.
- Nous tenons la plateforme : modèles, supervision, coûts, retour arrière — ou nous formons votre équipe à le faire.
Ce qu’il faut savoir avant de décider
Quatre points qui ne figurent pas sur une fiche produit, et que nous mettons sur la table à la première réunion.
Le local ne rend pas le modèle plus juste
Un modèle qui tourne dans vos locaux se trompe autant qu’un modèle en ligne, et il le fait avec le même aplomb. La confidentialité change le lieu du traitement, pas la qualité des réponses. La validation humaine reste écrite sur chaque cas d’usage.
Le modèle que vous pourrez faire tourner est plus petit
Les plus grands modèles du marché demandent un calcul que peu d’entreprises ont dans leur salle machine. Un modèle plus petit, bien choisi et branché sur vos documents, répond souvent mieux à vos questions qu’un grand modèle généraliste — mais moins bien à tout le reste. Nous le testons sur vos questions avant de conclure.
La sauvegarde et le retour arrière font partie du périmètre
Un index de plusieurs millions de fragments met des jours à se reconstruire. Il se sauvegarde comme une base de données, et le retour à la version d’avant d’un modèle se prépare avant la mise à jour, pas pendant l’incident.
Le coût se compare sur trois ans, exploitation comprise
Matériel, électricité, refroidissement, licences, et le temps des personnes qui tiennent la plateforme, face au coût à l’usage du service en ligne pour le même volume. Il arrive que la comparaison ne soit pas favorable au local sur une partie du périmètre. Nous l’écrivons quand c’est le cas.
Comment nous procédons
Rien ne s’achète avant que le prototype ait tourné sur vos vraies données. C’est l’ordre qui évite le serveur qui attend un usage.
Le cadrage
Le cas d’usage, le corpus et ses droits, les contraintes écrites, les volumes attendus et le temps de réponse acceptable. Et le calcul du seuil de coût face au service en ligne et à l’hybride.
Le prototype, sur vos données, sur du matériel prêté ou existant
Un modèle, un extrait représentatif du corpus, une vingtaine d’utilisateurs, trois semaines. On mesure la justesse des réponses, la latence et ce que les utilisateurs en font vraiment.
C’est ici que le projet peut s’arrêter, et c’est bien.
L’architecture et le matériel
Serveurs, processeurs graphiques, stockage, réseau, protection des données, dimensionnés sur les mesures du prototype. Préparés avant la livraison, installés, raccordés à Entra ID et à vos systèmes.
L’industrialisation et l’exploitation au quotidien
Ouverture progressive, supervision, mise à jour des modèles, sauvegarde de l’index, revue des réponses. Par nous, ou par votre équipe que nous formons.
Le périmètre est écrit avant de commencer. Ce que nous prenons en charge, ce que vous gardez, le retour arrière prévu, et la limite dite en clair. Les mêmes ingénieurs vous suivent du premier assessment à l’exploitation au quotidien.
Les pages qui vont avec
Les autres architectures, et l’infrastructure qui porte celle-ci.
Quand une partie seulement doit rester dans vos locaux
L’interface chez Microsoft, les données sensibles dans vos locaux : souvent la réponse la plus économique.
Voir la page PlateformeQuand plusieurs services veulent leur part de l’infrastructure locale
Une infrastructure commune, gouvernée et supervisée, au lieu d’un serveur par équipe.
Voir la page EdgeQuand la décision se prend sur la machine
Le local poussé jusqu’à la ligne de production, au chantier ou au site isolé.
Voir la page Serveurs Dell PowerEdgeLe serveur dimensionné sur vos applications
Quatre gammes, la chaîne de dimensionnement, et la section consacrée à l’intelligence artificielle.
Voir la page Azure Local sur DellL’écosystème Microsoft dans votre datacenter
L’infrastructure Dell validée pour Azure Local, et les trois autres écosystèmes comparés.
Voir la page Microsoft AzureAzure Local : rester dans vos locaux sans rester isolé
Les quatre situations où nous le proposons, et ce que nous ne promettons pas.
Voir la pageParlons de votre cas d’usage
Dites-nous ce qui ne doit pas sortir
Le corpus, les personnes qui doivent y accéder, le texte qui interdit le service en ligne, et un ordre de grandeur des volumes. Nous revenons avec l’architecture que nous étudierions, le seuil de coût, et ce qu’un prototype de trois semaines permettrait de mesurer.
Ce que nous offrons, c’est la rencontre des ingénieurs qui feront le travail. Assessment, prototype et dimensionnement font partie du projet. La discussion qui les précède, elle, ne coûte rien.
Renens, Sion, Châtel-Saint-Denis
Microsoft Solutions Partner et Dell Technologies Gold Partner. Le modèle, l’identité, l’intégration et le serveur qui les porte, avec le même interlocuteur.
Renens VD +41 21 806 37 15
Sion VS +41 27 552 00 22
Châtel-Saint-Denis FR +41 26 322 59 05

