Skip to content
Lambert Consulting

Intelligence artificielle, une offre transversale

Le résultat d'abord. L'infrastructure ensuite.

Un assistant sur vos documents, un contrôle en bout de ligne, une plateforme pour plusieurs services. Où l'intelligence artificielle s'exécute se décide d'après vos données, pas d'après un catalogue.

Voir toutes les solutions
4Architectures comparées, critère par critère
2 métiersLogiciel et matériel sous un même toit
Tous les cas d'usageLe cas d'usage d'abord, la technologie en dernier

Notre premier département

Ce qui doit fonctionner tous les matins.

Vos serveurs, vos postes, votre téléphonie et vos identités. Le socle que personne ne regarde tant qu'il tient, et que tout le monde regarde le jour où il lâche.

Voir le département
Multi-sitesProjets nationaux et internationaux
3Agences en Suisse romande
Voir nos projets clientsÉtudes de cas et références

Ce qui ne change pas

Un périmètre écrit avant de commencer.

Les mêmes personnes jusqu'au bout, un retour arrière prévu, et une limite dite en clair. C'est vrai des neuf domaines, quel que soit le sujet et quelle que soit la façon de nous engager.

Comment nous travaillons
9Domaines de services
3Façons de s'engager : forfait, régie, contrat
Dites-nous où vous en êtesL'établissement d'une offre est gratuit

Notre façon de travailler

Un conseil, pas un argumentaire.

Notre approche est consultative : nous vous disons ce que nous pensons, y compris quand cela ne va pas dans notre intérêt. C'est ce qui fait aboutir les projets.

Qui sommes-nous
1995Premier projet, sur Microsoft SMS
FamilialeÀ taille humaine et pérenne
Nous écrirePremier échange de 30 minutes, sans engagement
Technicien intervenant sur un équipement réseau avec un ordinateur portable, dans une salle machine

Intelligence artificielle / Architectures / On-premises

L’intelligence artificielle dans vos locaux : données, modèles et calcul restent dans vos locaux

Quand le service en ligne est exclu, rien ne sort — ni les documents, ni les requêtes, ni le modèle.

Un contrat qui l’interdit, un secret de fabrication, un dossier réglementé, du code source, ou des volumes qui rendraient le service en ligne trop cher : certains cas d’usage exigent que le modèle fonctionne dans votre datacenter. Nous concevons alors l’infrastructure qui leur correspond — le serveur avec processeurs graphiques, l’identité, l’intégration — et nous la tenons ensuite. Ce n’est pas un serveur qu’on vous vend : c’est un système qu’on exploite.

Rien ne quitte votre infrastructure Le corpus, l’index, le modèle et les journaux vivent dans votre datacenter, sous vos droits Entra ID.
Le logiciel et le matériel, avec le même interlocuteur Microsoft Solutions Partner et Dell Technologies Gold Partner : du modèle jusqu’au refroidissement du serveur.
Nous disons aussi quand ce n’est pas nécessaire Le local coûte chaque mois. Quand Copilot ou un découpage hybride suffit, nous l’écrivons.

Trois situations où l’hébergement dans vos locaux n’est pas un choix

Nous ne recommandons pas le local par principe. Mais dans ces trois cas, la question ne se pose plus : la contrainte est écrite quelque part, et elle passe avant tout le reste.

01

Un texte interdit que les données sortent

Un contrat avec un client, une obligation de secret professionnel, une directive interne sur les données de recherche, une réglementation sectorielle. Peu importe la qualité du service en ligne : l’envoi lui-même est le problème. La contrainte réglementaire est la seule qui ne se négocie pas.

On ne discute pas avec une clause.

02

Ce que le modèle lit est l’actif de l’entreprise

Le code source d’un éditeur, les procédés d’un fabricant, les dossiers d’un cabinet, les résultats d’un laboratoire. Même traité dans un tenant qui ne l’entraîne pas, un tel corpus ne se confie pas à un service que l’on ne contrôle pas de bout en bout.

Le risque n’est pas l’usage, c’est l’exposition.

03

Le volume rend le service en ligne trop cher

Relire des millions de pages chaque mois, transcrire des milliers d’heures d’appels, servir des centaines de requêtes par minute : facturé à l’usage, cela finit par coûter plus qu’un serveur et son exploitation. Le seuil se calcule sur trois ans, et il arrive plus tôt qu’on le croit.

Au-delà du seuil, le local est l’option économique.

Les cas d’usage qui la justifient

Trois pages détaillées aujourd’hui, et trois qui s’écrivent au fil des projets. Chacune dit ce qui reste humain, et ce que le local demande en plus.

Recommandée

RAG privé

Interroger un corpus confidentiel en langage courant, avec la source citée, sur un modèle qui tourne dans vos locaux parce que le service en ligne est exclu.

On-premisesHybride
Possible

Assistant d’entreprise hébergé en privé

L’assistant conversationnel de l’entreprise, avec Teams pour interface et un modèle qui ne voit jamais un document sortir.

En ligneOn-premisesHybride
Possible

Traitement intelligent des documents

Quand les documents sont réglementés, les services de lecture de Microsoft s’exécutent en conteneurs dans vos locaux, sur Azure Local.

En ligneOn-premisesHybride
À venir

Assistant de développement privé

Un modèle de code qui tourne sur vos processeurs graphiques, pour un code source qui ne doit pas sortir.

On-premisesHybride
À venir

Voix et transcription en local

Enregistrer, transcrire et résumer des appels sans qu’une minute de voix quitte votre réseau.

On-premisesHybride
À venir

Analyse de documents à grande échelle

Des millions de pages relues chaque mois : au-delà du seuil, le calcul local est le moins cher.

On-premises

Ce que « tout dans vos locaux » demande vraiment

Un serveur avec processeurs graphiques, oui. Mais le serveur est la partie facile. Six choses viennent avec, et c’est sur elles que les projets locaux réussissent ou échouent.

01

Le calcul, dimensionné sur la charge réelle

Le nombre d’utilisateurs simultanés, la taille du modèle, la longueur des documents et le temps de réponse acceptable fixent le nombre et le type de processeurs graphiques. Pas l’inverse.

02

L’alimentation, le refroidissement, le châssis

Un serveur d’inférence ne se glisse pas dans un châssis prévu pour de la virtualisation. Il s’ajoute à côté, avec ses propres exigences — c’est la chaîne de dimensionnement de nos serveurs Dell PowerEdge.

03

Le stockage des corpus et des index

Un corpus documentaire et son index vectoriel se comptent en millions de petits fichiers. Le stockage se choisit pour ce profil-là, et pour la vitesse à laquelle le modèle doit y lire.

04

L’identité et les droits

Un assistant local ne doit pas voir plus qu’un utilisateur : Entra ID reste la source des droits, et chaque réponse respecte ce que la personne a le droit de lire. Sans cela, le local est une fuite interne bien rangée.

05

Les modèles, et leur mise à jour

Un modèle à poids ouverts se remplace tous les quelques mois. Quelqu’un doit tester le nouveau sur vos questions, comparer, décider, et déployer sans interrompre le service.

06

La supervision et le retour arrière

Qui voit que les réponses dérivent, que la latence monte, que le disque se remplit ? Qui revient à la version d’avant ? Ces deux questions se règlent avant la mise en service, pas après.

Le dimensionnement

Ce que vous mesurez décide de ce que vous achetez

La chaîne de dimensionnement — les cœurs, la mémoire, les accès disque, les accélérateurs, la croissance — est décrite sur la page des serveurs Dell PowerEdge. Elle vaut mot pour mot pour une plateforme d’intelligence artificielle.

Voir la chaîne de dimensionnement

Ce qui fait tourner une intelligence artificielle privée

Les technologies viennent en dernier, et elles se choisissent par projet. Ce que nous mettons en œuvre selon le cas, et ce que chacune fait.

Microsoft Foundry Local

Exécuter des modèles du catalogue Microsoft localement, sans abonnement Azure dans le chemin de la requête : sur un poste de travail, sur Windows Server 2025, et sur Azure Local — cette dernière déclinaison est en préversion chez Microsoft, avec ordonnancement sur plusieurs nœuds et inférence qui continue si la liaison tombe.

C’est la voie qui garde l’outillage Microsoft — mêmes interfaces, mêmes agents — avec le calcul dans vos locaux.

Azure Local

Du matériel que vous possédez, dans vos murs, gouverné et mis à jour depuis Azure — y compris en opérations déconnectées, disponibles depuis février 2026. C’est le socle sur lequel Foundry Local, Edge RAG et les services de lecture de documents s’exécutent en local.

Le matériel doit figurer sur une liste validée : les nœuds Dell pour Azure Local en font partie.

Les modèles à poids ouverts

Des modèles publiés par leurs auteurs, que l’on télécharge et exécute soi-même. Ils permettent de choisir la taille du modèle en fonction du matériel, de le figer dans une version, et de le tester sur vos propres questions avant de le mettre en service.

Le choix du modèle fait partie du projet ; il se refait tous les quelques mois.

Dell PowerEdge avec processeurs graphiques NVIDIA

Des serveurs généralistes qui acceptent un ou deux accélérateurs pour l’inférence, jusqu’aux serveurs de la gamme XE conçus pour plusieurs processeurs graphiques et un refroidissement adapté. Le bon modèle se déduit de la charge mesurée, pas du catalogue.

Avec le stockage Dell pour les corpus, le réseau pour relier les nœuds, et la protection des données pour ne pas perdre trois mois d’index.

Microsoft Entra ID, et vos systèmes

L’identité reste celle que vous avez. Les droits que l’assistant respecte sont les droits de vos partages. Et l’intégration — Teams pour l’interface, SharePoint pour les documents, Dynamics 365 ou l’ERP pour les actions — se fait sans copier vos données ailleurs.

Les capacités de Foundry Local, d’Azure Local et des serveurs PowerEdge sont documentées par Microsoft et par Dell Technologies, et revérifiées avant chaque proposition : elles évoluent d’un trimestre à l’autre, et cette architecture plus vite que les autres.

Le message n’est pas « achetez un serveur »

Beaucoup d’acteurs vendent un serveur avec un modèle dedans, installée en deux jours. Nous vendons autre chose : le choix de l’architecture, puis le système complet, puis son exploitation.

Ce que fait un revendeur de matériel

  • Il livre un serveur avec un modèle préinstallé et une interface de conversation.
  • Il branche vos documents dessus, tels qu’ils sont.
  • Il vous laisse l’exploitation, les mises à jour et la question des droits.
  • Il ne vous dira jamais que Copilot suffisait, ou qu’un découpage hybride coûtait moins cher : il ne sait faire que le serveur.

Ce que nous faisons

  • Nous choisissons l’architecture d’abord, et nous savons faire les quatre — c’est ce qui rend le conseil possible.
  • Nous relions l’assistant à vos droits et à vos systèmes : Entra ID, Teams, SharePoint, Dynamics 365, l’ERP.
  • Nous dimensionnons et fournissons le matériel, préparé avant la livraison, en Suisse comme sur vos sites à l’étranger.
  • Nous tenons la plateforme : modèles, supervision, coûts, retour arrière — ou nous formons votre équipe à le faire.

Ce qu’il faut savoir avant de décider

Quatre points qui ne figurent pas sur une fiche produit, et que nous mettons sur la table à la première réunion.

Le local ne rend pas le modèle plus juste

Un modèle qui tourne dans vos locaux se trompe autant qu’un modèle en ligne, et il le fait avec le même aplomb. La confidentialité change le lieu du traitement, pas la qualité des réponses. La validation humaine reste écrite sur chaque cas d’usage.

Le modèle que vous pourrez faire tourner est plus petit

Les plus grands modèles du marché demandent un calcul que peu d’entreprises ont dans leur salle machine. Un modèle plus petit, bien choisi et branché sur vos documents, répond souvent mieux à vos questions qu’un grand modèle généraliste — mais moins bien à tout le reste. Nous le testons sur vos questions avant de conclure.

La sauvegarde et le retour arrière font partie du périmètre

Un index de plusieurs millions de fragments met des jours à se reconstruire. Il se sauvegarde comme une base de données, et le retour à la version d’avant d’un modèle se prépare avant la mise à jour, pas pendant l’incident.

Le coût se compare sur trois ans, exploitation comprise

Matériel, électricité, refroidissement, licences, et le temps des personnes qui tiennent la plateforme, face au coût à l’usage du service en ligne pour le même volume. Il arrive que la comparaison ne soit pas favorable au local sur une partie du périmètre. Nous l’écrivons quand c’est le cas.

Comment nous procédons

Rien ne s’achète avant que le prototype ait tourné sur vos vraies données. C’est l’ordre qui évite le serveur qui attend un usage.

01

Le cadrage

Le cas d’usage, le corpus et ses droits, les contraintes écrites, les volumes attendus et le temps de réponse acceptable. Et le calcul du seuil de coût face au service en ligne et à l’hybride.

Ce que vous recevez La fiche du cas d’usage et ses limites La comparaison chiffrée des architectures possibles
02

Le prototype, sur vos données, sur du matériel prêté ou existant

Un modèle, un extrait représentatif du corpus, une vingtaine d’utilisateurs, trois semaines. On mesure la justesse des réponses, la latence et ce que les utilisateurs en font vraiment.

C’est ici que le projet peut s’arrêter, et c’est bien.

Ce que vous recevez Les mesures : justesse, latence, usage La décision d’aller plus loin, ou pas, argumentée
03

L’architecture et le matériel

Serveurs, processeurs graphiques, stockage, réseau, protection des données, dimensionnés sur les mesures du prototype. Préparés avant la livraison, installés, raccordés à Entra ID et à vos systèmes.

Ce que vous recevez La configuration justifiée, poste par poste Une plateforme raccordée, pas un carton
04

L’industrialisation et l’exploitation au quotidien

Ouverture progressive, supervision, mise à jour des modèles, sauvegarde de l’index, revue des réponses. Par nous, ou par votre équipe que nous formons.

Ce que vous recevez Le dossier d’exploitation, utilisable par une autre équipe La revue trimestrielle des réponses et des coûts

Le périmètre est écrit avant de commencer. Ce que nous prenons en charge, ce que vous gardez, le retour arrière prévu, et la limite dite en clair. Les mêmes ingénieurs vous suivent du premier assessment à l’exploitation au quotidien.

Parlons de votre cas d’usage

Dites-nous ce qui ne doit pas sortir

Le corpus, les personnes qui doivent y accéder, le texte qui interdit le service en ligne, et un ordre de grandeur des volumes. Nous revenons avec l’architecture que nous étudierions, le seuil de coût, et ce qu’un prototype de trois semaines permettrait de mesurer.

Ce que nous offrons, c’est la rencontre des ingénieurs qui feront le travail. Assessment, prototype et dimensionnement font partie du projet. La discussion qui les précède, elle, ne coûte rien.

Trois agences en Suisse romande

Renens, Sion, Châtel-Saint-Denis

Microsoft Solutions Partner et Dell Technologies Gold Partner. Le modèle, l’identité, l’intégration et le serveur qui les porte, avec le même interlocuteur.

Renens VD +41 21 806 37 15
Sion VS +41 27 552 00 22
Châtel-Saint-Denis FR +41 26 322 59 05