Künstliche Intelligenz / Architekturen / On-premises
Künstliche Intelligenz in Ihrem Unternehmen: Daten, Modelle und Berechnungen verbleiben in Ihrem Unternehmen
Wenn der Online-Dienst ausgeschlossen ist, wird nichts ausgegeben – weder die Dokumente noch die Anfragen noch die Vorlage.Ein Vertrag, der dies verbietet, ein Betriebsgeheimnis, eine regulierte Datei, Quellcode oder Datenmengen, die den Online-Dienst zu teuer machen würden: Bestimmte Anwendungsfälle erfordern, dass das Modell in Ihrem datacenter läuft. Wir konzipieren dann die dafür passende Infrastruktur – den Server mit Grafikprozessoren, die Identitätsverwaltung, die Integration – und betreiben sie anschließend. Wir verkaufen Ihnen keinen Server: Wir betreiben ein System für Sie.
Drei Situationen, in denen ein Hosting in Ihren eigenen Räumlichkeiten keine Option ist
Grundsätzlich empfehlen wir den Raum nicht. Doch in diesen drei Fällen stellt sich die Frage gar nicht erst: Die Vorgabe ist irgendwo schriftlich festgehalten und hat Vorrang vor allem anderen.
Eine Klausel, die die Weitergabe von Daten untersagt
Ein Vertrag mit einem Kunden, eine berufliche Schweigepflicht, eine interne Richtlinie zu Forschungsdaten, eine branchenbezogene Vorschrift. Ganz gleich, wie gut der Online-Service auch sein mag: Das Versenden selbst ist das Problem. Die regulatorischen Auflagen sind das Einzige, worüber nicht verhandelt werden kann.
Über eine Klausel lässt sich nicht diskutieren.
Was das Modell auswertet, ist das Unternehmensvermögen
Der Quellcode eines Softwareherstellers, die Verfahren eines Herstellers, die Akten einer Kanzlei, die Ergebnisse eines Labors. Selbst wenn solche Daten in einer Umgebung verarbeitet werden, die keine Risiken birgt, sollten sie keinem Dienst anvertraut werden, den man nicht von Anfang bis Ende kontrollieren kann.
Das Risiko liegt nicht in der Nutzung, sondern in der Exposition.
Das Volumen macht den Online-Dienst zu teuer
Jeden Monat Millionen von Seiten erneut lesen, Tausende von Stunden an Telefonaten transkribieren, Hunderte von Anfragen pro Minute bearbeiten: Bei nutzungsabhängiger Abrechnung kostet das am Ende mehr als ein Server und dessen Betrieb. Die Schwelle wird über drei Jahre berechnet, und sie ist schneller erreicht, als man denkt.
Ab einer bestimmten Menge ist die Lagerung vor Ort die kostengünstigste Option.
Anwendungsfälle, die dies rechtfertigen
Drei Seiten, die heute im Detail ausgearbeitet wurden, und drei, die im Laufe der Projekte entstehen. Jede davon beschreibt, was menschlich bleibt und was das Lokale darüber hinaus erfordert.
Privater RAG
Ein vertrauliches Korpus in Umgangssprache abfragen, unter Angabe der Quelle, über ein Modell, das in Ihren Räumlichkeiten läuft, da der Online-Dienst ausgeschlossen ist.
MöglichUnternehmensassistent in Privatunterkunft
Der Chatbot des Unternehmens mit „ Teams “ als Benutzeroberfläche und einem Modell, das niemals ein Dokument verlässt.
MöglichIntelligente Dokumentenverarbeitung
Wenn es sich um regulierte Dokumente handelt, werden die Lesedienste von Microsoft in Containern in Ihren Räumlichkeiten ausgeführt, auf Azure Local.
Assistent für private Entwicklungsprojekte
Ein Codebeispiel, das auf Ihren Grafikprozessoren läuft – für Quellcode, der nicht veröffentlicht werden darf.
Sprachausgabe und Transkription vor Ort
Anrufe aufzeichnen, transkribieren und zusammenfassen, ohne dass auch nur eine Minute Sprachdaten Ihr Netzwerk verlässt.
Umfangreiche Dokumentenanalyse
Jeden Monat werden Millionen von Seiten erneut gelesen: Sobald die Schwelle überschritten ist, ist die lokale Berechnung am kostengünstigsten.
Was „alles in Ihren Räumlichkeiten“ wirklich bedeutet
Ein Server mit Grafikprozessoren, ja. Aber der Server ist der einfache Teil. Sechs Dinge gehören dazu, und an ihnen hängt der Erfolg oder Misserfolg lokaler Projekte ab.
Die Berechnung, ausgelegt auf die tatsächliche Belastung
Die Anzahl der gleichzeitigen Nutzer, die Größe des Modells, die Länge der Dokumente und die akzeptable Reaktionszeit bestimmen die Anzahl und den Typ der Grafikprozessoren. Nicht umgekehrt.
Stromversorgung, Kühlung, Gehäuse
Ein Inferenzserver passt nicht in ein Gehäuse, das für die Virtualisierung vorgesehen ist. Er wird daneben aufgestellt und hat seine eigenen Anforderungen – das ist die Dimensionierungskette unserer Dell-Server: PowerEdge.
Die Speicherung von Korpora und Indizes
Ein Dokumentenkorpus und sein vektorieller Index bestehen aus Millionen kleiner Dateien. Die Speicherlösung wird entsprechend diesem Profil und der Geschwindigkeit ausgewählt, mit der das Modell die Daten auslesen muss.
Identität und Rechte
Ein lokaler Assistent darf nicht mehr sehen als ein Benutzer: Entra ID bleibt die Quelle der Berechtigungen, und jede Antwort berücksichtigt, was die jeweilige Person lesen darf. Andernfalls wäre der lokale Assistent nichts anderes als eine gut organisierte interne Informationslecke.
Die Modelle und ihre Aktualisierung
Ein Modell mit offenen Gewichten muss alle paar Monate ausgetauscht werden. Jemand muss das neue Modell anhand Ihrer Fragen testen, vergleichen, eine Entscheidung treffen und es ohne Unterbrechung des Betriebs einführen.
Überwachung und Rückmeldung
Wer bemerkt, dass die Antwortzeiten länger werden, die Latenz steigt und die Festplatte voll wird? Wer kehrt zur vorherigen Version zurück? Diese beiden Fragen müssen vor der Inbetriebnahme geklärt werden, nicht danach.
Was Sie messen, entscheidet darüber, was Sie kaufen
Die Skalierungskette – Prozessorkerne, Arbeitsspeicher, Festplattenzugriff, Beschleuniger, Wachstum – wird auf der Seite zu den Dell-Servern unter PowerEdge beschrieben. Sie gilt Wort für Wort auch für eine Plattform für künstliche Intelligenz.
Was eine private künstliche Intelligenz antreibt
Die Technologien kommen erst an letzter Stelle, und sie werden je nach Projekt ausgewählt. Was wir je nach Situation einsetzen und was jede einzelne davon leistet.
Microsoft Foundry Local
Vorlagen aus dem Microsoft-Katalog lokal ausführen, ohne Abonnement Azure im Pfad der Anfrage: auf einem Arbeitsplatzrechner, im Jahr Windows Server 2025 und auf Azure „Local“ – diese letzte Variante befindet sich bei Microsoft in der Vorabversion und bietet eine Verteilung auf mehrere Knoten sowie eine Inferenz, die auch bei Verbindungsabbruch fortgesetzt wird.
Dies ist der Ansatz, bei dem die Microsoft-Tools – dieselben Benutzeroberflächen, dieselben Agenten – mit der Berechnung in Ihren Räumlichkeiten kombiniert werden.
Azure Lokal
Hardware, die Sie bereits besitzen und die sich in Ihren eigenen Räumlichkeiten befindet und von dort aus verwaltet und aktualisiert wird Azure – auch im Offline-Betrieb, verfügbar ab Februar 2026. Dies ist die Grundlage, auf der Foundry Local, Edge RAG und die Dokumentenlesedienste lokal ausgeführt werden.
Die Hardware muss auf einer genehmigten Liste aufgeführt sein: Dazu gehören die Dell-Knoten für Azure Local gehören dazu.
Modelle mit offenem Gewicht
Von den Autoren veröffentlichte Modelle, die man herunterladen und selbst ausführen kann. Damit lässt sich die Größe des Modells entsprechend der Hardware auswählen, eine bestimmte Version festlegen und das Modell anhand eigener Fragen testen, bevor es in Betrieb genommen wird.
Die Wahl des Modells ist Teil des Projekts; sie wird alle paar Monate neu getroffen.
Dell „ PowerEdge “ mit NVIDIA-Grafikprozessoren
Von Allzweckservern, die einen oder zwei Beschleuniger für die Inferenz unterstützen, bis hin zu Servern der XE-Reihe, die für mehrere Grafikprozessoren und eine entsprechende Kühlung ausgelegt sind. Das richtige Modell ergibt sich aus der gemessenen Auslastung, nicht aus dem Katalog.
Mit dem Dell-Speicher für die Datensätze, dem Netzwerk zur Verbindung der Knoten und dem Datenschutz, damit drei Monate an Indizes nicht verloren gehen.
Microsoft Entra ID und Ihre Systeme
Die Identität bleibt dieselbe wie bisher. Die Rechte, die der Assistent beachtet, sind die Rechte Ihrer Freigaben. Und die Integration – Teams für die Benutzeroberfläche, SharePoint für Dokumente, Dynamics 365 oder dieERP für Aktionen – erfolgt, ohne dass Ihre Daten an einen anderen Ort kopiert werden.
Die Funktionen von Foundry Local,Azure Local und der „ PowerEdge “-Server werden von Microsoft und auf Dell Technologies dokumentiert und vor jedem Angebot erneut überprüft: Sie entwickeln sich von Quartal zu Quartal weiter, und diese Architektur entwickelt sich schneller als andere.
Die Botschaft lautet nicht: „Kaufen Sie einen Server“
Viele Anbieter verkaufen einen Server mit einer vorinstallierten Software, die innerhalb von zwei Tagen eingerichtet ist. Wir bieten etwas anderes an: die Auswahl der Architektur, dann das komplette System und schließlich dessen Betrieb.
Was ein Hardware-Händler macht
- Er liefert einen Server mit einer vorinstallierten Vorlage und einer Konversationsoberfläche.
- Es bindet Ihre Dokumente so ein, wie sie sind.
- Er überlässt Ihnen den Betrieb, die Aktualisierungen und die Frage der Rechte.
- Er wird Ihnen niemals sagen, dass Copilot ausgereicht hätte oder dass eine hybride Aufteilung kostengünstiger gewesen wäre: Er kennt sich nur mit dem Server aus.
Was wir tun
- Wir entscheiden uns zunächst für die Architektur, und wir beherrschen alle vier Bereiche – genau das macht die Beratung erst möglich.
- Wir verbinden den Assistenten mit Ihren Berechtigungen und Ihren Systemen: Entra ID, Teams, SharePoint, Dynamics 365,ERP.
- Wir dimensionieren und liefern die Ausrüstung, die vor der Auslieferung vorbereitet wird, sowohl in der Schweiz als auch an Ihre Standorte im Ausland.
- Wir kümmern uns um die Plattform: Vorlagen, Überwachung, Kosten, Rückverfolgung – oder wir schulen Ihr Team darin, dies selbst zu übernehmen.
Was Sie wissen sollten, bevor Sie sich entscheiden
Vier Punkte, die nicht im Produktdatenblatt aufgeführt sind und die wir beim ersten Treffen zur Sprache bringen.
Die Größe des Raums macht das Modell nicht genauer
Ein Modell, das in Ihren Räumlichkeiten läuft, macht genauso viele Fehler wie ein Online-Modell – und zwar mit derselben Selbstsicherheit. Die Vertraulichkeit verändert lediglich den Ort der Verarbeitung, nicht jedoch die Qualität der Antworten. Die menschliche Überprüfung bleibt bei jedem Anwendungsfall gewährleistet.
Das Modell, das Sie ausführen können, ist kleiner
Die größten Modelle auf dem Markt erfordern Rechenleistungen, über die nur wenige Unternehmen in ihrem Rechenzentrum verfügen. Ein kleineres, sorgfältig ausgewähltes und auf Ihre Daten abgestimmtes Modell liefert oft bessere Antworten auf Ihre Fragen als ein großes, universell einsetzbares Modell – ist aber in allen anderen Bereichen weniger leistungsfähig. Wir testen es anhand Ihrer Fragen, bevor wir zu einem Ergebnis kommen.
Datensicherung und Wiederherstellung sind Teil des Umfangs
Der Wiederaufbau eines Index mit mehreren Millionen Fragmenten dauert mehrere Tage. Er wird wie eine Datenbank gesichert, und die Rückkehr zur vorherigen Version eines Modells wird vor dem Update vorbereitet – nicht während des Vorfalls.
Die Kosten werden über einen Zeitraum von drei Jahren verglichen, einschließlich Betriebskosten
Hardware, Strom, Kühlung, Lizenzen und der Zeitaufwand der Mitarbeiter, die die Plattform betreuen, im Vergleich zu den Kosten für die Nutzung des Online-Dienstes bei gleichem Volumen. Es kommt vor, dass der Vergleich in bestimmten Bereichen nicht zugunsten der lokalen Lösung ausfällt. In solchen Fällen weisen wir ausdrücklich darauf hin.
So gehen wir vor
Es wird nichts gekauft, bevor der Prototyp mit Ihren tatsächlichen Daten getestet wurde. Diese Vorgehensweise verhindert, dass der Server ungenutzt bleibt.
Der Rahmen
Der Anwendungsfall, der Korpus und die damit verbundenen Rechte, die schriftlichen Vorgaben, die erwarteten Volumina und die akzeptable Antwortzeit. Sowie die Berechnung der Kostenschwelle im Vergleich zum Online-Dienst und zum Hybridmodell.
Der Prototyp – basierend auf Ihren Daten, auf ausgeliehener oder bereits vorhandener Hardware
Ein Modell, ein repräsentativer Ausschnitt aus dem Korpus, etwa zwanzig Nutzer, drei Wochen. Wir messen die Genauigkeit der Antworten, die Latenzzeit und wie die Nutzer das Ganze tatsächlich nutzen.
An dieser Stelle kann das Projekt enden, und das ist gut so.
Architektur und Hardware
Server, Grafikprozessoren, Speicher, Netzwerk und Datenschutz – alles entsprechend den Spezifikationen des Prototyps dimensioniert. Vor der Auslieferung vorbereitet, installiert und an Entra ID sowie an Ihre Systeme angeschlossen.
Industrialisierung und Ausbeutung im Alltag
Schrittweise Inbetriebnahme, Überwachung, Aktualisierung der Vorlagen, Sicherung des Indexes, Überprüfung der Antworten. Durch uns oder durch Ihr Team, das wir schulen.
Der Projektumfang wird vor Beginn festgelegt. Was wir übernehmen, was Sie selbst übernehmen, der geplante Rückbau und die klar definierten Grenzen. Dieselben Ingenieure begleiten Sie vom ersten „ assessment “ bis zum täglichen Betrieb.
Die dazugehörigen Seiten
Die anderen Architekturen und die Infrastruktur, auf der diese basieren.
Wenn nur ein Teil in Ihren Räumlichkeiten verbleiben soll
Die Benutzeroberfläche bei Microsoft, sensible Daten in Ihren Räumlichkeiten: Oftmals die kostengünstigste Lösung.
Zur Seite PlattformWenn mehrere Abteilungen ihren Anteil an der lokalen Infrastruktur beanspruchen
Eine gemeinsame, verwaltete und überwachte Infrastruktur statt eines Servers pro Team.
Zur Seite EdgeWenn die Entscheidung am Computer getroffen wird
Der Raum wird bis zur Produktionslinie, zur Baustelle oder zum abgelegenen Standort transportiert.
Zur Seite Dell-Server PowerEdgeDer auf Ihre Anwendungen zugeschnittene Server
Vier Produktreihen, die Dimensionsreihe und der Bereich zum Thema künstliche Intelligenz.
Zur Seite Azure Lokal auf DellDas Microsoft-Ökosystem in Ihrem datacenter
Die für Azure Local validiert und die drei anderen Ökosysteme im Vergleich.
Zur Seite Microsoft AzureAzure Vor Ort: In Ihren Räumlichkeiten bleiben, ohne isoliert zu sein
Die vier Fälle, in denen wir dies vorschlagen, und was wir nicht versprechen.
Zur SeiteLassen Sie uns über Ihren Anwendungsfall sprechen
Sagen Sie uns, was nicht nach außen dringen darf
Der Datenbestand, die Personen, die darauf zugreifen sollen, der Text, der den Online-Dienst untersagt, sowie eine Größenordnung der Datenmengen. Wir kommen später auf die Architektur zurück, die wir untersuchen würden, die Kostenschwelle und darauf, was sich mit einem dreiwöchigen Prototyp messen ließe.
Was wir anbieten, ist ein Treffen mit den Ingenieuren, die die Arbeit ausführen werden. Assessment, Prototypenbau und Dimensionierung sind Teil des Projekts. Das vorhergehende Beratungsgespräch ist kostenlos.
Renens, Sion, Châtel-Saint-Denis
Microsoft Solutions Partner und Dell Technologies Gold Partner. Das Modell, die Identität, die Integration und der Server, auf dem sie laufen – alles aus einer Hand.
Renens VD +41 21 806 37 15
Sion VS +41 27 552 00 22
Châtel-Saint-Denis FR +41 26 322 59 05

