Dreidimensionales Modell einer KI-Anlage im Rack: Netzwerk-Switch, GPU-Server, Speicher und unterbrechungsfreie Stromversorgung, davor die Arbeitsplätze, deren Anfragen den Grafikspeicher füllen.
Business 24–35B · 4 × 48 GB
- Grafikspeicher
- 192 GB
- Modell
- 96 GB
- KV-Cache 32k
- 40 GB
- frei
- 56 GB
Anfragen: 8 laufen
Stationen
Die sieben Stationen im Überblick.
Dieselben Stationen wie im Rundgang oben, zum Nachlesen.
-
01
Eine KI-Anlage steht in einem Rack.
Oben der Netzwerk-Switch, darunter der GPU-Server, der Speicher und die unterbrechungsfreie Stromversorgung. Das Rack steht in Ihrem Serverraum und hängt an Ihrem Firmennetz.
-
02
Im GPU-Server rechnen die Grafikkarten.
Der Server fährt aus dem Rack und öffnet sich. Prozessoren und Arbeitsspeicher verteilen die Anfragen, die Grafikkarten rechnen das Sprachmodell. Netzteile und Lüfter halten sie unter Dauerlast. Wählen Sie, wie viele Karten mit wie viel Grafikspeicher im Server stecken.
-
03
Das Modell lädt in den Grafikspeicher.
Beim Start liest der Server die Modellgewichte vom Speicher und verteilt sie gleichmäßig auf alle Grafikkarten. Dieser Teil bleibt belegt, solange das Modell läuft. Größere Modellklassen belegen mehr davon.
-
04
Jede Anfrage belegt ihren Teil des Speichers.
Eine laufende Anfrage hält ihren Zwischenstand als KV-Cache im Grafikspeicher. Mit jedem erzeugten Token wächst er, bis die Antwort fertig ist. Längere Kontexte brauchen mehr Platz je Anfrage.
-
05
Ist der Speicher voll, warten Anfragen.
Maßgeblich ist die Zahl gleichzeitig laufender Anfragen. Die Zahl der Nutzer im Verzeichnis sagt darüber wenig. Die Auslegung legt fest, wie selten eine Anfrage warten muss.
-
06
Die Anlage arbeitet ohne Internet weiter.
Trennen Sie die Leitung nach draußen. Modelle, Suchindex und Protokolle liegen auf der Anlage, die Anfragen laufen weiter. Für die Modellverarbeitung gilt: 0 externe Modell-APIs im Regelbetrieb.
-
07
Jetzt bestücken Sie die Anlage selbst.
Drehen Sie das Rack mit der Maus oder dem Finger. Wählen Sie Karten, Modellklasse und Last, und sehen Sie zu, wie sich der Grafikspeicher füllt.
Auswertung
Was die Anlage zeigt.
Vier Eigenschaften der lokalen Verarbeitung, jede mit dem Mechanismus, der sie trägt.
-
Die Verarbeitung bleibt im Haus.
Anfrage, Treffer und Antwort bleiben im Firmennetz. Für die Modellverarbeitung gilt: 0 externe Modell-APIs im Regelbetrieb.
-
Geplante Abläufe laufen ohne Internet.
Modelle, Suchindex und Protokolle liegen auf der Anlage. Angebundene Dienste außerhalb des Hauses sind ohne Internet ebenfalls nicht erreichbar.
-
Die Modelle bleiben verfügbar.
Offene Gewichte liegen auf Ihrem Speicher und laufen ohne den Anbieter weiter. Ein Modellwechsel wird an denselben Aufgaben geprüft.
-
Die Auslegung folgt Ihrer Last.
Gleichzeitige Anfragen und Kontextlänge bestimmen den Grafikspeicher. Der Lasttest mit Ihren Aufgaben bestätigt die Klasse.
Ihre Anlage beginnt mit der Bestandsaufnahme.
Im Erstgespräch erfassen wir Aufgaben, Gleichzeitigkeit, Datenräume und vorhandene Infrastruktur. Daraus entsteht der Systemplan für Ihre Anlage.