Dreidimensionales Modell einer KI-Anlage im Rack: Netzwerk-Switch, GPU-Server, Speicher und unterbrechungsfreie Stromversorgung, davor die Arbeitsplätze, deren Anfragen den Grafikspeicher füllen.

Business 24–35B · 4 × 48 GB

Grafikspeicher
192 GB
Modell
96 GB
KV-Cache 32k
40 GB
frei
56 GB

Anfragen: 8 laufen

Grafikkarten
Grafikspeicher je Karte
Modellklasse
8
Kontextlänge je Anfrage
Leitung nach draußen

Stationen

Die sieben Stationen im Überblick.

Dieselben Stationen wie im Rundgang oben, zum Nachlesen.

  1. 01

    Eine KI-Anlage steht in einem Rack.

    Oben der Netzwerk-Switch, darunter der GPU-Server, der Speicher und die unterbrechungsfreie Stromversorgung. Das Rack steht in Ihrem Serverraum und hängt an Ihrem Firmennetz.

  2. 02

    Im GPU-Server rechnen die Grafikkarten.

    Der Server fährt aus dem Rack und öffnet sich. Prozessoren und Arbeitsspeicher verteilen die Anfragen, die Grafikkarten rechnen das Sprachmodell. Netzteile und Lüfter halten sie unter Dauerlast. Wählen Sie, wie viele Karten mit wie viel Grafikspeicher im Server stecken.

  3. 03

    Das Modell lädt in den Grafikspeicher.

    Beim Start liest der Server die Modellgewichte vom Speicher und verteilt sie gleichmäßig auf alle Grafikkarten. Dieser Teil bleibt belegt, solange das Modell läuft. Größere Modellklassen belegen mehr davon.

  4. 04

    Jede Anfrage belegt ihren Teil des Speichers.

    Eine laufende Anfrage hält ihren Zwischenstand als KV-Cache im Grafikspeicher. Mit jedem erzeugten Token wächst er, bis die Antwort fertig ist. Längere Kontexte brauchen mehr Platz je Anfrage.

  5. 05

    Ist der Speicher voll, warten Anfragen.

    Maßgeblich ist die Zahl gleichzeitig laufender Anfragen. Die Zahl der Nutzer im Verzeichnis sagt darüber wenig. Die Auslegung legt fest, wie selten eine Anfrage warten muss.

  6. 06

    Die Anlage arbeitet ohne Internet weiter.

    Trennen Sie die Leitung nach draußen. Modelle, Suchindex und Protokolle liegen auf der Anlage, die Anfragen laufen weiter. Für die Modellverarbeitung gilt: 0 externe Modell-APIs im Regelbetrieb.

  7. 07

    Jetzt bestücken Sie die Anlage selbst.

    Drehen Sie das Rack mit der Maus oder dem Finger. Wählen Sie Karten, Modellklasse und Last, und sehen Sie zu, wie sich der Grafikspeicher füllt.

Auswertung

Was die Anlage zeigt.

Vier Eigenschaften der lokalen Verarbeitung, jede mit dem Mechanismus, der sie trägt.

Ihre Anlage beginnt mit der Bestandsaufnahme.

Im Erstgespräch erfassen wir Aufgaben, Gleichzeitigkeit, Datenräume und vorhandene Infrastruktur. Daraus entsteht der Systemplan für Ihre Anlage.