Modelle & Kapazität

Lokale LLMs. Offene Modelle, austauschbar geplant.

Wir testen Modelle anhand Ihrer Aufgaben, Lizenzen, Gleichzeitigkeit und Hardware. Große Modellnamen ersetzen keinen reproduzierbaren Lasttest.

sinlu · Projektansicht Kandidaten lokal testen
Ihre Aufgabe16k Kontext · 18 parallele Vorgänge
Kandidat AKandidat BKandidat C · Testlauf
Vorläufiges ErgebnisBusiness-KlassePilotmessung noch offen

Die Aufgabe bestimmt die Modellklasse.

Wir vergleichen Modelle mit Ihren Aufgaben, Lizenzen und Betriebszielen. Kapazität folgt aus Gleichzeitigkeit, Kontext und gewünschter Geschwindigkeit. Welche GPU-Baugruppen eine Klasse trägt, zeigt die Hardware der KI-Anlage. Wie Modellgewichte und gleichzeitige Anfragen den Grafikspeicher füllen, können Sie im KI-Labor am 3D-Modell eines KI-Servers selbst einstellen; es rechnet mit denselben Werten wie diese Seite.

TeamEinzelknoten8–14B

Begrenzte Wissensarbeit und klar umrissene Teams.

Beispiele, keine Vorauswahl
  • Ministral 3 8B
  • Qwen3.5 9B
  • Ministral 3 14B
ab 32 GB VRAM
ein kompakter GPU-Knoten
BusinessLeistungsstarker Knoten24–35B

Anspruchsvolle Wissens-, Coding- und Agentenaufgaben.

Beispiele, keine Vorauswahl
  • Devstral Small 2 24B
  • Qwen3.8 27B
  • Qwen3.5 35B-A3B
ab 96 GB VRAM
ein leistungsfähiger Knoten oder zwei GPUs
ScaleMehr-GPU-Systemgroße MoE-Modelle

Hohe Parallelität und spezialisierte Arbeitslasten.

Beispiele, keine Vorauswahl
  • Mistral Small 4 119B-A6B
  • Qwen3.5 122B-A10B
ab 384 GB VRAM
mehrere gekoppelte GPUsPilot erforderlich
FrontierRechenzentrums-ClusterFrontier-Größe

Bezahlter Pilot, reproduzierbarer Lasttest und Rechenzentrumsplanung.

Beispiele, keine Vorauswahl
  • Mistral Large 3 675B
  • Kimi K3
  • GLM-5.3
ab 1.680 GB VRAM
Rechenzentrums-Cluster mit mehreren GPU-KnotenPilot erforderlich
Interaktive Vorprüfung · keine Leistungszusage

Von Arbeitslast zu Anlagenklasse.

Die Ausgabe ordnet Ihre Angaben einer technischen Klasse zu. Zahlen zu Kapazität und Nutzern werden erst nach einem reproduzierbaren Lasttest verbindlich.

Vorläufige Orientierung

Business 24–35B

Rechnerische VRAM-Reserve
ab 144 GB
Hardwareklasse
ein leistungsfähiger Knoten oder zwei GPUs
Zu prüfende Gleichzeitigkeit
18 Vorgänge
Belastbare Nutzerzahl
nach Lasttest

Annahme: 16-Bit-Gewichte und KV-Cache an der Obergrenze der Klasse; die Reserve wächst mit gleichzeitigen Vorgängen und Kontextlänge.

Orientierung für das Erstgespräch. Verbindlich werden Leistung und Preis erst mit dem freigegebenen Systemplan.

Vor dem Angebot steht die Lizenzprüfung.

Ein Modell kommt erst in ein Angebot, wenn geklärt ist, ob sinlu es Ihnen übergeben und für Sie betreiben darf. Diese Frage ist von der Frage nach der Qualität getrennt und wird vorher beantwortet.

Kommerzielle Nutzung offener LLMs: Lizenz je Modell prüfen.

Ob ein offenes Modell kommerziell genutzt werden darf, steht im Lizenztext der konkreten Version. Der Lizenztyp ist am Modellnamen nicht ablesbar und wechselt innerhalb einer Familie. Quantisierte Uploads Dritter erben die Lizenz des Originals, geben sie aber oft unvollständig wieder. Geprüft wird deshalb am Original-Repository, je Version.

Drei Handlungen, drei getrennte Prüfungen.

Weitergabe

Die Gewichte werden auf Hardware kopiert, die Ihnen gehört oder von Ihnen gemietet ist.

Lizenztext und Copyright-Vermerk müssen mitgeliefert werden. Das ist die am häufigsten übersehene Pflicht überhaupt.

Betrieb für Sie

sinlu betreibt die Anlage, wartet aus der Ferne und verantwortet die Verfügbarkeit.

Hier greifen die „Model as a Service"-Klauseln einzelner Lizenzen. Wer selbst betreibt, löst sie nicht aus.

Anpassung

Feinabstimmung, Quantisierung oder Destillation auf Ihren Daten.

Namenspflichten für abgeleitete Modelle, Weitergabe der Lizenz an das Ergebnis, teils Nutzungsverbote für die Ausgaben.

Ohne Einzelfreigabe kommen nur Apache 2.0 und MIT in ein Angebot.

Beide erlauben Weitergabe, Betrieb und Anpassung gegen eine einzige Auflage: Lizenztext und Copyright-Vermerk gehen mit. Alle vier Modellklassen sind damit vollständig besetzbar, es entsteht also keine Lücke in der Leistung.

Geprüft wird
am Original-Repository, je Version
Umfang
Sprachmodell, Einbettung, Reranking, Texterkennung
Ohne Freigabe zulässig
Apache 2.0 und MIT
Ergebnis
Lizenzliste als Anlage zum Systemplan

Ein Modell haben wir aus unseren Beispielen wieder gestrichen.

Bei der Prüfung im August 2026 stand ein Modell unter der Qwen Community License 1.0. Deren Klausel 2 verlangt ohne jede Umsatzschwelle eine gesonderte Lizenz, sobald der Lizenznehmer ein Assistenz- oder Betriebsgeschäft mit dem Modell führt. Genau das beschreibt das Angebot von sinlu, deshalb ist der Name aus den Beispielen verschwunden.

Dieselbe Prüfung hat vier andere Modelle desselben Hauses bestätigt: Sie stehen unter Apache 2.0 und sind unbedenklich. Die Lizenz gehört zum einzelnen Modell und wechselt innerhalb einer Familie; ein Haus führt durchaus drei Lizenzen nebeneinander.

Die Fallen liegen selten beim Sprachmodell.

Einbettung und Reranking

Für die Dokumentensuche verbreitete Modelle stehen teils unter einer Lizenz, die jede kommerzielle Nutzung untersagt. Sie fallen in einer Anlage nicht auf, weil sie im Hintergrund arbeiten.

Dokumentenpipelines

Werkzeuge für Texterkennung und Layoutanalyse stehen häufig unter GPL oder AGPL. Deren Copyleft zieht die umgebende Anlagensoftware mit hinein.

Regionale Einschränkungen

Einzelne Lizenzen räumen Unternehmen mit Sitz in der EU bestimmte Rechte ausdrücklich nicht ein oder behalten sich vor, die Nutzung nachträglich einzuschränken.

Die vollständige Prüfung mit Ampel je Modell, Klauselzitaten und Quellen liegt im Projekt vor und wird zum Angebot mitgeliefert.