GPU- & KI-Infrastruktur
GPU-Server, die zu Ihren Modellen passen.
Eigene KI-Hardware ist schnell gekauft und schwer korrigiert. Wir messen zuerst, was Ihre Modelle wirklich brauchen, schreiben daraus ein herstellerneutrales Anforderungsprofil, nehmen die gelieferten Systeme technisch ab und integrieren sie in Ihre Umgebung. Kleinere Systeme besorgen wir auf Wunsch mit, grosse GPU-Server kaufen Sie direkt beim Lieferanten Ihrer Wahl.
Typische Ausgangslagen
Wenn die Hardware vor der Frage gekauft wird
Die meisten Probleme mit KI-Hardware entstehen nicht im Rechenzentrum, sondern vorher: bei einer Annahme, die niemand nachgerechnet hat.
Das Modell passt nicht in den Speicher
Die Karte hat genug Rechenleistung, aber zu wenig Grafikspeicher. Das gewünschte Modell läuft nur stark verkleinert oder gar nicht.
Im Test schnell, im Alltag langsam
Mit einer Person läuft alles flüssig. Sobald zwanzig Mitarbeitende gleichzeitig fragen, wird der Kontextspeicher knapp und die Antworten stocken.
Der Prototyp steht unter dem Tisch
Ein Gaming-PC mit Grafikkarte hat gezeigt, dass es funktioniert. Jetzt hängen Prozesse daran, aber Backup, Zugriffsschutz und Updates fehlen.
Die Beschaffung braucht eine Spezifikation
Einkauf oder Vergabestelle verlangen eine produktneutrale Leistungsbeschreibung. Die Fachabteilung weiss, was sie rechnen will, aber nicht, wie man das ausschreibt.
Strom und Kühlung sind vergessen
Acht Karten mit je bis zu 600 Watt: Das sind allein für die GPUs fast fünf Kilowatt. Nicht jeder Serverraum und nicht jedes Rack verkraftet das.
Niemand ist für den Betrieb zuständig
Treiber, CUDA-Version, Inferenz-Server und Modelle müssen zusammenpassen. Nach dem ersten Update läuft plötzlich nichts mehr, und keiner weiss, warum.
Speicherbedarf schätzen
Passt das Modell auf die Karte?
Beim Betrieb grosser Sprachmodelle entscheidet meist der Grafikspeicher, nicht die Rechenleistung. Er setzt sich aus drei Teilen zusammen.
- Gewichte: Anzahl Parameter mal Bytes je Parameter. 16 Bit sind 2 Bytes, 8 Bit 1 Byte, 4-Bit-Verfahren brauchen mit Skalierungsfaktoren rund 4,5 Bit.
- KV-Cache: Für jedes Token im Kontext speichert jede Schicht Schlüssel und Werte. Er wächst mit Kontextlänge und Anzahl gleichzeitiger Anfragen und wird bei vielen Nutzern schnell grösser als das Modell.
- Reserve: Laufzeit, Zwischenergebnisse und Fragmentierung. Wir rechnen mit 10 Prozent der Gewichte, mindestens 1,5 GB.
Der Rechner geht vom ungünstigsten Fall aus: Jede Anfrage nutzt den vollen Kontext. Inferenz-Server wie vLLM belegen den Cache nur so weit, wie er gebraucht wird. Die Schätzung ersetzt keinen Test mit Ihren Daten, zeigt aber, ob Sie über 24, 96 oder 400 GB reden.
54.4 GB Grafikspeicher gesamt
- Gewichte
- 39.7 GB
- KV-Cache
- 10.7 GB
- Reserve
- 4.0 GB
| Speicher je Karte | Beispiele | Karten |
|---|---|---|
| 24 GB | RTX 4090 | 4 |
| 32 GB | RTX 5090 | 2 |
| 48 GB | L40S, RTX 6000 Ada | 2 |
| 80 GB | H100 | 1 |
| 96 GB | RTX PRO 6000 Blackwell | 1 |
| 141 GB | H200 | 1 |
Karten gerechnet mit 90 Prozent nutzbarem Speicher. Mehrere Karten teilen sich ein Modell per Tensor-Parallelität, üblich sind 2, 4 oder 8.
Was wir übernehmen
Beratung und Integration, herstellerneutral
Unser Schwerpunkt ist nicht der Hardware-Verkauf, sondern der ganze Weg von der Frage «was brauchen wir?» bis zum System, das im Alltag zuverlässig läuft. Die Empfehlung hängt deshalb nicht an einem bestimmten Produkt.
Dimensionierung
Welche Modelle, wie viele Nutzer, welche Kontextlängen, welche Antwortzeiten? Wir messen mit Ihren Beispielen auf Test-Hardware und rechnen daraus Speicher, Kartenzahl und Durchsatz.
Anforderungsprofil
Eine produktneutrale Spezifikation, die Angebote vergleichbar macht: Mindest- und K.-o.-Kriterien, Garantie und Reaktionszeit, Strom und Kühlung, Abnahmetest. Auch für öffentliche Beschaffungen.
Angebote prüfen & Abnahme
Wir prüfen Angebote gegen das Profil und nehmen die gelieferten Systeme ab: Inventar gegen Spezifikation, Diagnose unter Volllast, Durchsatzmessung mit Ihrem Modell. Mit Protokoll.
Plattform
Linux direkt auf der Hardware oder Proxmox mit durchgereichten Karten. NVIDIA-Treiber, CUDA und Container Toolkit in festen, getesteten Versionen.
Inferenz & Anwendungen
vLLM, llama.cpp oder Ollama mit OpenAI-kompatibler Schnittstelle. Daran hängen Ihre Anwendungen, ein interner Chat wie Open WebUI oder eigene Agenten.
Zugriff & Betrieb
Anmeldung über Entra ID, Zugriff nur aus dem internen Netz, Monitoring der Karten mit dem DCGM Exporter, Protokoll und ein Update-Prozess mit Rückweg.
Selbst im Betrieb
Unsere eigenen KI-Worker laufen genau so
Für DokAudit verarbeiten wir PDF-Dokumente mit lokalen Modellen: Layout- und Tabellenerkennung, Texterkennung für Scans, Prüfung auf Barrierefreiheit. Ohne Cloud-Dienst und ohne Kosten je Seite, verteilt auf mehrere eigene Rechner mit und ohne GPU.
- Derselbe Software-Stand auf jedem Rechner, ob Server-Container oder PC mit Grafikkarte. Unterschiedlich ist nur das Tempo.
- Alle Versionen fest vorgegeben, Modelle im Image. Im Betrieb braucht kein Worker Internetzugang für Modelle.
- Beim Bauen führt jeder Worker jede Fähigkeit einmal aus. Schlägt etwas fehl, wird nicht ausgerollt.
- Worker holen Aufträge selbst ab. Kein Tunnel, keine offenen Ports.
- Neue Worker bekommen zuerst nur Testaufträge, bevor echte Dokumente laufen.
Wo die Modelle laufen
Eigene Hardware ist eine von drei Antworten
Bevor Sie Hardware kaufen, gehört der Vergleich auf den Tisch. Oft ist die Antwort eine Mischung: sensible Daten lokal, der Rest über einen Cloud-Vertrag.
Eigene GPU-Server
Sinnvoll bei dauerhafter Auslastung, sensiblen Daten oder Forschung mit eigenen Modellen. Sie tragen Anschaffung, Strom, Kühlung und Betrieb.
GPU-Hosting in der Schweiz
Dedizierte oder gemietete Karten bei einem Schweizer Rechenzentrum. Daten bleiben im Land, ohne eigenen Serverraum. Gut für den Einstieg und schwankende Last.
Cloud-Modell per Vertrag
Die grössten Modelle über eine Schnittstelle, mit Auftragsverarbeitung und passender Datenregion. Oft die beste Qualität je Franken, solange die Daten das zulassen.
Vorgehen
Erst messen, dann kaufen
Jeder Schritt hat ein Ergebnis, mit dem Sie auch ohne uns weiterarbeiten können.
Anwendungsfälle
Welche Aufgaben, welche Daten, wie viele Nutzer, welche Antwortzeit.
Messen
Ihre Beispiele auf Test-Hardware oder gemieteten Karten.
Spezifizieren
Anforderungsprofil, Raum, Strom, Kühlung, Garantie.
Abnehmen
Lieferung gegen Profil prüfen, Last- und Durchsatztest.
Integrieren
Plattform, Zugriff, Monitoring, Anwendungen, Übergabe oder Betrieb.
Häufige Fragen
GPU- und KI-Infrastruktur: was Sie wissen sollten
Liefern Sie auch die Hardware?
Kleinere Systeme, etwa einen Inferenz-Server mit ein oder zwei Karten, besorgen wir auf Wunsch mit. Grosse GPU-Server mit vier oder acht Karten kaufen Sie besser direkt beim Systemhaus oder Hersteller, damit Garantie, Vorabaustausch und Ersatzteile dort geregelt sind. Wir schreiben dafür das Anforderungsprofil, prüfen die Angebote, nehmen die Systeme ab und übernehmen die Integration.
Können Sie bei einer öffentlichen Ausschreibung helfen?
Ja, auf der Seite des Auftraggebers. Wir formulieren die Leistungsbeschreibung produktneutral, trennen Mindest- von K.-o.-Kriterien, legen einen nachvollziehbaren Abnahmetest fest und unterstützen bei der technischen Prüfung der Angebote. Die Vergabe selbst bleibt bei Ihrer Beschaffungsstelle.
Lohnt sich eigene Hardware für ein KMU?
Manchmal. Bei gelegentlicher Nutzung ist ein Cloud-Vertrag oder gemietete Rechenleistung meist günstiger. Eigene Hardware lohnt sich bei dauerhafter Last, bei Daten, die das Haus nicht verlassen dürfen, oder wenn Sie Modelle selbst anpassen. Wir rechnen beide Varianten mit Ihren Zahlen durch.
Laufen GPUs auch unter Proxmox?
Ja. Proxmox VE kann Grafikkarten per PCIe-Passthrough an eine virtuelle Maschine durchreichen oder einem Container zur Verfügung stellen. Für reine Inferenz-Server ist Linux direkt auf der Hardware oft einfacher. Wir entscheiden das nach Betrieb, Backup und Auslastung.
Wie genau ist der Rechner auf dieser Seite?
Er liefert die richtige Grössenordnung. Gewichte und KV-Cache folgen aus der Architektur der Modelle, die Reserve ist ein Faustwert. Der tatsächliche Bedarf hängt von Inferenz-Server, Einstellungen und echter Auslastung ab. Deshalb messen wir vor jeder Kaufempfehlung mit Ihren eigenen Beispielen.
Sie planen eigene GPU-Hardware für KI?
In 30 Minuten schauen wir auf Ihre Modelle, Datenmengen und Nutzerzahlen. Sie erhalten eine ehrliche Einschätzung, ob eigene Hardware sinnvoll ist und welche Grössenordnung realistisch ist.