GPU- & KI-Infrastruktur

GPU-Server, die zu Ihren Modellen passen.

Eigene KI-Hardware ist schnell gekauft und schwer korrigiert. Wir messen zuerst, was Ihre Modelle wirklich brauchen, schreiben daraus ein herstellerneutrales Anforderungsprofil, nehmen die gelieferten Systeme technisch ab und integrieren sie in Ihre Umgebung. Kleinere Systeme besorgen wir auf Wunsch mit, grosse GPU-Server kaufen Sie direkt beim Lieferanten Ihrer Wahl.

Typische Ausgangslagen

Wenn die Hardware vor der Frage gekauft wird

Die meisten Probleme mit KI-Hardware entstehen nicht im Rechenzentrum, sondern vorher: bei einer Annahme, die niemand nachgerechnet hat.

Das Modell passt nicht in den Speicher

Die Karte hat genug Rechenleistung, aber zu wenig Grafikspeicher. Das gewünschte Modell läuft nur stark verkleinert oder gar nicht.

Im Test schnell, im Alltag langsam

Mit einer Person läuft alles flüssig. Sobald zwanzig Mitarbeitende gleichzeitig fragen, wird der Kontextspeicher knapp und die Antworten stocken.

Der Prototyp steht unter dem Tisch

Ein Gaming-PC mit Grafikkarte hat gezeigt, dass es funktioniert. Jetzt hängen Prozesse daran, aber Backup, Zugriffsschutz und Updates fehlen.

Die Beschaffung braucht eine Spezifikation

Einkauf oder Vergabestelle verlangen eine produktneutrale Leistungsbeschreibung. Die Fachabteilung weiss, was sie rechnen will, aber nicht, wie man das ausschreibt.

Strom und Kühlung sind vergessen

Acht Karten mit je bis zu 600 Watt: Das sind allein für die GPUs fast fünf Kilowatt. Nicht jeder Serverraum und nicht jedes Rack verkraftet das.

Niemand ist für den Betrieb zuständig

Treiber, CUDA-Version, Inferenz-Server und Modelle müssen zusammenpassen. Nach dem ersten Update läuft plötzlich nichts mehr, und keiner weiss, warum.

Speicherbedarf schätzen

Passt das Modell auf die Karte?

Beim Betrieb grosser Sprachmodelle entscheidet meist der Grafikspeicher, nicht die Rechenleistung. Er setzt sich aus drei Teilen zusammen.

  • Gewichte: Anzahl Parameter mal Bytes je Parameter. 16 Bit sind 2 Bytes, 8 Bit 1 Byte, 4-Bit-Verfahren brauchen mit Skalierungsfaktoren rund 4,5 Bit.
  • KV-Cache: Für jedes Token im Kontext speichert jede Schicht Schlüssel und Werte. Er wächst mit Kontextlänge und Anzahl gleichzeitiger Anfragen und wird bei vielen Nutzern schnell grösser als das Modell.
  • Reserve: Laufzeit, Zwischenergebnisse und Fragmentierung. Wir rechnen mit 10 Prozent der Gewichte, mindestens 1,5 GB.

Der Rechner geht vom ungünstigsten Fall aus: Jede Anfrage nutzt den vollen Kontext. Inferenz-Server wie vLLM belegen den Cache nur so weit, wie er gebraucht wird. Die Schätzung ersetzt keinen Test mit Ihren Daten, zeigt aber, ob Sie über 24, 96 oder 400 GB reden.

54.4 GB Grafikspeicher gesamt

Gewichte
39.7 GB
KV-Cache
10.7 GB
Reserve
4.0 GB
Speicher je KarteBeispieleKarten
24 GBRTX 40904
32 GBRTX 50902
48 GBL40S, RTX 6000 Ada2
80 GBH1001
96 GBRTX PRO 6000 Blackwell1
141 GBH2001

Karten gerechnet mit 90 Prozent nutzbarem Speicher. Mehrere Karten teilen sich ein Modell per Tensor-Parallelität, üblich sind 2, 4 oder 8.

Was wir übernehmen

Beratung und Integration, herstellerneutral

Unser Schwerpunkt ist nicht der Hardware-Verkauf, sondern der ganze Weg von der Frage «was brauchen wir?» bis zum System, das im Alltag zuverlässig läuft. Die Empfehlung hängt deshalb nicht an einem bestimmten Produkt.

Dimensionierung

Welche Modelle, wie viele Nutzer, welche Kontextlängen, welche Antwortzeiten? Wir messen mit Ihren Beispielen auf Test-Hardware und rechnen daraus Speicher, Kartenzahl und Durchsatz.

Anforderungsprofil

Eine produktneutrale Spezifikation, die Angebote vergleichbar macht: Mindest- und K.-o.-Kriterien, Garantie und Reaktionszeit, Strom und Kühlung, Abnahmetest. Auch für öffentliche Beschaffungen.

Angebote prüfen & Abnahme

Wir prüfen Angebote gegen das Profil und nehmen die gelieferten Systeme ab: Inventar gegen Spezifikation, Diagnose unter Volllast, Durchsatzmessung mit Ihrem Modell. Mit Protokoll.

Plattform

Linux direkt auf der Hardware oder Proxmox mit durchgereichten Karten. NVIDIA-Treiber, CUDA und Container Toolkit in festen, getesteten Versionen.

Inferenz & Anwendungen

vLLM, llama.cpp oder Ollama mit OpenAI-kompatibler Schnittstelle. Daran hängen Ihre Anwendungen, ein interner Chat wie Open WebUI oder eigene Agenten.

Zugriff & Betrieb

Anmeldung über Entra ID, Zugriff nur aus dem internen Netz, Monitoring der Karten mit dem DCGM Exporter, Protokoll und ein Update-Prozess mit Rückweg.

Selbst im Betrieb

Unsere eigenen KI-Worker laufen genau so

Für DokAudit verarbeiten wir PDF-Dokumente mit lokalen Modellen: Layout- und Tabellenerkennung, Texterkennung für Scans, Prüfung auf Barrierefreiheit. Ohne Cloud-Dienst und ohne Kosten je Seite, verteilt auf mehrere eigene Rechner mit und ohne GPU.

DoclingPyTorchCUDADockerProxmox VEOCRmyPDFveraPDF
  • Derselbe Software-Stand auf jedem Rechner, ob Server-Container oder PC mit Grafikkarte. Unterschiedlich ist nur das Tempo.
  • Alle Versionen fest vorgegeben, Modelle im Image. Im Betrieb braucht kein Worker Internetzugang für Modelle.
  • Beim Bauen führt jeder Worker jede Fähigkeit einmal aus. Schlägt etwas fehl, wird nicht ausgerollt.
  • Worker holen Aufträge selbst ab. Kein Tunnel, keine offenen Ports.
  • Neue Worker bekommen zuerst nur Testaufträge, bevor echte Dokumente laufen.

Wo die Modelle laufen

Eigene Hardware ist eine von drei Antworten

Bevor Sie Hardware kaufen, gehört der Vergleich auf den Tisch. Oft ist die Antwort eine Mischung: sensible Daten lokal, der Rest über einen Cloud-Vertrag.

Eigene GPU-Server

Sinnvoll bei dauerhafter Auslastung, sensiblen Daten oder Forschung mit eigenen Modellen. Sie tragen Anschaffung, Strom, Kühlung und Betrieb.

GPU-Hosting in der Schweiz

Dedizierte oder gemietete Karten bei einem Schweizer Rechenzentrum. Daten bleiben im Land, ohne eigenen Serverraum. Gut für den Einstieg und schwankende Last.

Cloud-Modell per Vertrag

Die grössten Modelle über eine Schnittstelle, mit Auftragsverarbeitung und passender Datenregion. Oft die beste Qualität je Franken, solange die Daten das zulassen.

Enterprise-KI, Modellwahl & Gateway

Vorgehen

Erst messen, dann kaufen

Jeder Schritt hat ein Ergebnis, mit dem Sie auch ohne uns weiterarbeiten können.

1

Anwendungsfälle

Welche Aufgaben, welche Daten, wie viele Nutzer, welche Antwortzeit.

2

Messen

Ihre Beispiele auf Test-Hardware oder gemieteten Karten.

3

Spezifizieren

Anforderungsprofil, Raum, Strom, Kühlung, Garantie.

4

Abnehmen

Lieferung gegen Profil prüfen, Last- und Durchsatztest.

5

Integrieren

Plattform, Zugriff, Monitoring, Anwendungen, Übergabe oder Betrieb.

Häufige Fragen

GPU- und KI-Infrastruktur: was Sie wissen sollten

Liefern Sie auch die Hardware?

Kleinere Systeme, etwa einen Inferenz-Server mit ein oder zwei Karten, besorgen wir auf Wunsch mit. Grosse GPU-Server mit vier oder acht Karten kaufen Sie besser direkt beim Systemhaus oder Hersteller, damit Garantie, Vorabaustausch und Ersatzteile dort geregelt sind. Wir schreiben dafür das Anforderungsprofil, prüfen die Angebote, nehmen die Systeme ab und übernehmen die Integration.

Können Sie bei einer öffentlichen Ausschreibung helfen?

Ja, auf der Seite des Auftraggebers. Wir formulieren die Leistungsbeschreibung produktneutral, trennen Mindest- von K.-o.-Kriterien, legen einen nachvollziehbaren Abnahmetest fest und unterstützen bei der technischen Prüfung der Angebote. Die Vergabe selbst bleibt bei Ihrer Beschaffungsstelle.

Lohnt sich eigene Hardware für ein KMU?

Manchmal. Bei gelegentlicher Nutzung ist ein Cloud-Vertrag oder gemietete Rechenleistung meist günstiger. Eigene Hardware lohnt sich bei dauerhafter Last, bei Daten, die das Haus nicht verlassen dürfen, oder wenn Sie Modelle selbst anpassen. Wir rechnen beide Varianten mit Ihren Zahlen durch.

Laufen GPUs auch unter Proxmox?

Ja. Proxmox VE kann Grafikkarten per PCIe-Passthrough an eine virtuelle Maschine durchreichen oder einem Container zur Verfügung stellen. Für reine Inferenz-Server ist Linux direkt auf der Hardware oft einfacher. Wir entscheiden das nach Betrieb, Backup und Auslastung.

Wie genau ist der Rechner auf dieser Seite?

Er liefert die richtige Grössenordnung. Gewichte und KV-Cache folgen aus der Architektur der Modelle, die Reserve ist ein Faustwert. Der tatsächliche Bedarf hängt von Inferenz-Server, Einstellungen und echter Auslastung ab. Deshalb messen wir vor jeder Kaufempfehlung mit Ihren eigenen Beispielen.

Sie planen eigene GPU-Hardware für KI?

In 30 Minuten schauen wir auf Ihre Modelle, Datenmengen und Nutzerzahlen. Sie erhalten eine ehrliche Einschätzung, ob eigene Hardware sinnvoll ist und welche Grössenordnung realistisch ist.