Zum Inhalt

Blog

KI-Agenten in Produktion: die richtige GPU wählen

H100, A100, L40S: Kriterien und Kosten pro Token Stand März 2026. Branchen-TCO, kein Hikube-PUE. GPUs in der 14-Tage-Trial.

Hidora-Artikel vom 6. März 2026. Zahlen, Preise und Vergleiche gelten zu diesem Datum.

Einleitung

Die Verbreitung von KI-Agenten in Unternehmen verändert den Bedarf an IT-Infrastruktur. Während Organisationen ihre Projekte mit generativer KI vervielfachen, interne Chatbots, analytische Assistenten, Entscheidungsagenten, wird die Frage der GPU-Dimensionierung kritisch.

In einem Umfeld, in dem Sprachmodelle alltäglich werden, kann die Wahl zwischen einer Einsteiger-Rechenzentrums-GPU und einer Hochleistungskonfiguration Kostenunterschiede um das Dreifache bedeuten. Angesichts dieser Spanne müssen technische Teams zwischen roher Leistung, Vielseitigkeit und Budget abwägen.

Dieser Beitrag beschreibt die technischen Merkmale der wichtigsten NVIDIA-GPUs für KI-Agenten, L40S, A100 und H100, zeigt ihre optimalen Anwendungsfälle und schlägt einen Entscheidungsrahmen aus messbaren Kriterien vor: Modellgrösse, Anfragevolumen, Fine-Tuning-Bedarf und wirtschaftliche Vorgaben.

Den Bedarf vor der Hardware verstehen

Ursprünglich für die Grafikdarstellung entwickelt, beruhen GPUs auf Tausenden von Kernen, die identische Operationen parallel verarbeiten. Das steht im Gegensatz zu CPUs, die auf sequenzielle Verarbeitung ausgelegt sind. Dieser Unterschied erlaubt GPUs, wiederkehrende Matrixoperationen wie Multiplikationen und Faltungen erheblich zu beschleunigen, die für modernes Machine Learning wesentlich sind. Ein einzelner Beschleuniger kann so sehr viele Neuronen oder Vektoren parallel verarbeiten, was die Gewinne im intensiven Training erklärt.

Die vier Dimensionen der GPU-Dimensionierung

Bevor die passende GPU feststeht, muss der Anwendungsfall entlang von vier technischen Achsen genau bestimmt werden.

Erste Dimension: die Grösse des Sprachmodells.

Ein Modell mit 7 Milliarden Parametern (7B) braucht rund 14 bis 16 GB VRAM in FP16-Präzision oder 7 bis 8 GB in INT8-Quantisierung. Ein 13B-Modell verlangt 26 bis 28 GB in FP16. Ab 34B Parametern übersteigt der VRAM-Bedarf 68 GB, womit GPUs mit 80 GB und mehr zwingend werden, oder Multi-GPU-Konfigurationen für Modelle ab 70B, die über 140 GB hinausgehen.

Zweite Dimension: die vorgesehene Art der Operation.

Die Inferenz, also das Erzeugen von Antworten in Produktion, stellt strenge VRAM-Anforderungen, priorisiert aber den Durchsatz. Fine-Tuning dagegen vervielfacht den Speicherbedarf um das Drei- bis Vierfache. Der Grund: Gradienten der Rückpropagation und Optimiererzustände (Momentum, Varianz bei Adam) müssen gespeichert werden. Fine-Tuning verlangt zudem hohe Speicherbandbreite, um iterative Berechnungen zu beschleunigen.

Dritte Dimension: Anfragevolumen und Ziellatenz.

Eine einfache Formel schätzt die nötige GPU-Kapazität:

GPU-Kapazität = (Anfragen pro Sekunde × Inferenzzeit) / angestrebte Auslastung

50 Anfragen pro Sekunde mit 0,8 Sekunden Latenz und 70 % Auslastung verlangen zum Beispiel Kapazität für rund 57 gleichzeitige Inferenzen, also zwei bis drei GPUs je nach eingesetztem Modell.

Vierte Dimension, die betrieblichen Vorgaben.

Das verfügbare Budget, ob Capex (Kauf) oder Opex (Miete), beeinflusst die Wahl unmittelbar. Stromverbrauch und Kühlbedarf reichen von 350 W bei einer L40S bis 700 W bei einer H100. Die Softwareverträglichkeit mit den Frameworks (PyTorch, TensorFlow, vLLM) und die Compliance-Anforderungen, namentlich das Hosting der Daten in der Schweiz für bestimmte Kategorien sensibler Daten nach revDSG, vervollständigen die Auswahlkriterien.

Methodik der Bedarfsklärung

Es empfiehlt sich, den Bedarf so zu formulieren: «Mein KI-Agent nutzt ein Modell der Grösse [X], verarbeitet [Y] Anfragen pro Tag, braucht Fine-Tuning [ja/nein], mit [sensiblen/nicht sensiblen] Daten.» Diese Klärung erlaubt es, den Anwendungsfall genau auf die verfügbaren GPU-Spezifikationen abzubilden.

Technischer Blick auf die Rechenzentrums-GPUs

NVIDIA A100, die vielseitige Referenz-GPU

NVIDIA verkauft die A100 seit 2020. Auf der Ampere-Architektur aufgebaut, gibt es diese Rechenzentrums-GPU in zwei Ausführungen: 40 GB und 80 GB HBM2e-Speicher. Die 40-GB-Version bietet 1555 GB/s Speicherbandbreite, die 80-GB-Version erreicht 2039 GB/s. Die TDP liegt bei beiden Varianten bei 400 W.

Technische Merkmale im Detail.

Die A100 80 GB verfügt über 6912 CUDA-Kerne und 432 Tensor Cores der dritten Generation. Sie unterstützt die Präzisionen FP64, FP32, FP16, BF16, TF32 und INT8. Die NVLink-Unterstützung erlaubt, bis zu acht GPUs in einer Multi-Node-Konfiguration zu verbinden, mit insgesamt 600 GB/s Bandbreite je GPU.

Optimale Anwendungsfälle.

Die A100 gilt als Referenz für Modelle von 7 bis 34 Milliarden Parametern. Sie passt besonders zu Architekturen, die Inferenz und gelegentliches Fine-Tuning mischen. Finanzwesen, Forschung und digitale Dienstleistungen setzen sie ein, um RAG-Agenten (Retrieval-Augmented Generation), Assistenten zur Dokumentenanalyse oder hochverfügbare interne Chatbots zu betreiben. Die Mietpreise für die A100 80GB liegen je nach Anbieter und Vertragsdauer meist zwischen 1200 und 1800 CHF pro Monat.


NVIDIA H100: rohe Leistung für intensive Lasten

Die 2022 lancierte H100 beruht auf der Hopper-Architektur. NVIDIA gibt an, dass diese GPU 80 GB HBM3-Speicher mit 3350 GB/s Bandbreite trägt, das 2,15-Fache der A100 80GB. Die TDP erreicht 700 W und verlangt verstärkte Kühlinfrastruktur.

Fortgeschrittene technische Merkmale.

Die H100 enthält 16 896 CUDA-Kerne und 528 Tensor Cores der vierten Generation. Das Unterscheidungsmerkmal ist die Transformer Engine, die Operationen in FP8-Präzision ausführt und die Ergebnisgenauigkeit über dynamisches Scaling erhält. Diese Funktion verbessert den Durchsatz bei Transformer-Modellen gemäss NVIDIA-Benchmarks um 30 bis 60 %, wobei die real beobachteten Gewinne in Produktion je nach Last und Optimierung meist zwischen 20 und 50 % liegen.

Gemessene Leistungsgewinne.

Beim Fine-Tuning von 70B-Modellen zeigt die H100 gemäss Herstellerbenchmarks einen Geschwindigkeitsgewinn von 2,8× gegenüber der A100. Bei Inferenz mit INT8-Quantisierung liegt der Gewinn je nach Modellgrösse und Optimierung zwischen 40 und 60 %.

Anwendungsfälle, welche die Investition rechtfertigen.

Die H100 drängt sich in drei Szenarien auf: Betrieb von Modellen über 40 Milliarden Parametern, regelmässiges Fine-Tuning (monatlich oder häufiger) komplexer Modelle und Anwendungen mit einer Latenzanforderung unter 500 Millisekunden. Die Mietpreise der H100 liegen je nach Anbieter meist zwischen 1800 und 2400 CHF pro Monat, ein Aufschlag von 30 bis 50 % gegenüber der A100 80GB. Dieser Mehrpreis rechtfertigt sich, wenn die Leistungsgewinne sich in gesparte Rechenzeit oder in Mehrertrag aus geringerer Latenz übersetzen.


NVIDIA L40S: die auf Inferenz optimierte Alternative

Die L40S auf Basis der Ada-Lovelace-Architektur, 2023 eingeführt, trägt 48 GB GDDR6-Speicher mit 864 GB/s Bandbreite. Ihre TDP von 350 W macht sie zur energieeffizientesten der drei betrachteten Rechenzentrums-GPUs.

Besondere technische Merkmale.

Die L40S verfügt über 18 176 CUDA-Kerne und 568 auf Inferenz optimierte Tensor Cores der vierten Generation. Anders als A100 und H100, die HBM (High Bandwidth Memory) nutzen, stützt sich die L40S auf GDDR6, was die geringere Speicherbandbreite, aber auch die tieferen Stückkosten erklärt. Dieser Speicherunterschied wirkt sich besonders auf Operationen mit intensiven Speicherzugriffen aus, etwa das Fine-Tuning grosser Modelle, wo die HBM-Bandbreite einen deutlichen Vorteil bringt.

Technische Positionierung.

NVIDIA positioniert die L40S als vielseitige GPU für gemischte Lasten: generative KI, Grafikdarstellung und wissenschaftliches Rechnen. Für KI-Agenten glänzt sie bei reiner Inferenz auf Modellen von 7 bis 20 Milliarden Parametern. Die GDDR6-Konfiguration macht sie für intensives Fine-Tuning von Modellen über 20B weniger geeignet, wo die höhere Bandbreite der HBM-GPUs entscheidend wird.

Energetischer Vorteil.

Mit 350 W gegenüber 400 W (A100) und 700 W (H100) hat die L40S in Multi-GPU-Architekturen einen klaren Vorteil. Eine Konfiguration mit 4× L40S zieht 1400 W, das Äquivalent von 2× H100. Über 36 Monate Dauerbetrieb kann die Stromersparnis mehrere Tausend Franken gegenüber einer gleichwertigen H100-Konfiguration ausmachen. Die Mietpreise der L40S liegen meist zwischen 700 und 1000 CHF pro Monat.

Technische Vergleichstabelle

Spezifikation

L40S

A100 80GB

H100

Architektur

Ada Lovelace

Ampere

Hopper

VRAM

48 GB GDDR6

80 GB HBM2e

80 GB HBM3

Bandbreite

864 GB/s

2039 GB/s

3350 GB/s

CUDA-Kerne

18 176

6912

16 896

Tensor Cores

568 (Gen 4)

432 (Gen 3)

528 (Gen 4)

TDP

350W

400W

700W

Präzisionen

FP32, FP16, INT8, INT4

FP64, FP32, TF32, FP16, INT8

FP64, FP32, TF32, FP16, FP8, INT8

NVLink-Unterstützung

Nein

Ja (600 GB/s)

Ja (900 GB/s)

Mietpreis*

760 CHF/Monat

1495 CHF/Monat

1999 CHF/Monat

*Das sind keine Marktdurchschnitte: es sind die im Hikube-Katalog publizierten Monatspreise für L40S, A100-80 und H100, am Tag Ihrer Lektüre auf der Preisseite prüfbar. Die weiter oben genannten Spannen sind Grössenordnungen, die bei verschiedenen Anbietern beobachtet wurden.

Überblick über die GPU-Alternativen

Professionelle NVIDIA-GPUs.

Die Reihe RTX A6000 (48GB GDDR6) und A5000 (24GB) richtet sich an Workstations und Prototyping-Umgebungen. Die RTX A6000 mit 300 W TDP eignet sich für kleine Deployments oder Entwicklungsphasen. Fehlende NVLink-Unterstützung und geringere Leistung als Rechenzentrums-GPUs begrenzen jedoch ihren Nutzen im intensiven Produktivbetrieb.

Consumer-GPUs der RTX-40-Reihe.

Die RTX 4090 mit 24 GB VRAM und 450 W TDP bietet ausgezeichnete Rohleistung bei tiefem Anschaffungspreis (rund 1800 CHF). Fehlende Rechenzentrumstreiber, keine ECC-Speicherunterstützung und eine begrenzte Garantie machen sie jedoch für kritische Produktionsumgebungen ungeeignet. Für lokale Entwicklung oder unkritische Kleinproduktion bleibt sie sinnvoll.

Alternativen von AMD und Intel.

AMD bietet die MI300X mit 192 GB HBM3-Speicher für sehr grosse Modelle. Das Software-Ökosystem ROCm macht Fortschritte, bleibt aber weniger reif als CUDA. Intel entwickelt Gaudi 2 und 3, auf Training optimiert, deren Verbreitung bei allgemeiner Inferenz jedoch gering bleibt. NVIDIA hält rund 90 % des Marktes für KI-GPUs, wobei das CUDA-Ökosystem kurzfristig einen schwer angreifbaren Vorteil darstellt.

Anwendungsfälle und wirtschaftliche Abwägungen

Konversationsagent mit RAG (Modell 7-13B)

Ein solcher Agent verarbeitet typischerweise 100 bis 500 Anfragen pro Minute bei einer Ziellatenz unter 2 Sekunden. Ein auf INT8 quantisiertes 7B-Modell braucht 8 GB VRAM, ein 13B-Modell rund 14 GB.

Empfohlene Konfigurationen:

Option

GPU

Optimale Nutzung

Sparsam

L40S

Reine Inferenz, bis 300 Anfragen/min auf 7B-Modell

Standard

A100 40GB

Quartalsweises Fine-Tuning geplant

Premium

A100 80GB

Wechsel zu Modellen ab 20B absehbar

Analyse

Für reine Inferenz ohne Fine-Tuning bietet die L40S einen ausgezeichneten TCO bei für dieses Segment reichlich genügender Leistung. Die A100 rechtfertigt sich, wenn das Modell regelmässig auf eigenen Fachdaten nachtrainiert werden muss.


Analytischer Agent (Modell 13-34B)

Agenten zur Dokument- oder Datenanalyse setzen Modelle von 13 bis 34 Milliarden Parametern ein, mit quartalsweisem oder monatlichem Fine-Tuning auf Fachdaten.

Empfohlene Konfiguration nach Grösse:

Modellgrösse

Minimale GPU

Optimale GPU

Begründung

13B

L40S

A100 40GB

Bei regelmässigem Fine-Tuning

20B

A100 80GB

A100 80GB

VRAM zwingend

34B

A100 80GB

H100

Bei monatlichem oder häufigerem Fine-Tuning

Wirtschaftliche Analyse

Der Kostenunterschied zwischen A100 80GB und H100 rechtfertigt sich, wenn die durch 2,8 geteilte Fine-Tuning-Zeit einen Produktivitätsgewinn im Team bringt, der über diesem monatlichen Aufschlag liegt. Bei einer technischen Ressource zu 150 CHF pro Stunde deckt die Ersparnis von 20 Rechenstunden pro Monat die Investition mehr als ab.


Komplexer multimodaler Agent (Modell ab 70B)

Modelle über 70 Milliarden Parametern verlangen zwingend Multi-GPU-Konfigurationen.

Typische Konfigurationen:

Konfiguration

Nutzung

Relative Leistung

2× A100 80GB

Inferenz 70B-Modell

Referenz (1×)

2× H100

Inferenz plus intensives Fine-Tuning

2× Inferenz, 2,8× Fine-Tuning

3× L40S

Nur Inferenz

0,7× (reduzierte Leistung)

Empfehlung.

Für eine Organisation, die ein 70B-Modell monatlich nachtrainiert, senkt die H100 die Rechenzeit von 15 auf 5 Tage, entlastet das Team und verkürzt die Markteinführung. Für reine Inferenz unter Budgetdruck bietet Multi-A100 den besten Kompromiss.


Multi-Agenten-Architektur

Organisationen, die mehrere Agenten auf gemeinsamer Infrastruktur betreiben, bevorzugen homogene GPU-Pools, um die Orchestrierung zu vereinfachen.

Beobachtete Strategien:

Konfiguration

Richtkosten/Monat*

Optimaler Anwendungsfall

6× L40S

4560 CHF

5-8 Agenten (7-13B), reine Inferenz

3× A100 80GB

4485 CHF

Gemischter Bedarf Inferenz/Fine-Tuning

Mix 2× A100 + 2× L40S

~3800 CHF

Hybride Strategie

Die zu vermeidenden Fehler

Fehler 1, vorsorgliche Überdimensionierung

Beobachtetes Symptom.

Technische Teams wählen grundsätzlich die stärkste GPU, «um Ruhe zu haben», ohne den realen Bedarf zu prüfen. So werden H100 für Agenten eingesetzt, die 7-13B-Modelle in reiner Inferenz betreiben.

Gemessene Folge.

Produktionsanalysen zeigen, dass ein erheblicher Teil der für Konversationsagenten eingesetzten Hochleistungs-GPUs unter 40 % Auslastung läuft. Die Mehrkosten betragen mehrere Tausend Franken pro Monat ohne spürbaren Leistungsgewinn.

Empfohlene Lösung.

Mit einer GPU beginnen, die dem aktuellen Bedarf entspricht (L40S oder A100 je nach Fall), die reale Auslastung 2 bis 4 Wochen messen und danach anpassen. Cloud-Infrastruktur erlaubt diese Flexibilität ohne Nachteil.


Fehler 2: den Fine-Tuning-Bedarf unterschätzen

Beobachtetes Symptom.

Eine L40S für ein Projekt wählen, das monatliches Fine-Tuning von Modellen ab 13B verlangt, mit dem Argument der tieferen Kosten.

Gemessene Folge.

Das Fine-Tuning eines 13B-Modells dauert auf einer L40S drei- bis viermal länger als auf einer A100, wegen der geringeren Speicherbandbreite. Braucht ein monatliches Nachtraining auf einer A100 48 Stunden, sind es auf einer L40S 6 Tage. Die Kosten der Teamzeit übersteigen die GPU-Ersparnis rasch.

Empfohlene Lösung.

Für jedes Projekt mit häufigerem Fine-Tuning als einmal pro Quartal mindestens eine A100 wählen. Die Gesamtkosten inklusive Personalzeit rechnen: (Rechenstunden × Stundensatz Team) plus GPU-Kosten.


Fehler 3, Engpässe ausserhalb der GPU ignorieren

Beobachtetes Symptom.

In eine Hochleistungs-GPU investieren, ohne die übrige Infrastruktur richtig zu dimensionieren, CPU, RAM, Storage, Netz.

Folge.

Die GPU wartet einen erheblichen Teil der Zeit auf Daten. Die beobachtete Leistung bleibt hinter den Erwartungen zurück, bei höheren Infrastrukturkosten.

Empfohlene Mindestspezifikationen:

  • CPU, mindestens 32 Kerne (64 bei Multi-GPU)
  • RAM, Verhältnis 1:4 zum GPU-VRAM (Beispiel, A100 80GB → 320GB System-RAM)
  • Storage, NVMe zwingend (mindestens 3000 MB/s Lesen)
  • Netz, 25 Gbps bei Multi-GPU, 100 Gbps ab 4 GPUs

Lösung.

Vor der Investition in eine Premium-GPU die gesamte Infrastruktur prüfen und bestehende Engpässe erkennen.


Fehler 4, die Datensouveränität vernachlässigen

Beobachtetes Symptom.

Einen GPU-Anbieter allein nach dem Preis wählen, ohne den physischen Standort der Server und die Compliance-Zertifizierungen zu prüfen.

Regulatorische Folge.

Das revDSG stellt für bestimmte Kategorien sensibler Daten besondere Anforderungen an das Hosting. Ein Betrieb auf GPUs ausserhalb des Territoriums kann für bestimmte Datenarten und Branchen eine Nichtkonformität darstellen.

Empfohlene Lösung.

Für regulierte Branchen (Finanzwesen, Gesundheit, Verwaltung) oder die Bearbeitung sensibler Personendaten grundsätzlich prüfen:

  • Den physischen Standort der GPU-Server
  • Die Zertifizierungen des Anbieters (ISO 27001) und den Schweizer Sitz (revDSG); Hikube ist kein französischer HDS-Hoster und nicht HDS-zertifiziert
  • Die vertraglichen Klauseln zum Datenschutz

Fehler 5, die Entwicklung der Modelle vergessen

Beobachtetes Symptom.

Die GPU-Infrastruktur strikt auf das heutige Modell auslegen, ohne die weitere Entwicklung mitzudenken.

Folge.

Sprachmodelle entwickeln sich rasch. Ein heute auf einem 7B-Modell betriebener Agent kann in 12 bis 18 Monaten 13B oder 20B brauchen, um konkurrenzfähig zu bleiben. Eine knapp dimensionierte GPU wird dann zur Grenze und erzwingt eine teure Migration.

Empfohlene Lösung.

Eine Reserve von 30-50 % beim VRAM einplanen. Ist der heutige Bedarf ein 7B-Modell (14GB), eine GPU mit mindestens 24GB statt 16GB wählen, was den Wechsel auf 13B ohne Infrastrukturänderung erlaubt.

Einführung im Unternehmen: praktischer Leitfaden

Phase 1, Audit und Bedarfsklärung (2-4 Wochen)

Die Anwendungsfälle erfassen.

Alle für 18 bis 24 Monate geplanten KI-Agenten erfassen, Konversations-, Analyse- und Entscheidungsagenten. Für jeden die vorgesehene Modellgrösse, das erwartete Anfragevolumen und die Häufigkeit des Nachtrainings dokumentieren.

Die regulatorischen Vorgaben beurteilen.

Für regulierte Branchen oder die Bearbeitung sensibler Daten die Anforderungen an Standort und Zertifizierung prüfen. Diese Analyse entscheidet, ob ein Hosting in der Schweiz zwingend ist, was die Anbieterwahl unmittelbar bestimmt.

Die bestehende Infrastruktur prüfen.

Die heutigen Kapazitäten bei CPU, RAM, Storage und Netz messen. Die möglichen Engpässe erkennen, die eine Hochleistungs-GPU ausbremsen würden.

Erwartete Ergebnisse.

Ein technisches Spezifikationsdokument, das je Agent auflistet: Modell, nötiger VRAM, angestrebter Durchsatz, Latenz- und Compliance-Vorgaben.


Phase 2, Proof of Concept und technische Validierung (2-4 Wochen)

Vorgehen.

Die in die engere Wahl gekommenen GPUs (L40S, A100, H100) für 1 bis 2 Wochen mieten. Den Agenten unter realistischer simulierter Last betreiben: repräsentatives Anfragevolumen, Nutzungsmuster (Spitzen, Täler), Prompt-Typen.

Zu messende Kennzahlen:

  • GPU-Auslastung, Mittelwert und Spitzen (Ziel 60-80 %)
  • Latenz, P50, P95, P99 (Ausreisser erkennen)
  • Durchsatz, verarbeitete Anfragen pro Sekunde bei Normal- und Spitzenlast
  • Kosten je Anfrage, Stundenkosten der GPU durch die Zahl verarbeiteter Anfragen teilen

Entscheid.

Die getesteten Konfigurationen in einer Kosten-Leistungs-Tabelle vergleichen. Eine GPU mit 30 % ungenutzter Kapazität weist auf Überdimensionierung hin. Eine P95-Latenz über dem Ziel zeigt Unterdimensionierung.

Gute Praxis.

Auch die Software-Optimierungen testen (vLLM, INT8-Quantisierung), welche die Leistung ohne GPU-Wechsel verdoppeln können.


Phase 3: Einführung und Architektur (4-8 Wochen)

Single-GPU-Architektur.

Für einen einzelnen Agenten mit mässiger Last genügt eine Single-GPU-Konfiguration. Empfehlungen:

  • Die GPU auf einem eigenen Server mit den in Phase 1 ermittelten Mindestspezifikationen betreiben
  • GPU-Monitoring einrichten (Auslastung, Temperatur, Speicherfehler)
  • Einen Backup-Plan vorsehen, regelmässige Sicherung der fine-getunten Modelle und Konfigurationen

Homogene Multi-GPU-Architektur.

Für mehrere Agenten oder einen hochverfügbaren Agenten 2 bis 4 identische GPUs mit Load Balancing betreiben. Das erlaubt:

  • Automatische Lastverteilung zwischen den GPUs
  • Fehlertoleranz (eine ausfallende GPU stoppt den Dienst nicht)
  • Einfache horizontale Skalierung (weitere GPUs ergänzen)

Hybride Architektur.

Für gemischten Bedarf (Inferenz plus Fine-Tuning) auf Inferenz optimierte GPUs (L40S) mit vielseitigen (A100) kombinieren:

  • L40S für die laufende Inferenz (Agenten in Produktion)
  • A100 für monatliches oder quartalsweises Fine-Tuning reserviert
  • 20-30 % Ersparnis gegenüber einer reinen A100-Konfiguration

Empfehlung zum Netz.

Bei Multi-GPU ist eine Verbindung von mindestens 25 Gbps nötig. Ab 4 GPUs 100 Gbps wählen, um Staus bei der Synchronisation zu vermeiden.


Phase 4: Governance und laufende Optimierung

Laufendes Monitoring.

Dashboards einrichten, die Folgendes verfolgen:

  • GPU-Auslastung je Stunde und Tag (ruhige Zeiten erkennen)
  • P95-Latenz im Zeitverlauf (Verschlechterungen erkennen)
  • Monatliche Kosten je Anfrage (TCO optimieren)
  • GPU-Fehler (ECC-Fehler, Timeouts, OOM)

Quartalsweise Überprüfung.

Die Kennzahlen über drei Monate auswerten und die Optimierungen bestimmen:

  • Dauerhafte Unternutzung (unter 50 %) → GPU-Downgrade möglich
  • Regelmässige Sättigung (über 85 %) → Skalierung nötig
  • Starke Schwankung Tag/Nacht → Kapazität nach Tageszeit optimieren

Entwicklung der Modelle.

Migrationen auf neuere oder grössere Modelle planen. Den zusätzlichen VRAM-Bedarf sechs Monate im Voraus abschätzen, um teure Notmigrationen zu vermeiden.

Kostensteuerung.

Die Anbieterpreise regelmässig vergleichen und Verträge nachverhandeln. Der GPU-Markt bewegt sich schnell, und zwischen Anbietern können bei gleicher Konfiguration Unterschiede von 15-20 % auftreten.

TCO-Analyse und wirtschaftliche Überlegungen

Gesamtbetriebskosten über 36 Monate

Rechenannahmen:

  • Nutzung rund um die Uhr in Produktion
  • Strompreis, 0,18 CHF/kWh (mittlerer Schweizer Industrietarif)
  • Kühlung, 1,5× des GPU-Verbrauchs (üblicher PUE, Power Usage Effectiveness)
  • Netz- und Storage-Infrastruktur, +15 % der monatlichen GPU-Kosten

Single-GPU-Konfiguration über 36 Monate:

GPU

Miete, 36 Monate*

Strom**

Infrastruktur***

Gesamt-TCO

L40S

27 360 CHF

2484 CHF

4100 CHF

33 944 CHF

A100 80GB

53 820 CHF

2835 CHF

8075 CHF

64 730 CHF

H100

71 964 CHF

4968 CHF

10 795 CHF

87 727 CHF

*Tarife des referenzierten Anbieters. **Inklusive Kühlung (TDP × 1,5 × 24/7 × 36 Monate × 0,18 CHF/kWh). ***15 % der Mietkosten für Netz, Storage und Wartung.

Analyse. Die L40S zeigt über 36 Monate bei reiner Inferenz einen TCO, der 48 % unter der A100 und 61 % unter der H100 liegt. Dieser Vorteil schrumpft, sobald monatliches Fine-Tuning dazukommt, da die auf A100 oder H100 gesparte Zeit den Mehrpreis teilweise ausgleicht.

Multi-GPU-Konfiguration: Kostenstrategien

Szenario, 4 GPUs für eine Multi-Agenten-Architektur

Konfiguration

Monatskosten*

TCO über 36 Monate

4× L40S

3040 CHF

135 776 CHF

4× A100 80GB

5980 CHF

258 920 CHF

2× A100 + 2× L40S

4510 CHF

201 348 CHF

*Inklusive Strom und Infrastruktur

Hybride Strategie im Detail.

Für eine Organisation mit 5 Agenten (3 in reiner Inferenz auf 7-13B-Modellen, 2 mit monatlichem Fine-Tuning auf 13-20B):

  • 2× L40S für die 3 Agenten in reiner Inferenz
  • 2× A100 80GB für die 2 Agenten mit Fine-Tuning

Ersparnis, 57 572 CHF über 36 Monate gegenüber einer reinen A100-Konfiguration. Dieser Ansatz verlangt eine komplexere Orchestrierung, maximiert aber den ROI, indem jede GPU ihrer optimalen Nutzung zugewiesen wird.

Break-even: mieten oder kaufen

Für Organisationen, die einen GPU-Kauf statt einer Miete erwägen, wird die Break-even-Rechnung relevant.

Geschätzte Anschaffungskosten (nur Hardware):

  • L40S, ~8000 CHF
  • A100 80GB, ~15 000 CHF
  • H100, ~30 000 CHF

Ungefährer Break-even (ohne Infrastruktur-, Strom- und Wartungskosten):

  • L40S, 11 Monate Miete
  • A100 80GB, 10 Monate Miete
  • H100, 15 Monate Miete

Analyse. Der Kauf lohnt sich bei Einsätzen über mindestens 24 Monate mit intensiver Nutzung (über 80 % der Zeit). Unter 18 Monaten oder bei schwankender Nutzung bleibt die Miete wegen ihrer Flexibilität vorzuziehen.

Vor dem Kauf zu bedenkende Faktoren:

  • Veralterung, KI-GPUs entwickeln sich rasch (Zyklus 18-24 Monate)
  • Wartung, Herstellergarantie, Ersatzteile
  • Wiederverkauf, Restwert nach drei Jahren (30-40 % bei Rechenzentrumsmodellen)

Folgen und Ausblick

Was diese Abwägungen für Organisationen ändern

Die grössere Vielfalt bei Rechenzentrums-GPUs erlaubt technischen Teams heute, ihre Infrastruktur entlang von drei Achsen fein abzustimmen, rohe Leistung, Vielseitigkeit und wirtschaftliche Effizienz. Die L40S macht Inferenz im grossen Massstab für 7-13B-Modelle zugänglich, das mehrheitliche Segment bei KMU und mittelgrossen Unternehmen. Die A100 80GB bleibt die vielseitige Referenz-GPU, passend für sich entwickelnde Architekturen, deren Bedarf zwischen Inferenz und Fine-Tuning schwankt. Die H100 bleibt Anwendungsfällen vorbehalten, in denen ihre höheren Fähigkeiten wirtschaftlich gerechtfertigt sind: Modelle ab 70B, sehr niedrige Latenz oder intensives Fine-Tuning mit belegbarem ROI.

Beobachtete Trends und erwartete Entwicklungen

Erster Trend, die Software-Optimierung holt die Hardware ein.

Frameworks wie vLLM, TensorRT-LLM oder SGLang verbessern den Durchsatz auf gleicher Hardware um das 2- bis 3-Fache. Eine sauber optimierte A100 kann bei manchen Inferenzlasten mit einer nicht optimierten H100 mithalten. Es empfiehlt sich daher, die Software-Optimierungen zu testen, bevor in Premium-Hardware investiert wird.

Zweiter Trend: Quantisierung wird zum Standard.

INT8-Präzision setzt sich in der Produktion durch, mit einem Qualitätsverlust von meist unter 3 % über die meisten Benchmarks. Die aggressivere INT4-Quantisierung kann je nach Aufgabe Verluste von 5 bis 8 % zeigen und verlangt eine Prüfung im Einzelfall. Diese Techniken vierteln bis halbieren den VRAM-Bedarf und erlauben 13B-Modelle auf 24GB-GPUs oder 34B-Modelle auf 48GB-GPUs.

Dritter Trend: die Datensouveränität setzt sich durch.

Regulatorische Vorgaben und Branchenanforderungen (Finanzwesen, Gesundheit, Verwaltung) begünstigen das Hosting der GPU-Infrastruktur in der Schweiz. Cloud-Anbieter mit L40S, A100 und H100 in der Schweiz bedienen diese wachsende Nachfrage, mit Zertifizierungen für regulierte Branchen.

Fazit: ein unverzichtbar gewordener Beschleuniger

Wichtiger Hinweis, Die Empfehlungen dieses Beitrags beruhen auf allgemeinen Anwendungsfällen. Jede Infrastruktur hat ihre Eigenheiten. Es empfiehlt sich, eine Cloud-Architektin oder einen Infrastrukturspezialisten beizuziehen, um die Dimensionierung im eigenen Kontext zu validieren.

Bereit für 100 % Schweizer Infrastruktur?

14-Tage-Trial, keine Karte. GPUs inklusive.