• KI
  • Infrastruktur
  • DSGVO

GPU-Server mieten in Deutschland: worauf es für KI-Projekte ankommt

Dr. Thomas Link

Rechenzentrumsgang mit Server-Racks und Arbeitsplatz — GPU-Hosting als kontrollierte Infrastruktur

Das Wichtigste

Für Ollama und Open-Weight zählen VRAM, Root und Rechenzentrum in DE/EU — nicht der günstigste Marktplatz-Preis. Zuerst klären, welche Daten auf eine Cloud-GPU dürfen.

Fragen zu diesem Artikel?

Antworten nur aus diesem Beitrag und freigegebenen Zusatzinfos. Keine vertraulichen Firmendaten eingeben.

Wählen Sie eine Frage oder schreiben Sie selbst.

Ggf. Nutzung — siehe Datenschutz.

Antworten auf Sie zuschneiden

Schnell wählen oder ergänzen — nur zur Formulierung. Keine Namen oder vertraulichen Firmendaten.

Rolle

Größe

Branche

Situation

Chips wählen, optional ergänzen — dann Speichern. Erst danach gilt das Profil für Fragen.

Nicht die günstigste GPU — der richtige Ort

Wenn wir bei LEXI KI-Anwendungen für Kundenprojekte betreiben — etwa Ollama mit Open-Weight-Modellen — geht es selten um „irgendeine GPU in der Cloud“. Es geht darum, welche Daten wohin dürfen und ob die Maschine Root, genug VRAM und einen nachvollziehbaren Standort in Deutschland oder der EU hat. Diese Orientierung nutzen wir intern genau so: erst Datenampel, dann Hardware.

Dieser Artikel ist kein Preisportal. Preise ändern sich; Stand der genannten Zahlen: 01.08.2026 (Orientierung, oft excl. MwSt. / Promo möglich). Vor Buchung immer die Anbieterseite prüfen.

Getting Started: Was sollten Sie vorher wissen?

Bevor Sie Preise vergleichen — fünf Klärungen. Ohne die wird jede Anbieterliste Zufall.

  1. Welche Daten dürfen die Maschine sehen?

    Datenampel: Personendaten/Mandanten → DE/EU + AVV; Tests ohne Personenbezug können anders laufen.

  2. Inferenz oder Training?

    Chat/Ollama braucht oft weniger VRAM als Fine-Tuning.

  3. Wie viel VRAM?

    Richtwert Open-Weight: 16–24 GB Einstieg; mehr VRAM = größere Modelle/Context.

  4. Brauchen Sie Root/Docker?

    Ja für eigenen Ollama-Stack — reine Token-APIs reichen dann nicht.

  5. Wie oft läuft die GPU?

    Täglich → Monat/Kauf prüfen; sporadisch → Stunde/Pause (TCO).

Danach: Weg wählen (Drei Wege) → Kurzliste → Anbieterseite + AVV.

Welche drei Wege gibt es für GPU-Kapazität?

Weg 1

On-Prem / bestehende GPU

Wenn Daten nicht raus dürfen — oder die Last dauerhaft lokal planbar ist.

Weg 2

DE Dedicated

Dauerbetrieb mit Root, typisch 16–24 GB+ VRAM, RZ in Deutschland, AVV möglich.

Weg 3

EU-Burst (stündlich)

Große Jobs (A100/H100-Klasse), danach Instanz aus — nicht blind 24/7 mieten.

Marketplaces (z. B. Vast.ai, RunPod) eignen sich zum Preisvergleich und für Tests ohne Personendaten — nicht als Default für Mandantendaten.

Welche Anbieter eignen sich für produktive DE/EU-Nutzung?

Orientierung — keine Rangfolge. Auswahl nach Datenklasse, VRAM, Root und Standort. Preise Stand 01.08.2026, vor Buchung prüfen.

AnbieterTypisch fürVRAM (Beispiel)Preis-ReferenzHinweis
centronCloud GPU, BSI C516–48 GB (RTX 6000: 24 GB)ab ca. 171 €/Mo (zzgl. USt.)DE · ISO 27001 + C5 Typ 1 · AVV via Trust Center
Hetzner GEXDedicated Inferenz20 / 96 GB184 / 889 €/Mo + Setup GEX44 (excl. VAT)Monat, DE Falkenstein/Nürnberg · AVV
INGATEBare-Metal, tiefe Zertifikate20 GB (RTX 4000 SFF Ada)ab 349 €/Mo (zzgl. USt.)München · kein US Cloud Act · AVV prüfen
IONOSBare-Metal Root16–96 GB (A10: 24 GB)AP2-10 max. ca. 679 €/Mo (inkl. MwSt.)Standort DE wählen; auch FR/ES/UK/US möglich · AVV separat prüfen
OVHcloudEU-Burst stündlichL4 / A10 24 GBab ca. 0,75 €/h (Gravelines)ISO/SOC/HDS · Firmensitz FR
Trooper.AIBare-Metal flexibel16–96 GBPowerAI Promo ~0,46 €/h (Normal ~0,58)Prepaid/Promo · AVV einfordern · Standort je Blib

Filter: öffentliche/sensible Daten → Zertifikate/AVV streng prüfen. 16–24-GB-Inferenz → Dedicated/Bare-Metal mit Root vergleichen. Burst → OVHcloud/Scaleway. Weitere DE-Anbieter (aime, LWLcom, rackspeed …): erweiterte Übersicht.

Wo werden die Daten gehostet?

Schematische Übersicht bekannter bzw. typischer RZ-Regionen (Stand 08/2026). Keine GIS-Genauigkeit — bei Cloud immer die Region in der Konsole wählen und dokumentieren.

Blau = konkret genannte Region; grau = multi-Region / unscharf / RZ vor Buchung klären. Kacheln: OpenStreetMap/CARTO beim Einblenden. Zoom nach Klick auf die Karte auch per Mausrad.

Mehr Anbieter (EU-Burst, Marketplace, Stufe A/B/C) — bei Bedarf aufklappen:

Erweiterte Übersicht (Orientierung)

Stufe: A = Produktion DE/EU · B = EU/mit Einschränkung · C = nur Benchmark · X = nicht nutzen.
* AVV/RZ vor Mandantendaten klären · † aktuell SOLD OUT / nicht buchbar.

AnbieterFormVRAMPreis-ReferenzOrtStufe
aime GPU CloudCloud / Baremetal24–141 GBRTX 3090 ca. 0,35–0,47 €/hBerlin (RZ-Upgrade?)A*
centronCloud16–48 GBRTX 6000 ab ca. 171 €/MoDEA
Hetzner GEX44 / GEX131Dedicated20 / 96 GB184 / 889 €/Mo (excl. VAT)DE FSN/NBGA
INGATEBare-Metal20–96 GBab 349 €/MoDE MünchenA
IONOS Bare Metal (AP2-10 u. a.)Bare-Metal16–96 GBAP2-10 max. ca. 679 €/MoDE wählbarA
OVHcloud L4 / A10Cloud24 GBab ca. 0,75 €/hFR GravelinesA
Trooper.AIBare-Metal16–96 GBPromo ~0,46 €/h / Normal ~0,58DE/NL/FRA*
LWLcomBare-Metal Anfragevariabelauf AnfrageDE BremenB
rackspeedDedicated2×48 GB L40auf AnfrageDE DüsseldorfB
VerdacloudManaged (Hetzner)20 / 96 GB299 / 1.349 €/MoDE (via Hetzner)B
IONOS Cloud H200Cloud VMbis 141 GBca. 3,26 $/hDE/EUA
ContaboCloud48–141 GBab 600 €/Moglobal, unklarC
mittwald AIManaged API— / 96 GB Enterpriseab 9 €/Mo APIDEC
netcup vGPUSlice7 / 14 GBSOLD OUT†DE NürnbergC†
partimusCloudab 48 GBEnterprise / AnfrageDE LimburgC
Pexon Private AIBeratungPakete POC…C
ScalewayCloud24–80 GBH100 ca. 2,73 $/hFR/PLB
NebiusCloud48–141 GBH100 ca. 2,95 $/hFI/FRB
Vast.ai / RunPodMarketplace24 GB+ab ca. 0,13 $/hvariabelC

netcup: unter Sweet-Spot und derzeit ausverkauft. Contabo/partimus: kein 16–24-GB-Fenster. mittwald/Pexon: kein klassisches GPU-Hosting für eigenen Ollama-Stack (außer Enterprise/Beratung).

Brücke zu LEXI: Leistungen im Überblick — wo Modelle laufen dürfen, gehört in die Roadmap. Sicher nutzen im Team: KI-Kompetenzschulung.

Worauf müssen Sie bei GPU-Hosting achten?

  • DatenklasseWas darf On-Prem bleiben? Datenampel vor dem Preis.
  • AVV + StandortArt. 28, TOMs, RZ DE/EU, Subprozessoren.
  • VRAM≥ 16–24 GB für typische Open-Weight-Inferenz.
  • Root / DockerNötig für eigenen Ollama-Stack.
  • AbrechnungMonat vs. Stunde vs. Pause/Resume.

Reicht „DSGVO-konform“ auf der Website?

Irrtum

„DSGVO-konform“ reicht als Nachweis

Realität Ohne AVV, TOMs und klare Subprozessoren/Standorte fehlt die vertragliche Absicherung.

Schritt AVV im Kundenportal suchen und akzeptieren

Irrtum

Günstigster Marktplatz = beste Wahl

Realität Preis-Benchmark ja — Mandantendaten nur mit Extra-Prüfung (oft SCC/AVV unklar).

Schritt Stufe C nur für Tests ohne Personendaten

Irrtum

Rechenzentren bieten meine 5070 Ti an

Realität Consumer-Karten sind VRAM-Referenz; RZ liefern Pro-/Datacenter-GPUs oder Marketplace-Hardware.

Schritt Nach GB VRAM und Root vergleichen, nicht nach Marketingnamen

Was bedeuten die wichtigsten Begriffe?

BegriffBedeutung
InferenzFertiges Modell anwenden (Chat, Klassifikation)
Training / Fine-TuningModell anpassen — meist mehr VRAM und Zeit
DedicatedMaschine für Sie, oft Root
Marketplacefremde/Restkapazität — Compliance je Host prüfen
vRAMSpeicher auf der GPU — oft entscheidender als der Kartenname

Lernbeispiel Anbieterseite: Hetzner GEX-Matrix — Inferenz (GEX44, 20 GB) vs. Training (GEX131, 96 GB).

Wann lohnt sich eigene Hardware — und wann Cloud?

Bei Multi-GPU-Clustern (Rechenzentrums-Maßstab) kippt die Rechnung anders als bei einer einzelnen Grafikkarte bzw. einem Dedicated-GPU-Server — unserer Größenordnung in Kundenprojekten.

Großcluster (eigen)Einzelne Grafikkarte / 1 GPU-Server
Break-Evenoft erst bei hoher Dauerauslastung (Richtwert oft über der Hälfte)Nutzungsstunden: regelmäßige tägliche Nutzung reicht oft
Unter der SchwelleCloud oft günstiger — Fixkosten (RZ, Personal, Kühlung) laufen weiterWorst Case: GPU idle — kein vergleichbarer Kostensprung
KostentreiberStrom, Kühlung, Netz, Personal (Hardware oft nur Teil der TCO)Kaufpreis dominiert; Strom/Ops eher Nebenkosten
ZeithorizontJahre, kapitalintensivMonate — einfachere Break-Even-Logik

Branchenseitig wird bei selbstbetriebenen Großclustern häufig von niedriger Durchschnittsauslastung berichtet — dann wirkt Eigenbetrieb teurer als gedacht. Das ist nicht 1:1 Ihre Entscheidung bei einer Workstation-/Server-GPU.

Kurz: Großcluster = auslastungsgetrieben. Eine Grafikkarte bzw. ein GPU-Server = nutzungsstundengetrieben. Der TCO-Rechner modelliert die Einzel-GPU-Logik.

Was gehört in die Kostenrechnung?

Eigene Hardware: Anschaffung · Setup · Abschreibung (typisch 24–36 Monate) · Strom unter Last und Idle · Ops · Kühlung (Einzelkarte meist vernachlässigbar) · Kapitalbindung · Restwert · Ausfallrisiko.

Cloud: €/h · echte Stunden/Monat · Fix-Abo · Egress (RAG-Uploads) · Storage · Rest-Ops · Flexibilität.

Übergreifend: Compliance kann Cloud unabhängig vom Preis ausschließen · SLA.

Welche typischen Fallen gibt es?

  • „DSGVO“ ohne AVV — Claim ≠ Vertrag.
  • Promo-Preise — Basisrate kann höher liegen.
  • Monatsbindung/Setup — gegen Stundenmiete rechnen (TCO).
  • Cluster-Logik auf eine einzelne Grafikkarte übertragen — gilt so nicht.
  • Aggregator-Preise — an der Primär-URL prüfen.
  • Managed ohne Root — ersetzt keinen Ollama-Stack.

TCO-Rechner: eigene GPU vs. Cloud

Modell für eine Grafikkarte bzw. einen einzelnen GPU-Server (nicht Multi-GPU-Cluster) über 36 Monate. Beispiel Cloud-Stundensatz ~0,46 €/h (Trooper PowerAI-Promo Stand 01.08.2026; Normal ~0,58 €/h — Slider anpassen). Idle-Strom und Compliance sind vereinfacht bzw. außerhalb der Rechnung — siehe Einzel-GPU vs. Cluster.

Eigene Hardware

Cloud-GPU

Cloud-Ops mit 30 % des eigenen Ops-Werts angesetzt (kein Hardware-Troubleshooting, aber Monitoring bleibt).

Eigene Hardware Ø €/Mo
Cloud €/Mo
Break-Even

Kumulierte Kosten (36 Monate)

Eigene Hardware Cloud

Häufige Fragen

Reicht „DSGVO-konform“ auf der Anbieter-Website?
Nein. Bei Personendaten brauchen Sie einen AVV (Art. 28), dokumentierte TOMs und Klarheit zu Standort und Subprozessoren. Der Marketing-Claim allein reicht nicht.
Wie viel VRAM brauche ich für Ollama?
Für viele 7B–14B-Modelle (quantisiert) sind 16–24 GB ein sinnvoller Einstieg. Größere Modelle oder längerer Context brauchen spürbar mehr. Training/Fine-Tuning oft deutlich mehr als reine Inferenz.
Dedicated GPU oder Cloud-VM?
Dedicated (Root, feste Maschine) eignet sich für dauerhafte Stacks wie Ollama. Cloud-VMs und Stundenabrechnung eignen sich für Burst und große Jobs. Marketplaces sind günstig, aber für Mandantendaten nur mit Extra-Prüfung.
Lohnt sich Kaufen oder Cloud-Miete?
Bei einer einzelnen Grafikkarte oder einem Dedicated-GPU-Server zählt die tägliche Nutzung — Break-Even oft in Monaten. Großcluster (viele GPUs) brauchen hohe Dauerauslastung; darunter ist Cloud meist günstiger. Der TCO-Rechner modelliert genau diese Einzel-GPU-Logik. Compliance kann Cloud unabhängig vom Preis ausschließen.
Was ist der erste Schritt in einem Kundenprojekt?
Datenampel: Was darf On-Prem bleiben, was darf in ein DE/EU-RZ? Dann Use-Case (Inferenz vs. Training) und VRAM — erst danach Anbieter und Preis.

Welche Workloads dürfen auf die GPU?

Im Erstgespräch klären wir Datenklasse und sinnvollen Ort — On-Prem, DE-Dedicated oder EU-Burst. 30 Minuten, unverbindlich.