- KI
- Infrastruktur
- DSGVO
GPU-Server mieten in Deutschland: worauf es für KI-Projekte ankommt
Dr. Thomas Link
Rechenzentrumsgang mit Server-Racks und Arbeitsplatz — GPU-Hosting als kontrollierte Infrastruktur
Das Wichtigste
Für Ollama und Open-Weight zählen VRAM, Root und Rechenzentrum in DE/EU — nicht der günstigste Marktplatz-Preis. Zuerst klären, welche Daten auf eine Cloud-GPU dürfen.
Fragen zu diesem Artikel?
Antworten nur aus diesem Beitrag und freigegebenen Zusatzinfos. Keine vertraulichen Firmendaten eingeben.
Ggf. Nutzung — siehe Datenschutz.
Nicht die günstigste GPU — der richtige Ort
Wenn wir bei LEXI KI-Anwendungen für Kundenprojekte betreiben — etwa Ollama mit Open-Weight-Modellen — geht es selten um „irgendeine GPU in der Cloud“. Es geht darum, welche Daten wohin dürfen und ob die Maschine Root, genug VRAM und einen nachvollziehbaren Standort in Deutschland oder der EU hat. Diese Orientierung nutzen wir intern genau so: erst Datenampel, dann Hardware.
Dieser Artikel ist kein Preisportal. Preise ändern sich; Stand der genannten Zahlen: 01.08.2026 (Orientierung, oft excl. MwSt. / Promo möglich). Vor Buchung immer die Anbieterseite prüfen.
Getting Started: Was sollten Sie vorher wissen?
Bevor Sie Preise vergleichen — fünf Klärungen. Ohne die wird jede Anbieterliste Zufall.
-
Welche Daten dürfen die Maschine sehen?
Datenampel: Personendaten/Mandanten → DE/EU + AVV; Tests ohne Personenbezug können anders laufen.
-
Inferenz oder Training?
Chat/Ollama braucht oft weniger VRAM als Fine-Tuning.
-
Wie viel VRAM?
Richtwert Open-Weight: 16–24 GB Einstieg; mehr VRAM = größere Modelle/Context.
-
Brauchen Sie Root/Docker?
Ja für eigenen Ollama-Stack — reine Token-APIs reichen dann nicht.
-
Wie oft läuft die GPU?
Täglich → Monat/Kauf prüfen; sporadisch → Stunde/Pause (TCO).
Danach: Weg wählen (Drei Wege) → Kurzliste → Anbieterseite + AVV.
Welche drei Wege gibt es für GPU-Kapazität?
Weg 1
On-Prem / bestehende GPU
Wenn Daten nicht raus dürfen — oder die Last dauerhaft lokal planbar ist.
Weg 2
DE Dedicated
Dauerbetrieb mit Root, typisch 16–24 GB+ VRAM, RZ in Deutschland, AVV möglich.
Weg 3
EU-Burst (stündlich)
Große Jobs (A100/H100-Klasse), danach Instanz aus — nicht blind 24/7 mieten.
Marketplaces (z. B. Vast.ai, RunPod) eignen sich zum Preisvergleich und für Tests ohne Personendaten — nicht als Default für Mandantendaten.
Welche Anbieter eignen sich für produktive DE/EU-Nutzung?
Orientierung — keine Rangfolge. Auswahl nach Datenklasse, VRAM, Root und Standort. Preise Stand 01.08.2026, vor Buchung prüfen.
| Anbieter | Typisch für | VRAM (Beispiel) | Preis-Referenz | Hinweis |
|---|---|---|---|---|
| centron | Cloud GPU, BSI C5 | 16–48 GB (RTX 6000: 24 GB) | ab ca. 171 €/Mo (zzgl. USt.) | DE · ISO 27001 + C5 Typ 1 · AVV via Trust Center |
| Hetzner GEX | Dedicated Inferenz | 20 / 96 GB | 184 / 889 €/Mo + Setup GEX44 (excl. VAT) | Monat, DE Falkenstein/Nürnberg · AVV |
| INGATE | Bare-Metal, tiefe Zertifikate | 20 GB (RTX 4000 SFF Ada) | ab 349 €/Mo (zzgl. USt.) | München · kein US Cloud Act · AVV prüfen |
| IONOS | Bare-Metal Root | 16–96 GB (A10: 24 GB) | AP2-10 max. ca. 679 €/Mo (inkl. MwSt.) | Standort DE wählen; auch FR/ES/UK/US möglich · AVV separat prüfen |
| OVHcloud | EU-Burst stündlich | L4 / A10 24 GB | ab ca. 0,75 €/h (Gravelines) | ISO/SOC/HDS · Firmensitz FR |
| Trooper.AI | Bare-Metal flexibel | 16–96 GB | PowerAI Promo ~0,46 €/h (Normal ~0,58) | Prepaid/Promo · AVV einfordern · Standort je Blib |
Filter: öffentliche/sensible Daten → Zertifikate/AVV streng prüfen. 16–24-GB-Inferenz → Dedicated/Bare-Metal mit Root vergleichen. Burst → OVHcloud/Scaleway. Weitere DE-Anbieter (aime, LWLcom, rackspeed …): erweiterte Übersicht.
Wo werden die Daten gehostet?
Schematische Übersicht bekannter bzw. typischer RZ-Regionen (Stand 08/2026). Keine GIS-Genauigkeit — bei Cloud immer die Region in der Konsole wählen und dokumentieren.
Mehr Anbieter (EU-Burst, Marketplace, Stufe A/B/C) — bei Bedarf aufklappen:
Erweiterte Übersicht (Orientierung)
Stufe: A = Produktion DE/EU · B = EU/mit Einschränkung · C = nur Benchmark · X = nicht nutzen.
* AVV/RZ vor Mandantendaten klären · † aktuell SOLD OUT / nicht buchbar.
| Anbieter | Form | VRAM | Preis-Referenz | Ort | Stufe |
|---|---|---|---|---|---|
| aime GPU Cloud | Cloud / Baremetal | 24–141 GB | RTX 3090 ca. 0,35–0,47 €/h | Berlin (RZ-Upgrade?) | A* |
| centron | Cloud | 16–48 GB | RTX 6000 ab ca. 171 €/Mo | DE | A |
| Hetzner GEX44 / GEX131 | Dedicated | 20 / 96 GB | 184 / 889 €/Mo (excl. VAT) | DE FSN/NBG | A |
| INGATE | Bare-Metal | 20–96 GB | ab 349 €/Mo | DE München | A |
| IONOS Bare Metal (AP2-10 u. a.) | Bare-Metal | 16–96 GB | AP2-10 max. ca. 679 €/Mo | DE wählbar | A |
| OVHcloud L4 / A10 | Cloud | 24 GB | ab ca. 0,75 €/h | FR Gravelines | A |
| Trooper.AI | Bare-Metal | 16–96 GB | Promo ~0,46 €/h / Normal ~0,58 | DE/NL/FR | A* |
| LWLcom | Bare-Metal Anfrage | variabel | auf Anfrage | DE Bremen | B |
| rackspeed | Dedicated | 2×48 GB L40 | auf Anfrage | DE Düsseldorf | B |
| Verdacloud | Managed (Hetzner) | 20 / 96 GB | 299 / 1.349 €/Mo | DE (via Hetzner) | B |
| IONOS Cloud H200 | Cloud VM | bis 141 GB | ca. 3,26 $/h | DE/EU | A |
| Contabo | Cloud | 48–141 GB | ab 600 €/Mo | global, unklar | C |
| mittwald AI | Managed API | — / 96 GB Enterprise | ab 9 €/Mo API | DE | C |
| netcup vGPU | Slice | 7 / 14 GB | SOLD OUT† | DE Nürnberg | C† |
| partimus | Cloud | ab 48 GB | Enterprise / Anfrage | DE Limburg | C |
| Pexon Private AI | Beratung | — | Pakete POC… | — | C |
| Scaleway | Cloud | 24–80 GB | H100 ca. 2,73 $/h | FR/PL | B |
| Nebius | Cloud | 48–141 GB | H100 ca. 2,95 $/h | FI/FR | B |
| Vast.ai / RunPod | Marketplace | 24 GB+ | ab ca. 0,13 $/h | variabel | C |
netcup: unter Sweet-Spot und derzeit ausverkauft. Contabo/partimus: kein 16–24-GB-Fenster. mittwald/Pexon: kein klassisches GPU-Hosting für eigenen Ollama-Stack (außer Enterprise/Beratung).
Brücke zu LEXI: Leistungen im Überblick — wo Modelle laufen dürfen, gehört in die Roadmap. Sicher nutzen im Team: KI-Kompetenzschulung.
Worauf müssen Sie bei GPU-Hosting achten?
- DatenklasseWas darf On-Prem bleiben? Datenampel vor dem Preis.
- AVV + StandortArt. 28, TOMs, RZ DE/EU, Subprozessoren.
- VRAM≥ 16–24 GB für typische Open-Weight-Inferenz.
- Root / DockerNötig für eigenen Ollama-Stack.
- AbrechnungMonat vs. Stunde vs. Pause/Resume.
Reicht „DSGVO-konform“ auf der Website?
Irrtum
„DSGVO-konform“ reicht als Nachweis
Realität Ohne AVV, TOMs und klare Subprozessoren/Standorte fehlt die vertragliche Absicherung.
Schritt AVV im Kundenportal suchen und akzeptieren
Irrtum
Günstigster Marktplatz = beste Wahl
Realität Preis-Benchmark ja — Mandantendaten nur mit Extra-Prüfung (oft SCC/AVV unklar).
Schritt Stufe C nur für Tests ohne Personendaten
Irrtum
Rechenzentren bieten meine 5070 Ti an
Realität Consumer-Karten sind VRAM-Referenz; RZ liefern Pro-/Datacenter-GPUs oder Marketplace-Hardware.
Schritt Nach GB VRAM und Root vergleichen, nicht nach Marketingnamen
Was bedeuten die wichtigsten Begriffe?
| Begriff | Bedeutung |
|---|---|
| Inferenz | Fertiges Modell anwenden (Chat, Klassifikation) |
| Training / Fine-Tuning | Modell anpassen — meist mehr VRAM und Zeit |
| Dedicated | Maschine für Sie, oft Root |
| Marketplace | fremde/Restkapazität — Compliance je Host prüfen |
| vRAM | Speicher auf der GPU — oft entscheidender als der Kartenname |
Lernbeispiel Anbieterseite: Hetzner GEX-Matrix — Inferenz (GEX44, 20 GB) vs. Training (GEX131, 96 GB).
Wann lohnt sich eigene Hardware — und wann Cloud?
Bei Multi-GPU-Clustern (Rechenzentrums-Maßstab) kippt die Rechnung anders als bei einer einzelnen Grafikkarte bzw. einem Dedicated-GPU-Server — unserer Größenordnung in Kundenprojekten.
| Großcluster (eigen) | Einzelne Grafikkarte / 1 GPU-Server | |
|---|---|---|
| Break-Even | oft erst bei hoher Dauerauslastung (Richtwert oft über der Hälfte) | Nutzungsstunden: regelmäßige tägliche Nutzung reicht oft |
| Unter der Schwelle | Cloud oft günstiger — Fixkosten (RZ, Personal, Kühlung) laufen weiter | Worst Case: GPU idle — kein vergleichbarer Kostensprung |
| Kostentreiber | Strom, Kühlung, Netz, Personal (Hardware oft nur Teil der TCO) | Kaufpreis dominiert; Strom/Ops eher Nebenkosten |
| Zeithorizont | Jahre, kapitalintensiv | Monate — einfachere Break-Even-Logik |
Branchenseitig wird bei selbstbetriebenen Großclustern häufig von niedriger Durchschnittsauslastung berichtet — dann wirkt Eigenbetrieb teurer als gedacht. Das ist nicht 1:1 Ihre Entscheidung bei einer Workstation-/Server-GPU.
Kurz: Großcluster = auslastungsgetrieben. Eine Grafikkarte bzw. ein GPU-Server = nutzungsstundengetrieben. Der TCO-Rechner modelliert die Einzel-GPU-Logik.
Was gehört in die Kostenrechnung?
Eigene Hardware: Anschaffung · Setup · Abschreibung (typisch 24–36 Monate) · Strom unter Last und Idle · Ops · Kühlung (Einzelkarte meist vernachlässigbar) · Kapitalbindung · Restwert · Ausfallrisiko.
Cloud: €/h · echte Stunden/Monat · Fix-Abo · Egress (RAG-Uploads) · Storage · Rest-Ops · Flexibilität.
Übergreifend: Compliance kann Cloud unabhängig vom Preis ausschließen · SLA.
Welche typischen Fallen gibt es?
- „DSGVO“ ohne AVV — Claim ≠ Vertrag.
- Promo-Preise — Basisrate kann höher liegen.
- Monatsbindung/Setup — gegen Stundenmiete rechnen (TCO).
- Cluster-Logik auf eine einzelne Grafikkarte übertragen — gilt so nicht.
- Aggregator-Preise — an der Primär-URL prüfen.
- Managed ohne Root — ersetzt keinen Ollama-Stack.
TCO-Rechner: eigene GPU vs. Cloud
Modell für eine Grafikkarte bzw. einen einzelnen GPU-Server (nicht Multi-GPU-Cluster) über 36 Monate. Beispiel Cloud-Stundensatz ~0,46 €/h (Trooper PowerAI-Promo Stand 01.08.2026; Normal ~0,58 €/h — Slider anpassen). Idle-Strom und Compliance sind vereinfacht bzw. außerhalb der Rechnung — siehe Einzel-GPU vs. Cluster.
Eigene Hardware
Cloud-GPU
Cloud-Ops mit 30 % des eigenen Ops-Werts angesetzt (kein Hardware-Troubleshooting, aber Monitoring bleibt).
Kumulierte Kosten (36 Monate)
–