Lokale LLM-Workstation (2× RTX 5090)

KI zu Hause: 64GB VRAM ohne NVLink – welche Modellgrößen passen, und wo PCIe limitiert?

Stand: 30.9.2026 · Preise und Benchmarks werden regelmäßig neu recherchiert

Eingabequalität

Konfidenz: hoch

Die Konfiguration ist sehr detailliert und technisch schlüssig für eine dedizierte KI-Workstation. Alle kritischen Hardware-Komponenten sind spezifiziert.

Verwendete Annahmen:

  • • RTX 5090 Blackwell-Spezifikationen entsprechen den aktuellsten Marktgerüchten/Leaks für Q3 2026
  • • Stromversorgung mittels 2x 1600W Titanium als redundant/lastverteilend interpretiert
  • • Gehäusekapazität für Luftkühlung von 2x 600W TDP-GPUs als physisch gegeben vorausgesetzt

Gesamtbewertung

Stärken

Massive 64GB VRAM Gesamtkapazität, hohe FP8/FP4 Performance der Blackwell-Architektur, exzellente Single-Core-Leistung für Daten-Pipeline.

Einschränkungen

PCIe 5.0 x8 Limitierung ohne NVLink für verteiltes Training, hohe thermische Anforderungen durch 1200W GPU-TDP.

Beste Einsatzgebiete

Lokale LLM-Serving, QLoRA-Fine-Tuning, datenschutzkonforme Inferenz großer Sprachmodelle.

Fazit

Ein leistungsfähiges, kompromissloses KI-Workstation-System für Prosumer und spezialisierte F&E-Abteilungen, das jedoch bei massivem Trainings-Load an strukturelle Grenzen stößt.

Kompatibilität

Das System ist hochgradig kompatibel und für die spezifizierten Aufgaben exzellent dimensioniert, wobei thermisches Management die größte operative Herausforderung bleibt.

Bestätigt

  • • Threadripper TRX50-Plattform unterstützt PCIe 5.0 Lanes für duale GPU-Setups
  • • 10GbE Netzwerk ist für Workstation-Workloads ideal
  • • Netzteilkapazität von 3200W deckt Lastspitzen ab

Mögliche Risiken

  • • Thermische Probleme bei Luftkühlung von zwei 600W-GPUs
  • • PCIe-Bandbreite bei x8/x8-Split als Flaschenhals bei massivem GPU-Datentransfer

Nicht prüfbar

  • • Exakte Gehäuse-Airflow-Effizienz

Performance Scores

Bewertet relativ zur aktuell schnellsten Hardware · Stand: 9/30/2026

Produktivität92/100
Energieeffizienz75/100
KI-Leistung85/100
Gesamtbewertung82/100

KI-Inferenz: Sehr stark für LLM-Inferenz und LoRA-Fine-Tuning. Mit 64GB VRAM können 70B Modelle in INT4/INT8 effizient betrieben werden. Training von >70B Modellen ohne NVLink stark limitiert.

Score-Begründung

Das System ist eine exzellente Workstation für KI-Inferenz und Fine-Tuning. Der hohe Score resultiert aus der massiven VRAM-Ausstattung und schnellen CPU, punktabzüge wegen fehlender NVLink-Unterstützung für professionelles Large-Scale-Training.

Flaschenhälse erkannt

1

2× NVIDIA GeForce RTX 5090, PCIe 5.0 Schnittstelle

Fehlendes NVLink/NVSwitch bei Multi-GPU-Konfiguration; PCIe 5.0 x8 Anbindung limitiert Datenaustausch zwischen GPUs bei massivem Gradienten-Synchronisations-Bedarf im Training.

Schweregrad: hochEvidenz: 95%Priorität: kritisch
2

NVIDIA GeForce RTX 5090, Gehäuse-Airflow

Hoher Platzbedarf und thermische Last von 2× 600W TDP GPUs in einem luftgekühlten Gehäuse führt zu potenziellem Throttling unter Dauerlast.

Schweregrad: mittelEvidenz: 90%Priorität: hoch

Verbesserungsschritte

  1. 1

    Implementierung einer Custom-Loop Wasserkühlung für beide RTX 5090 – behebt: Thermische Limitierung

  2. 2

    Wechsel auf EPYC-Plattform mit mehr PCIe-Lanes für x16/x16 Anbindung – behebt: Interconnect-Bandbreite

Live-Benchmarks

Tagesaktuell recherchierte Benchmark-Werte zur erkannten Hardware.

Speicherbandbreite (pro GPU)
1792GB/sEinordnung: 99/100
RTX 3060 ≈ 360RTX 5090 ≈ 1792

Durch GDDR7-Speicher und 512-Bit-Interface

TechPowerUp
Gesamter VRAM (System)
64GBEinordnung: 100/100
RTX 4060 ≈ 8RTX 6000 Ada ≈ 48

Summe aus 2x 32GB; kein gemeinsamer Adressraum

InsiderLLM
FP32 Rechenleistung (pro GPU)
104.8TFLOPSEinordnung: 99/100
RTX 3070 ≈ 20RTX 5090 ≈ 105

Theoretische Rechenleistung – relevant für KI- und Rendering-Workloads, nicht direkt für Spiele-FPS.

Rohleistung der Blackwell GB202 Architektur

Tom's Hardware
LLM-Inferenz (Llama 3 8B)
213Tokens/sEinordnung: 96/100
RTX 3060 ≈ 35RTX 5090 ≈ 213

Gemessen bei lokaler Inferenz auf einer RTX 5090

Shattered.io
QLoRA Fine-Tuning (Mistral 7B)
720Tokens/sEinordnung: 95/100
RTX 3090 ≈ 120RTX 5090 ≈ 720

Durchsatz bei INT4-Quantisierung

Spheron Network
Tensor-Core-Generation
5GenEinordnung: 100/100
Ampere (RTX 30) ≈ 3Blackwell (RTX 50) ≈ 5

Blackwell-Architektur mit dedizierten KI-Beschleunigern

CpuTronic
Größtes LLM (INT4)
70Milliarden ParameterEinordnung: 100/100
RTX 3060 (12GB) ≈ 7RTX 5090 (32GB) ≈ 70

Limitierung durch 32GB VRAM pro Karte

InsiderLLM
PassMark GPU Score
40012PunkteEinordnung: 98/100
RTX 3080 ≈ 17000RTX 5090 ≈ 40000

PassMark ist ein Gesamtindex über viele CPU-Disziplinen – vergleichbar über alle Generationen.

Synthetischer Benchmark-Wert

gpudeals.net

Szenario-Bewertung

Gaming 1080p

Nicht anwendbar für KI-System

Gaming 1440p

Nicht anwendbar für KI-System

Gaming 4K

Nicht anwendbar für KI-System

Produktivität

Hervorragend durch 24 Kerne des Threadripper 9960X und schnelle Gen5-Speicheranbindung für Pre-Processing.

Lokale KI

Sehr stark für LLM-Inferenz und LoRA-Fine-Tuning. Mit 64GB VRAM können 70B Modelle in INT4/INT8 effizient betrieben werden. Training von >70B Modellen ohne NVLink stark limitiert.

Multitasking

Sehr gut geeignet für Batch-Inferenz und parallele Workloads aufgrund hoher VRAM-Reserven.

Speicherbewertung

Priorität: Hoch

Mit 64GB dediziertem VRAM und 256GB Host-RAM ist das System für lokale LLM-Inferenz und Fine-Tuning sehr gut aufgestellt.

Kapazität

Ausreichend für Llama 3.1 70B (quantisiert) und 8B-Modelle in vollem FP16.

Takt

GDDR7 auf den RTX 5090 sorgt für exzellente Inferenz-Bandbreite.

Konfiguration

4x64GB ECC RDIMM ist optimal für TRX50-Boards.

Plattform-Fit

Hervorragend für Workstation-KI-Anforderungen.

Intelligente Upgrade-Empfehlungen

Upgrade-Dashboard

Alle Maßnahmen sind direkt sichtbar: erst kritische Basis-Fixes, danach sinnvolle Leistungsstufen und Premium-Optionen.

8 Bereiche sichtbar
3 Stufen vergleichbar
Kapazität

Erster Schritt

Kritische KI-Befunde zuerst: VRAM vs. Modellgröße, GPU-Interconnect (NVLink/InfiniBand) und Host-Balance (RAM/PCIe) — bevor reine Leistungs-Upgrades sinnvoll sind.

Diese Maßnahmen stabilisieren die Basis, bevor teure Performance-Upgrades sinnvoll bewertet werden.

Pflicht-Hardware-Fixes

  • Schnellen GPU-Interconnect (NVLink/NVSwitch intra-node, InfiniBand NDR/XDR inter-node) einsetzen — Multi-GPU-Training ohne Bottleneck ·

    behebt: Interconnect-Bandbreite
  • hoch ·

    behebt: Thermische Limitierung
Performance

Upgrade-Pfad: LLM-Inferenz & Serving

Optimiert für hohen Durchsatz und parallele Anfragen.

High-End

+150%

Gesamtsystem

0.7 € je % MehrleistungBestes Preis-Leistungs-Verhältnis
Warum diese Stufe

Für maximale Skalierbarkeit im Serving ist H100 die Referenz. NVLink/NVSwitch Architektur ist durch nichts zu ersetzen.

Kennzahlen

VRAM gesamt

640 GB

Llama 3.1 405B

~80 tok/s

vs. dein aktuelles System

Massiv höhere Inferenz-Performance für riesige Modelle, die aktuell nicht auf dem System laufen würden

Gesamtbudget: 98$/h
Preis/Leistung

Budget

+0%

Gesamtsystem

Warum diese Stufe

Diese Konfiguration bietet aktuell das beste VRAM/Preis-Verhältnis für Inferenz. Die Blackwell-Architektur ermöglicht schnellen Durchsatz via vLLM.

Kennzahlen

VRAM gesamt

64 GB

Llama 3.1 70B INT4

~45 tok/s

vs. dein aktuelles System

Das System entspricht bereits diesem Tier und ermöglicht bereits hohe Tokens/s Durchsatz

Gesamtbudget: 6.000€ - 7.500€
Beste Empfehlung

Ausgewogen

+40%

Gesamtsystem

650 € je % Mehrleistung
Warum diese Stufe

Die L40S bietet dedizierte Inferenz-Optimierung und höhere Zuverlässigkeit im Dauerbetrieb. Mehr VRAM erlaubt größere Batches.

Kennzahlen

VRAM gesamt

192 GB

Llama 3.1 70B INT8

~110 tok/s

vs. dein aktuelles System

Erhöht die Batch-Kapazität um das Dreifache im Vergleich zum aktuellen System

Gesamtbudget: 24.000€ - 28.000€
Performance

Upgrade-Pfad: Großmodell-Training

Training komplexer Modelle erfordert extremen Interconnect.

Preis/Leistung

Budget

+0%

Gesamtsystem

Warum diese Stufe

Nur für QLoRA-Fine-Tuning sinnvoll, kein Pre-Training. Die Architektur ist für Trainings-Workloads ohne NVLink suboptimal.

Kennzahlen

FP8 Performance

3.352 TFLOPS/Karte

Interconnect

PCIe 5.0 (limitierend)

vs. dein aktuelles System

Aktuelles System ist für Full-Training nicht optimiert

Gesamtbudget: 6.000€ - 7.500€
Beste Empfehlung

Ausgewogen

+500%

Gesamtsystem

Warum diese Stufe

SXM5 Module mit NVLink sind Pflicht für effizientes verteiltes Training. Nur so lässt sich die Gradienten-Synchronisation handhaben.

Kennzahlen

Interconnect

NVLink 900 GB/s

FP8 Performance

4 PFLOPS/Karte

vs. dein aktuelles System

Ermöglicht erstmals effizientes Pre-Training großer Sprachmodelle

Gesamtbudget: 250.000€+

High-End

+800%

Gesamtsystem

Warum diese Stufe

Das aktuellste Blackwell-System bietet die höchste Dichte an Speicher und Rechenleistung. Essentiell für state-of-the-art Forschung.

Kennzahlen

VRAM

1.5 TB HBM3e

Interconnect

InfiniBand NDR

vs. dein aktuelles System

Quantensprung gegenüber dem aktuellen System in jeder Metrik

Gesamtbudget: 400.000€+
Kapazität

Upgrade-Pfad: Fine-Tuning & Experimente

Fokus auf Speichereffizienz und schnelle Iterationen.

Preis/Leistung

Budget

+0%

Gesamtsystem

Warum diese Stufe

Ideal für LoRA/QLoRA auf 70B Modellen. Kosteneffizienter Einstieg in die Welt des Fine-Tunings.

Kennzahlen

VRAM

32 GB

Training Speed

hoch (LoRA)

vs. dein aktuelles System

Gleiche Performance wie aktuelle Konfiguration bei halber GPU-Anzahl

Gesamtbudget: 3.000€ - 3.500€
Beste Empfehlung

Ausgewogen

+70%

Gesamtsystem

96.4 € je % MehrleistungBestes Preis-Leistungs-Verhältnis
Warum diese Stufe

Dual-GPU Setup ermöglicht beschleunigtes Checkpointing und Training. 64GB VRAM sind ein Sweetspot für 70B Modelle.

Kennzahlen

VRAM

64 GB

Modell-Support

Llama 3 70B

vs. dein aktuelles System

Aktuelles Setup ist bereits hier. bietet solide Basis für F&E

Gesamtbudget: 6.000€ - 7.500€

High-End

+110%

Gesamtsystem

154.5 € je % Mehrleistung
Warum diese Stufe

Mehr VRAM pro Karte reduziert die Notwendigkeit für extrem aggressive Quantisierung beim Fine-Tuning.

Kennzahlen

VRAM

96 GB

FP16 TFLOPS

182 TFLOPS/Karte

vs. dein aktuelles System

50% mehr VRAM ermöglicht feinere Modell-Feinabstimmung ohne Qualitätsverlust

Gesamtbudget: 16.000€ - 18.000€
Performance

Upgrade-Pfad: Edge-KI & On-Device

Kompakte Inferenz für den Produktiv-Einsatz.

Preis/Leistung

Budget

+-80%

Gesamtsystem

Warum diese Stufe

Für stromsparende Anwendungen am Rand des Netzwerks konzipiert.

Kennzahlen

TOPS

40

Verbrauch

15 W

vs. dein aktuelles System

Drastisch weniger Leistung, aber Bruchteil des Energieverbrauchs

Gesamtbudget: 400€ - 600€
Beste Empfehlung

Ausgewogen

+-50%

Gesamtsystem

Warum diese Stufe

Beste Kombination aus Leistung und Verbrauch für komplexe Edge-Vision Aufgaben.

Kennzahlen

TOPS

275

VRAM

64 GB

vs. dein aktuelles System

Leistungsfähiger Edge-Compute für autonomes Fahren oder Robotik

Gesamtbudget: 2.000€ - 2.500€

High-End

+-20%

Gesamtsystem

Warum diese Stufe

Industrie-Grade Edge-Lösung für medizinische Geräte oder kritische Infrastruktur.

Kennzahlen

Safety

ASIL-D

TOPS

700

vs. dein aktuelles System

Sicherheitszertifizierte Plattform für industrielle KI-Workloads

  • Hardware

    Nachher (neu)

    NVIDIA IGX Orin
Gesamtbudget: 10.000€+
Kapazität

Upgrade-Pfad: Bild-, Video- & Audio-KI

Fokus auf VRAM für Bild- und Videogenerierung.

Preis/Leistung

Budget

+0%

Gesamtsystem

Warum diese Stufe

Die hohe Bandbreite der 5090 ist exzellent für ComfyUI-Workflows mit SDXL oder Flux.

Kennzahlen

VRAM

32 GB

Speed

extrem hoch

vs. dein aktuelles System

Aktuelles System ist bereits eine Top-Lösung für generative Medien

Gesamtbudget: 3.000€ - 3.500€
Beste Empfehlung

Ausgewogen

+50%

Gesamtsystem

135 € je % Mehrleistung
Warum diese Stufe

Zwei Karten ermöglichen massives Batch-Rendering und parallele Video-Encoding-Tasks.

Kennzahlen

Parallel-Streams

4

VRAM gesamt

64 GB

vs. dein aktuelles System

Verdoppelt den Durchsatz bei komplexen Animationen

Gesamtbudget: 6.000€ - 7.500€

High-End

+60%

Gesamtsystem

129.2 € je % MehrleistungBestes Preis-Leistungs-Verhältnis
Warum diese Stufe

Die L40S ist durch ihre Stabilität und VRAM-Größe die Wahl für professionelle Rendering-Studios.

Kennzahlen

VRAM

48 GB

Encoder

NVENC-Professional

vs. dein aktuelles System

Höhere Stabilität und VRAM-Reserven für Langzeit-Video-Rendering

Gesamtbudget: 7.000€ - 8.500€
Performance

Upgrade-Pfad: Confidential & regulierte KI

On-Premise Fokus für Compliance.

Preis/Leistung

Budget

+0%

Gesamtsystem

Warum diese Stufe

SEV-SNP bietet hardwareseitige Verschlüsselung der virtuellen Maschinen.

Kennzahlen

Security

Hardware-Verschlüsselung

Compliance

DSGVO-konform

vs. dein aktuelles System

Sicherheits-Upgrade gegenüber Standard-Threadripper

  • CPU
    ~+15%

    Nachher (neu)

    AMD Threadripper PRO 7000 (SEV-SNP)
Gesamtbudget: 5.000€ - 6.000€
Beste Empfehlung

Ausgewogen

+20%

Gesamtsystem

875 € je % Mehrleistung
Warum diese Stufe

Intel TDX ist der Industriestandard für isolierte Compute-Enclaves.

Kennzahlen

Isolation

Trust Domain Extensions

Attestierung

remote/local

vs. dein aktuelles System

Höchste Sicherheitsstufe durch moderne TEE-Technologie

Gesamtbudget: 15.000€ - 20.000€

High-End

+100%

Gesamtsystem

450 € je % MehrleistungBestes Preis-Leistungs-Verhältnis
Warum diese Stufe

NVIDIA CC schützt Daten während des Trainings/der Inferenz direkt auf dem Beschleuniger.

Kennzahlen

GPU-Isolation

Hardware-Enclave

Sicherheit

GPU-Level-Encryption

vs. dein aktuelles System

End-to-End Sicherheit für KI-Workloads

Gesamtbudget: 40.000€ - 50.000€
Performance

Upgrade-Pfad: Preis/Leistung & Hybrid-Cloud

Strategische Kosten-Optimierung.

High-End

+200%

Gesamtsystem

1.3 € je % MehrleistungBestes Preis-Leistungs-Verhältnis
Warum diese Stufe

Bei sehr hoher Auslastung (>70%) ist die Cloud effizienter als lokale Investitionen.

Kennzahlen

Cloud-Preis

2.50$/h

VRAM gesamt

160 GB

vs. dein aktuelles System

Eliminiert Wartung und Stromkosten bei hoher Performance

Gesamtbudget: 2.50$/h
Preis/Leistung

Budget

+0%

Gesamtsystem

Warum diese Stufe

Die 5090 bietet den günstigsten Einstieg in die 32GB-VRAM-Klasse.

Kennzahlen

€/GB VRAM

93€

Cloud-Break-Even

45%

vs. dein aktuelles System

Beste Wahl für lokale Entwickler

Gesamtbudget: 3.000€
Beste Empfehlung

Ausgewogen

+30%

Gesamtsystem

133.3 € je % Mehrleistung
Warum diese Stufe

Lokale Entwicklung auf eigener Hardware, Bursting bei Lastspitzen in die Cloud.

Kennzahlen

Hybrid-Strategie

Peak-Offloading

Break-Even

50%

vs. dein aktuelles System

Deutlich flexibler durch Cloud-Skalierbarkeit

Gesamtbudget: 4.000€ Setup + 0.5$/h

⚠ Empfehlungen basieren auf KI-Analyse und Internetrecherche. Alle Angaben ohne Gewähr.

* Hardware-Links sind Amazon Partner-Links (Werbung). Verlinkt werden nur kaufbare Produktbegriffe, keine Diagnose- oder Begründungstexte. Empfehlungen werden nach technischer Eignung ausgewählt, niemals nach Provisionshöhe.

Jetzt das eigene System prüfen

Dieses Gutachten wurde mit derselben KI-Analyse erstellt, die auch für Ihr System läuft – kostenlos und ohne Registrierung.

Diese Analyse wurde durch KI mit tagesaktueller Internetrecherche erstellt. Alle Angaben ohne Gewähr. Bitte verifizieren Sie kritische Angaben eigenständig.