NVIDIA · Local AI · VRAM Ranking

Grafikkarten für KI

Sortiert nach praktischer Eignung für lokale KI: zuerst VRAM und Speicherbandbreite, dann Tensor-Cores, Effizienz, Multi-GPU-Tauglichkeit und Preis/Leistung. Für LLMs gilt: VRAM ist oft wichtiger als reine Gaming-FPS.

96 GBgrößte Workstation-Klasse
24–32 GBSweet Spot für lokale LLMs
16 GBEinsteiger für 7B/8B & Bild-KI
nextflow-ai gpu-rank$ sort --by ai-fit --prefer vram
01 RTX PRO 6000 Blackwell · große Modelle
02 RTX 6000 Ada · Profi-Workstation
03 RTX A6000 · 48 GB gebraucht stark
04 RTX 5090 · schnellste Consumer-Karte

Hinweis: Angaben sind typische Referenzdaten. Board-Partner, Max-Q/OEM-Varianten und Treiber können abweichen.

Ranking nach KI-Eignung

Bewertung aus Sicht einer lokalen KI-Workstation: LLM-Inferenz, RAG, Fine-Tuning/LoRA, Bildgenerierung, Video/3D und professionelle Dauerlast. Datacenter-Karten wie H100/B200 sind bewusst nicht im Fokus, weil die Seite Grafikkarten für Workstations und lokale Systeme vergleicht.

LLM Chat, RAG, Agenten
GenAI Stable Diffusion, ComfyUI, Video
Train LoRA, Fine-Tuning, Experimente
Pro ECC, Dauerlast, Workstation
01
KI-Score 98/100

RTX PRO 6000 Blackwell Workstation

Die stärkste Workstation-Karte für lokale KI, wenn sehr große Modelle und professionelle Dauerlast wichtiger sind als Anschaffungskosten.

96 GB ECCBlackwell5th Gen TensorPro
96 GBGDDR7 ECC
24.064CUDA Cores*
~4.000AI TOPS*
ProWorkstation-Treiber

Stärken

Große LLMs, mehrere Modelle parallel, RAG-Server, 3D/Rendering, Simulation, professionelle Produktivlast.

Grenzen

Sehr teuer; lohnt sich nur, wenn 48 GB/32 GB VRAM wirklich nicht reichen.

02
KI-Score 93/100

RTX 6000 Ada Generation

Sehr starke Profi-Karte mit 48 GB ECC-VRAM. Ideal für zuverlässige Workstations und größere Modelle ohne Datacenter-Hardware.

48 GB ECCAda4th Gen TensorDauerlast
48 GBGDDR6 ECC
18.176CUDA Cores
960 GB/sBandbreite
568Tensor Cores

Stärken

LLMs bis in große Quantisierungsbereiche, LoRA, CAD/Rendering plus KI, stabile Workstation-Treiber.

Grenzen

Langsamer als Blackwell/5090 bei neuen Low-Precision-Pfaden; Preis meist hoch.

03
KI-Score 88/100

RTX A6000 Ampere

Gebraucht oft interessant: 48 GB ECC-VRAM sind für lokale LLMs wertvoller als viele neuere Karten mit weniger Speicher.

48 GB ECCAmpereNVLink möglichWorkstation
48 GBGDDR6 ECC
10.752CUDA Cores
768 GB/sBandbreite
336Tensor Cores

Stärken

Großer VRAM, stabile Workstation, 30B/70B-Quant-Experimente, große ComfyUI-Workflows.

Grenzen

Ältere Tensor-Generation; bei reiner Geschwindigkeit von Ada/Blackwell geschlagen.

04
KI-Score 86/100

GeForce RTX 5090

Schnellste Consumer-Klasse mit 32 GB GDDR7. Sehr stark für lokale Inferenz, Bildgenerierung und neue Blackwell-KI-Funktionen.

32 GBGDDR7FP4Consumer-Top
32 GBGDDR7
21.760CUDA Cores
1.792 GB/sBandbreite
3.352AI TOPS

Stärken

Extrem schnelle Inferenz, 7B–34B komfortabel, große Bild-/Video-KI, sehr hohe Bandbreite.

Grenzen

32 GB bleiben die VRAM-Grenze; kein ECC, hoher Strombedarf, Consumer-Treiber.

05
KI-Score 78/100

GeForce RTX 4090

Der bewährte Local-AI-Klassiker: 24 GB VRAM, sehr schnell, breit unterstützt, stark für Bild-KI und LLM-Inferenz.

24 GBAdaPreis/LeistungComfyUI
24 GBGDDR6X
16.384CUDA Cores
1.008 GB/sBandbreite
512Tensor Cores

Stärken

7B/8B/13B sehr schnell, 30B quantisiert möglich, Stable Diffusion XL/Flux, Video- und Upscaling-Workflows.

Grenzen

24 GB limitieren große Modelle; kein NVLink, kein ECC.

06
KI-Score 74/100

GeForce RTX 3090 / 3090 Ti

Gebraucht weiterhin sehr attraktiv für lokale KI: 24 GB VRAM und breite CUDA-Unterstützung zu oft realistischen Preisen.

24 GBAmpereNVLink bei 3090Budget-Profi
24 GBGDDR6X
10.496CUDA Cores
936 GB/sBandbreite
328Tensor Cores

Stärken

Lokale LLMs, RAG, Whisper, ComfyUI, Experimente mit Multi-GPU/NVLink bei passenden Karten.

Grenzen

Mehr Strom/Abwärme, ältere Tensor-Generation, Gebrauchtkauf sorgfältig prüfen.

07
KI-Score 67/100

GeForce RTX 5080

Sehr schnelle moderne Consumer-Karte, aber mit 16 GB VRAM für LLMs deutlich enger als 24/32/48-GB-Karten.

16 GBBlackwellGDDR7schnell
16 GBGDDR7
10.752CUDA Cores*
960 GB/sBandbreite*
5th GenTensor Cores

Stärken

7B/8B sehr schnell, Bildgenerierung, Gaming plus KI, moderne Tensor-Features.

Grenzen

16 GB VRAM bremsen größere LLMs und komplexe ComfyUI-Pipelines.

08
KI-Score 63/100

GeForce RTX 4080 SUPER

Effiziente 16-GB-Ada-Karte. Gut für Bild-KI und kleinere LLMs, aber nicht ideal als dedizierte LLM-Workstation.

16 GBAdaeffizientCreator
16 GBGDDR6X
10.240CUDA Cores
736 GB/sBandbreite
320Tensor Cores

Stärken

Stable Diffusion, Video/Render, 7B/8B Inferenz, leiser und effizienter als ältere High-End-Karten.

Grenzen

Für 13B+ und größere Kontexte oft zu wenig VRAM.

09
KI-Score 59/100

GeForce RTX 4070 Ti SUPER

Interessanter 16-GB-Mittelweg: solide für lokale Experimente, aber nicht die erste Wahl für große Produktionsmodelle.

16 GBAdaMittelklasse+Lab
16 GBGDDR6X
8.448CUDA Cores
672 GB/sBandbreite
264Tensor Cores

Stärken

7B/8B, SDXL, LoRA-Kleinexperimente, Entwickler-PC mit guter Effizienz.

Grenzen

Kein großer VRAM-Puffer; 24-GB-Karten sind für LLMs meist sinnvoller.

10
KI-Score 51/100

GeForce RTX 4060 Ti 16GB

Günstiger Einstieg mit 16 GB VRAM. Gut zum Lernen und Testen, aber deutlich langsamer und speicherbandbreiten-limitiert.

16 GBAdaEinsteigersparsam
16 GBGDDR6
4.352CUDA Cores
288 GB/sBandbreite
136Tensor Cores

Stärken

Lernen, kleinere LLMs, einfache Bildgenerierung, sparsame Dauerläufe.

Grenzen

Speicherbandbreite und Rechenleistung deutlich niedriger; eher Einstieg als Profi-KI.

Kurze Kaufregel

Für lokale KI sollte die Auswahl nicht nach Gaming-Rangliste erfolgen. Entscheidend ist, was in den VRAM passt und wie stabil die Karte unter Dauerlast läuft.

LLM / Chat / RAG

  • Minimum sinnvoll: 16 GB
  • Sweet Spot: 24–32 GB
  • Große Modelle: 48–96 GB
  • Für 70B lieber 48 GB+ oder Multi-GPU

Bildgenerierung

  • SDXL läuft gut ab 12–16 GB
  • Flux und Video profitieren stark von 16–24 GB+
  • Bandbreite zählt bei großen Workflows
  • 4090/5090 sind Consumer-seitig sehr stark

Professionelle Nutzung

  • ECC schützt vor Speicherfehlern
  • Workstation-Treiber sind stabiler
  • Blower/Pro-Karten sind besser für enge Gehäuse
  • Strom, Kühlung und Netzteil nicht unterschätzen
nextflow-ai recommendation$ choose --practical
Wenn Preis/Leistung zählt: RTX 3090 24GB oder RTX 4090 24GB.
Wenn maximale Consumer-Leistung zählt: RTX 5090 32GB.
Wenn große Modelle stabil laufen sollen: RTX A6000 / RTX 6000 Ada / RTX PRO 6000 Blackwell.
* Einige Blackwell-Angaben können je nach finaler/OEM-Version abweichen. Für konkrete Angebote immer Herstellerdatenblatt prüfen.