Uploaded June 2025 | Updated September 2026, 1 hour ago
🚀 Willkommen zu einem brandaktuellen Praxis-Video rund um LM-Studio & lokale KI auf der RTX 5090!
In diesem Video zeigen wir dir schrittweise, wie du das Top-Modell „Qwen3-30B-AA3B-IQ4_xs“ optimal in LM-Studio einrichtest – eines der leistungsfähigsten Modelle, das perfekt zur RTX 5090 passt.
✅ Kapitelübersicht:
Kapitel 1 – Einführung: Was ist das Qwen3-Modell und warum IQ4_xs?
Kapitel 2 – Schritt-für-Schritt: LM-Studio richtig einstellen (Token-Speed, VRAM, Cache, Threads, GGUF)
Kapitel 3 – Experiment: Zwei übergroße Modelle laden – und woran man erkennt dass die Modelle die 5090 überlasten!
Kapitel 4 – Performance & Stärken: Wann ist das Modell unschlagbar, wo schwächelt es?
Kapitel 5 – Fazit & Tipps: Welche Alternativen gibt’s für verschiedene Use-Cases?
🧠 Highlights:
Reale Token/s-Messung mit Screenshots
Tipps für context length, GPU-Auslastung & auto batch
Verhalten bei Speicherüberlastung und Absturzgrenzen
📌 System im Test:
GPU: NVIDIA RTX 5090 (32 GB VRAM)
Software: LM Studio (aktuellste Version, GGUF-kompatibel)
Top-Modelle im Video Kapitel 1:
- Qwen3-30B-AA3B-IQ4_xs
Zu groß für die 5090 aber trotzdem Mal im Video um zeigen woran man erkennt dass das Modell für die 5090 zu groß ist und welche T/s Raten man trotzdem bekommt (Kapitel 2+:3)
- Qwenlong-I1-3b@q8_0 mit 34 GB
- Qwen3-235b-a22b mit 85 GB !!!
Manche Bauteile sind Ihrer Zeit weit vor raus und stehen wie Titanen über dem Durchschnitt der "üblichen Bauteile". So auch diese HDD:
Samsung 9100 PRO Heatsink NVMe M.2 SSD, 4 TB, PCIe 5.0, 14.800 MB/s Lesen, 13.400 MB/s Schreiben, Interne SSD (AMAZON Linke)
amzn.to/44aX7DJ
Wer ernsthaft mit LLM's testen will braucht genau das Teil!
Es lädt quasi so schnell wie aus dem RAM!
🚀 Willkommen zu einem brandaktuellen Praxis-Video rund um LM-Studio & lokale KI auf der RTX 5090!
In diesem Video zeigen wir dir schrittweise, wie du das Top-Modell „Qwen3-30B-AA3B-IQ4_xs“ optimal in LM-Studio einrichtest – eines der leistungsfähigsten Modelle, das perfekt zur RTX 5090 passt.
✅ Kapitelübersicht:
Kapitel 1 – Einführung: Was ist das Qwen3-Modell und warum IQ4_xs?
Kapitel 2 – Schritt-für-Schritt: LM-Studio richtig einstellen (Token-Speed, VRAM, Cache, Threads, GGUF)
Kapitel 3 – Experiment: Zwei übergroße Modelle laden – und woran man erkennt dass die Modelle die 5090 überlasten!
Kapitel 4 – Performance & Stärken: Wann ist das Modell unschlagbar, wo schwächelt es?
Kapitel 5 – Fazit & Tipps: Welche Alternativen gibt’s für verschiedene Use-Cases?
🧠 Highlights:
Reale Token/s-Messung mit Screenshots
Tipps für context length, GPU-Auslastung & auto batch
Verhalten bei Speicherüberlastung und Absturzgrenzen
📌 System im Test:
GPU: NVIDIA RTX 5090 (32 GB VRAM)
Software: LM Studio (aktuellste Version, GGUF-kompatibel)
Top-Modelle im Video Kapitel 1:
- Qwen3-30B-AA3B-IQ4_xs
Zu groß für die 5090 aber trotzdem Mal im Video um zeigen woran man erkennt dass das Modell für die 5090 zu groß ist und welche T/s Raten man trotzdem bekommt (Kapitel 2+:3)
- Qwenlong-I1-3b@q8_0 mit 34 GB
- Qwen3-235b-a22b mit 85 GB !!!
Manche Bauteile sind Ihrer Zeit weit vor raus und stehen wie Titanen über dem Durchschnitt der "üblichen Bauteile". So auch diese HDD:
Samsung 9100 PRO Heatsink NVMe M.2 SSD, 4 TB, PCIe 5.0, 14.800 MB/s Lesen, 13.400 MB/s Schreiben, Interne SSD (AMAZON Linke)
amzn.to/44aX7DJ
Wer ernsthaft mit LLM's testen will braucht genau das Teil!
Es lädt quasi so schnell wie aus dem RAM!



![Fury I Roller Coaster [NoLimits2] [8K] [VR-Look-around 3D]
This video is in 8K and allows you to look around while driving.
In this Video we are going to push NoLimit2 to the Limits.
The Import of this City structures took nearly 20 hrs.
This Rendering is in 8K virtual 3D Technology.
Therefore you can look around using the remote Control or Mouse during the Video. Fury I Roller Coaster [NoLimits2] [8K] [VR-Look-around 3D]](https://i.ytimg.com/vi/4vzibw8Y6xc/mqdefault.jpg)






