Reddit r/LocalLLaMA: Reale Builds & Benchmarks: Funktionierende lokale KI-Setups im Realitäts-Check

Kurzfassung (4-6 Sätze): Reddit r/LocalLLaMA: Reale Builds & Benchmarks ist eine Community, die sich mit der Dokumentation und Benchmarking von lokalen KI-Setups beschäftigt. In dieser Woche sind insbesondere die Einträge zu Qwen3.6-27B NVFP4 auf 1x/2x 5090s, die Verbesserungen von DavidAU an Qwen 3.6 27B, und die NInfer-Engine für Qwen3.6-35B-A3B hervorgetreten. Diese Einträge bieten konkrete Zahlen und praktische Erkenntnisse, die für den Bau eines eigenen lokalen KI-Setups hilfreich sind.
I benchmarked Unsloth’s Qwen3.6-27B NVFP4 on 1x/2x 5090s. MTP is great until it really isn’t. (8/10) — OpenCode-Fit: JA

Worum es geht (2-4 Sätze): Der Benutzer hat das Modell Qwen3.6-27B NVFP4 von Unsloth auf 1x und 2x RTX 5090s getestet. Die Tests konzentrieren sich auf die Effizienz des MTP (Multi-Token Prediction) und die Auswirkungen von Batching und großen Kontexten.
Reales Setup (komplette Fakten-Tabelle):
| Feld | Wert |
|—|—|
| GPU(s) | 2x RTX 5090, 32 GB each |
| CPU / Mainboard | nicht im Post belegt |
| RAM | nicht im Post belegt |
| PSU | nicht im Post belegt |
| Chassis / Kuehlung | nicht im Post belegt |
| Framework + Version | vLLM 0.25.1, PyTorch 2.11.0+cu130 |
| Modell + Quant | Qwen3.6-27B NVFP4 (compressed-tensors; NVFP4 MLP, FP8 attention) |
| Kontext-Länge | 65,536 |
| tok/s (single) | 542.8 ± 12.5 tok/s |
| tok/s (batched) | nicht im Post belegt |
| Strom (full load) | nicht im Post belegt |
| Rohkosten | nicht im Post belegt |
| Autarkie-Fit | JA |
Was funktioniert konkret? (3-5 Sätze): Das Modell Qwen3.6-27B NVFP4 erreicht auf einem RTX 5090 eine Geschwindigkeit von 542.8 tok/s bei einem Kontext von 65,536 Tokens. Die MTP-Funktion ist effektiv, solange der Kontext kurz und die Anzahl der parallelen Anfragen gering ist. Bei größeren Kontexten und mehreren parallelen Anfragen verschlechtert sich die Performance.
Was NICHT funktioniert / Limits (2-4 Sätze): Bei großen Kontexten und hohem Batching kann die MTP-Funktion zu erheblichen Verzögerungen führen. Die Performance sinkt deutlich, wenn die GPU mit vielen parallelen Anfragen belastet wird.
Nachbau-Empfehlung (2-4 Sätze): Dieses Setup ist für Benutzer mit einem RTX 5090 oder mehreren 5090s empfehlenswert, insbesondere für Aufgaben mit kurzen Kontexten und wenigen parallelen Anfragen. Für komplexe Aufgaben mit langen Kontexten und hohem Batching sollten alternative Modelle oder Hardware-Konfigurationen in Betracht gezogen werden.
543 tok/s single-request Qwen3.6-35B-A3B on one RTX 5090 over a 65K-token decode (9/10) — OpenCode-Fit: JA

Worum es geht (2-4 Sätze): Der Benutzer hat eine eigene C++/CUDA-Inferenz-Engine (NInfer) entwickelt, die speziell für das Modell Qwen3.6-35B-A3B auf einem RTX 5090 optimiert ist. Die Engine erreicht eine Geschwindigkeit von 543 tok/s bei einem Kontext von 65,536 Tokens.
Reales Setup (komplette Fakten-Tabelle):
| Feld | Wert |
|—|—|
| GPU(s) | 1x RTX 5090, 32 GB |
| CPU / Mainboard | nicht im Post belegt |
| RAM | nicht im Post belegt |
| PSU | nicht im Post belegt |
| Chassis / Kuehlung | nicht im Post belegt |
| Framework + Version | NInfer (custom) |
| Modell + Quant | Qwen3.6-35B-A3B (16.29 GiB, ~5.03 bpw) |
| Kontext-Länge | 65,536 |
| tok/s (single) | 543 tok/s |
| tok/s (batched) | nicht im Post belegt |
| Strom (full load) | nicht im Post belegt |
| Rohkosten | nicht im Post belegt |
| Autarkie-Fit | JA |
Was funktioniert konkret? (3-5 Sätze): Die NInfer-Engine erreicht eine beeindruckende Geschwindigkeit von 543 tok/s bei einem Kontext von 65,536 Tokens. Die Engine ist speziell für das Modell Qwen3.6-35B-A3B optimiert und nutzt eine Vielzahl von Optimierungen, wie z.B. benutzerdefinierte Quantisierung, Gewichts-Layout-Design und Kernel-Fusion.
Was NICHT funktioniert / Limits (2-4 Sätze): Die NInfer-Engine ist derzeit nur für die Modelle Qwen3.6-27B und Qwen3.6-35B-A3B geeignet. Für andere Modelle oder Hardware-Konfigurationen ist eine Anpassung erforderlich. Die Engine ist auch nicht allgemein nutzbar, sondern speziell für diese Modelle und das RTX 5090 optimiert.
Nachbau-Empfehlung (2-4 Sätze): Dieses Setup ist besonders für fortgeschrittene Benutzer mit einem RTX 5090 und spezifischen Anforderungen an die Inferenz-Geschwindigkeit und den Kontext geeignet. Die NInfer-Engine bietet eine hohe Performance, aber die Anpassung für andere Modelle oder Hardware-Konfigurationen erfordert technisches Know-how.
Weitere Beitraege (automatisch gefiltert):
– DavidAU somehow managed to improve Qwen 3.6 27B — keine konkreten Messwerte, keine nachbaubaren Daten