Reddit r/LocalLLaMA: Reale Builds & Benchmarks: Funktionierende lokale KI-Setups im Realitäts-Check

Kurzfassung (4-6 Sätze): Reddit r/LocalLLaMA: Reale Builds & Benchmarks ist eine Community, die sich auf die Dokumentation und Analyse von lokalen KI-Setups konzentriert. In dieser Woche sind besonders interessante Beiträge zu sehen, die sich mit der Ausführung von großen Modellen auf Consumer-GPUs und Apple-Silicon befassen. Ein Highlight ist das Benchmarking von Ornith-397B auf einem RTX PRO 6000 Blackwell 96GB, das erstaunliche Leistungen zeigt. Ein weiterer Beitrag beschreibt die Optimierung von Qwen 3.6 27B auf einem RTX 5090, wobei spezifische Einstellungen zur Steigerung der Leistung vorgestellt werden. Diese Einträge bieten wertvolle Einblicke für Leser, die ein nachbaubares und effizientes lokales KI-Setup aufbauen möchten.
Ornith-397B running at Q4 on a single RTX PRO 6000 Blackwell 96GB – 2,354 tok/s prefill, ~20–24 tok/s decode (8/10) — OpenCode-Fit: JA

Worum es geht (2-4 Sätze): Der Benutzer hat ein Setup aufgebaut, das Ornith-397B, ein 397-Milliarden-Parameter-Modell, auf einem einzelnen RTX PRO 6000 Blackwell 96GB laufen lässt. Das Modell wird durch Krasis, einem MoE-fokussierten Runtime, gestreamt, um es in begrenztem VRAM laufen zu lassen. Die Leistung ist bemerkenswert, mit 2,354 tok/s im Prefill und 20-24 tok/s im Decode.
Reales Setup (komplette Fakten-Tabelle):
| Feld | Wert |
|—|—|
| GPU(s) | 1× RTX PRO 6000 Blackwell 96GB |
| CPU / Mainboard | AMD EPYC 7742 (64c) |
| RAM | 256 GB DDR4 |
| PSU | nicht im Post belegt |
| Chassis / Kuehlung | nicht im Post belegt |
| Framework + Version | Krasis (nicht spezifische Version genannt) |
| Modell + Quant | Ornith-397B Q4 |
| Kontext-Laenge | 39,920 tokens |
| tok/s (single) | 2,354 tok/s prefill, 20-24 tok/s decode |
| tok/s (batched) | nicht im Post belegt |
| Strom (full load) | nicht im Post belegt |
| Rohkosten | nicht im Post belegt |
| Autarkie-Fit | JA |
Was funktioniert konkret? (3-5 Sätze): Das Setup erreicht beeindruckende Leistungen, insbesondere bei der Verarbeitung von großen Kontexten. Ornith-397B läuft stabil und effizient auf einem einzelnen RTX PRO 6000 Blackwell 96GB, was es zu einem interessanten Kandidaten für lokale KI-Setups macht.
Was NICHT funktioniert / Limits (2-4 Sätze): Das Modell passt nicht vollständig in die 96 GB VRAM, weshalb Krasis die Experten dynamisch zwischen VRAM und System-RAM verwalten muss. Dies kann zu einer leichten Leistungsbeeinträchtigung führen, insbesondere bei sehr großen Kontexten.
Nachbau-Empfehlung (2-4 Sätze): Dieses Setup ist besonders für Benutzer geeignet, die mit großen Modellen arbeiten und eine hohe Leistung erzielen möchten. Die Verwendung von Krasis und der RTX PRO 6000 Blackwell 96GB bietet eine ausgezeichnete Basis für solche Anwendungen. Für kleinere Budgets könnten alternativ RTX 5090 oder 4090 in Betracht gezogen werden.
Sanity checking 5090 results – Qwen 3.6 Unsloth quants + large context (7/10) — OpenCode-Fit: BEDINGT

Worum es geht (2-4 Sätze): Der Benutzer testet Qwen 3.6 27B in verschiedenen Quantisierungen auf einem RTX 5090 mit einem Kontext von 80,000 Tokens. Die Leistung variiert je nach Quantisierung, wobei Q5 die beste Balance zwischen Leistung und Kontextgröße bietet.
Reales Setup (komplette Fakten-Tabelle):
| Feld | Wert |
|—|—|
| GPU(s) | 1× RTX 5090 32GB |
| CPU / Mainboard | Ryzen 7950X |
| RAM | 64 GB DDR4 |
| PSU | nicht im Post belegt |
| Chassis / Kuehlung | nicht im Post belegt |
| Framework + Version | llama.cpp (nicht spezifische Version genannt) |
| Modell + Quant | Qwen 3.6 27B (Q5, Q6, Q35 A3B) |
| Kontext-Laenge | 80,000 tokens |
| tok/s (single) | Q5: 60-70 tok/s, Q6: 15 tok/s, Q35 A3B: 90-100 tok/s |
| tok/s (batched) | nicht im Post belegt |
| Strom (full load) | nicht im Post belegt |
| Rohkosten | nicht im Post belegt |
| Autarkie-Fit | BEDINGT |
Was funktioniert konkret? (3-5 Sätze): Qwen 3.6 27B läuft stabil auf einem RTX 5090, insbesondere in der Q5-Quantisierung. Die Leistung bei großen Kontexten ist gut, wobei Q5 die beste Balance zwischen Leistung und Kontextgröße bietet.
Was NICHT funktioniert / Limits (2-4 Sätze): Die Q6-Quantisierung hat Schwierigkeiten, den gesamten Kontext in die VRAM zu passen, was zu Leistungsproblemen führt. Q35 A3B bietet die höchste Leistung, ist aber weniger effizient in Bezug auf VRAM-Nutzung.
Nachbau-Empfehlung (2-4 Sätze): Dieses Setup ist besonders für Benutzer geeignet, die mit großen Kontexten arbeiten und eine gute Leistung erzielen möchten. Die Verwendung von Q5-Quantisierung auf einem RTX 5090 ist eine gute Wahl. Für kleinere Budgets könnten alternative Quantisierungen oder kleinere Modelle in Betracht gezogen werden.
DFlash made Laguna S 2.1 (71 GB Q4) 2.5x slower on 2x RTX 5090. I tuned it from 23 to 64 tok/s, benchmarked on Spec-Bench, and I’m still running without it (6/10) — OpenCode-Fit: NEIN

Worum es geht (2-4 Sätze): Der Benutzer beschreibt, wie DFlash, eine spekulative Decoding-Methode, die Leistung von Laguna S 2.1 (71 GB Q4) auf 2x RTX 5090 stark beeinträchtigt. Durch Optimierung der Einstellungen konnte die Leistung verbessert werden, aber das Modell läuft immer noch langsamer als ohne DFlash.
Reales Setup (komplette Fakten-Tabelle):
| Feld | Wert |
|—|—|
| GPU(s) | 2× RTX 5090 32GB |
| CPU / Mainboard | Xeon w5-3423 |
| RAM | 256 GB |
| PSU | nicht im Post belegt |
| Chassis / Kuehlung | nicht im Post belegt |
| Framework + Version | llama.cpp (nicht spezifische Version genannt) |
| Modell + Quant | Laguna S 2.1 (118B-param MoE, 71 GB Q4_K_M) |
| Kontext-Laenge | 65,536 tokens |
| tok/s (single) | 64 tok/s (optimiert), 23 tok/s (standard) |
| tok/s (batched) | nicht im Post belegt |
| Strom (full load) | nicht im Post belegt |
| Rohkosten | nicht im Post belegt |
| Autarkie-Fit | NEIN |
Was funktioniert konkret? (3-5 Sätze): Durch Optimierung der DFlash-Einstellungen konnte die Leistung von Laguna S 2.1 auf 2x RTX 5090 verbessert werden. Die optimierte Konfiguration erreicht 64 tok/s, was eine erhebliche Verbesserung gegenüber der Standardkonfiguration darstellt.
Was NICHT funktioniert / Limits (2-4 Sätze): DFlash führt bei Standard-Einstellungen zu einer starken Leistungsbeeinträchtigung, insbesondere bei großen Modellen und Kontexten. Die Verwendung von DFlash ist in diesem Setup nicht empfehlenswert, da es die Leistung negativ beeinflusst.
Nachbau-Empfehlung (2-4 Sätze): Dieses Setup ist für Benutzer, die mit großen Modellen arbeiten und eine hohe Leistung erzielen möchten, nicht optimal. Die Verwendung von DFlash sollte vermieden werden, da es die Leistung negativ beeinflusst. Stattdessen sollten alternative Optimierungsmethoden oder kleinere Modelle in Betracht gezogen werden.
Weitere Beiträge (kurz):
– We trained a 0.3B OCR model for patent documents — keine Hardware belegt, kein nachbaubares Setup
– Need Advice: Llama.cpp Tensor Parallelism RPC vs Single Node Performance — reine Problem-Frage ohne Lösung
– 4x 3090, 96gb vram what Model to drive Hermes? — keine konkreten Zahlen oder Leistungsdaten
– What Would You Run on 2× RTX 3090s Today? — keine konkreten Zahlen oder Leistungsdaten
– llama.cpp slower on P-Cores than on E-Cores with MoE Model and GPU+CPU offloading? — reine Problem-Frage ohne Lösung
– [Built a from-scratch BitNet inference engine in pure C — 1.8× faster than bitnet.cpp on Xeon (36 tok/s), zero dependencies [BitNet & Bonsai CPU testers wanted]](https://old.reddit.com/r/LocalLLaMA/comments/1v3pn1w/built_a_fromscratch_bitnet_inference_engine_in/) — keine konkreten Zahlen oder Leistungsdaten
– DavidAU somehow managed to improve Qwen 3.6 27B — keine konkreten Zahlen oder Leistungsdaten