Reddit r/LocalLLaMA: Reale Builds & Benchmarks: Funktionierende lokale KI-Setups im Realitäts-Check

# Reddit r/LocalLLaMA: Reale Builds & Benchmarks: Funktionierende lokale KI-Setups im Realitäts-Check ![Reddit r/LocalLLaMA: Reale Builds & Benchmarks](https://www.redditstatic.com/shreddit/assets/fa

Reddit r/LocalLLaMA: Reale Builds & Benchmarks: Funktionierende lokale KI-Setups im Realitäts-Check

Reddit r/LocalLLaMA: Reale Builds & Benchmarks

Kurzfassung (4-6 Sätze): Reddit r/LocalLLaMA: Reale Builds & Benchmarks ist eine wertvolle Quelle für Community-User, die ihre lokalen KI-Setups dokumentieren. Diese Woche sind besonders die Einträge zu Multi-GPU-Setups und spezialisierten Modellen wie Gepard TTS und GLM 5.2 hervorzuheben. Ein Leser kann heute Abend mit konkreten Benchmarks und Setup-Details beginnen, um ein nachbaubares Setup für OpenCode zu erstellen.

NVIDIA Puzzle-75B-A9B NVFP4 at 132 t/s on 3×3090 — Why is this size category a desert otherwise? (8/10) — OpenCode-Fit: JA

Zum Original

Vorschau

Worum es geht (2-4 Sätze): Der User hat ein Setup mit 3x RTX 3090 gebaut, um das NVIDIA Puzzle-75B-A9B Modell mit NVFP4 Quantisierung zu laufen. Das Setup erreicht 132 tok/s bei 3 Streams und verbraucht etwa 500W. Es ersetzt ein vorheriges Setup mit 4x RTX 3090, das langsamer und weniger effizient war.

Reales Setup (komplette Fakten-Tabelle):

| Feld | Wert |
|—|—|
| GPU(s) | 3x RTX 3090 24GB |
| CPU / Mainboard | nicht im Post belegt |
| RAM | nicht im Post belegt |
| PSU | nicht im Post belegt |
| Chassis / Kuehlung | nicht im Post belegt |
| Framework + Version | vLLM 0.22.1 |
| Modell + Quant | Puzzle-75B-A9B, NVFP4 |
| Kontext-Laenge | 256K |
| tok/s (single) | ~65 tok/s |
| tok/s (batched) | 132 tok/s aggregate bei 3 Streams |
| Strom (full load) | ~500W |
| Rohkosten | nicht im Post belegt |
| Autarkie-Fit | JA |

Was funktioniert konkret? (3-5 Sätze): Das Setup läuft stabil mit 132 tok/s bei 3 Streams und 256K Kontext. Es ist effizienter und schneller als das vorherige Setup mit 4x RTX 3090. Die NVFP4 Quantisierung ermöglicht eine hohe Leistung bei moderatem VRAM-Verbrauch.

Was NICHT funktioniert / Limits (2-4 Sätze): Das Setup ist spezialisiert auf das Puzzle-75B-A9B Modell und könnte für andere Modelle oder längere Kontexte weniger effizient sein. Es gibt keine Angaben zu CPU, RAM, PSU und Chassis.

Nachbau-Empfehlung (2-4 Sätze): Dieses Setup ist für Benutzer mit einem Budget von etwa 4.000 EUR geeignet, die ein leistungsstarkes und effizientes Multi-GPU-Setup für OpenCode benötigen. Es ist besonders empfehlenswert für die Ausführung von MoE-Modellen wie Puzzle-75B-A9B.


Running GLM 5.2 on 4xGB10 with a 100G Switch, 330k ctx, ~25 t/s tg, ~650 t/s pp (7/10) — OpenCode-Fit: BEDINGT

Zum Original

Vorschau

Worum es geht (2-4 Sätze): Der User hat GLM 5.2 auf 4x GB10 GPUs mit einem 100G Switch laufen lassen. Das Setup erreicht 330k Kontext und 25 tok/s bei Textgenerierung. Es ist teurer als alternative Optionen, aber für spezifische Anwendungen wie GLM lokal zu laufen, ist es eine gute Wahl.

Reales Setup (komplette Fakten-Tabelle):

| Feld | Wert |
|—|—|
| GPU(s) | 4x GB10 |
| CPU / Mainboard | nicht im Post belegt |
| RAM | 128GB |
| PSU | nicht im Post belegt |
| Chassis / Kuehlung | nicht im Post belegt |
| Framework + Version | vLLM, llama-benchy |
| Modell + Quant | GLM 5.2 |
| Kontext-Laenge | 330k |
| tok/s (single) | ~25 tok/s |
| tok/s (batched) | ~650 tok/s prefill |
| Strom (full load) | nicht im Post belegt |
| Rohkosten | ~16k EUR |
| Autarkie-Fit | BEDINGT |

Was funktioniert konkret? (3-5 Sätze): Das Setup läuft stabil mit 330k Kontext und 25 tok/s bei Textgenerierung. Es ist besonders effizient bei längeren Prompts, wobei die Predecode-Rate bei 650 tok/s liegt. Die Verwendung eines 100G Switches ermöglicht eine hohe Bandbreite und parallele Verarbeitung.

Was NICHT funktioniert / Limits (2-4 Sätze): Das Setup ist sehr teuer und nicht für jeden privaten Haushalt geeignet. Es gibt keine Angaben zu CPU, RAM, PSU und Chassis. Die Leistung bei kürzeren Prompts könnte geringer sein.

Nachbau-Empfehlung (2-4 Sätze): Dieses Setup ist für Benutzer mit einem höheren Budget und spezifischen Anforderungen an GLM 5.2 geeignet. Es ist besonders empfehlenswert für die Ausführung von großen Modellen mit sehr langen Kontexten. Für den durchschnittlichen Benutzer könnte ein weniger teures Setup ausreichen.


Benchmarked the 128GB M5 Max as an Amateur – Need Feedback (6/10) — OpenCode-Fit: BEDINGT

Zum Original

Vorschau

Worum es geht (2-4 Sätze): Der User hat sein 128GB M5 Max MacBook Pro für lokale KI-Modelle gebenchmarkt. Er hat verschiedene Modelle und Quantisierungen getestet und die Ergebnisse in einer Tabelle zusammengefasst. Das Setup erreicht gute Leistungen, insbesondere bei kleineren Modellen und 128K Kontext.

Reales Setup (komplette Fakten-Tabelle):

| Feld | Wert |
|—|—|
| GPU(s) | Apple M5 Max 128GB |
| CPU / Mainboard | nicht im Post belegt |
| RAM | 128GB |
| PSU | nicht im Post belegt |
| Chassis / Kuehlung | nicht im Post belegt |
| Framework + Version | MLX, llama-bench, llama.cpp |
| Modell + Quant | Gemma 4 E4B, Qwen 3.6 27B, MiniMax M2.7 |
| Kontext-Laenge | 128K, 256K |
| tok/s (single) | 704 tok/s (Qwen 3.6 27B, GGUF Q8) |
| tok/s (batched) | 2,904 tok/s (Gemma 4 E4B, Q4 XL) |
| Strom (full load) | nicht im Post belegt |
| Rohkosten | nicht im Post belegt |
| Autarkie-Fit | BEDINGT |

Was funktioniert konkret? (3-5 Sätze): Das Setup läuft stabil mit 128K und 256K Kontext und erreicht gute Leistungen bei kleineren Modellen wie Gemma 4 E4B und Qwen 3.6 27B. Die Quantisierung Q8 XL und Q4 XL zeigt besonders gute Ergebnisse.

Was NICHT funktioniert / Limits (2-4 Sätze): Das Setup ist begrenzt auf 128GB VRAM, was für sehr große Modelle oder längere Kontexte nicht ausreicht. Es gibt keine Angaben zu CPU, RAM, PSU und Chassis. Die Leistung bei sehr großen Modellen könnte geringer sein.

Nachbau-Empfehlung (2-4 Sätze): Dieses Setup ist für Benutzer mit einem Budget von etwa 3.000 EUR geeignet, die ein leistungsstarkes und portables Setup für OpenCode benötigen. Es ist besonders empfehlenswert für die Ausführung von kleineren Modellen und 128K Kontext. Für sehr große Modelle könnte ein stärkeres Setup erforderlich sein.


Weitere Beiträge (kurz):

Modded RTX 4090 48GB vs Radeon AI Pro R9700 vs Arc Pro B70 for local coding LLMs? — keine Hardware belegt, kein nachbaubares Setup
Distilled DeepSeek into Gemma 4 26B-A4B vs 12B. Not very useful, but I learned a lot. — keine Hardware belegt, kein nachbaubares Setup
Gepard : 0.6B streaming TTS built for real-time dialogue – 20× realtime factor, ~50ms time-to-first-audio, vLLM-native, Apache 2.0 — keine Hardware belegt, kein nachbaubares Setup
Qwen3.6-27B – Effect of KV quantization on KLD – Q8, Q6, Q5 (bartowski) — keine Hardware belegt, kein nachbaubares Setup
Running a vision + audio + reasoning on one Gemma 4 E2B locally on 4 GB VRAM — and keeping it real time. — keine Hardware belegt, kein nachbaubares Setup
I built a free desktop app to make running local models dead simple (Athanor Lite) — keine Hardware belegt, kein nachbaubares Setup
I asked Codex to optimize DeepSeek V4 Flash 8-bit MLX on oMLX. Got ~1.6x prefill and ~3x decode speedup. — keine Hardware belegt, kein nachbaubares Setup
Considering Buying Another RTX 3090 – Benefits? — keine Hardware belegt, kein nachbaubares Setup
Concurrency plus nvfp4 on Blackwell — keine Hardware belegt, kein nachbaubares Setup

👁 1 Aufrufe 👤 1 Leser