Reddit r/LocalLLaMA: Reale Builds & Benchmarks: Funktionierende lokale KI-Setups im Realitäts-Check

# Reddit r/LocalLLaMA: Reale Builds & Benchmarks: Funktionierende lokale KI-Setups im Realitäts-Check ![Reddit r/LocalLLaMA: Reale Builds & Benchmarks](https://www.redditstatic.com/shreddit/assets/fa

Reddit r/LocalLLaMA: Reale Builds & Benchmarks: Funktionierende lokale KI-Setups im Realitäts-Check

Reddit r/LocalLLaMA: Reale Builds & Benchmarks

Kurzfassung: Reddit r/LocalLLaMA: Reale Builds & Benchmarks ist derzeit von konkreten Build-Berichten und Benchmarks geprägt. Besonders hervorzuheben sind die Einträge, die funktionierende Setups mit konkreten tok/s-Zahlen und Modell-Variationen dokumentieren. Ein Leser kann heute Abend mit einem 2x RTX 3090-Setup loslegen, das das NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-Modell mit 262k Kontext-Länge laufen lässt. Ein weiterer Beitrag zeigt, wie man DeepSeek V4 Flash auf einer RTX 5090 mit 1 Million Kontext-Länge betreiben kann.

[DeepSeek v4 Flash on 5090 in llama.cpp with 1 Million context] (8/10) — OpenCode-Fit: BEDINGT

Zum Original

Vorschau

Worum es geht: Der Benutzer hat DeepSeek V4 Flash auf einer RTX 5090 mit 1 Million Kontext-Länge betrieben und die Konfiguration sowie die Benchmarks geteilt.

Reales Setup (komplette Fakten-Tabelle):

| Feld | Wert |
|—|—|
| GPU(s) | 1x RTX 5090 24GB |
| CPU / Mainboard | nicht im Post belegt |
| RAM | nicht im Post belegt |
| PSU | nicht im Post belegt |
| Chassis / Kuehlung | nicht im Post belegt |
| Framework + Version | llama.cpp (neueste Version) |
| Modell + Quant | DeepSeek-V4-Flash-UD-Q8_K_XL |
| Kontext-Laenge | 1048576 |
| tok/s (single) | ~650–700 tok/s (Prefill), ~17 tok/s (Decode) |
| tok/s (batched) | nicht im Post belegt |
| Strom (full load) | nicht im Post belegt |
| Rohkosten | nicht im Post belegt |
| Autarkie-Fit | BEDINGT (hohe Leistung, aber keine vollständige Hardware-Angabe) |

Was funktioniert konkret? DeepSeek V4 Flash läuft stabil auf einer RTX 5090 mit 1 Million Kontext-Länge. Die Prefill-Geschwindigkeit liegt bei 650–700 tok/s, während die Decode-Geschwindigkeit bei 17 tok/s liegt.

Was NICHT funktioniert / Limits Die Decode-Geschwindigkeit ist im Vergleich zu anderen Modellen wie Qwen noch nicht so beeindruckend, aber es gibt noch Optimierungspotenzial in llama.cpp.

Nachbau-Empfehlung Das Setup ist für Benutzer mit einem RTX 5090 und Interesse an DeepSeek V4 Flash empfehlenswert. Die Konfiguration ist gut dokumentiert, aber die vollständige Hardware-Angabe fehlt. Für einen vollständigen Nachbau sollten die fehlenden Hardware-Details ergänzt werden.


[NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B on 2x3090s] (9/10) — OpenCode-Fit: JA

Zum Original

Vorschau

Worum es geht: Der Benutzer hat das Modell NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B auf 2x RTX 3090s betrieben und die Konfiguration sowie die Benchmarks geteilt.

Reales Setup (komplette Fakten-Tabelle):

| Feld | Wert |
|—|—|
| GPU(s) | 2x RTX 3090 24GB |
| CPU / Mainboard | nicht im Post belegt |
| RAM | nicht im Post belegt |
| PSU | nicht im Post belegt |
| Chassis / Kuehlung | nicht im Post belegt |
| Framework + Version | vLLM, no CPU offload, full 262K, N=4 |
| Modell + Quant | NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-W4A16 (INT4 experts / INT8 shared+mamba / BF16 attn+latent+router+embed+lm_head) |
| Kontext-Laenge | 262144 |
| tok/s (single) | nicht im Post belegt |
| tok/s (batched) | 304 pages/min (concurrency 8), 427 pages/min (concurrency 16) |
| Strom (full load) | nicht im Post belegt |
| Rohkosten | nicht im Post belegt |
| Autarkie-Fit | JA (funktioniert in einem privaten Haushalt) |

Was funktioniert konkret? Das Modell läuft stabil auf 2x RTX 3090s mit einer Kontext-Länge von 262k. Die Benchmarks zeigen, dass es bei einer Konkurrenz von 8 bis 16 gleichzeitig verarbeiteten Seiten eine gute Leistung bietet.

Was NICHT funktioniert / Limits Die Decode-Geschwindigkeit ist decode-bound, was bedeutet, dass die Leistung durch die Decodierung begrenzt ist. Die VRAM-Nutzung ist jedoch irrelevant, da ein 16 GB-GPU-Karten das Modell problemlos betreiben kann.

Nachbau-Empfehlung Das Setup ist für Benutzer mit 2x RTX 3090s und Interesse an dem NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-Modell empfehlenswert. Die Konfiguration ist gut dokumentiert und die Benchmarks zeigen eine gute Leistung. Für einen vollständigen Nachbau sollten die fehlenden Hardware-Details ergänzt werden.


Weitere Beitraege (automatisch gefiltert):
I benchmarked 5 local models that fit a MacBook Pro — a 2-bit 27B in 8GB came in second — keine Hardware belegt, kein nachbaubares Setup

👁 5 Aufrufe 👤 5 Leser