SGLang-Community: Autarke Multi-GPU-Inference für lokale Coding-Agenten
Kurzfassung
Die SGLang-Community diskutiert aktuell hauptsächlich Themen rund um die Optimierung von Modellen auf Consumer-GPUs, die Verbesserung der Prefix-Caching-Techniken und die Unterstützung verschiedener Modell-Architekturen. Besonders relevant für Nutzer, die ein autarkes Setup mit 4x 3090 oder 2x 5090 aufbauen möchten, sind Diskussionen zur Quantisierung, zur Hybrid-Inference und zur Verbesserung der Agent-Workloads. Diese Themen haben direkte Auswirkungen auf die Performance und den Energieverbrauch, was für ein 24/7-Betrieb in der Wohnung oder im Haus entscheidend ist.
Running MiniMax H3 Ref2VA on 2x RTX 5090 under a 116 GB cgroup — streaming weight load + resident-layer GPU routing (4 patches, SGLang 0.5.17) (9/10) — OpenCode-Fit: JA
Worum geht es konkret?
Der Nutzer beschreibt, wie er das Modell MiniMax H3 Ref2VA (33B DiT + Qwen3VL, full BF16, ~123 GB) auf 2x RTX 5090 unter einem cgroup mit 116 GB Speicher erfolgreich lädt und inferiert. Das Problem war, dass der Standardprozess zu einem Out-of-Memory (OOM) führt, da die gesamten Gewichte auf den CPU-Speicher geladen werden. Durch 4 Patches wird dies umgangen, indem die Gewichte schrittweise geladen und direkt auf die GPU übertragen werden.
Was heisst das für ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Diese Patches sind extrem relevant für ein autarkes Home-Setup, da sie es ermöglichen, große Modelle wie MiniMax H3 auf Consumer-GPUs zu betreiben, ohne an die VRAM-Grenzen zu stoßen. Die beschriebenen Optimierungen reduzieren den Speicherverbrauch und ermöglichen es, das Modell effizient zu laden und zu inferieren, auch bei begrenzten Ressourcen.
Konsequenz für OpenCode-Nutzer:
Die Patches verbessern die Ladegeschwindigkeit und die Speicherverwaltung, was zu schnelleren und ressourcenschonenderen Agent-Workloads führt. Dies ist besonders nützlich für OpenCode, da der System-Prompt regelmäßig neu gesendet wird und effiziente Speicherverwaltung entscheidend ist.
Handlungsempfehlung:
Die beschriebenen Patches anwenden und SGLang auf Version 0.5.17 updaten. Die Patches sind in der Gist verfügbar: https://gist.github.com/ft54482/b5489349620c7f0fa63e634e3356d79b.
Fakten-Tabelle:
– Hardware im Post: 2x RTX 5090
– Modell: MiniMax H3 Ref2VA (33B DiT + Qwen3VL)
– Framework-Version: SGLang 0.5.17
– tok/s / Benchmark: 1344×768 / 4.5 s video out, peak GPU 18.7 GB, peak CPU 114.7 GB
– Multi-GPU-Konfiguration: TP=2
How fast can you run DeepSeek V4 Spark 0731 with CPU-GPU hybrid inference when VRAM is not enough? (8/10) — OpenCode-Fit: JA
Worum geht es konkret?
Der Nutzer beschreibt, wie er DeepSeek V4 Spark 0731 auf Consumer-GPUs mit begrenzter VRAM betreibt, indem er Teile des Modells in den System-RAM und auf die CPU auslagert. Dies wird als „VRAM extender“ bezeichnet. Es werden Benchmarks für verschiedene Konfigurationen vorgestellt, darunter 2x 5060Ti, 2x 3090 und 1x Pro 6000.
Was heisst das für ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Die beschriebene Hybrid-Inference-Methode ist sehr relevant für ein autarkes Home-Setup, da sie es ermöglicht, große Modelle auf Consumer-GPUs zu betreiben, ohne an die VRAM-Grenzen zu stoßen. Die Benchmarks zeigen, dass diese Methode auch auf 3090 und 5090-GPUs gut funktioniert und die Performance nur minimal leidet.
Konsequenz für OpenCode-Nutzer:
Die Hybrid-Inference-Methode kann die VRAM-Effizienz erheblich verbessern, was zu schnelleren und ressourcenschonenderen Agent-Workloads führt. Dies ist besonders nützlich für OpenCode, da es ermöglicht, größere Modelle zu verwenden, ohne die VRAM-Grenzen zu überschreiten.
Handlungsempfehlung:
Die beschriebene Hybrid-Inference-Methode testen und die Konfiguration anpassen, um die bestmögliche Performance zu erzielen. Die Benchmarks und die verwendete Software-Stack sind im Post beschrieben.
Fakten-Tabelle:
– Hardware im Post: 2x 5060Ti, 2x 3090, 1x Pro 6000
– Modell: DeepSeek V4 Spark 0731
– Framework-Version: Lsglang Lvllm
– tok/s / Benchmark: 850 t/s (5060Ti), 1060 t/s (3090), 3100 t/s (Pro 6000)
– Multi-GPU-Konfiguration: TP=2
Running MiniMax H3 (FL2VA) on 4x L40S with SGLang: dynamic FP8, ~2x speedup vs 2-GPU BF16, 14GB/card (8/10) — OpenCode-Fit: JA
Worum geht es konkret?
Der Nutzer beschreibt, wie er das Modell MiniMax H3 (FL2VA) auf 4x L40S-GPUs mit SGLang betreibt, indem er dynamische FP8-Quantisierung verwendet. Dies führt zu einer VRAM-Reduktion von ~1/4 und einer Geschwindigkeitsverbesserung von ~2x im Vergleich zu 2-GPU BF16.
Was heisst das für ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Die beschriebene Methode ist relevant für ein autarkes Home-Setup, da sie es ermöglicht, große Modelle auf Consumer-GPUs zu betreiben, ohne an die VRAM-Grenzen zu stoßen. Die VRAM-Reduktion und die Geschwindigkeitsverbesserung sind besonders nützlich für 4x 3090 oder 2x 5090-Setups.
Konsequenz für OpenCode-Nutzer:
Die dynamische FP8-Quantisierung kann die VRAM-Effizienz und die Inferenzgeschwindigkeit erheblich verbessern, was zu schnelleren und ressourcenschonenderen Agent-Workloads führt. Dies ist besonders nützlich für OpenCode, da es ermöglicht, größere Modelle zu verwenden, ohne die VRAM-Grenzen zu überschreiten.
Handlungsempfehlung:
Die beschriebene Methode testen und die Konfiguration anpassen, um die bestmögliche Performance zu erzielen. Die Launch-Command und die Konfiguration sind im Post beschrieben.
Fakten-Tabelle:
– Hardware im Post: 4x L40S
– Modell: MiniMax H3 (FL2VA)
– Framework-Version: SGLang 0.5.9
– tok/s / Benchmark: ~5.8–6.1 s/it
– Multi-GPU-Konfiguration: TP=4
Customize prefix caching (7/10) — OpenCode-Fit: BEDINGT
Worum geht es konkret?
Der Nutzer fragt, ob es möglich ist, eine benutzerdefinierte Implementierung für Prefix-Caching zu verwenden, wenn das Modell in einem Modus betrieben wird, der Eingabe-Embeddings anstelle von Token-IDs akzeptiert. Der aktuelle SGLang-Code unterstützt nur Integer-Tokens für Prefix-Caching.
Was heisst das für ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Die Fähigkeit, benutzerdefinierte Prefix-Caching-Implementierungen zu verwenden, könnte für ein autarkes Home-Setup relevant sein, insbesondere wenn man spezialiserte Agent-Workloads betreiben möchte. Allerdings erfordert dies möglicherweise Anpassungen am SGLang-Code, was die Komplexität erhöht.
Konsequenz für OpenCode-Nutzer:
Die Möglichkeit, benutzerdefinierte Prefix-Caching-Implementierungen zu verwenden, könnte die Effizienz und die Performance von Agent-Workloads verbessern, insbesondere wenn man spezialiserte Eingabe-Embeddings verwendet. Dies ist besonders nützlich für OpenCode, da es die Flexibilität erhöht.
Handlungsempfehlung:
Die SGLang-Dokumentation und den Code überprüfen, um zu sehen, ob eine benutzerdefinierte Implementierung ohne Forking möglich ist. Falls nicht, die Community um Unterstützung bitten oder eine eigene Implementierung entwickeln.
Fakten-Tabelle:
– Hardware im Post: nicht im Post belegt
– Modell: nicht im Post belegt
– Framework-Version: nicht im Post belegt
– tok/s / Benchmark: nicht im Post belegt
– Multi-GPU-Konfiguration: nicht im Post belegt
Is MegaMoE currently limited to DeepSeek models? Any plans to support other architectures like GLM? (6/10) — OpenCode-Fit: BEDINGT
Worum geht es konkret?
Der Nutzer fragt, ob MegaMoE derzeit nur auf DeepSeek-Modelle beschränkt ist und ob es Pläne gibt, andere Architekturen wie GLM-5.2 zu unterstützen. Der Nutzer hat Probleme beim Betreiben von GLM-5.2, da die Quantisierungsskalen nicht übereinstimmen.
Was heisst das für ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Die Unterstützung von GLM-5.2 auf Consumer-GPUs wäre relevant, da es eine weitere Option für Agent-Workloads bietet. Allerdings erfordert dies möglicherweise Anpassungen an der Quantisierung, was die Komplexität erhöht.
Konsequenz für OpenCode-Nutzer:
Die Unterstützung von GLM-5.2 könnte die Modellvielfalt erweitern und die Performance von Agent-Workloads verbessern. Es ist jedoch zu prüfen, ob die Quantisierungsskalen angepasst werden müssen, um Kompatibilität zu gewährleisten.
Handlungsempfehlung:
Die Community um Feedback und Unterstützung bei der Anpassung der Quantisierung für GLM-5.2 bitten. Auf offizielle Ankündigungen zur Unterstützung von GLM-5.2 warten.
Fakten-Tabelle:
– Hardware im Post: nicht im Post belegt
– Modell: GLM-5.2, DeepSeek
– Framework-Version: SGLang 0.5.12
– tok/s / Benchmark: nicht im Post belegt
– Multi-GPU-Konfiguration: nicht im Post belegt
Do Hopper support Deepseek V4 Flash run EP by deepep in the future? (4/10) — OpenCode-Fit: NEIN
Worum geht es konkret?
Der Nutzer fragt, ob Hopper-GPUs (H20) in der Zukunft die DeepSeek V4 Flash mit Expert Parallelism (EP) von Deepep unterstützen werden. Der Nutzer hat Probleme, das Modell auf H20-GPUs zu betreiben, da die erforderliche FP4-Quantisierung nicht unterstützt wird.
Was heisst das für ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Diese Diskussion ist nicht relevant für ein autarkes Home-Setup, da H20-GPUs Enterprise-Hardware sind und nicht in der Regel in privaten Haushalten verwendet werden. Die beschriebenen Probleme betreffen hauptsächlich Rechenzentren und Cloud-Setups.
Konsequenz für OpenCode-Nutzer:
Diese Diskussion hat keine direkten Auswirkungen auf OpenCode-Nutzer, die Consumer-GPUs verwenden. Es ist jedoch zu beachten, dass die Unterstützung von FP4-Quantisierung in der Zukunft möglicherweise relevant werden könnte, wenn sie auf Consumer-GPUs verfügbar wird.
Handlungsempfehlung:
Diese Diskussion ignorieren, da sie für autarke Home-Setups nicht relevant ist.
Fakten-Tabelle:
– Hardware im Post: H20
– Modell: DeepSeek V4 Flash
– Framework-Version: SGLang 0.5.12
– tok/s / Benchmark: nicht im Post belegt
– Multi-GPU-Konfiguration: TP=2
Weitere Diskussionen (kurz):
– wx大模型agent技术交流: Diskussion über Agent-Technologien, insbesondere für große Modelle. Relevant für die Verbesserung von Agent-Workloads, aber spezifische Details fehlen.
– support read/write datalake(iceberg、delta lake、paimon、lance): Planungen zur Unterstützung von Datalakes. Relevant für Enterprise-Setups, aber nicht direkt für autarke Home-Setups.
– add dingding falied: Problem mit dem Hinzufügen von DingTalk. Nicht relevant für autarke Home-Setups.
– Why do PDMux Prefill and Decode kernels show no temporal overlap?: Diskussion über Performance-Probleme mit PDMux. Relevant für die Optimierung von Inferenz-Prozessen, aber spezifische Lösungen fehlen.
– Measured: scattered-token KV eviction frees zero pages under paged allocation: Messung zur KV-Eviction. Relevant für die Speicherverwaltung, aber spezifische Anwendungen für autarke Home-Setups fehlen.
– SGLang Inference 8*H200(1 HGX). QWEN-3.5-397B-A17B-FP8: Diskussion über die Inferenz von Qwen3.5-397B-A17B-FP8 auf 8x H200-GPUs. Relevant für Enterprise-Setups, aber nicht direkt für autarke Home-Setups.
– Is origin_input_ids expected to always be array.array in SGLang v0.5.13+?: Diskussion über einen Typenkonflikt in SGLang. Relevant für die Fehlersuche und die Code-Optimierung, aber spezifische Auswirkungen für autarke Home-Setups fehlen.