SGLang-Community: Autarke Multi-GPU-Inference für lokale Coding-Agenten

# SGLang-Community: Autarke Multi-GPU-Inference für lokale Coding-Agenten ![SGLang Repository](https://opengraph.githubassets.com/1/sgl-project/sglang) ## Kurzfassung Die SGLang-Community diskutiert

SGLang-Community: Autarke Multi-GPU-Inference für lokale Coding-Agenten

SGLang Repository

Kurzfassung

Die SGLang-Community diskutiert aktuell hauptsächlich Themen rund um die Optimierung von LLM-Agenten auf Consumer-GPUs, insbesondere die Verbesserung der Prefix-Caching-Techniken, die Reduzierung des VRAM-Verbrauchs und die Steigerung der Inferenz-Geschwindigkeit. Zwei zentrale Themen sind die Implementierung von SCAN für die Behebung von System-Prompt-Drift und die Optimierung von Qwen3.8-Modellen auf RTX 5090-GPUs. Diese Entwicklungen sind besonders relevant für Nutzer, die ein autarkes Setup mit 4x 3090 oder 2x 5090 aufbauen möchten, um OpenCode auf Claude-Sonnet-Niveau zu betreiben.


[Solving agent system prompt drift in long sessions — a 300-token fix] (8/10) — OpenCode-Fit: JA

Zur Discussion

Worum geht es konkret?
Die Diskussion behandelt das Problem der System-Prompt-Drift bei LLM-Agenten, die nach längerer Zeit immer weniger auf die ursprünglichen Anweisungen achten. Der Autor schlägt eine Methode namens SCAN vor, die das Modell dazu bringt, Tokens zu generieren, die semantisch mit den Anweisungen verknüpft sind, anstatt diese einfach zu wiederholen. SCAN verwendet Fragen am Ende jeder Sektion des System-Prompts, die das Modell beantworten muss, um die Aufmerksamkeit auf die Anweisungen zu lenken.

Was heisst das fuer ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
SCAN ist eine Software-Optimierung, die auf Consumer-GPUs wie 3090 oder 5090 ohne Probleme laufen kann. Es erfordert keine spezielle Hardware und kann leicht in bestehende Agent-Workflows integriert werden. Die Methode hilft, die Aufmerksamkeit des Modells auf die System-Prompts zu konzentrieren, was besonders nützlich für lang andauernde Sitzungen ist.

Konsequenz fuer OpenCode-Nutzer:
SCAN verbessert die Konsistenz des Agenten in langen Sitzungen, was zu besseren Ergebnissen führt. OpenCode-Nutzer können ihre Agenten so optimieren, dass sie über längere Zeiträume hinweg zuverlässiger und konsistenter arbeiten.

Handlungsempfehlung:
SCAN-Methoden in den Agent-Workflows integrieren, um System-Prompt-Drift zu vermeiden.

Fakten-Tabelle:
– Hardware im Post: [nicht im Post belegt]
– Modell: [nicht im Post belegt]
– Framework-Version: [nicht im Post belegt]
– tok/s / Benchmark: [nicht im Post belegt]
– Multi-GPU-Konfiguration: [nicht im Post belegt]


[Running MiniMax H3 Ref2VA on 2x RTX 5090 under a 116 GB cgroup — streaming weight load + resident-layer GPU routing (4 patches, SGLang 0.5.17)] (9/10) — OpenCode-Fit: JA

Zur Discussion

Worum geht es konkret?
Der Autor beschreibt, wie er das MiniMax H3 Ref2VA-Modell (33B DiT + Qwen3VL) auf 2x RTX 5090-GPUs unter einem cgroup mit 116 GB Speicher laufen lassen konnte. Er hat 4 Patches für SGLang 0.5.17 entwickelt, um das Modell zu laden und zu inferenzieren, ohne dass es an VRAM-Grenzen scheitert.

Was heisst das fuer ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Diese Optimierungen sind direkt auf Consumer-GPUs wie 5090 anwendbar und ermöglichen es, große Modelle wie MiniMax H3 Ref2VA auf autarken Home-Setups zu betreiben. Die beschriebenen Patches können leicht integriert werden, um die VRAM-Verwaltung zu verbessern und das Modell effizient zu laden.

Konsequenz fuer OpenCode-Nutzer:
Die Patches ermöglichen es, größere Modelle auf Consumer-GPUs zu laufen, was die Leistung und die Vielseitigkeit von OpenCode-Agenten erhöht. Nutzer können so komplexere Aufgaben mit höherer Genauigkeit bearbeiten.

Handlungsempfehlung:
Die beschriebenen Patches in die SGLang-Installation integrieren, um das Modell effizient zu laden und zu inferenzieren.

Fakten-Tabelle:
– Hardware im Post: 2x RTX 5090
– Modell: MiniMax H3 Ref2VA (33B DiT + Qwen3VL)
– Framework-Version: SGLang 0.5.17
– tok/s / Benchmark: [nicht im Post belegt]
– Multi-GPU-Konfiguration: [nicht im Post belegt]


[Optimizing Qwen3.8 Flash-Next and 27B/DFlash2 on SM120: native speculation, XQA, RecoverSSM, and HiCache/NIXL] (8/10) — OpenCode-Fit: JA

Zur Discussion

Worum geht es konkret?
Der Autor beschreibt, wie er Qwen3.8-Modelle (Flash-Next und 27B/DFlash2) auf einer 96 GB RTX PRO 6000 GPU optimiert hat. Er hat eine Reihe von Optimierungen durchgeführt, darunter FlashInfer GDN, FlashInfer CUTLASS MoE, Triton QSA und HiCache/NIXL, um die Leistung und den VRAM-Verbrauch zu verbessern.

Was heisst das fuer ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Die beschriebenen Optimierungen sind für Consumer-GPUs wie 3090 oder 5090 relevant und können die Leistung dieser Modelle erheblich steigern. Die Verwendung von FlashInfer und HiCache/NIXL hilft, den VRAM-Verbrauch zu reduzieren und die Inferenz-Geschwindigkeit zu erhöhen.

Konsequenz fuer OpenCode-Nutzer:
Die Optimierungen ermöglichen es, Qwen3.8-Modelle effizienter zu betreiben, was zu schnelleren und ressourcenschonenderen Agent-Workflows führt. OpenCode-Nutzer können so komplexere Aufgaben mit höherer Genauigkeit und geringerem VRAM-Verbrauch bearbeiten.

Handlungsempfehlung:
Die beschriebenen Optimierungen in die SGLang-Installation integrieren, um die Leistung der Qwen3.8-Modelle zu verbessern.

Fakten-Tabelle:
– Hardware im Post: 96 GB RTX PRO 6000
– Modell: Qwen3.8 Flash-Next, Qwen3.8-27B
– Framework-Version: SGLang 0.5.17
– tok/s / Benchmark: [nicht im Post belegt]
– Multi-GPU-Konfiguration: [nicht im Post belegt]


[Why is sgalng’s torch.compile startup so much slower than vLLM?] (6/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Worum geht es konkret?
Der Autor vergleicht die Startzeiten von SGLang und vLLM bei der Verwendung von `torch.compile` mit dem Modell Gemma 3 12B. Er stellt fest, dass SGLang deutlich länger braucht, um zu starten, obwohl es 5-15% Leistungsgewinne bei niedrigen Batch-Größen bietet.

Was heisst das fuer ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Die Startzeiten von SGLang sind auf Consumer-GPUs wie 3090 oder 5090 relevant, da sie die Benutzererfahrung beeinflussen. Obwohl `torch.compile` Leistungsgewinne bringt, ist der hohe Startaufwand ein Hinderungsgrund.

Konsequenz fuer OpenCode-Nutzer:
Die langen Startzeiten können die Benutzerfreundlichkeit beeinträchtigen, insbesondere bei häufigen Neustarts. Nutzer sollten die Vorteile von `torch.compile` gegen die Startzeiten abwägen.

Handlungsempfehlung:
Die Startzeiten von SGLang im Vergleich zu vLLM beobachten und ggf. auf PRs warten, die die Startzeiten verbessern.

Fakten-Tabelle:
– Hardware im Post: 3080Ti
– Modell: Gemma 3 12B
– Framework-Version: SGLang 0.5.9
– tok/s / Benchmark: [nicht im Post belegt]
– Multi-GPU-Konfiguration: [nicht im Post belegt]


[Why do PDMux Prefill and Decode kernels show no temporal overlap?] (5/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Worum geht es konkret?
Der Autor untersucht, warum die PDMux-Kernels für Prefill und Decode bei der Verwendung von `–enable-pdmux` keine zeitliche Überlappung zeigen. Er verwendet `nsys` zur Profilierung und stellt fest, dass die Zeit bis zur ersten Ausgabe (TTFT) bei Aktivierung von PDMux signifikant zunimmt.

Was heisst das fuer ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Die PDMux-Optimierung ist relevant für Consumer-GPUs wie 3090 oder 5090, da sie die Leistung beeinflusst. Die fehlende zeitliche Überlappung kann zu längeren Verarbeitungszeiten führen, was die Benutzererfahrung beeinträchtigen kann.

Konsequenz fuer OpenCode-Nutzer:
Die fehlende zeitliche Überlappung kann die Leistung von OpenCode-Agenten beeinträchtigen, insbesondere bei der Verarbeitung von großen Kontexten. Nutzer sollten die PDMux-Konfiguration überprüfen und ggf. alternative Optimierungen ausprobieren.

Handlungsempfehlung:
Die PDMux-Konfiguration beobachten und ggf. auf PRs warten, die die zeitliche Überlappung verbessern.

Fakten-Tabelle:
– Hardware im Post: 3080Ti
– Modell: Qwen3-1.7B
– Framework-Version: SGLang 0.5.9
– tok/s / Benchmark: [nicht im Post belegt]
– Multi-GPU-Konfiguration: [nicht im Post belegt]


[FROZEN_KV_MTP slower than no-spec on Gemma 4 (SWA hybrid) under concurrency] (5/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Worum geht es konkret?
Der Autor untersucht, warum die Verwendung von FROZEN_KV_MTP bei der Verarbeitung von mehreren Anfragen (Concurrency) langsamer ist als ohne Spezifikation. Er verwendet das Modell `gemma-4-31B-it-INT8` und stellt fest, dass die Leistung unter Concurrency deutlich abfällt.

Was heisst das fuer ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Die Leistung von FROZEN_KV_MTP ist relevant für Consumer-GPUs wie 3090 oder 5090, da sie die Verarbeitung von mehreren Anfragen beeinflusst. Die langsameren Verarbeitungszeiten können die Benutzererfahrung beeinträchtigen, insbesondere bei der Verarbeitung von großen Kontexten.

Konsequenz fuer OpenCode-Nutzer:
Die Verwendung von FROZEN_KV_MTP kann die Leistung von OpenCode-Agenten unter Concurrency beeinträchtigen. Nutzer sollten alternative Konfigurationen ausprobieren, um die Leistung zu verbessern.

Handlungsempfehlung:
Die FROZEN_KV_MTP-Konfiguration beobachten und ggf. auf PRs warten, die die Leistung unter Concurrency verbessern.

Fakten-Tabelle:
– Hardware im Post: GA100 64GB
– Modell: `gemma-4-31B-it-INT8`
– Framework-Version: SGLang 0.5.18
– tok/s / Benchmark: [nicht im Post belegt]
– Multi-GPU-Konfiguration: [nicht im Post belegt]


Weitere Diskussionen (kurz):

GLM-5.3-Flash on 8x B200: dual TP4/EP4 serving profile with long-context measurements — Enterprise — nicht autark-relevant.
Is MegaMoE currently limited to DeepSeek models? Any plans to support other architectures like GLM? — Enterprise — nicht autark-relevant.
Do Hopper support Deepseek V4 Flash run EP by deepep in the future? — Enterprise — nicht autark-relevant.
qwen2.5-vl model infer has an compute hash_feature function cost 84ms, and the qwen-vl vit forward cost 53ms, so it is necessary? or has another function to replace it? — Spezifische Optimierung, relevant für Modell-Entwickler.
How fast can you run DeepSeek V4 Spark 0731 with CPU-GPU hybrid inference when VRAM is not enough? — Relevant für Nutzer mit begrenztem VRAM, aber eher für fortgeschrittene Anwender.
Qwen3.5 seems have problem with tp>1 in triton_attention — Spezifisches Modell-Problem, relevant für Modell-Entwickler.
wx大模型agent技术交流 — Chinesisch, spezifische Diskussion, nicht direkt relevant.
Customize prefix caching — Spezifische Anfrage zur Customisierung, relevant für fortgeschrittene Nutzer.

👁 0 Aufrufe 👤 0 Leser