vLLM-Community: Autarke Multi-GPU-Inference für lokale Coding-Agenten
Kurzfassung
Die vLLM-Community diskutiert aktuell vor allem Themen rund um die Optimierung der Inference auf Consumer-GPUs, die Quantisierung von Modellen und die Verbesserung der Tool-Calling-Fähigkeiten. Besonders relevant für Nutzer, die ein autarkes Home-Setup mit 4x 3090 oder 2x 5090 aufbauen wollen, sind Diskussionen zur Quantisierung, zur Nutzung von Consumer-GPUs und zur Verbesserung der Performance. Diese Themen helfen dabei, das Setup effizienter und leistungsfähiger zu gestalten, um in die Nähe von Claude-Sonnet-Niveau zu kommen.
[Running Llama4 quantized on 2xH100 80GB] (3/10) — OpenCode-Fit: NEIN
Worum geht es konkret?
Der Nutzer fragt, ob es möglich ist, Llama4 mit fp8 oder experts_int8 Quantisierung auf 2x H100 80GB GPUs zu laufen zu bringen. Er hat bisher Probleme mit CUDA out of memory, obwohl int8 Quantisierung theoretisch die VRAM-Anforderungen halbieren sollte.
Was heisst das für ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Diese Diskussion ist nicht autark-relevant, da H100 GPUs Enterprise-Hardware sind und nicht in einem typischen Home-Setup verwendet werden. Die VRAM-Grenzen von 3090 oder 5090 sind deutlich geringer, und die Quantisierungsmethoden müssen für diese GPUs angepasst werden.
Konsequenz für OpenCode-Nutzer:
Für Nutzer mit Consumer-GPUs ist diese Diskussion irrelevant. Die Quantisierungsmethoden für H100 GPUs sind nicht direkt auf 3090 oder 5090 übertragbar.
Handlungsempfehlung:
Enterprise — ignorieren.
Fakten-Tabelle:
– Hardware im Post: H100 80GB
– Modell: Llama4
– Framework-Version: nicht im Post belegt
– tok/s / Benchmark: nicht im Post belegt
– Multi-GPU-Konfiguration: 2x H100 80GB
[Determining Overall Speed for One Long Prompt] (7/10) — OpenCode-Fit: JA
Worum geht es konkret?
Der Nutzer möchte die Geschwindigkeit für lange Prompts benchmarken, aber erhält mehrere Geschwindigkeitsmessungen, da das System die Anfrage in mehrere Batches aufteilt. Er fragt, ob es möglich ist, eine Gesamtgeschwindigkeit für die gesamte Anfrage zu erhalten.
Was heisst das für ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Diese Diskussion ist relevant, da sie die Performance-Optimierung auf Consumer-GPUs anspricht. Die Möglichkeit, eine Gesamtgeschwindigkeit für lange Prompts zu erhalten, ist wichtig für Nutzer, die ihre Modelle auf 3090 oder 5090 laufen lassen. Die Konfiguration mit `–tensor-parallel-size 2` und `–max-model-len 34100` ist für 2x 5090 oder 4x 3090 geeignet.
Konsequenz für OpenCode-Nutzer:
Die Fähigkeit, eine Gesamtgeschwindigkeit für lange Prompts zu messen, kann helfen, die Performance des Setups zu optimieren. Dies ist besonders nützlich für Agent-Workloads, bei denen lange Prompts häufig vorkommen.
Handlungsempfehlung:
Auf die neueste vLLM-Version updaten und die Konfiguration mit `–tensor-parallel-size 2` und `–max-model-len 34100` verwenden.
Fakten-Tabelle:
– Hardware im Post: nicht im Post belegt
– Modell: Qwen/Qwen3-30B-A3B-FP8
– Framework-Version: nicht im Post belegt
– tok/s / Benchmark: 41.1 tokens/s, 19.8 tokens/s, 77.6 tokens/s
– Multi-GPU-Konfiguration: TP=2
[Guidance regarding prepare calibration dataset to perform GPTQ] (8/10) — OpenCode-Fit: JA
Worum geht es konkret?
Der Nutzer fragt nach Empfehlungen zur Vorbereitung eines Kalibrierungsdatensatzes für die Quantisierung von Modellen mit GPTQ. Er erwähnt, dass 128 Samples aus dem C4-Datensatz empfohlen werden, aber fragt, ob dies in der Praxis gut funktioniert.
Was heisst das für ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Die Quantisierung ist entscheidend für die Nutzung großer Modelle auf Consumer-GPUs mit begrenzter VRAM. Die Verwendung des C4-Datensatzes als Kalibrierungsdatensatz kann helfen, die Quantisierungseffizienz zu verbessern, ohne spezifische Task-Daten zu benötigen. Dies ist besonders nützlich für Nutzer, die Modelle wie Llama-3.3 oder Qwen3 auf 3090 oder 5090 laufen lassen.
Konsequenz für OpenCode-Nutzer:
Die Verwendung des C4-Datensatzes für die Kalibrierung kann die Quantisierungseffizienz verbessern und die VRAM-Anforderungen reduzieren. Dies führt zu besseren Performance-Werten und ermöglicht die Nutzung großer Modelle auf Consumer-GPUs.
Handlungsempfehlung:
Den C4-Datensatz für die Kalibrierung verwenden und die Quantisierung mit GPTQ durchführen.
Fakten-Tabelle:
– Hardware im Post: nicht im Post belegt
– Modell: Llama, Qwen, etc.
– Framework-Version: nicht im Post belegt
– tok/s / Benchmark: nicht im Post belegt
– Multi-GPU-Konfiguration: nicht im Post belegt
[TP/PP with Different VRAM Cards] (7/10) — OpenCode-Fit: JA
Worum geht es konkret?
Der Nutzer fragt, ob es möglich ist, Tensor Parallelism (TP) und Pipeline Parallelism (PP) auf Karten mit unterschiedlichem VRAM zu verwenden. Er erwähnt, dass er eine 4070 Ti Super (16GB) und eine Tesla L4 (24GB) hat und fragt, ob er die gesamte VRAM nutzen kann.
Was heisst das für ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Diese Diskussion ist relevant, da sie die Nutzung von Karten mit unterschiedlichem VRAM anspricht. Nutzer mit 4x 3090 oder 2x 5090 können von dieser Information profitieren, um ihre VRAM-Ressourcen optimal zu nutzen. Die Konfiguration mit TP und PP kann die Performance verbessern, auch wenn die Karten unterschiedliche VRAM-Mengen haben.
Konsequenz für OpenCode-Nutzer:
Die Nutzung von Karten mit unterschiedlichem VRAM kann die Gesamtperformance verbessern. Es ist wichtig, die Konfiguration richtig zu setzen, um die VRAM-Ressourcen optimal zu nutzen.
Handlungsempfehlung:
Die Konfiguration mit TP und PP testen und die VRAM-Verwendung überwachen.
Fakten-Tabelle:
– Hardware im Post: 4070 Ti Super (16GB), Tesla L4 (24GB)
– Modell: nicht im Post belegt
– Framework-Version: nicht im Post belegt
– tok/s / Benchmark: nicht im Post belegt
– Multi-GPU-Konfiguration: TP, PP
[Can I run VLLM with 5090+5070Ti for Llama 70B Q4 (needs approximately 42 GB) inference? Or do I need identical GPUs?] (8/10) — OpenCode-Fit: JA
Worum geht es konkret?
Der Nutzer fragt, ob es möglich ist, VLLM mit einer Kombination aus 5090 und 5070Ti zu laufen zu bringen, um die Llama 70B Q4 zu inferenzieren. Er erwähnt, dass er nur ~42GB VRAM benötigt und fragt nach der erwarteten Leistung.
Was heisst das für ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Diese Diskussion ist sehr relevant, da sie die Nutzung von Karten mit unterschiedlichem VRAM anspricht. Nutzer mit 2x 5090 und einer zusätzlichen 5070Ti können von dieser Information profitieren. Die Kombination von Karten mit unterschiedlichem VRAM kann die VRAM-Ressourcen erweitern und die Leistung verbessern.
Konsequenz für OpenCode-Nutzer:
Die Kombination von 5090 und 5070Ti kann die VRAM-Ressourcen erweitern und die Leistung verbessern. Es ist wichtig, die Konfiguration richtig zu setzen, um die VRAM-Verwendung zu optimieren.
Handlungsempfehlung:
Die Kombination von 5090 und 5070Ti testen und die VRAM-Verwendung überwachen.
Fakten-Tabelle:
– Hardware im Post: 5090, 5070Ti
– Modell: Llama 70B Q4
– Framework-Version: nicht im Post belegt
– tok/s / Benchmark: 0.4s (5090), 0.5s (5070Ti)
– Multi-GPU-Konfiguration: nicht im Post belegt
[Clarifying how to calculate the KV cache usage in GiB] (6/10) — OpenCode-Fit: BEDINGT
Worum geht es konkret?
Der Nutzer fragt, wie die Verwendung des KV-Caches in GiB berechnet wird. Er ist unsicher, ob `num_total_gpu` die gesamte Anzahl der GPU-Blöcke oder nur die für den KV-Cache reservierten Blöcke bezeichnet.
Was heisst das für ein autarkes Home-Setup (4x 3090 / 2x 5090 / Mac Studio)?
Diese Diskussion ist relevant, da sie die VRAM-Verwaltung anspricht. Nutzer mit 4x 3090 oder 2x 5090 können von dieser Information profitieren, um ihre VRAM-Ressourcen besser zu verstehen und zu optimieren. Die korrekte Berechnung des KV-Caches kann die Performance verbessern.
Konsequenz für OpenCode-Nutzer:
Die korrekte Berechnung des KV-Caches kann helfen, die VRAM-Verwendung zu optimieren und die Performance zu verbessern. Dies ist besonders nützlich für Agent-Workloads, bei denen der KV-Cache eine wichtige Rolle spielt.
Handlungsempfehlung:
Die VRAM-Verwendung überwachen und die Konfiguration des KV-Caches optimieren.
Fakten-Tabelle:
– Hardware im Post: nicht im Post belegt
– Modell: nicht im Post belegt
– Framework-Version: nicht im Post belegt
– tok/s / Benchmark: nicht im Post belegt
– Multi-GPU-Konfiguration: nicht im Post belegt
Weitere Diskussionen (kurz):
– Any known integration with n8n? — Enterprise — nicht autark-relevant.
– Many 0 Day user questions – What is this vllm thing useful — Allgemeine Fragen und Kritik an der Community-Interaktion.
– ……lib/python3.12/site-packages/vllm/_C.abi3.so: undefined symbol: _ZN5torch3jit17parseSchemaOrNameERKSsb — Technisches Problem mit der Installation, nicht direkt autark-relevant.
– XGrammar falling to Outlines — Spezifisches Problem mit XGrammar, eher für fortgeschrittene Nutzer relevant.
– tool-call-parser for DeepSeek-V3 — Spezifische Frage zur Verwendung von DeepSeek-V3, eher für fortgeschrittene Nutzer relevant.
– Pipeline Parallelism Support — Technische Frage zur Implementierung von Pipeline Parallelism, eher für fortgeschrittene Nutzer relevant.
– can’t list models:curl http://127.0.0.1:50051/v1/models — Technisches Problem mit der Modell-Listung, eher für fortgeschrittene Nutzer relevant.
– How to load the model successfully through multi-card in vllm? — Technische Frage zur Multi-GPU-Modell-Ladung, eher für fortgeschrittene Nutzer relevant.
– Does VLLM support DP attention for deepseek? — Technische Frage zur Unterstützung von DP-Attention, eher für fortgeschrittene Nutzer relevant.