Reddit Apple-Silicon-Lagebild: Mac Studio, MLX und Cluster
In dieser Zusammenfassung analysiere ich relevante Reddit-Beiträge zu Apple-Silicon, insbesondere den Mac Studio, MLX und EXO-Cluster, im Kontext von OpenCode und Claude-Opus-Nähe. Der Fokus liegt auf der Eignung dieser Hardware für die Ausführung von großen Sprachmodellen und Clustern.
[Benchmarking the 128GB M5 Max – First Attempt*] (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Der M5 Max 128GB ist für kleinere Modelle geeignet, aber für OpenCode mit 128k+ Kontexten zu langsam.
Hardware: Macbook Pro M5 Max 128GB
Modell: Qwen 3.6 27B, Gemma 4 E4B, MiniMax M2.7
tok/s-Claim: 4,748 tok/s (Gemma 4 E4B MLX 8-bit), 706 tok/s (Qwen 3.6 27B MLX Q8)
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf stärkere Modelle
Kontext (2-3 Saetze): Der Benutzer hat verschiedene Modelle auf seinem M5 Max 128GB getestet und zeigt, dass MLX im Allgemeinen schneller ist als GGUF. Allerdings sind die tok/s-Werte für größere Modelle wie Qwen 3.6 27B und MiniMax M2.7 relativ niedrig, was für OpenCode mit 128k+ Kontexten problematisch sein könnte.
[8 Token/s Deepseek V4 Flash on Mac Studio M3 Ultra (can it be?)] (6/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): 8 tok/s bei Deepseek V4 Flash auf dem Mac Studio M3 Ultra 512GB ist sehr langsam und reicht nicht für OpenCode.
Hardware: Mac Studio M3 Ultra 512GB
Modell: Deepseek V4 Flash
tok/s-Claim: 8 tok/s
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf bessere Performance
Kontext (2-3 Saetze): Der Benutzer berichtet, dass er nur 8 tok/s erreicht, was deutlich langsamer ist als erwartet. Dies deutet darauf hin, dass der Mac Studio M3 Ultra 512GB für OpenCode mit 128k+ Kontexten nicht geeignet ist.
[Running GLM 5.2 on 4xGB10 with a 100G Switch, 330k ctx, ~25 t/s tg, ~650 t/s pp] (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Ein 4xGB10-Cluster ist für GLM 5.2 mit 330k Kontexten geeignet, aber teurer als Mac Studio.
Hardware: 4x GB10, 100G Switch
Modell: GLM 5.2
tok/s-Claim: 25 tok/s tg, 650 tok/s pp
Cluster-Bezug: Multi
Investment-Empfehlung: „Rechnet sich nicht“ im Vergleich zu Mac Studio
Kontext (2-3 Saetze): Der Benutzer hat einen 4xGB10-Cluster eingerichtet, der GLM 5.2 mit 330k Kontexten laufen lässt. Die Performance ist gut, aber der Aufwand und die Kosten sind hoch. Ein Mac Studio könnte eine kostengünstigere Alternative sein.
[mlx-dspark: DeepSeek’s DSpark drafter running lossless on a Mac (native MLX, ~1.6×, OpenAI server + benchmarks)] (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): DSpark auf MLX verbessert die Performance, aber die Speedups sind begrenzt auf Macs.
Hardware: Mac M4 Pro
Modell: Qwen3 4B/8B/14B, Gemma-4 12B
tok/s-Claim: 1.4-1.6x Speedup
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf bessere MLX-Optimierungen
Kontext (2-3 Saetze): Der Benutzer hat DSpark, einen spekulativen Decoder, für MLX auf Macs portiert. Die Performance verbessert sich um 1.4-1.6x, was hilfreich ist, aber nicht die erwarteten 2-4x Speedups erreicht. Dies könnte sich in Zukunft ändern, wenn MLX weiter optimiert wird.
[Agents-A1-Q8_0-GGUF works pretty well for me (anecdotal feedback)] (6/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Agents A1 Q8 auf M1 Max 64GB ist für kleinere Aufgaben geeignet, aber für OpenCode mit 128k+ Kontexten zu langsam.
Hardware: Mac M1 Max 64GB
Modell: Agents A1 Q8
tok/s-Claim: 500 tok/s pp, 40 tok/s tg
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf stärkere Modelle
Kontext (2-3 Saetze): Der Benutzer berichtet, dass Agents A1 Q8 auf seinem M1 Max 64GB gut funktioniert, aber die tok/s-Werte für OpenCode mit 128k+ Kontexten zu niedrig sind. Es könnte sich lohnen, stärkere Modelle zu testen.
[How hot does your Mac get?] (5/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Hohe Temperaturen beim Betrieb von LLMs auf Macs sind ein Indikator für mögliche Leistungseinschränkungen.
Hardware: Mac Studio
Modell: nicht spezifiziert
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf bessere Kühlung
Kontext (2-3 Saetze): Der Benutzer berichtet, dass sein Mac Studio bei der Ausführung von LLMs hohe Temperaturen erreicht. Dies könnte die Leistung beeinträchtigen und langfristig Schäden verursachen. Es ist ratsam, die Kühlung zu überprüfen und eventuell alternative Lösungen zu betrachten.
Weitere Beiträge:
– I should be able to dip my toes into local models with this gaming desktop. Right?
– Complete local model asset generation pipeline
– Can you trust local models to answer accurately?
– mistral.rs v0.9.0: up to 1.8x faster CPU decode than llama.cpp on x86 and ARM!
– I built a free desktop app to make running local models dead simple (Athanor Lite)
– I asked Codex to optimize DeepSeek V4 Flash 8-bit MLX on oMLX. Got ~1.6x prefill and ~3x decode speedup.