Reddit Apple-Silicon-Lagebild: Mac Studio, MLX und Cluster
Einleitung: In diesem Reddit-Überblick analysieren wir aktuelle Diskussionen und Erfahrungsberichte zu Apple-Silicon-Clustern, insbesondere im Kontext von Mac Studio, MLX und EXO-Cluster. Der Fokus liegt auf der Eignung dieser Hardware für die lokale Ausführung von großen Sprachmodellen wie Claude-Opus, insbesondere für OpenCode-Anwendungen.
[Running GLM 5.2 on 4xGB10 with a 100G Switch, 330k ctx, ~25 t/s tg, ~650 t/s pp] (6/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Der Post zeigt, dass ein 4xGB10-Cluster mit 100G Switch für GLM 5.2 leistungsfähig ist, aber der Mac Studio M3 Ultra 512GB ist für OpenCode-Anwendungen eher unzureichend.
Hardware: 4x GB10, 100G Switch
Modell: GLM 5.2
tok/s-Claim: ~25 t/s tg, ~650 t/s pp
Cluster-Bezug: Multi
Investment-Empfehlung: „Warten“
Kontext (2-3 Saetze): Der Post beschreibt ein Setup mit 4x GB10 und einem 100G Switch, das GLM 5.2 mit 330k Kontext effizient laufen lässt. Der Mac Studio M3 Ultra 512GB wird als weniger geeignet für solche Anwendungen dargestellt.
[Can you trust local models to answer accurately?] (5/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Lokale Modelle können genaue Antworten liefern, insbesondere wenn sie mit RAG (Retrieval-Augmented Generation) verbunden sind, was für OpenCode-Anwendungen relevant ist.
Hardware: Nicht spezifiziert
Modell: Various (Gemma, Qwen, DeepSeek)
tok/s-Claim: Nicht im Post belegt
Cluster-Bezug: Nicht klar
Investment-Empfehlung: „Warten“
Kontext (2-3 Saetze): Der Post untersucht die Genauigkeit lokaler Modelle bei der Beantwortung technischer Fragen. Lokale Modelle performen besser, wenn sie mit RAG verbunden sind, was für OpenCode-Anwendungen von Vorteil sein kann.
[8 Token/s Deepseek V4 Flash on Mac Studio M3 Ultra (can it be?)] (7/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Die Performance von 8 tok/s für Deepseek V4 Flash auf dem Mac Studio M3 Ultra 512GB ist enttäuschend und deutlich langsamer als erwartet.
Hardware: Mac Studio M3 Ultra 512GB
Modell: Deepseek V4 Flash
tok/s-Claim: 8 tok/s
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“
Kontext (2-3 Saetze): Der Benutzer berichtet, dass Deepseek V4 Flash auf dem Mac Studio M3 Ultra 512GB nur 8 tok/s erreicht, was deutlich langsamer ist als erwartet. Dies deutet darauf hin, dass der Mac Studio für solche Modelle möglicherweise nicht die beste Wahl ist.
[mlx-dspark: DeepSeek’s DSpark drafter running lossless on a Mac (native MLX, ~1.6×, OpenAI server + benchmarks)] (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): Die Implementierung von DeepSeek’s DSpark drafter auf Apple Silicon bietet eine signifikante Leistungssteigerung, was für OpenCode-Anwendungen von Vorteil sein kann.
Hardware: Mac M4 Pro
Modell: Qwen3 4B/8B/14B, Gemma-4 12B
tok/s-Claim: ~1.4-1.6x single user, up to ~2x on code/math with Gemma
Cluster-Bezug: Single
Investment-Empfehlung: „Jetzt kaufen“
Kontext (2-3 Saetze): Der Post beschreibt die Implementierung von DeepSeek’s DSpark drafter auf Apple Silicon, die eine Leistungssteigerung von 1.4-1.6x für einzelne Benutzer und bis zu 2x für Code/Math-Anwendungen mit Gemma-4 12B bietet. Dies kann für OpenCode-Anwendungen sehr nützlich sein.
[I built a free desktop app to make running local models dead simple (Athanor Lite)] (6/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Athanor Lite vereinfacht die lokale Ausführung von Modellen, aber es fehlt der direkte Bezug zu Apple Silicon und OpenCode.
Hardware: Nicht spezifiziert
Modell: Various
tok/s-Claim: Nicht im Post belegt
Cluster-Bezug: Nicht klar
Investment-Empfehlung: „Warten“
Kontext (2-3 Saetze): Der Post stellt Athanor Lite vor, eine kostenlose Desktop-App, die die lokale Ausführung von Modellen vereinfacht. Obwohl es nützlich sein kann, fehlt der direkte Bezug zu Apple Silicon und OpenCode-Anwendungen.
[Agents-A1-Q8_0-GGUF works pretty well for me (anecdotal feedback)] (5/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Agents-A1-Q8_0-GGUF performt gut auf einem M1 Max Mac, aber die Performance ist für OpenCode-Anwendungen möglicherweise nicht ausreichend.
Hardware: M1 Max Mac (64GB)
Modell: Agents A1 Q8
tok/s-Claim: 500 t/s pp, 40 t/s tg
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“
Kontext (2-3 Saetze): Der Benutzer berichtet, dass Agents-A1-Q8_0-GGUF auf einem M1 Max Mac gut performt, aber die Performance könnte für OpenCode-Anwendungen nicht ausreichend sein.
[How hot does your Mac get?] (4/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Die Temperatur des Mac Studio bei der Ausführung von LLMs ist hoch, was für langfristige Anwendungen wie OpenCode problematisch sein könnte.
Hardware: Mac Studio
Modell: Nicht spezifiziert
tok/s-Claim: Nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“
Kontext (2-3 Saetze): Der Post beschreibt, dass der Mac Studio bei der Ausführung von LLMs hohe Temperaturen erreicht, was langfristig Schäden verursachen könnte.
[Is MTP on macs a scam?] (6/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): MTP scheint bei Apple Silicon für Qwen oQ4-Modelle und agente Workloads eher negativ zu sein, was für OpenCode-Anwendungen relevant ist.
Hardware: M5 128 GB 40 Core GPU
Modell: Qwen oQ4
tok/s-Claim: Nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“
Kontext (2-3 Saetze): Der Post diskutiert, ob MTP bei Apple Silicon für Qwen oQ4-Modelle und agente Workloads eher negativ ist, was für OpenCode-Anwendungen relevant sein kann.
[Follow-up: GLM-5.2 NVFP4 on four DGX Sparks — the MTP mystery is solved, and it’s now ~24 tok/s at 128K context] (7/10) — OpenCode-Fit: JA
Verdict (1 Satz): Die Optimierung von GLM-5.2 NVFP4 auf einem 4x DGX Spark-Cluster ermöglicht eine Leistung von ~24 tok/s bei 128K Kontext, was für OpenCode-Anwendungen sehr nützlich ist.
Hardware: 4x DGX Spark
Modell: GLM-5.2 NVFP4
tok/s-Claim: ~24 tok/s
Cluster-Bezug: Multi
Investment-Empfehlung: „Jetzt kaufen“
Kontext (2-3 Saetze): Der Post beschreibt, wie die Optimierung von GLM-5.2 NVFP4 auf einem 4x DGX Spark-Cluster die Leistung bei 128K Kontext signifikant verbessert hat, was für OpenCode-Anwendungen sehr nützlich sein kann.
Weitere Beiträge:
– mistral.rs v0.9.0: up to 1.8x faster CPU decode than llama.cpp on x86 and ARM!
– Need some help figuring which quant sizes of some of the big MoEs would fit properly (with how much context + unquantized KV) on a future 256GB or 512GB dram + 48GB VRAM rig I might build later on, since I want to download and save them now (not later on when I have the rig)