Reddit Apple-Silicon-Lagebild: Mac Studio, MLX und Cluster
In dieser Zusammenfassung analysiere ich relevante Reddit-Beiträge zu Apple-Silicon-KI, insbesondere im Kontext von Mac Studio, MLX und EXO-Cluster. Der Fokus liegt auf der Eignung dieser Hardware für OpenCode und Claude-Opus-Nähe.
At most my Strix Halo uses $0.48 a day (4/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Die Strix Halo bietet eine gute Kombination aus Leistung, Energieeffizienz und Stille, aber für OpenCode könnte die Token-Processing-Speed ein Hinderungsgrund sein.
Hardware: Strix Halo
Modell: Qwen 3.6 35B
tok/s-Claim: 50 tps
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“
Kontext (2-3 Saetze): Der Beitrag betont die Energieeffizienz und Stille der Strix Halo, was für den Einsatz in einer Wohnumgebung von Vorteil sein kann. Allerdings ist die Token-Processing-Speed bei 50 tps, was für OpenCode-Anwendungen möglicherweise zu langsam ist.
Benchmarked the 128GB M5 Max as an Amateur – Need Feedback (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die Benchmarks zeigen, dass der M5 Max für kleinere Modelle gut geeignet ist, aber für OpenCode mit 128k+ Kontexten möglicherweise zu langsam ist.
Hardware: 128GB M5 Max Macbook Pro
Modell: Qwen 3.6 27B, Gemma 4 E4B
tok/s-Claim: 706 tps (Qwen 3.6 27B Q8), 4,748 tps (Gemma 4 E4B Q8)
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“
Kontext (2-3 Saetze): Der Beitrag bietet detaillierte Benchmarks für verschiedene Modelle auf einem 128GB M5 Max Macbook Pro. Die Token-Processing-Speed ist für kleinere Modelle gut, aber für OpenCode-Anwendungen mit 128k+ Kontexten könnte sie zu langsam sein.
8 Token/s Deepseek V4 Flash on Mac Studio M3 Ultra (can it be?) (6/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Die sehr niedrige Token-Processing-Speed von 8 tps auf dem Mac Studio M3 Ultra ist für OpenCode-Anwendungen unzureichend.
Hardware: Mac Studio M3 Ultra 512GB
Modell: DeepSeek V4 Flash
tok/s-Claim: 8 tps
Cluster-Bezug: Single
Investment-Empfehlung: „Rechnet sich nicht“
Kontext (2-3 Saetze): Der Beitrag beschreibt die Enttäuschung über die sehr niedrige Token-Processing-Speed von 8 tps auf einem Mac Studio M3 Ultra. Diese Leistung ist für OpenCode-Anwendungen mit 128k+ Kontexten zu langsam.
Running GLM 5.2 on 4xGB10 with a 100G Switch, 330k ctx, ~25 t/s tg, ~650 t/s pp (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): Die Setup mit 4x GB10 und einem 100G Switch bietet eine ausgezeichnete Leistung für 330k Kontexte, was für OpenCode sehr geeignet ist.
Hardware: 4x GB10, 100G Switch
Modell: GLM 5.2
tok/s-Claim: 25 tps (decode), 650 tps (prefill)
Cluster-Bezug: Cluster
Investment-Empfehlung: „Jetzt kaufen“
Kontext (2-3 Saetze): Der Beitrag beschreibt ein hochleistungsfähiges Cluster-Setup mit 4x GB10 und einem 100G Switch, das 330k Kontexte unterstützt. Die Token-Processing-Speed von 25 tps für Decode und 650 tps für Prefill ist sehr gut für OpenCode-Anwendungen.
mlx-dspark: DeepSeek’s DSpark drafter running lossless on a Mac (native MLX, ~1.6×, OpenAI server + benchmarks) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die Verwendung von DSpark auf einem Mac kann die Token-Processing-Speed um bis zu 1.6x verbessern, was für OpenCode-Anwendungen hilfreich sein kann.
Hardware: Mac (M4 Pro)
Modell: Qwen3 4B/8B/14B, Gemma-4 12B
tok/s-Claim: 1.4-1.6x Speedup
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“
Kontext (2-3 Saetze): Der Beitrag stellt eine native MLX-Portierung von DeepSeek’s DSpark vor, die die Token-Processing-Speed auf einem Mac um bis zu 1.6x verbessert. Dies kann für OpenCode-Anwendungen hilfreich sein, aber die absolute Speedup ist abhängig von der spezifischen Hardware.
I built a free desktop app to make running local models dead simple (Athanor Lite) (5/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Athanor Lite vereinfacht den Betrieb lokaler Modelle, aber die Token-Processing-Speed ist für OpenCode-Anwendungen möglicherweise zu langsam.
Hardware: Windows PC
Modell: Various
tok/s-Claim: Nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“
Kontext (2-3 Saetze): Der Beitrag stellt Athanor Lite vor, eine kostenlose Desktop-App, die den Betrieb lokaler Modelle vereinfacht. Obwohl die App nützlich sein kann, ist die Token-Processing-Speed für OpenCode-Anwendungen möglicherweise zu langsam.
Weitere Beiträge:
– Has anyone created a „Local LLM Survival Kit“?
– Locally run assistant on a w-10 board on a local Xiaozhi server
– I should be able to dip my toes into local models with this gaming desktop. Right?
– Complete local model asset generation pipeline
– Can you trust local models to answer accurately?
– mistral.rs v0.9.0: up to 1.8x faster CPU decode than llama.cpp on x86 and ARM!