Reddit Apple-Silicon-Lagebild: Mac Studio, MLX und Cluster
In diesem Reddit-Feed finden sich verschiedene Diskussionen und Erfahrungsberichte zu Apple-Silicon-Systemen, insbesondere Mac Studio, MLX und EXO-Cluster. Diese Beiträge geben Einblicke in die Leistungsfähigkeit und Eignung dieser Systeme für die lokale Ausführung von großen Sprachmodellen (LLMs) und agenterischen Workflows, die für OpenCode relevant sind.
[PSA: llama.app, Mac app and llama serve from llama.cpp] (6/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die neue Mac-App von llama.cpp vereinfacht die Einrichtung und Nutzung, aber für OpenCode-Projekte ist die Performance kritisch.
Hardware: Mac
Modell: llama.cpp
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ (auf Performance-Tests)
Kontext (2-3 Saetze): Die App vereinfacht die Installation und Nutzung von llama.cpp auf Macs, was für Neueinsteiger und die Einrichtung von neuen Maschinen hilfreich sein kann. Allerdings fehlen konkrete Performance-Zahlen, die für OpenCode-Projekte relevant wären.
[Deepseek-V4-Flash-0731 Dwarfstar on Mac] (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): Die Performance von DeepSeek-V4-Flash auf M2 Ultra ist gut, was die Eignung für OpenCode-Projekte mit langen Kontexten bestätigt.
Hardware: M2 Ultra
Modell: DeepSeek-V4-Flash
tok/s-Claim: 28 t/s (Start), 23.5 t/s (45k), 18 t/s (192k)
Cluster-Bezug: Single
Investment-Empfehlung: „Jetzt kaufen“ (für M2 Ultra)
Kontext (2-3 Saetze): Der Beitrag zeigt die Performance von DeepSeek-V4-Flash auf einem M2 Ultra mit 192 GB RAM. Die tok/s-Werte bleiben stabil, auch bei längeren Kontexten, was für OpenCode-Projekte sehr relevant ist.
[[Release] WinterMix — Qwen3.5-122B-A10B in native MLX: an 82 GiB build that beats 94–95 GiB quants, plus a 68 GiB build for agent swarms] (9/10) — OpenCode-Fit: JA
Verdict (1 Satz): WinterMix bietet eine signifikante Leistungssteigerung für MLX-Modelle auf Apple Silicon, was die Eignung für OpenCode-Projekte verbessert.
Hardware: M5 Max
Modell: Qwen3.5-122B-A10B
tok/s-Claim: 9x schneller Prefill, ~20% schneller Token-Generation
Cluster-Bezug: Single
Investment-Empfehlung: „Jetzt kaufen“ (für M5 Max)
Kontext (2-3 Saetze): WinterMix ist eine neue Quantisierungsmethode für MLX-Modelle, die die Leistung auf Apple Silicon erheblich verbessert. Es ist besonders nützlich für agenterische Workflows und Modelle mit langen Kontexten.
[DeepSeek-V4-Flash 284B on 5.3GB of memory] (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): DeepSeek-V4-Flash 284B kann auf einem M5 Pro mit 24 GB RAM laufen, aber die Performance ist begrenzt, was für OpenCode-Projekte nur bedingt geeignet ist.
Hardware: M5 Pro
Modell: DeepSeek-V4-Flash
tok/s-Claim: 4.8 t/s
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ (auf leistungsfähigere Hardware)
Kontext (2-3 Saetze): Der Beitrag zeigt, wie DeepSeek-V4-Flash 284B auf einem M5 Pro mit 24 GB RAM ausgeführt werden kann. Die Performance ist begrenzt, aber es ist ein interessanter Ansatz für die lokale Ausführung großer Modelle.
[DeepSeek V4 Flash 0731 local setup gotcha: model, tool call & config setting] (7/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Die lokalen Setup-Probleme von DeepSeek V4 Flash auf Mac Studio M3 Ultra zeigen, dass die Konfiguration und Tool-Calling noch optimiert werden müssen.
Hardware: Mac Studio M3 Ultra
Modell: DeepSeek-V4-Flash
tok/s-Claim: 4-7 t/s (anfänglich), 17.20 t/s (nach Optimierung)
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ (auf bessere Konfigurationen)
Kontext (2-3 Saetze): Der Beitrag beschreibt die Herausforderungen bei der lokalen Einrichtung von DeepSeek V4 Flash auf einem Mac Studio M3 Ultra, insbesondere bei der Tool-Calling und Konfiguration. Die Performance kann durch Optimierungen verbessert werden.
[How would you set up a 96GB M3 Ultra as a small shared local LLM server?] (7/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Ein M3 Ultra mit 96 GB RAM kann als kleiner, geteilter LLM-Server verwendet werden, aber die Performance und Zuverlässigkeit müssen geprüft werden.
Hardware: M3 Ultra
Modell: verschiedene LLMs
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ (auf Performance-Tests)
Kontext (2-3 Saetze): Der Beitrag diskutiert, wie ein M3 Ultra mit 96 GB RAM als kleiner, geteilter LLM-Server für interne Dokumentaufgaben eingesetzt werden kann. Es werden Fragen zur Wahl des Modells, der Job-Queue und der Fehlerbehandlung aufgeworfen.
Weitere Beiträge:
– Five tips for building a local wake word that triggers on the first try
– Encrypted Clouds?
– A collection of small domain-specific benchmarks for local models (30+ and growing)
– Tomte – super fast harness for Gemma 4
– DeepSeek-V4-Flash-0731 UD-Q8_K_XL 17.20~ t/s on A6000 + 256GB DDR4
– Looking for inference compute integration ideas – standard consumer 5090 PC, TB4/5 5090 eGPU, M3U 256gb Studio, & 14th Gen Dell Server