Reddit Apple-Silicon-Lagebild: Mac Studio, MLX und Cluster
In dieser Zusammenfassung analysieren wir Reddit-Beiträge, die sich auf Apple-Silicon-KI, Mac-Studio, MLX und EXO-Cluster beziehen. Der Fokus liegt auf der Frage, ob und wie ein Apple-Silicon-Cluster als Weg zu Claude-Opus-Nähe für OpenCode geeignet ist.
How would you set up a 96GB M3 Ultra as a small shared local LLM server? (6/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Ein M3 Ultra 96GB kann für kleinere Teams und interne Aufgaben wie Finanzanalyse und Dokumentenverarbeitung geeignet sein, aber für OpenCode-Anwendungen mit 128k+ Kontexten ist die Performance möglicherweise zu langsam.
Hardware: M3 Ultra 96GB
Modell: GLM-OCR, Ternary-Bonsai 27B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf bessere Performance-Tests
Kontext (2-3 Saetze): Der Beitrag beschreibt, wie ein M3 Ultra 96GB als lokaler LLM-Server für interne Aufgaben wie Finanzanalyse und Dokumentenverarbeitung eingesetzt werden kann. Es wird nach Empfehlungen für die Wahl des Modells, der Job-Queue, Benutzerzugriff, Logging und Fehlerbehebung gefragt. Die Performance für OpenCode-Anwendungen wird nicht direkt angesprochen.
I ported TurboFieldfare to Qwen 3.6 35B and it runs in 1.4 GB of RAM (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): TurboFieldfare ermöglicht das Laufen von Qwen 3.6 35B auf einem M5 Mac mit nur 1.4 GB RAM, was für kleinere Aufgaben geeignet ist, aber für OpenCode-Anwendungen mit 128k+ Kontexten möglicherweise zu langsam ist.
Hardware: M5 Mac
Modell: Qwen 3.6 35B
tok/s-Claim: 19–23 tok/s
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf bessere Performance-Tests
Kontext (2-3 Saetze): Der Beitrag beschreibt, wie TurboFieldfare, ein Mac-Engine, Qwen 3.6 35B auf einem M5 Mac mit nur 1.4 GB RAM laufen lässt. Die Speeds liegen bei 19–23 tok/s, was für kleinere Aufgaben ausreichend ist, aber für OpenCode-Anwendungen möglicherweise zu langsam ist.
Turbo-fieldfare: Open-source engine running Gemma 4 26B in 2 GB RAM on Apple Silicon (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): TurboFieldfare ermöglicht das Laufen von Gemma 4 26B auf Apple-Silicon-Macs mit nur 2 GB RAM, was für kleinere Aufgaben geeignet ist, aber für OpenCode-Anwendungen mit 128k+ Kontexten möglicherweise zu langsam ist.
Hardware: M2 MacBook Air 8GB, M5 MacBook Pro
Modell: Gemma 4 26B
tok/s-Claim: 5–6 tok/s (M2), 31–35 tok/s (M5)
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf bessere Performance-Tests
Kontext (2-3 Saetze): Der Beitrag stellt TurboFieldfare vor, eine Open-Source-Engine, die Gemma 4 26B auf Apple-Silicon-Macs mit nur 2 GB RAM laufen lässt. Die Speeds liegen bei 5–6 tok/s auf einem M2 MacBook Air und 31–35 tok/s auf einem M5 MacBook Pro. Die Engine unterstützt auch Tool-Calls und Streaming.
Mac Pro for local inference (5/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Der Mac Pro 2019 ist eine kostengünstige Option für lokale Inferenz, aber er verwendet DDR4-RAM und ist nicht speziell für Apple-Silicon-Modelle optimiert, was ihn für OpenCode-Anwendungen weniger geeignet macht.
Hardware: Mac Pro 2019
Modell: nicht spezifiziert
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf spezifischere Apple-Silicon-Tests
Kontext (2-3 Saetze): Der Beitrag diskutiert die Möglichkeit, einen gebrauchten Mac Pro 2019 mit 300+ GB DDR4-RAM und großen Speicherkapazitäten für lokale Inferenz zu verwenden. Es wird nach Benchmarks gefragt, aber der Fokus liegt nicht auf Apple-Silicon-Modellen oder OpenCode-Anwendungen.
[[Project] Local LLM agent playing Perfect Dark on Mac — real locomotion + combat (on-device MLX)](https://old.reddit.com/r/LocalLLaMA/comments/1v8dflw/project_local_llm_agent_playing_perfect_dark_on/) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Ein lokaler LLM-Agent, der Perfect Dark auf einem Mac mit MLX steuert, zeigt die Leistungsfähigkeit von Apple-Silicon, aber die Anwendung für OpenCode-Anwendungen ist begrenzt.
Hardware: Mac
Modell: MLX
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf spezifischere OpenCode-Tests
Kontext (2-3 Saetze): Der Beitrag zeigt ein Forschungsprojekt, bei dem ein lokaler LLM-Agent das Spiel Perfect Dark auf einem Mac mit MLX steuert. Es wird eine schnelle Kampfschicht verwendet, die jede 50 ms die Bewegung und Zielerfassung handhabt, während der LLM höhere Aktionen auf einer langsameren Zeitskala setzt.
Viable ways to run K3 locally (5/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Der Beitrag diskutiert verschiedene Möglichkeiten, Kimi K3 lokal zu betreiben, aber es wird kein spezifischer Fokus auf Apple-Silicon oder OpenCode-Anwendungen gelegt.
Hardware: verschiedene Optionen
Modell: Kimi K3
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht klar
Investment-Empfehlung: „Warten“ auf spezifischere Apple-Silicon-Tests
Kontext (2-3 Saetze): Der Beitrag fragt nach verschiedenen Möglichkeiten, Kimi K3 lokal zu betreiben, einschließlich DGX Spark/Strix Halo Clusters, Optane Persistent Memory Platform, Mac Studio Clusters, Orange Pi 6 Clusters und mehr. Es wird kein spezifischer Fokus auf Apple-Silicon oder OpenCode-Anwendungen gelegt.
I kept rewriting parameters every time I swapped models on vLLM and llama.cpp, so I built a tool to manage them (llmux, MIT) (5/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): llmux ist ein nützliches Tool zur Verwaltung von Modellen auf vLLM und llama.cpp, aber es ist nicht spezifisch für Apple-Silicon oder OpenCode-Anwendungen.
Hardware: Linux, NVIDIA GPU
Modell: verschiedene Modelle
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht klar
Investment-Empfehlung: „Warten“ auf spezifischere Apple-Silicon-Tests
Kontext (2-3 Saetze): Der Beitrag stellt llmux vor, ein Tool zur Verwaltung von Modellen auf vLLM und llama.cpp. Es vereinfacht das Wechseln zwischen Modellen und bietet eine CLI für Skripte und SSH. Es ist jedoch nicht spezifisch für Apple-Silicon oder OpenCode-Anwendungen.
Keep my AI rig or sell it? (4/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Der Beitrag diskutiert, ob ein selbstgebautes AI-Rig mit NVIDIA-GPUs behalten oder verkauft werden sollte, aber es wird kein spezifischer Fokus auf Apple-Silicon oder OpenCode-Anwendungen gelegt.
Hardware: PC mit NVIDIA-GPUs
Modell: GPT 120B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf spezifischere Apple-Silicon-Tests
Kontext (2-3 Saetze): Der Beitrag beschreibt ein selbstgebautes AI-Rig mit NVIDIA-GPUs, das für lokale Inferenz und Training verwendet wurde. Es wird nach Meinungen gefragt, ob das Rig behalten oder verkauft werden sollte, da der Autor nun Zugang zu Copilot hat.
DGX Spark or M5 Max MacBook Pro 128GB RAM? (4/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Der Beitrag fragt nach der besten Wahl zwischen DGX Spark und M5 Max MacBook Pro 128GB RAM für lokale Inferenz und Training, aber es wird kein spezifischer Fokus auf Apple-Silicon oder OpenCode-Anwendungen gelegt.
Hardware: DGX Spark, M5 Max MacBook Pro 128GB
Modell: nicht spezifiziert
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf spezifischere Apple-Silicon-Tests
Kontext (2-3 Saetze): Der Beitrag fragt nach der besten Wahl zwischen DGX Spark und M5 Max MacBook Pro 128GB RAM für lokale Inferenz und Training. Es wird nach Benchmarks und Erfahrungen gefragt, aber es wird kein spezifischer Fokus auf Apple-Silicon oder OpenCode-Anwendungen gelegt.
I used local models and embedders to find out how coding agents are making decisions for me and how my coding preferences are being saved (5/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Der Beitrag beschreibt, wie lokale Modelle und Embedder verwendet werden, um die Entscheidungsprozesse von Coding-Agents zu analysieren, aber es wird kein spezifischer Fokus auf Apple-Silicon oder OpenCode-Anwendungen gelegt.
Hardware: verschiedene
Modell: verschiedene
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf spezifischere Apple-Silicon-Tests
Kontext (2-3 Saetze): Der Beitrag beschreibt, wie lokale Modelle und Embedder verwendet werden, um die Entscheidungsprozesse von Coding-Agents wie Claude Code und Codex zu analysieren. Es wird eine Open-Source-Tool genannt, das die Entscheidungsprozesse visualisiert, aber es wird kein spezifischer Fokus auf Apple-Silicon oder OpenCode-Anwendungen gelegt.
Best Value Spec M5 Max MacBook Pro? (4/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Der Beitrag fragt nach der besten Spezifikation für einen M5 Max MacBook Pro für lokale Modelle, aber es wird kein spezifischer Fokus auf Apple-Silicon oder OpenCode-Anwendungen gelegt.
Hardware: M5 Max MacBook Pro
Modell: nicht spezifiziert
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single
Investment-Empfehlung: „Warten“ auf spezifischere Apple-Silicon-Tests
Kontext (2-3 Saetze): Der Beitrag fragt nach der besten Spezifikation für einen M5 Max MacBook Pro, insbesondere, ob 64GB RAM ausreichen oder ob 128GB RAM besser sind. Es wird nach Erfahrungen und Benchmarks gefragt, aber es wird kein spezifischer Fokus auf Apple-Silicon oder OpenCode-Anwendungen gelegt.
Best way to setup and use the hardware I have (4/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Der Beitrag fragt nach der besten Nutzung von verschiedenen PCs und GPUs für lokale LLMs und Agents, aber es wird kein spezifischer Fokus auf Apple-Silicon oder OpenCode-Anwendungen gelegt.
Hardware: verschiedene PCs und GPUs
Modell: verschiedene
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht klar
Investment-Empfehlung: „Warten“ auf spezifischere Apple-Silicon-Tests
Kontext (2-3 Saetze): Der Beitrag fragt nach der besten Nutzung von verschiedenen PCs und GPUs, einschließlich ATX-PCs, Mac Mini M4 und mehr, für lokale LLMs und Agents. Es wird nach Vorschlägen für die Netzwerkkonfiguration und die Nutzung der Hardware gefragt, aber es wird kein spezifischer Fokus auf Apple-Silicon oder OpenCode-Anwendungen gelegt.
Weitere Beiträge:
– Mac Pro for local inference
– Viable ways to run K3 locally
– [I kept rewriting parameters every time I swapped models on vLLM and llama.cpp, so I built a tool to manage them (llmux, MIT)](https