MLX-Community: Apple Silicon für lokale KI-Agenten
Das MLX-Projekt von Apple ist derzeit in hohem Tempo in Entwicklung, insbesondere im Bereich der lokalen KI-Agenten auf Apple Silicon. Die Community arbeitet intensiv an der Verbesserung der Modell-Unterstützung, der Quantisierung, der Performance und der Skalierung auf Clustern. Für Nutzer, die OpenCode-Workloads mit langen Kontexten und Tool-Calling-Fähigkeiten betreiben möchten, sind einige Diskussionen besonders relevant.
MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (8/10) — OpenCode-Fit: JA
Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für lokal betriebene KI-Agenten entscheidend ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): MacProvider ist ein Projekt, das MLX-Endpoints über das Internet erreichbar macht, was für Anwendungen wie long-running personal agents und privacy-sensitive tooling entscheidend ist. Es bietet Authentifizierung, Routing und verifizierbare Inferenz, was die Verwendung von MLX in lokalen, aber vernetzten Szenarien erheblich verbessert.
Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (9/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Dieser Bericht zeigt, dass das Betreiben von Qwen3.8-2.4T auf einem 4-Node-Cluster möglich ist, aber die Performance und die Modellgenauigkeit noch optimiert werden müssen.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s (nach dem ersten Generate)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB für 2 TB Unified Memory (~40.000 EUR)
Kontext (2-3 Saetze): Dieser Field Report beschreibt die ersten Ergebnisse beim Betreiben des Qwen3.8-2.4T-A95B-Modells auf einem 4-Node-Cluster mit Mac Studio M3 Ultras. Es wird gezeigt, dass das Modell lauffähig ist, aber die Performance und die Modellgenauigkeit noch verbessert werden müssen, insbesondere bei der Verwendung von 4-bit Quantisierung.
Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA
Verdict (1 Satz): Diese Benchmarks zeigen, dass der Kontextlänge eine größere Bedeutung für die Performance zukommt als der Grad der Quantisierung, was für Nutzer mit langen Kontexten wie OpenCode entscheidend ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: 10.4 tok/s (Qwen 32B, 1K Kontext), 5.5 tok/s (Qwen 32B, 128K Kontext)
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB (~10.000 EUR)
Kontext (2-3 Saetze): Diese systematischen Benchmarks untersuchen die Performance von fünf Modellen bei sechs Quantisierungsgraden und sieben Kontextlängen. Die Ergebnisse zeigen, dass die Kontextlänge einen größeren Einfluss auf die Tokens pro Sekunde (TPS) hat als die Quantisierung, was für Nutzer mit langen Kontexten wie OpenCode besonders relevant ist.
[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Der Bericht zeigt, dass das Betreiben von Kimi-K3 auf einem 4-Node-Cluster möglich ist, aber die Performance durch dispatch-bound Decode eingeschränkt ist.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: 2.0 tok/s (batch 1), 21.2 tok/s (32 concurrent)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB für 2 TB Unified Memory (~40.000 EUR)
Kontext (2-3 Saetze): Dieser Bericht beschreibt die Performance von Kimi-K3 (2.78T) auf einem 4-Node-Cluster mit Mac Studio M3 Ultras. Es wird gezeigt, dass die Decode-Performance dispatch-bound ist, was bedeutet, dass die Performance durch die Dispatch-Logik eingeschränkt wird, anstatt durch die Bandbreite.
Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Diskussion erkundet die Möglichkeiten der Quantisierung bei sehr niedrigen Bit pro Weight (bpw) und diskutiert, wie diese Techniken in MLX implementiert werden könnten.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Die Diskussion fokussiert sich auf die Quantisierung von Modellen bei sehr niedrigen Bit pro Weight (bpw) und die Verwendung von gemischten Allokationen und benutzerdefinierten Packern. Es wird untersucht, wie diese Techniken in MLX implementiert werden könnten, um die Modellgröße zu reduzieren und die Performance zu verbessern.
Overview of three perf PRs for LLM inference (#3918, #3919, #3920) (7/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese PRs verbessern die Performance von LLM-Inferenz auf Apple Silicon, insbesondere bei langen Kontexten und MoE-Modellen.
Hardware: Mac Studio M3 Max
Modell: Qwen3.6-35B-A3B
tok/s-Claim: +6.2% MoE prefill at 32K, +2.8% prefill end to end
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Max (~6.000 EUR)
Kontext (2-3 Saetze): Diese PRs verbessern verschiedene Aspekte der LLM-Inferenz auf Apple Silicon, darunter die Tile-Größe in `gather_qmm_rhs`, die Fusionsoperation in `SDPA ops fallback` und die CPU-Overhead-Reduktion in `eval_impl` und `gather_mm`. Die Verbesserungen sind besonders nützlich für MoE-Modelle und lange Kontexte.
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate (7/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Dieser Bericht beschreibt ein Problem mit JACCL auf einem 4-Node-Cluster, das nach dem ersten Generate auftritt und die Stabilität beeinträchtigt.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s (erster Generate)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB für 2 TB Unified Memory (~40.000 EUR)
Kontext (2-3 Saetze): Dieser Bericht beschreibt ein Problem mit JACCL auf einem 4-Node-Cluster, bei dem nach dem ersten Generate ein Fehler auftritt. Es wird gezeigt, dass der Fehler durch eine Kombination von Transport- und Lebenszyklusproblemen verursacht wird, die die Stabilität des Clusters beeinträchtigen.
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO (6/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Dieser Bericht kritisiert Apple für die Entscheidung, den Mac Studio mit weniger Speicher als den MacBook Pro auszustatten, was die Wahl des Geräts für KI-Anwendungen erschwert.
Hardware: Mac Studio, MacBook Pro
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Autor kritisiert Apple für die Entscheidung, den Mac Studio mit weniger Speicher als den MacBook Pro auszustatten. Dies erschwert die Wahl des Geräts für Nutzer, die große Modelle lokal betreiben möchten, und zeigt, dass Apple in dieser Hinsicht hinter anderen Herstellern zurückbleibt.
Weitere Diskussionen:
– Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
– Symbio: Self fine tuning ai agents
– Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
– Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)
– Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the frontier?
– Can you stop gradients for part of a tensor?
– MLX Community Projects