MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt von Apple ist aktuell in vollem Schwung, insbesondere bei

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt von Apple ist aktuell in vollem Schwung, insbesondere bei der Entwicklung von lokalen KI-Agenten auf Apple Silicon. Die Community arbeitet intensiv an der Optimierung von Modellen, der Verbesserung der Performance und der Unterstützung neuer Hardware. Für Entwickler, die Claude-ähnliche Leistungen auf Mac Studio oder EXO-Clustern anstreben, bieten diese Diskussionen wertvolle Einblicke und Lösungen.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für die Integration in OpenCode-Workflows und die Erweiterung lokaler Agenten über mehrere Geräte hinweg entscheidend ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node / Multi-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): MacProvider ist ein Projekt, das MLX-Endpoints über das Internet verfügbar macht, was für Anwendungen wie long-running personal agents, privacy-sensitive tooling und dev workflows von Bedeutung ist. Der Fokus liegt auf Authentifizierung, Routing und verifizierbarer Inference, was die Zuverlässigkeit und Sicherheit von lokalen KI-Agenten erhöht.

Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (9/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Dieser Field Report zeigt, dass das Qwen3.8-2.4T-Modell auf einem 4-node M3 Ultra Cluster lauffähig ist, aber die Performance und Stabilität weiter optimiert werden müssen.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s (bei 128 Tokens)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Field Report beschreibt die Initialisierung und die ersten Testläufe des Qwen3.8-2.4T-Modells auf einem 4-node M3 Ultra Cluster. Es wird auf die Herausforderungen bei der Quantisierung und der Stabilität eingegangen, die für die praktische Anwendung relevant sind.

Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese systematischen Benchmarks liefern wertvolle Einblicke in die Performance von verschiedenen Modellen, Quantisierungen und Kontextlängen auf dem M3 Ultra, was für die Optimierung von OpenCode-Workloads entscheidend ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: 10.4 tok/s (F16, 1K Kontext), 47.6 tok/s (Q2, 1K Kontext)
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB (~10.000 EUR)

Kontext (2-3 Saetze): Die Benchmarks zeigen, dass die Kontextlänge einen größeren Einfluss auf die Tokens pro Sekunde (TPS) hat als die Quantisierung. Besonders bei langen Kontexten wird die Performance durch den KV-Cache dominiert, was für die Auswahl geeigneter Modelle und Quantisierungen wichtig ist.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Der Debugging-Report für Kimi-K3 auf einem 4-node M3 Ultra Cluster zeigt, dass die Decode-Performance dispatch-bound ist, was für die Optimierung von großen Modellen auf Apple Silicon relevant ist.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: 2.0 tok/s (batch 1), 21.2 tok/s (32 concurrent)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Report untersucht die Performance von Kimi-K3 auf einem 4-node M3 Ultra Cluster und identifiziert, dass die Decode-Performance durch die Dispatch-Overhead begrenzt ist. Dies liefert wertvolle Erkenntnisse für die Optimierung von großen Modellen auf verteilten Systemen.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion über die Quantisierung von Modellen auf sehr niedrige Bit-Raten (<= 2 bit) bietet wertvolle Einblicke in die Möglichkeiten und Herausforderungen, die für die Effizienz von OpenCode-Workloads relevant sind.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Die Diskussion fokussiert auf die Entwicklung von benutzerdefinierten Quantisierungs- und Packern für sehr niedrige Bit-Raten. Es werden die Vorteile und Herausforderungen von K-quant hierarchischem Skalieren und sub-2-bit/Ternary-Packern diskutiert, die für die Effizienz von lokalen KI-Modellen entscheidend sein können.

JACCL Recv/Send -12 on 4-node TB5 after a successful first generate (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Dieser Fehlerbericht für JACCL auf einem 4-node TB5 Cluster zeigt, dass es Probleme mit der Kommunikation bei mehreren Generate-Anfragen gibt, was für die Stabilität von verteilten Systemen relevant ist.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s (bei 128 Tokens)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Fehlerbericht beschreibt, dass JACCL nach einer erfolgreichen ersten Generate-Anfrage bei späteren Anfragen fehlschlägt. Es werden verschiedene Ursachen und Lösungsansätze diskutiert, die für die Stabilität und Zuverlässigkeit von verteilten Systemen wichtig sind.

Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic (6/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Vorschläge zur Optimierung der CPU/GPU-Dispatch-Heuristik und der GPU-seitigen erweiterten Präzision können die Performance von MLX-Modellen auf Apple Silicon verbessern.
Hardware: Apple Silicon Mac, 34GB unified memory
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Die Vorschläge zielen darauf ab, die Performance von MLX-Modellen durch eine adaptive CPU/GPU-Dispatch-Heuristik und GPU-seitige erweiterte Präzision zu verbessern. Es werden Messergebnisse und Optimierungsvorschläge präsentiert, die für die Entwicklung von leistungsstarken Anwendungen relevant sind.

Weitere Diskussionen:

Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)
Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the frontier?
Can you stop gradients for part of a tensor?
MLX Community Projects
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)

👁 6 Aufrufe 👤 5 Leser