MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt von Apple ist derzeit in hohem Tempo in Entwicklung, insbe

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt von Apple ist derzeit in hohem Tempo in Entwicklung, insbesondere im Bereich der lokalen KI-Agenten auf Apple Silicon. Die Community arbeitet intensiv an der Verbesserung der Modell-Unterstützung, der Performance und der Skalierbarkeit auf Clustern. Für Entwickler, die an Claude-ähnlichen Leistungen auf Mac Studio oder EXO-Clustern interessiert sind, bieten diese Diskussionen wertvolle Einblicke.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für lokale KI-Agenten und Tool-Calling-Anwendungen entscheidend ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): MacProvider ist ein Projekt, das MLX-Endpoints über das Internet erreichbar macht, was für Anwendungen wie long-running personal agents und privacy-sensitive tooling entscheidend ist. Der Fokus liegt auf Authentifizierung, Routing und verifizierbarer Inference.

Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (9/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Dieser Field Report zeigt, dass das Qwen3.8-2.4T-Modell auf einem 4-node M3 Ultra Cluster lauffähig ist, aber die Performance bei 4-bit Quantisierung kritisch ist.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s bei 128 Tokens
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB für 2.4T-Modelle

Kontext (2-3 Saetze): Der Report gibt Einblicke in die Performance und Stabilität des Qwen3.8-2.4T-Modells auf einem 4-node M3 Ultra Cluster. Besonders interessant ist die Analyse der Quantisierung und der Speicherverbrauch.

Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese systematischen Benchmarks zeigen, dass der Kontextlänge bei lokalen LLMs auf Apple Silicon eine größere Bedeutung für die Performance zukommt als der Quantisierungsgrad.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: 31.2 tok/s (Qwen 32B), 68.4 tok/s (Mixtral 8x7B) bei 1K Kontext
Cluster-Bezug: Single-Node
Investment-Empfehlung: M3 Ultra 512 GB für leistungsstarke Single-Node-Anwendungen

Kontext (2-3 Saetze): Die Benchmarks umfassen verschiedene Modelle, Quantisierungsgrade und Kontextlängen. Besonders aufschlussreich sind die Ergebnisse zur Performance bei langen Kontexten und der Effekt der Quantisierung.

JACCL Recv/Send -12 on 4-node TB5 after a successful first generate (7/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Dieser Bericht beschreibt ein Problem mit JACCL auf einem 4-node Thunderbolt 5 Cluster, das nach der ersten Generierung auftritt.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s bei 128 Tokens
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB für verteilte Anwendungen

Kontext (2-3 Saetze): Das Problem tritt nach der ersten Generierung auf und führt zu einem Absturz des Clusters. Es wird auf transport- und Lebenszyklusprobleme hingewiesen, die eine weitere Untersuchung erfordern.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion erkundet die Möglichkeiten der effizienten Quantisierung bei sehr niedrigen Bit-Raten, was für die Reduzierung des Speicherverbrauchs und die Steigerung der Performance wichtig ist.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Fokus liegt auf der Entwicklung von benutzerdefinierten Quantisierungs- und Packern, um die Modellqualität bei sehr niedrigen Bit-Raten zu verbessern. Inspiriert von Projekten wie GGUF und llama.cpp.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Der Bericht zeigt, dass die Performance des Kimi-K3-Modells auf einem 4-node M3 Ultra Cluster dispatch-bound ist, was für die Optimierung der Decode-Leistung entscheidend ist.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: 2.0 tok/s bei Batch 1, 21.2 tok/s aggregiert bei 32 konkurrierenden Streams
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB für 2.78T-Modelle

Kontext (2-3 Saetze): Die Analyse zeigt, dass die Decode-Leistung dispatch-bound ist, was bedeutet, dass die Optimierung der Dispatch-Logik entscheidend für die Steigerung der Performance ist. Es werden auch einige offene Fragen und Probleme diskutiert.

THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO (6/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Diese Diskussion kritisiert die Entscheidung von Apple, den Mac Studio mit weniger Speicher als den MacBook Pro auszustatten, was für Entwickler, die lokale KI-Modelle betreiben möchten, problematisch ist.
Hardware: Mac Studio, MacBook Pro
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: MacBook Pro für höhere Speicherkapazität

Kontext (2-3 Saetze): Der Autor kritisiert die Entscheidung von Apple, den Mac Studio mit weniger Speicher auszustatten als den MacBook Pro. Dies wirft Fragen auf, warum Apple seine eigenen Entwickler bevorzugt.

Weitere Diskussionen:

Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
Can you stop gradients for part of a tensor?
MLX Community Projects
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)
Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the frontier?

👁 4 Aufrufe 👤 4 Leser