MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt ist derzeit in hohem Tempo in Bewegung. Die Community arbe

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt ist derzeit in hohem Tempo in Bewegung. Die Community arbeitet intensiv an der Verbesserung der lokalen KI-Agenten auf Apple Silicon, insbesondere im Bereich der Modell-Unterstützung, Quantisierung und Performance-Optimierung. Für Nutzer, die OpenCode-Workloads auf Mac Studio oder EXO-Clustern betreiben möchten, sind aktuelle Entwicklungen besonders relevant, da sie die Leistung und den Einsatz von Claude-ähnlichen Modellen verbessern.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpunkte im Internet verfügbar zu machen, was für die Integration in OpenCode-Workloads und die Erweiterung der Anwendungsfelder von lokalen KI-Agenten entscheidend ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): MacProvider ist ein Projekt, das MLX-Endpunkte im Internet verfügbar macht, was für Anwendungen wie long-running personal agents und privacy-sensitive tooling wichtig ist. Der Fokus liegt auf Authentifizierung, Routing und verifizierbaren Inferenzen, die die Zuverlässigkeit und Sicherheit von lokalen KI-Agenten erhöhen.

Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (9/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Dieser Bericht zeigt, dass das Qwen3.8-2.4T-Modell auf einem 4-knotigen M3 Ultra Cluster lauffähig ist, aber die Leistung und Stabilität noch verbessert werden müssen, um Claude-ähnliche Anwendungen zu ermöglichen.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s (nur bei ersten Generate, später -12 Fehler)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB für Qwen3.8-2.4T

Kontext (2-3 Saetze): Der Bericht beschreibt die ersten Ergebnisse des Betriebs von Qwen3.8-2.4T auf einem 4-knotigen M3 Ultra Cluster. Obwohl das Modell lauffähig ist, gibt es Probleme mit der Stabilität und Leistung, die weiter untersucht werden müssen.

Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese systematischen Benchmarks zeigen, dass der Kontextlänge ein größerer Einfluss auf die Leistung als die Quantisierung zukommt, was für die Optimierung von OpenCode-Workloads auf Apple Silicon entscheidend ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: Qwen 32B: 5.5 tok/s (128K), Llama 405B: 9.3 tok/s (128K)
Cluster-Bezug: Single-Node
Investment-Empfehlung: M3 Ultra 512 GB für Qwen 32B und Llama 405B

Kontext (2-3 Saetze): Die Benchmarks vergleichen die Leistung von fünf Modellen bei sechs Quantisierungsebenen und sieben Kontextlängen. Die Ergebnisse zeigen, dass die Kontextlänge einen größeren Einfluss auf die Leistung hat als die Quantisierung, was für die Wahl der Hardware und die Optimierung von Workloads wichtig ist.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Der Bericht zeigt, dass Kimi-K3 auf einem 4-knotigen M3 Ultra Cluster lauffähig ist, aber die Leistung durch dispatch-bound Decode eingeschränkt wird, was für die Optimierung von Claude-ähnlichen Anwendungen relevant ist.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s (batch 1), 21.2 tok/s (32 concurrent)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB für Kimi-K3

Kontext (2-3 Saetze): Der Bericht beschreibt die Leistung von Kimi-K3 auf einem 4-knotigen M3 Ultra Cluster. Die Decode-Leistung ist dispatch-bound, was bedeutet, dass die Leistung durch die dispatch-Overhead eingeschränkt wird. Dies ist ein wichtiger Punkt für die Optimierung von großen Modellen auf Apple Silicon.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion erkundet die Möglichkeiten der Quantisierung bei sehr niedrigen Bit-Raten, was für die Effizienz und Leistung von OpenCode-Workloads auf Apple Silicon relevant ist.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Die Diskussion fokussiert sich auf die Quantisierung von Modellen bei sehr niedrigen Bit-Raten (1-2 Bit) und die Verwendung von benutzerdefinierten Packern. Dies ist besonders relevant für die Effizienz und Leistung von großen Modellen auf Apple Silicon.

Overview of three perf PRs for LLM inference (#3918, #3919, #3920) (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese drei Performance-PRs verbessern die Leistung von LLM-Inferenz auf Apple Silicon, was für die Optimierung von OpenCode-Workloads entscheidend ist.
Hardware: M3 Max
Modell: Qwen3.6-35B-A3B
tok/s-Claim: +6.2% MoE prefill, +2.8% prefill end to end, +2.0 to 2.8% decode
Cluster-Bezug: Single-Node
Investment-Empfehlung: M3 Max für Qwen3.6-35B-A3B

Kontext (2-3 Saetze): Die PRs verbessern die Leistung von LLM-Inferenz in verschiedenen Phasen, einschließlich Gather, SDPA Ops und Eval. Die Verbesserungen sind signifikant und können die Leistung von OpenCode-Workloads erheblich steigern.

JACCL Recv/Send -12 on 4-node TB5 after a successful first generate (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Dieser Bericht beschreibt ein Problem mit JACCL auf einem 4-knotigen TB5-Cluster, das die Stabilität und Leistung von verteilten Modellen beeinträchtigen kann.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s (erster Generate)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB für DeepSeek-V4-Pro-0813

Kontext (2-3 Saetze): Der Bericht beschreibt ein JACCL-Problem auf einem 4-knotigen TB5-Cluster, das nach einem erfolgreichen ersten Generate auftritt. Dies kann die Stabilität und Leistung von verteilten Modellen beeinträchtigen und weiter untersucht werden muss.

Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Vorschläge zur CPU/GPU-Dispatch-Heuristik und GPU-seitigen erweiterten Präzision können die Leistung und Effizienz von MLX-Workloads auf Apple Silicon verbessern.
Hardware: Apple Silicon Mac, 34GB unified memory
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Die Vorschläge zielen darauf ab, die Leistung und Präzision von MLX-Workloads durch automatische CPU/GPU-Dispatch-Heuristik und GPU-seitige erweiterte Präzision zu verbessern. Dies kann die Effizienz und Leistung von lokalen KI-Agenten erheblich steigern.

THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO (6/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Dieser Beitrag kritisiert die Entscheidung von Apple, die Mac Studio-Versionen mit weniger Speicher zu verkaufen, was für Nutzer, die große Modelle betreiben möchten, problematisch sein kann.
Hardware: Mac Studio, MacBook Pro
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: MacBook Pro M5 Max 128 GB

Kontext (2-3 Saetze): Der Beitrag kritisiert, dass die Mac Studio-Versionen mit weniger Speicher angeboten werden, während der MacBook Pro M5 Max 128 GB Speicher hat. Dies kann für Nutzer, die große Modelle betreiben möchten, ein Problem darstellen.

Weitere Diskussionen:

Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)
Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the frontier?
Can you stop gradients for part of a tensor?
MLX Community Projects

👁 2 Aufrufe 👤 2 Leser