MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt von Apple ist derzeit in hohem Tempo weiterentwickelt, um

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt von Apple ist derzeit in hohem Tempo weiterentwickelt, um lokale LLMs auf Apple Silicon effizient zu betreiben. Besonders interessant für die OpenCode-Workloads sind Themen wie Modell-Support, Quantisierung, Performance und verteilte Systeme. In diesem Artikel analysieren wir aktuelle Diskussionen aus der MLX-Community, um herauszufinden, welche Hardware-Investitionen sinnvoll sind, um Claude-ähnliche Leistungen zu erzielen.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Modelle über das Internet zu erreichen, was für lokal betriebene KI-Agenten wie OpenCode sehr relevant ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): MacProvider ist ein Projekt, das MLX-Modelle auf Apple Silicon über das Internet erreichbar macht. Es bietet Authentifizierung, Routing und verifizierbare Inferenz, was die Anwendung von lokal betriebenen KI-Agenten erheblich erweitert.

Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (9/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die Field-Report zeigt, dass das Qwen3.8-2.4T-Modell auf einem 4-Node-Cluster mit M3 Ultra 512 GB lauffähig ist, aber die Performance bei 4-bit Quantisierung kritisch ist.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s (erster Generate), 128 tokens
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB für 2 TB Unified Memory

Kontext (2-3 Saetze): Der Bericht gibt Einblicke in die Performance und Stabilität des Qwen3.8-2.4T-Modells auf einem 4-Node-Cluster. Die 4-bit Quantisierung ist notwendig, um das Modell auf den verfügbaren 512 GB Unified Memory pro Node zu bekommen, was die Performance beeinträchtigt.

Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Die Benchmarks zeigen, dass der Kontextlänge eine größere Rolle bei der Performance zukommt als der Quantisierung, was für die Wahl der Hardware und Modelle bei OpenCode entscheidend ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: 10.4 tok/s (F16, 1K), 47.6 tok/s (Q2, 1K)
Cluster-Bezug: Single-Node
Investment-Empfehlung: M3 Ultra 512 GB für 128k Kontexte

Kontext (2-3 Saetze): Die Benchmarks vergleichen verschiedene Modelle, Quantisierungen und Kontextlängen. Besonders interessant ist, dass die Kontextlänge die Performance stärker beeinflusst als die Quantisierung, was bei der Wahl der Hardware berücksichtigt werden sollte.

JACCL Recv/Send -12 on 4-node TB5 after a successful first generate (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Der Bericht über JACCL-Fehler bei der zweiten Generate-Anfrage auf einem 4-Node-Cluster zeigt, dass die Stabilität bei verteilten Systemen weiter verbessert werden muss.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s (erster Generate), 128 tokens
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB für 2 TB Unified Memory

Kontext (2-3 Saetze): Der Bericht beschreibt JACCL-Fehler, die nach der ersten Generate-Anfrage auftreten. Dies zeigt, dass die Stabilität bei verteilten Systemen weiter verbessert werden muss, um kontinuierliche Inferenz zu gewährleisten.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (6/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die Diskussion über sehr niedrige Quantisierung (<= 2 bit) zeigt, dass es Potenzial gibt, die Modellgröße zu reduzieren, aber die Qualität und Performance müssen sorgfältig abgewogen werden.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Die Diskussion erkundet die Möglichkeiten der sehr niedrigen Quantisierung (<= 2 bit) und die Verwendung von benutzerdefinierten Packern, um die Modellgröße zu reduzieren. Dies könnte für die Betriebsumgebung von OpenCode relevant sein, aber die Qualität und Performance müssen sorgfältig abgewogen werden.

THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO (6/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Der Vergleich zwischen MacBook Pro und Mac Studio zeigt, dass der MacBook Pro mehr Speicher hat, was für die Betreibung von LLMs relevant ist, aber nicht direkt auf OpenCode zutrifft.
Hardware: MacBook Pro M5 Max 128 GB, Mac Studio 96 GB
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: MacBook Pro M5 Max 128 GB

Kontext (2-3 Saetze): Der Beitrag kritisiert, dass der MacBook Pro mehr Speicher hat als der Mac Studio. Dies ist relevant für die Betreibung von LLMs, aber es gibt keine direkte Anwendung auf OpenCode.

Weitere Diskussionen:

Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)
Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the frontier?
MLX Community Projects
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
– [Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939)
Can you stop gradients for part of a tensor?

👁 0 Aufrufe 👤 0 Leser