MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt von Apple entwickelt sich kontinuierlich weiter, insbesond

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt von Apple entwickelt sich kontinuierlich weiter, insbesondere im Bereich der lokalen KI-Agenten auf Apple Silicon. Aktuell steht der Fokus auf der Verbesserung der Performance, der Unterstützung neuer Modelle und der Integration in verteilte Systeme. Für Nutzer, die OpenCode als Agenten-Tool einsetzen, sind insbesondere die Fortschritte in der Modell-Unterstützung, der Quantisierung und der Cluster-Integration von Bedeutung.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für die Integration in OpenCode-Workloads und die Verwendung von lokalen KI-Agenten entscheidend ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): MacProvider ist ein Projekt, das MLX-Endpoints über das Internet erreichbar macht, was für Anwendungen wie long-running personal agents, privacy-sensitive tooling und dev workflows wichtig ist. Der Fokus liegt auf Authentifizierung, Routing und verifizierbarer Inference.

Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (9/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Der Field Report zeigt, dass das Qwen3.8-2.4T-Modell auf einem 4-Node-Cluster mit M3 Ultras lauffähig ist, aber die Performance bei langen Kontexten noch optimiert werden muss.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s bei 128 Tokens
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB für 2 TB Unified Memory

Kontext (2-3 Saetze): Der Field Report beschreibt die Initialisierung und die ersten Testergebnisse des Qwen3.8-2.4T-Modells auf einem 4-Node-Cluster mit M3 Ultras. Die Performance bei langen Kontexten wird noch verbessert, aber die grundlegende Funktionalität ist gegeben.

Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Die systematischen Benchmarks zeigen, dass der Kontextlänge bei der Performance eine größere Rolle zukommt als der Quantisierung, was für die Wahl der Hardware und Modelle bei OpenCode-Workloads entscheidend ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: 31.2 tok/s (Qwen 32B Q4 bei 1K Kontext), 68.4 tok/s (Mixtral 8x7B Q4 bei 1K Kontext)
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB für 32B-Modelle, 4× Mac Studio M3 Ultra 512 GB für 47B-Modelle

Kontext (2-3 Saetze): Die Benchmarks umfassen 5 Modelle, 6 Quantisierungen und 7 Kontextlängen. Die Ergebnisse zeigen, dass die Kontextlänge die Performance stärker beeinflusst als die Quantisierung, was bei der Wahl der Hardware und Modellgrößen berücksichtigt werden sollte.

JACCL Recv/Send -12 on 4-node TB5 after a successful first generate (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Der Fehler bei der JACCL-Kommunikation nach der ersten Generierung auf einem 4-Node-Cluster zeigt, dass die Stabilität bei verteilten Setups verbessert werden muss.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s bei 128 Tokens
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB für 2 TB Unified Memory

Kontext (2-3 Saetze): Der Fehler tritt nach der ersten Generierung auf und kann durch einen vollständigen Neustart des Clusters behoben werden. Die Ursache liegt möglicherweise in der JACCL-Kommunikation und der RDMA-Verbindung.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die Diskussion über die Effizienz von sehr niedriger Quantisierung zeigt, dass die optimale Bit-Allokation für Modelle wie Qwen weiter erforscht werden muss.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Die Diskussion fokussiert sich auf die Effizienz von sehr niedriger Quantisierung (1-2 Bit) und die Verwendung von K-quant-hierarchischen Skalierung. Die Ergebnisse könnten die Performance von Modellen wie Qwen auf Apple Silicon verbessern.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die Analyse der Performance von Kimi-K3 auf einem 4-Node-Cluster zeigt, dass die Dispatch-Bound-Decode die Hauptbremse für die Performance darstellt.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: 2.0 tok/s bei Batch 1, 21.2 tok/s aggregiert bei 32 konkurrierenden Streams
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB für 2 TB Unified Memory

Kontext (2-3 Saetze): Die Performance-Analyse von Kimi-K3 zeigt, dass die Dispatch-Bound-Decode die Hauptbremse für die Performance darstellt. Die Ergebnisse helfen bei der Optimierung von verteilten Setups und der Wahl der Hardware.

Overview of three perf PRs for LLM inference (#3918, #3919, #3920) (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die drei Performance-PRs verbessern die Decode- und Prefill-Performance von LLMs auf Apple Silicon, was die Gesamtleistung von OpenCode-Workloads erhöhen kann.
Hardware: Mac Studio M3 Max
Modell: Qwen3.6-35B-A3B
tok/s-Claim: +6.2% MoE prefill bei 32K Kontext, +2.8% Prefill end-to-end, +2.0 to 2.8% Decode
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Max für 35B-Modelle

Kontext (2-3 Saetze): Die drei PRs verbessern verschiedene Aspekte der LLM-Inference, darunter die Tile-Größe, die Fusions-Operationen und die CPU-Overhead-Reduktion. Die Ergebnisse zeigen signifikante Performance-Gewinne.

Weitere Diskussionen:

Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)
Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the frontier?
Can you stop gradients for part of a tensor?
MLX Community Projects

👁 1 Aufrufe 👤 1 Leser