MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt ist derzeit in hohem Tempo aktiv, insbesondere im Bereich

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt ist derzeit in hohem Tempo aktiv, insbesondere im Bereich der Unterstützung neuer Modelle, der Optimierung der Leistung und der Verbesserung der Cluster-Integration. Apple-LLMs sind dabei, sich zu einem wichtigen Bestandteil des OpenCode-Workloads zu entwickeln, insbesondere für Anwendungen, die hohe Datenschutzstandards und lokale Verarbeitung erfordern.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für die Integration in OpenCode-Projekte und die Erweiterung der Anwendbarkeit von Apple-Silicon-LLMs entscheidend ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): MacProvider ist ein Projekt, das MLX-Endpoints über das Internet erreichbar macht, was für Anwendungen wie long-running personal agents, privacy-sensitive tooling und dev workflows wichtig ist. Der Fokus liegt auf Authentifizierung, Routing und verifizierbaren Inferenzen, was die Vertrauenswürdigkeit der Anwendungen erhöht.

Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (9/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Field-Report zeigt, dass das Qwen3.8-2.4T-Modell auf einem 4-node M3 Ultra Cluster lauffähig ist, aber die Leistung und die Anwendung als echtes Qwen3.8-Modell noch nicht vollständig bestätigt wurde.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s bei 128 Token
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB für 2 TB Unified Memory

Kontext (2-3 Saetze): Der Bericht beschreibt die Initialisierung und das Laufen des Qwen3.8-2.4T-Modells auf einem 4-node M3 Ultra Cluster. Es wird auf die Notwendigkeit der 4-bit Quantisierung und die Herausforderungen bei der Verwendung als echtes Qwen3.8-Modell eingegangen.

Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese systematischen Benchmarks zeigen, dass der Kontextlänge bei der Leistung von MLX-Modellen auf Apple Silicon eine größere Bedeutung zukommt als der Quantisierung, was für die Optimierung von OpenCode-Projekten entscheidend ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: 19.7 tok/s (Qwen 32B, Q4, 1K Kontext)
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB

Kontext (2-3 Saetze): Die Benchmarks umfassen 5 Modelle, 6 Quantisierungen und 7 Kontextlängen. Die Ergebnisse zeigen, dass die Kontextlänge einen größeren Einfluss auf die Tokens pro Sekunde (TPS) hat als die Quantisierung, insbesondere bei langen Kontexten.

JACCL Recv/Send -12 on 4-node TB5 after a successful first generate (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion beleuchtet ein technisches Problem bei der Verwendung von JACCL in einem 4-node Thunderbolt 5 Cluster, das die Stabilität und Leistung von MLX-Modellen beeinflusst.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s bei 128 Token
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB für 2 TB Unified Memory

Kontext (2-3 Saetze): Das Problem tritt auf, wenn nach einem erfolgreichen ersten Generate ein weiterer Generate-Vorgang durchgeführt wird. Es wird auf die Notwendigkeit einer tiefgreifenden Analyse und möglicher Workarounds eingegangen, um die Stabilität des Clusters zu gewährleisten.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion erkundet die Möglichkeiten der aggressiven Quantisierung bei MLX, insbesonderheit die Verwendung von sub-2-bit und ternären Packern, um die Modellgröße zu reduzieren und die Leistung zu verbessern.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Fokus liegt auf der Entwicklung von benutzerdefinierten Quantisierungs- und Packermethoden, um die Modellgröße zu reduzieren und die Leistung zu optimieren. Es werden Inspirationen aus anderen Projekten wie GGUF und llama.cpp diskutiert.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Der Bericht beschreibt die Leistung und die Herausforderungen bei der Ausführung des Kimi-K3-Modells auf einem 4-node M3 Ultra Cluster, wobei die Decode-Leistung dispatch-bound ist und nicht von der Bandbreite begrenzt wird.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: 2.0 tok/s (batch 1), 21.2 tok/s (32 concurrent)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB für 2 TB Unified Memory

Kontext (2-3 Saetze): Die Analyse zeigt, dass die Decode-Leistung hauptsächlich durch die Dispatch-Overhead begrenzt ist. Es werden verschiedene Optimierungen und Debugging-Schritte diskutiert, um die Leistung zu verbessern.

Overview of three perf PRs for LLM inference (#3918, #3919, #3920) (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Übersicht präsentiert drei Performance-PRs, die die Leistung von LLM-Inferenz auf Apple Silicon verbessern, insbesondere bei der Prefill- und Decode-Phase.
Hardware: Mac Studio M3 Max
Modell: Qwen3.6-35B-A3B
tok/s-Claim: +6.2% MoE prefill, +2.8% prefill end to end, +2.0 to 2.8% decode
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Max

Kontext (2-3 Saetze): Die PRs adressieren verschiedene Phasen der Inferenz, wie die Tile-Größe in `gather_qmm_rhs`, die Fusionsoptimierung in `SDPA ops fallback` und die Reduzierung von CPU-Overhead in `eval_impl` und `gather_mm`.

Weitere Diskussionen:

Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)
Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the frontier?

👁 3 Aufrufe 👤 3 Leser