MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt von Apple ist derzeit in hohem Tempo in Entwicklung, insbe

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt von Apple ist derzeit in hohem Tempo in Entwicklung, insbesondere im Bereich der lokalen Ausführung von großen Sprachmodellen (LLMs) auf Apple Silicon. Die Community konzentriert sich auf die Optimierung der Performance, die Unterstützung neuer Modelle und die Verbesserung der Tool-Calling-Qualität. Für Nutzer, die OpenCode-Workloads auf Mac Studio oder EXO-Clusters ausführen möchten, sind diese Entwicklungen von großer Bedeutung.

[MacOS MLX Control Center v0.4 Released] (5/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Ein einfaches GUI für MLX auf MacOS, das die Integration mit Hugging Face vereinfacht, kann nützlich sein, aber es ist kein zentrales Werkzeug für OpenCode-Workloads.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte das Tool ausprobieren, um zu sehen, ob es die Benutzerfreundlichkeit von MLX auf MacOS verbessert. Es ist besonders nützlich für Anfänger, die eine grafische Oberfläche bevorzugen.

[MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference] (8/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für OpenCode-Workloads, die auf mehreren Geräten laufen, sehr nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte MacProvider prüfen, um zu sehen, ob es die Remote-Zugriffsfähigkeit von MLX-Endpoints verbessert. Besonders interessant ist die verifizierbare Inference, die die Transparenz und Sicherheit erhöht.

[Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers)] (9/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Dieser Field Report zeigt, dass das Qwen3.8-2.4T-Modell auf einem 4-node M3 Ultra Cluster laufen kann, aber die Performance und die Nützlichkeit für OpenCode-Workloads noch bewertet werden müssen.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: ~19 tok/s (nicht final)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Performance-Zahlen und die Stabilität des Modells prüfen, um zu entscheiden, ob es für seine Anwendungen geeignet ist. Die 4-bit Quantisierung ist entscheidend für die Ausführbarkeit auf diesem Hardware-Setup.

[Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra] (9/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): Diese Benchmarks liefern wertvolle Einblicke in die Performance von verschiedenen Modellen und Quantisierungen auf dem M3 Ultra, was für die Wahl der richtigen Hardware und Konfiguration für OpenCode-Workloads hilfreich ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: Q2: 47.6 tok/s (1K context), 9.3 tok/s (128K context)
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB (~10.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Benchmarks prüfen, um zu verstehen, wie Context-Länge und Quantisierung die Performance beeinflussen. Besonders interessant ist der Vergleich zwischen verschiedenen Modellen und Quantisierungen.

[Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers] (7/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Diskussion über niedrig-bpw Quantisierung und benutzerdefinierte Packer ist für Nutzer interessant, die die Modellgröße reduzieren und die Performance optimieren möchten.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die verschiedenen Ansätze zur Quantisierung prüfen, um zu sehen, welche Methode für seine spezifischen Anforderungen am besten geeignet ist. Die Diskussion bietet wertvolle Einblicke in die Herausforderungen und Möglichkeiten.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]] (8/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Dieser Report zeigt, dass Kimi-K3 auf einem 4-node M3 Ultra Cluster laufen kann, aber die Performance ist dispatch-bound, was für OpenCode-Workloads relevant ist.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s (batch 1), 21.2 tok/s (32 concurrent)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Performance-Zahlen und die Debugging-Ergebnisse prüfen, um zu verstehen, welche Faktoren die Performance beeinflussen. Die dispatch-bound Decode-Performance ist besonders relevant für die Optimierung.

[Overview of three perf PRs for LLM inference (#3918, #3919, #3920)] (7/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese PRs verbessern die Performance von LLM-Inferenz auf Apple Silicon, was für die Optimierung von OpenCode-Workloads relevant ist.
Hardware: Mac Studio M3 Max
Modell: Qwen3.6-35B-A3B
tok/s-Claim: +6.2% MoE prefill, +2.8% prefill end-to-end, +2.0 to 2.8% decode
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die PRs prüfen, um zu verstehen, welche Optimierungen implementiert wurden und wie sie die Performance verbessern. Besonders interessant sind die Verbesserungen in den Gather- und SDPA-Operationen.

[Symbio: Self fine tuning ai agents] (6/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Symbio ist ein lokaler AI-Agent, der sich selbst feintunen kann, was für OpenCode-Workloads, die kontinuierlich verbessert werden sollen, interessant sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte Symbio ausprobieren, um zu sehen, ob die automatische Feintuning-Funktion für seine Anwendungen nützlich ist. Besonders interessant ist die Integration von LoRA-Feintuning.

Weitere Diskussionen:

Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)

👁 2 Aufrufe 👤 2 Leser