MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt ist in ständigem Aufschwung, insbesondere im Bereich der lo

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt ist in ständigem Aufschwung, insbesondere im Bereich der lokalen KI-Agenten auf Apple Silicon. Die Community arbeitet intensiv an der Unterstützung neuer Modelle, der Optimierung der Performance und der Verbesserung der Tool-Calling-Qualität. Für Nutzer, die OpenCode-Workloads auf Mac Studio oder EXO-Clustern betreiben möchten, sind aktuelle Diskussionen und Fortschritte von großer Bedeutung.

JACCL Recv/Send -12 on 4-node TB5 after a successful first generate (6/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion zeigt Probleme bei der verteilten Ausführung von Modellen auf einem 4-Node-Cluster, was für den Betrieb von Claude-ähnlichen Workloads relevant ist.
Hardware: 4x Mac Studio M3 Ultra 512 GB, Thunderbolt 5
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s (erster Generate)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag beschreibt ein Problem mit JACCL und RDMA auf einem 4-Node-Cluster, das zu Abstürzen bei nachfolgenden Generate-Anfragen führt. Es wird empfohlen, die Diskussion zu prüfen, um Einsichten in die aktuelle Stabilität und mögliche Workarounds zu erhalten.

Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): Dieser Field Report zeigt, dass das Qwen3.8-2.4T-Modell auf einem 4-Node-Cluster lauffähig ist, aber die Performance und Stabilität noch verbessert werden müssen.
Hardware: 4x Mac Studio M3 Ultra 512 GB, Thunderbolt 5
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s (erster Generate)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag enthält eine detaillierte Analyse der Ausführung des Qwen3.8-2.4T-Modells auf einem 4-Node-Cluster. Es wird empfohlen, die Diskussion zu prüfen, um die aktuellen Herausforderungen und mögliche Optimierungen zu verstehen.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion erkundet die Möglichkeiten der effizienten Quantisierung bei sehr niedrigen Bit-Raten, was für die Optimierung von Modellen auf Apple Silicon relevant ist.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag diskutiert die Verwendung von K-quant-hierarchischen Skalierungen und sub-2-Bit/Pakern in MLX. Es wird empfohlen, die Diskussion zu prüfen, um die aktuellen Entwicklungen und Erfahrungen in der Quantisierung zu verstehen.

Overview of three perf PRs for LLM inference (#3918, #3919, #3920) (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese PRs verbessern die Performance von LLM-Inferenz auf Apple Silicon, was für den Betrieb von Claude-ähnlichen Workloads entscheidend ist.
Hardware: M3 Max
Modell: Qwen3.6-35B-A3B
tok/s-Claim: +6.2% MoE prefill at 32K, +2.8% prefill end to end, +2.0 to 2.8% decode
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Die PRs decken verschiedene Phasen der LLM-Inferenz ab und bieten signifikante Performance-Verbesserungen. Es wird empfohlen, die Diskussion zu prüfen, um die technischen Details und die Auswirkungen auf die Performance zu verstehen.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese Diskussion zeigt, dass Kimi-K3 auf einem 4-Node-Cluster lauffähig ist, aber die Performance durch dispatch-bound Decode eingeschränkt ist.
Hardware: 4x Mac Studio M3 Ultra 512 GB, Thunderbolt 5
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate at 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag enthält eine detaillierte Analyse der Performance von Kimi-K3 auf einem 4-Node-Cluster. Es wird empfohlen, die Diskussion zu prüfen, um die aktuellen Herausforderungen und mögliche Optimierungen zu verstehen.

Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese Benchmarks liefern wertvolle Einblicke in die Performance von verschiedenen Modellen und Quantisierungen auf Apple Silicon, was für den Betrieb von Claude-ähnlichen Workloads entscheidend ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: 10.4 tok/s (F16, 1K context), 47.6 tok/s (Q2, 1K context)
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Die Benchmarks decken verschiedene Modelle, Quantisierungen und Kontextlängen ab und liefern wertvolle Einblicke in die Performance. Es wird empfohlen, die Diskussion zu prüfen, um die Auswirkungen von Kontextlänge und Quantisierung auf die Performance zu verstehen.

Symbio: Self fine tuning ai agents (6/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Symbio ist ein lokaler AI-Agent, der sich selbst feintunen kann, was für den Betrieb von Claude-ähnlichen Workloads relevant ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag stellt Symbio vor, einen lokalen AI-Agenten, der sich selbst feintunen kann. Es wird empfohlen, die Diskussion zu prüfen, um die Funktionsweise und die Vorteile von Symbio zu verstehen.

Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%) (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion zeigt, dass die Performance von MoE-Modellen durch die Fusion von Experten-Gather-Operationen verbessert werden kann.
Hardware: M3 Ultra 512 GB
Modell: GLM-5.2
tok/s-Claim: ~51 ms/token (L=1), ~112 ms (L=2)
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag enthält eine detaillierte Analyse der Experten-Überlappung in MoE-Modellen und zeigt, wie die Performance durch die Fusion von Experten-Gather-Operationen verbessert werden kann. Es wird empfohlen, die Diskussion zu prüfen, um die technischen Details und die Auswirkungen auf die Performance zu verstehen.

THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO (5/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Diese Diskussion kritisiert die Speicherbegrenzungen des Mac Studio im Vergleich zum MacBook Pro, was für den Kaufentscheid relevant sein kann.
Hardware: Mac Studio, MacBook Pro
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag kritisiert die Entscheidung von Apple, den Mac Studio mit weniger Speicher auszustatten als den MacBook Pro. Es wird empfohlen, die Diskussion zu prüfen, um die Hintergründe und mögliche Auswirkungen auf den Kaufentscheid zu verstehen.

Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model) (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion zeigt, dass die KV-Memory von Gemma-3/4-Modellen unbeschränkt wächst, was für den Betrieb von Claude-ähnlichen Workloads relevant ist.
Hardware: nicht im Post belegt
Modell: Gemma-3/4
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag erklärt, warum die KV-Memory von Gemma-3/4-Modellen unbeschränkt wächst und wie dies umgangen werden kann. Es wird empfohlen, die Diskussion zu prüfen, um die technischen Details und mögliche Lösungen zu verstehen.

Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the frontier? (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion zeigt, dass die Performance von streaming-video VLMs auf Apple Silicon durch die LM-prefill-Bound eingeschränkt ist, was für den Betrieb von Claude-ähnlichen Workloads relevant ist.
Hardware: M3 Max
Modell: FastVLM-0.5B, FastVLM-1.5B, FastVLM-7B, Idefics3-8B
tok/s-Claim: 244 ms/frame (Idefics3-8B)
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag analysiert die Performance von streaming-video VLMs und zeigt, dass die LM-prefill-Bound die Hauptbegrenzung darstellt. Es wird empfohlen, die Diskussion zu prüfen, um die technischen Details und mögliche Optimierungen zu verstehen.

atlas: measured-cost quantization for MLX — give it a RAM budget, it finds the optimal (bit-width, group-size) plan (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion stellt ein neues Quantisierungstool vor, das die Performance und die Speicherverwendung von Modellen auf Apple Silicon optimiert.
Hardware: nicht im Post belegt
Modell: Qwen2.5-7B-Instruct, TinyLlama-1.1B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag stellt atlas vor, ein Quantisierungstool, das die Performance und die Speicherverwendung von Modellen optimiert. Es wird empfohlen, die Diskussion zu prüfen, um die technischen Details und die Vorteile von atlas zu verstehen.

mlx-serve: native Zig LLM server for Apple Silicon – OpenAI + Anthropic + Ollama APIs, no Python (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese Diskussion stellt mlx-serve vor, einen nativen Zig-Server für Apple Silicon, der OpenAI-, Anthropic- und Ollama-APIs unterstützt.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: 35%+ faster decode than LM Studio on Gemma 4 E4B 4-bit
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag stellt mlx-serve vor, einen nativen Zig-Server, der OpenAI-, Anthropic- und Ollama-APIs unterstützt und eine bessere Performance als LM Studio bietet. Es wird empfohlen, die Diskussion zu prüfen, um die technischen Details und die Vorteile von mlx-serve zu verstehen.

Weitere Diskussionen:
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers)
Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
– [Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939)
Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)
– [Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the

👁 5 Aufrufe 👤 5 Leser