MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt von Apple ist derzeit in vollem Schwung, insbesondere bei

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt von Apple ist derzeit in vollem Schwung, insbesondere bei der Entwicklung von lokalen LLMs auf Apple Silicon. Die Community arbeitet intensiv an der Verbesserung der Performance, der Unterstützung neuer Modelle und der Integration in verteilte Systeme. Für Entwickler, die OpenCode-Workloads auf ihren Macs laufen lassen möchten, bieten sich interessante Fortschritte, aber auch Herausforderungen.

[Kimi-K3 (2.78T) in TP4 auf vier M3 Ultras — dispatch-bound decode, und einige Dinge, die ich falsch hatte [laufende Debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Discussion zeigt, dass Kimi-K3 auf einem EXO-Cluster lauffähig ist, aber die Performance bei Batch-1 ist dispatch-bound, was für Claude-ähnliche Workloads kritisch sein kann.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate at 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4x Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte sich die Performance-Messungen und die Debugging-Schritte ansehen, um zu verstehen, welche Optimierungen notwendig sind, um die dispatch-bound Probleme zu lösen. Besonders interessant sind die Messungen zur Bandbreite und den Overhead-Problemen.

Systematische Inferenz-Benchmarks: 5 Modelle × 6 Quantisierungen × 7 Kontextlängen auf M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese Benchmarks zeigen, dass die Kontextlänge stärker als die Quantisierung die Performance beeinflusst, was für Claude-ähnliche Workloads mit langen Kontexten wichtig ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: Detaillierte TPS-Werte für verschiedene Konfigurationen
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB (~10.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die detaillierten TPS-Werte und die TTFT-Messungen prüfen, um zu verstehen, wie verschiedene Modelle und Quantisierungen sich bei unterschiedlichen Kontextlängen verhalten. Besonders interessant sind die Vergleiche zwischen MoE-Modellen und dichten Modellen.

MacProvider — MLX-Endpoints über das Internet ansprechbar machen, mit verifizierbarer Inferenz (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für verteilte Workflows nützlich sein kann, aber keine direkte Cluster-Unterstützung bietet.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte sich die Architektur von MacProvider ansehen, um zu verstehen, wie MLX-Endpoints sicher über das Internet ansprechbar gemacht werden können. Besonders interessant sind die verifizierbaren Inference-Receipts.

Field report: Qwen3.8-2.4T-A95B in TP4 auf vier M3 Ultras (frühe Zahlen) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Qwen3.8-2.4T läuft auf einem EXO-Cluster, aber die Performance bei 4-bit Quantisierung ist kritisch für Claude-ähnliche Workloads.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4x Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die detaillierten Messungen zur Speicheranforderung und der Performance prüfen, um zu verstehen, ob die 4-bit Quantisierung für seine Workloads geeignet ist. Besonders interessant sind die Vergleiche zur 8-bit Quantisierung.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Discussion erkundet die Möglichkeiten der sub-2-bit Quantisierung, was für Claude-ähnliche Workloads mit hohen Anforderungen an die Modellgröße relevant sein kann.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Diskussion über die sub-2-bit Quantisierung und die benutzerdefinierten Packer prüfen, um zu verstehen, welche Optimierungen für seine Modelle möglich sind. Besonders interessant sind die Vergleiche zu anderen Quantisierungsmethoden.

THE MACBOOK PRO Hält mehr Modellgewichte als der MAC STUDIO (6/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Diese Diskussion zeigt, dass der MacBook Pro mehr Speicher hat als der Mac Studio, was für die Wahl der Hardware bei der Erstellung eines lokalen KI-Setups relevant sein kann.
Hardware: MacBook Pro M5 Max 128 GB, Mac Studio 96 GB
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: MacBook Pro M5 Max 128 GB (~3.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Diskussion über die Speicherbegrenzungen des Mac Studio lesen, um zu verstehen, warum der MacBook Pro in manchen Fällen eine bessere Wahl sein kann. Besonders interessant sind die Überlegungen zur Zukunft des Home-Servers.

Weitere Diskussionen:

MLX Community Projects
MacOS MLX Control Center v0.4 Released
Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Can you stop gradients for part of a tensor?
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)

👁 2 Aufrufe 👤 2 Leser