MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt von Apple ist derzeit in vollem Schwung, insbesondere bei

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt von Apple ist derzeit in vollem Schwung, insbesondere bei der Entwicklung von lokalen KI-Agenten auf Apple Silicon. Die Community arbeitet intensiv an der Optimierung von Modellen, der Verbesserung der Performance und der Unterstützung neuer Modelle. Für Entwickler, die OpenCode-Workloads auf ihren Macs ausführen möchten, sind aktuelle Diskussionen besonders relevant, da sie Einblicke in die aktuelle Entwicklung und mögliche Workarounds bieten.

[Kimi-K3 (2.78T) in TP4 auf vier M3 Ultras — dispatch-bound decode, und einige Dinge, die ich falsch hatte [laufende Debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Discussion ist für jemanden, der Claude-Nähe auf Mac Studio anpeilt, sehr relevant, da sie detaillierte Informationen über die Performance und die Herausforderungen bei der Ausführung von großen Modellen wie Kimi-K3 auf Apple Silicon bietet.

Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate at 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte diese Discussion lesen, um Einblicke in die Performance-Optimierungen und die Herausforderungen bei der Ausführung von großen Modellen auf einem EXO-Cluster zu erhalten. Es werden detaillierte Messergebnisse und Debugging-Schritte beschrieben, die für die Entscheidung über die Hardwareauswahl und die Konfiguration hilfreich sein können.

MacOS MLX Control Center v0.4 Released (6/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Die Release eines MLX Control Center für MacOS ist für Entwickler relevant, die eine benutzerfreundliche GUI für die Verwaltung von MLX-Modellen auf ihren Macs suchen, aber es ist weniger spezifisch für die Anforderungen von OpenCode-Workloads.

Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte diese Discussion lesen, um eine Übersicht über die Funktionen und die Benutzerfreundlichkeit des MLX Control Center zu erhalten. Es ist besonders nützlich für Entwickler, die eine einfache Bedienoberfläche für die Verwaltung von MLX-Modellen auf ihren Macs benötigen.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): MacProvider ist eine interessante Lösung, um MLX-Modelle über das Internet erreichbar zu machen, was für Entwickler, die lokale KI-Agenten in der Cloud oder über verschiedene Geräte nutzen möchten, relevant sein kann.

Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte diese Discussion lesen, um zu verstehen, wie MacProvider MLX-Modelle über das Internet erreichbar macht und wie verifizierbare Inferenz sicherstellt, dass die Anfragen korrekt verarbeitet werden. Es ist besonders nützlich für Entwickler, die lokale KI-Agenten in der Cloud oder über verschiedene Geräte nutzen möchten.

Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese detaillierten Benchmark-Tests sind für Entwickler, die Claude-Nähe auf Mac Studio anpeilen, sehr relevant, da sie Einblicke in die Performance von verschiedenen Modellen und Quantisierungen bei unterschiedlichen Kontextlängen geben.

Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: Qwen 32B: 10.4 tok/s (F16, 1K), 5.5 tok/s (F16, 128K); Llama 405B: 37s (Q2, 1K), 10.3 min (Q2, 16K)
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB (~10.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte diese Discussion lesen, um detaillierte Benchmark-ergebnisse für verschiedene Modelle und Quantisierungen bei unterschiedlichen Kontextlängen zu erhalten. Es gibt wertvolle Erkenntnisse über die Performance-Optimierung und die Auswahl der besten Hardware für spezifische Anwendungen.

Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Dieser Field Report ist für Entwickler, die große Modelle wie Qwen3.8 auf Apple Silicon ausführen möchten, sehr relevant, da er detaillierte Informationen über die Ausführbarkeit und die Performance auf einem EXO-Cluster bietet.

Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte diese Discussion lesen, um zu verstehen, wie das Qwen3.8-Modell auf einem EXO-Cluster mit vier M3 Ultras ausgeführt werden kann. Es werden detaillierte Informationen über die Hardwareanforderungen, die Quantisierung und die Performance-Optimierung bereitgestellt.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Discussion ist für Entwickler, die sich mit der Quantisierung von Modellen auf sehr niedrigem Bit-Rate befassen, relevant, da sie Einblicke in fortgeschrittene Quantisierungstechniken und deren Anwendung auf MLX bietet.

Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte diese Discussion lesen, um zu verstehen, wie die Quantisierung von Modellen auf sehr niedrigem Bit-Rate optimiert werden kann. Es werden fortgeschrittene Techniken wie K-quant hierarchische Skalierung und benutzerdefinierte Packer diskutiert, die für die Effizienz und die Qualität von lokalen KI-Modellen wichtig sind.

THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO (5/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Diese Discussion ist für Entwickler, die sich über die Hardwareauswahl für MLX-Modelle informieren möchten, relevant, da sie auf eine unerwartete Beschränkung der Mac Studio im Vergleich zum MacBook Pro hinweist.

Hardware: Mac Studio 96GB, MacBook Pro 128GB
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: MacBook Pro 128GB (~2.500 EUR)

Kontext (2-3 Saetze): Der Leser sollte diese Discussion lesen, um zu verstehen, warum der MacBook Pro mehr Speicher hat als der Mac Studio und wie diese Beschränkung die Wahl der Hardware für MLX-Modelle beeinflusst. Es gibt auch kritische Anmerkungen zur Strategie von Apple bei der Hardwareentwicklung.

Weitere Diskussionen:

MLX Community Projects
Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)
Can you stop gradients for part of a tensor?
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)

👁 0 Aufrufe 👤 0 Leser