MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt ist derzeit stark in Bewegung, insbesondere bei der Unters

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt ist derzeit stark in Bewegung, insbesondere bei der Unterstützung neuer Modelle und der Optimierung der Leistung auf Apple Silicon. Die Community arbeitet intensiv daran, lokale LLMs wie Qwen3, DeepSeek, und Kimi auf Mac Studio und Clustern zu betreiben, um Claude-ähnliche Leistungen zu erreichen. Dieser Artikel gibt einen Überblick über die aktuellsten Diskussionen, die für den Betrieb von OpenCode und ähnlichen Workloads relevant sind.

[Kimi-K3 (2.78T) in TP4 auf vier M3 Ultras — dispatch-bound decode, und einige Dinge, die ich falsch hatte [laufende Debugging]] (9/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Discussion zeigt, dass Kimi-K3 auf einem EXO-Cluster von vier M3 Ultras lauffähig ist, aber die Leistung durch dispatch-bound Decode eingeschränkt ist.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate at 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: EXO-Cluster für Kimi-K3, aber beachten Sie die Leistungsbeschränkungen.

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, welche Leistungsprobleme bei der Betriebslast auftreten und wie diese gelöst werden können. Es wird auch auf die Notwendigkeit eingegangen, die Hardware- und Software-Konfiguration sorgfältig zu optimieren.

[Systematische Inferenz-Benchmarks: 5 Modelle × 6 Quantisierungen × 7 Kontextlängen auf M3 Ultra] (8/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): Diese Benchmarks zeigen, dass die Kontextlänge einen größeren Einfluss auf die Leistung als die Quantisierung hat, was für den Betrieb von OpenCode relevant ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB für Modelle mit kurzen Kontexten, EXO-Cluster für lange Kontexte.

Kontext (2-3 Saetze): Der Leser sollte die Benchmarks prüfen, um die Leistung von verschiedenen Modellen und Quantisierungen bei unterschiedlichen Kontextlängen zu verstehen. Dies hilft bei der Entscheidung, welche Hardware für welche Workloads am besten geeignet ist.

[Field report: Qwen3.8-2.4T-A95B in TP4 auf vier M3 Ultras (frühe Zahlen)] (7/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Qwen3.8-2.4T-A95B kann auf einem EXO-Cluster von vier M3 Ultras laufen, aber die Leistung ist durch die 4-bit-Quantisierung begrenzt.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Multi-Node
Investment-Empfehlung: EXO-Cluster für Qwen3.8-2.4T-A95B, aber beachten Sie die Leistungsbeschränkungen durch 4-bit-Quantisierung.

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, welche Herausforderungen bei der Betriebslast auftreten und wie die 4-bit-Quantisierung die Leistung beeinflusst. Es wird auch auf die Notwendigkeit eingegangen, die Hardware- und Software-Konfiguration sorgfältig zu optimieren.

[Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers] (6/10) — OpenCode-Fit: NEIN

Zur Discussion

Verdict (1 Satz): Diese Diskussion behandelt die Entwicklung von benutzerdefinierten Quantisierungsmethoden für sehr niedrige Bit-Raten, was für den Betrieb von OpenCode weniger relevant ist.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, welche Ansätze für die Entwicklung von benutzerdefinierten Quantisierungsmethoden existieren. Dies ist eher für fortgeschrittene Benutzer und Entwickler relevant.

[MacOS MLX Control Center v0.4 Released] (5/10) — OpenCode-Fit: NEIN

Zur Discussion

Verdict (1 Satz): Diese Diskussion stellt ein GUI-Tool für MLX auf macOS vor, das für den Betrieb von OpenCode weniger relevant ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, welche Funktionen das MLX Control Center bietet und wie es die Benutzerfreundlichkeit von MLX verbessern kann. Dies ist eher für Anfänger und Benutzer, die eine einfache Benutzeroberfläche suchen.

Weitere Diskussionen:

MLX Community Projects
MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference
Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)

👁 1 Aufrufe 👤 1 Leser