MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt von Apple entwickelt sich kontinuierlich weiter, insbesond

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt von Apple entwickelt sich kontinuierlich weiter, insbesondere im Bereich der lokalen KI-Agenten auf Apple Silicon. Die Community diskutiert aktuell intensiv über die Unterstützung neuer Modelle, die Performance von verteilten Systemen und die Effizienz von Quantisierungstechniken. Für Nutzer, die OpenCode-Workloads auf hochleistungsfähigen Mac Studios oder Clustern ausführen möchten, bieten diese Diskussionen wertvolle Einblicke.

[Kimi-K3 (2.78T) in TP4 auf vier M3 Ultras — dispatch-bound decode, und einige Dinge, die ich bisher falsch hatte [laufende Debugging]](9/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Discussion zeigt, dass der Betrieb von großen Modellen wie Kimi-K3 auf einem Mac Studio Cluster möglich ist, aber die Performance bei kleinem Batch-Size durch dispatch-bound Decode eingeschränkt ist.

Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate at 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4x Mac Studio M3 Ultra 512 GB für Kimi-K3

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, welche Herausforderungen beim Betrieb von großen Modellen auf Apple Silicon auftreten und wie diese gelöst werden können. Besonders interessant sind die Detailinformationen zur Performance und den Debugging-Schritten.

[Systematische Inferenz-Benchmarks: 5 Modelle × 6 Quantisierungen × 7 Kontextlängen auf M3 Ultra](9/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): Diese Benchmarks liefern wertvolle Einblicke in die Performance von verschiedenen Modellen und Quantisierungen auf Apple Silicon, insbesondere bei langen Kontexten.

Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: Detaillierte TPS-Werte für verschiedene Konfigurationen
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB für optimale Performance bei langen Kontexten

Kontext (2-3 Saetze): Der Leser sollte die Benchmarks prüfen, um die besten Konfigurationen für seine spezifischen Anforderungen zu finden. Besonders interessant sind die Erkenntnisse zur Bedeutung der Kontextlänge im Vergleich zur Quantisierung.

[MacProvider — MLX-LM-Endpunkte über das Internet erreichbar machen, mit verifizierbarer Inferenz](8/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Modelle über das Internet zu erreichen, was für Anwendungen wie lokale Agenten oder Workflows, die häufig auf Modelle zugreifen, sehr nützlich sein kann.

Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, wie MacProvider funktioniert und welche Vorteile es bietet, insbesondere in Bezug auf Authentifizierung, Routing und verifizierbare Inferenz.

[Field report: Qwen3.8-2.4T-A95B in TP4 auf vier M3 Ultras (frühe Zahlen)](8/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Der Betrieb von Qwen3.8-2.4T auf einem Cluster von vier M3 Ultras ist möglich, aber die Performance hängt stark von der Quantisierung ab.

Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4x Mac Studio M3 Ultra 512 GB für Qwen3.8-2.4T

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, welche Herausforderungen beim Betrieb von Qwen3.8-2.4T auf Apple Silicon auftreten und wie diese gelöst werden können. Besonders interessant sind die Detailinformationen zur Quantisierung und der Speicherverbrauch.

[Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers](7/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Diskussion erkundet die Möglichkeiten der effizienten Quantisierung bei sehr niedrigen Bit-Raten, was für den Betrieb großer Modelle auf Apple Silicon relevant sein kann.

Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, welche Ansätze zur effizienten Quantisierung existieren und wie diese auf MLX angewendet werden können. Besonders interessant sind die Vergleiche zu anderen Frameworks wie GGUF.

[MacOS MLX Control Center v0.4 Released](6/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Die Release eines GUI-Tools für MLX auf macOS kann die Nutzung von MLX-Modellen für Nutzer ohne tiefgehende technische Kenntnisse erleichtern.

Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, welche Funktionen das MLX Control Center bietet und wie es die Nutzung von MLX-Modellen vereinfachen kann. Besonders interessant sind die neuen Features in Version 0.4.

Weitere Diskussionen:

MLX Community Projects
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
Can you stop gradients for part of a tensor?
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)

👁 0 Aufrufe 👤 0 Leser