MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt ist derzeit stark in Bewegung, insbesondere im Bereich der

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt ist derzeit stark in Bewegung, insbesondere im Bereich der lokalen KI-Agenten auf Apple Silicon. Die Community arbeitet intensiv an der Verbesserung der Performance, der Modell-Unterstützung und der Skalierbarkeit auf mehreren Mac Studios. Für Nutzer, die OpenCode-Workloads auf Apple Silicon betreiben möchten, gibt es interessante Diskussionen, die die Entscheidung für eine Investition in Mac Studio oder Cluster-Betrieb beeinflussen können.

[JACCL Recv/Send -12 on 4-node TB5 after a successful first generate] (5/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Discussion zeigt Probleme bei der verteilten Ausführung von Modellen auf einem 4-Node-Cluster, was für den Betrieb von OpenCode auf Apple Silicon relevant ist.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s (erster Generate)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Nutzer beschreibt Probleme mit JACCL und RDMA auf einem 4-Node-Cluster, insbesondere bei der Ausführung von mehreren Generate-Vorgängen. Es gibt Fehlercodes -12, die auf Transport- oder Lebenszyklusprobleme hinweisen. Diese Diskussion ist wichtig für Nutzer, die verteilte Systeme betreiben möchten.

[Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers)] (7/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Field-Report zeigt, dass das Qwen3.8-2.4T-Modell auf einem 4-Node-Cluster lauffähig ist, aber die Performance und Stabilität noch verbessert werden müssen.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Multi-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Nutzer berichtet über die Ausführung des Qwen3.8-2.4T-Modells auf einem 4-Node-Cluster. Es wird beschrieben, dass das Modell lauffähig ist, aber die Performance und Stabilität noch verbessert werden müssen. Die Diskussion enthält wichtige Informationen für Nutzer, die große Modelle auf Apple Silicon betreiben möchten.

[Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers] (6/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Discussion erkundet fortgeschrittene Quantisierungstechniken, die für die Effizienz und Performance von Modellen auf Apple Silicon relevant sind.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Nutzer untersucht die Verwendung von sehr niedrigen Bitweiten (1-2 Bit) für die Quantisierung von Modellen. Es werden verschiedene Ansätze und Tools diskutiert, die die Effizienz und Performance von Modellen auf Apple Silicon verbessern können. Diese Diskussion ist für Nutzer interessant, die sich mit fortgeschrittener Quantisierung beschäftigen.

[Overview of three perf PRs for LLM inference (#3918, #3919, #3920)] (8/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): Diese Diskussion präsentiert drei Performance-Optimierungen, die die Ausführung von LLMs auf Apple Silicon erheblich verbessern können.
Hardware: M3 Max
Modell: Qwen3.6-35B-A3B
tok/s-Claim: +6.2% MoE prefill at 32K, +2.8% prefill end to end, +2.0 to 2.8% decode
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Nutzer präsentiert drei Pull Requests, die die Performance von LLMs auf Apple Silicon verbessern. Die Optimierungen betreffen verschiedene Phasen der Ausführung, wie z.B. die Kernel-Dispatch-Logik und die SDPA-Operationen. Diese Diskussion ist für Nutzer, die die Performance von LLMs auf Apple Silicon optimieren möchten, sehr relevant.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]] (7/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Diskussion zeigt, dass das Kimi-K3-Modell auf einem 4-Node-Cluster lauffähig ist, aber die Performance durch Dispatch-Bound-Decode eingeschränkt ist.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78 T params)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate at 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Nutzer beschreibt die Ausführung des Kimi-K3-Modells auf einem 4-Node-Cluster. Es wird festgestellt, dass die Performance durch Dispatch-Bound-Decode eingeschränkt ist. Die Diskussion enthält wichtige Informationen für Nutzer, die große Modelle auf Apple Silicon betreiben möchten.

[Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra] (9/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): Diese Diskussion präsentiert umfassende Benchmark-Tests, die die Performance von verschiedenen Modellen und Quantisierungsebenen auf Apple Silicon analysieren.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: 10.4-47.6 tok/s (abhängig von Modell und Quantisierung)
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Nutzer führt systematische Benchmark-Tests durch, um die Performance von verschiedenen Modellen und Quantisierungsebenen auf Apple Silicon zu analysieren. Die Ergebnisse zeigen, dass die Kontextlänge einen größeren Einfluss auf die Performance hat als die Quantisierung. Diese Diskussion ist für Nutzer, die die Performance von LLMs auf Apple Silicon optimieren möchten, sehr relevant.

[Symbio: Self fine tuning ai agents] (6/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Diskussion präsentiert ein lokales AI-Agenten-System, das automatisch Fehler korrigiert und sich selbst feintuningt.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Nutzer stellt Symbio vor, ein lokales AI-Agenten-System, das automatisch Fehler korrigiert und sich selbst feintuningt. Es verwendet MLX und LoRA für die dynamische Anpassung der Modelle. Diese Diskussion ist für Nutzer interessant, die sich mit lokalen AI-Agenten und automatischer Fehlerkorrektur beschäftigen.

[THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO] (4/10) — OpenCode-Fit: NEIN

Zur Discussion

Verdict (1 Satz): Diese Diskussion kritisiert die Entscheidung von Apple, den Mac Studio mit weniger Speicher auszustatten als den MacBook Pro.
Hardware: Mac Studio, MacBook Pro
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Nutzer kritisiert Apple dafür, dass der Mac Studio weniger Speicher hat als der MacBook Pro. Diese Diskussion ist eher allgemein und weniger spezifisch für die Ausführung von LLMs auf Apple Silicon.

Weitere Diskussionen:

Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)
Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the frontier?
atlas: measured-cost quantization for MLX — give it a RAM budget, it finds the optimal (bit-width, group-size) plan
mlx-serve: native Zig LLM server for Apple Silicon – OpenAI + Anthropic + Ollama APIs, no Python

👁 4 Aufrufe 👤 3 Leser