MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt von Apple's ML Research Team ist in stetem Aufschwung. Die

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt von Apple’s ML Research Team ist in stetem Aufschwung. Die Community diskutiert aktuell intensiv über neue Modelle, Quantisierungstechniken, Performance-Optimierungen und verteilte Systeme. Für Entwickler, die Claude-ähnliche Leistung auf Apple Silicon erreichen möchten, bieten diese Diskussionen wertvolle Einblicke in die Möglichkeiten und Herausforderungen.

[MacOS MLX Control Center v0.4 Released] (5/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Ein neues GUI für MLX auf MacOS, das die Integration mit Hugging Face vereinfacht, kann nützlich sein, aber ist eher für Anfänger geeignet.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Entwickler hat ein einfaches GUI für MLX erstellt, das die Arbeit mit Hugging Face vereinfacht. Es ist besonders nützlich für Entwickler, die eine benutzerfreundliche Oberfläche bevorzugen. Die neueste Version v0.4 bringt viele neue Features.

[MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference] (8/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für verteilte Anwendungen und Agenten sehr nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): MacProvider ist ein Projekt, das MLX-Endpoints über das Internet erreichbar macht. Es bietet Authentifizierung, Rate-Limiting und verifizierbare Inferenz, was die Verwendung von MLX in verteilten Anwendungen und Agenten erheblich verbessert. Besonders nützlich für Entwickler, die ihre Modelle über das Internet verfügbar machen möchten.

[Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers)] (9/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Ein früher Bericht über die Ausführung des Qwen3.8-2.4T-A95B-Modells auf vier M3 Ultra Mac Studios zeigt, dass es möglich ist, aber die Performance ist noch nicht optimal.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s bei 128 Tokens
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Dieser Bericht beschreibt die Ausführung des Qwen3.8-2.4T-A95B-Modells auf vier M3 Ultra Mac Studios. Die Modelle werden in 4-bit Quantisierung ausgeführt, um die Speicherkapazität zu nutzen. Die Performance ist stabil, aber die Auslastung der Hardware ist noch nicht optimal. Es wird empfohlen, die 4-bit Quantisierung weiter zu optimieren.

[Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra] (9/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): Systematische Benchmarks zeigen, dass der Kontextlänge bei der Performance von LLMs auf Apple Silicon eine größere Rolle zukommt als der Quantisierungsgrad.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: Q2: 9.3 tok/s bei 128K Kontext, F16: 5.5 tok/s bei 128K Kontext
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB (~10.000 EUR)

Kontext (2-3 Saetze): Diese Benchmarks vergleichen verschiedene Modelle, Quantisierungsgrade und Kontextlängen auf einem Mac Studio M3 Ultra. Die Ergebnisse zeigen, dass die Kontextlänge einen größeren Einfluss auf die Performance hat als die Quantisierung. Besonders nützlich für Entwickler, die optimierte Performance bei langen Kontexten benötigen.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]] (8/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Der Bericht über die Ausführung des Kimi-K3-Modells auf vier M3 Ultra Mac Studios zeigt, dass die Performance dispatch-bound ist und nicht durch Bandbreite begrenzt.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s bei batch 1, 21.2 tok/s aggregiert bei 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Bericht beschreibt die Ausführung des Kimi-K3-Modells auf vier M3 Ultra Mac Studios. Die Performance ist dispatch-bound, was bedeutet, dass die Dispatch-Overhead die Hauptbremse ist. Es werden auch einige offene Fragen und Debugging-Schritte diskutiert, die für die weitere Optimierung hilfreich sein können.

[Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers] (7/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Eine Diskussion über aggressive Quantisierungstechniken, die die Balance zwischen Qualität und Geschwindigkeit optimieren können.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Entwickler untersucht, wie die Quantisierung von Gewichten auf 1 bis 2 Bit die Modellgröße reduzieren und die Performance verbessern kann. Es werden verschiedene Ansätze und Tools diskutiert, die für die Optimierung von LLMs auf Apple Silicon hilfreich sein können.

[Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic] (6/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Vorschläge zur Optimierung der CPU/GPU-Dispatch-Heuristik und der GPU-seitigen numerischen Genauigkeit könnten die Performance von MLX verbessern.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Entwickler schlägt vor, eine automatische CPU/GPU-Dispatch-Heuristik und GPU-seitige erweiterte Präzision zu implementieren, um die Performance von MLX zu verbessern. Es werden verschiedene Benchmarks und Optimierungsmöglichkeiten diskutiert.

Weitere Diskussionen:

JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)

👁 0 Aufrufe 👤 0 Leser