MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt von Apple ist derzeit in hohem Tempo in Entwicklung, insbe

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt von Apple ist derzeit in hohem Tempo in Entwicklung, insbesondere im Bereich der lokalen KI-Agenten auf Apple Silicon. Die Community arbeitet intensiv an der Verbesserung der Performance, der Unterstützung neuer Modelle und der Optimierung der Hardware-Nutzung. Für Entwickler, die Claude-ähnliche Leistungen auf Mac Studio oder EXO-Clustern anstreben, bieten diese Diskussionen wertvolle Einblicke in die aktuelle Entwicklung und die Möglichkeiten von MLX.

[Kimi-K3 (2.78T) in TP4 auf vier M3 Ultras — dispatch-bound decode, und einige Dinge, die ich falsch hatte [laufende Debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion zeigt, dass Kimi-K3 (2.78T) auf einem EXO-Cluster von vier M3 Ultras lauffähig ist, aber die Performance durch dispatch-bound Decode eingeschränkt wird.

Hardware: 4x Mac Studio M3 Ultra 512 GB, Thunderbolt 5
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4x M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte sich auf die Performance-Optimierung konzentrieren, insbesondere auf die dispatch-bound Decode-Problematik. Die Diskussion bietet wertvolle Einblicke in die aktuelle Debugging-Phase und die Herausforderungen bei der Ausführung großer Modelle auf Apple Silicon.

Systematische Inferenz-Benchmarks: 5 Modelle × 6 Quantisierungen × 7 Kontextlängen auf M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese Benchmarks zeigen, dass die Kontextlänge einen größeren Einfluss auf die Performance als die Quantisierung hat, was für die Wahl der Hardware und der Modell-Größe entscheidend ist.

Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: Detaillierte TPS-Werte für verschiedene Konfigurationen
Cluster-Bezug: Single-Node
Investment-Empfehlung: M3 Ultra 512 GB (~10.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte sich die detaillierten Benchmarks ansehen, um die besten Konfigurationen für seine spezifischen Anforderungen zu finden. Die Diskussion bietet wertvolle Erkenntnisse über die Performance-Optimierung bei langen Kontexten und MoE-Modellen.

MacOS MLX Control Center v0.4 Released (6/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die MacOS MLX Control Center v0.4 bietet eine benutzerfreundliche GUI für MLX, die die Verwaltung und den Einsatz von Modellen auf Apple Silicon erleichtert.

Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die neuen Features der Control Center v0.4 prüfen, um die Benutzerfreundlichkeit und die Effizienz bei der Modell-Verwaltung zu verbessern. Die Diskussion bietet eine Übersicht der Funktionen und der Installation.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für die Integration in Cloud-Workflows und die Verifizierung von Inferenzen nützlich ist.

Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte sich die Funktionalität von MacProvider ansehen, um die Erreichbarkeit von MLX-Endpoints über das Internet zu verbessern. Die Diskussion bietet Einblicke in die Architektur und die Verifizierung von Inferenzen.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion erkundet die Möglichkeiten der effizienten Quantisierung bei sehr niedriger Bit-Genauigkeit, was für die Reduzierung der Modellgröße und die Steigerung der Performance relevant ist.

Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte sich die Ansätze zur effizienten Quantisierung ansehen, um die Modellgröße zu reduzieren und die Performance zu verbessern. Die Diskussion bietet wertvolle Erkenntnisse über die Verwendung von K-quant und anderen Techniken.

Symbio: Self fine tuning ai agents (6/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Symbio ist ein lokales AI-Agenten-Framework, das die kontinuierliche Anpassung und Feinabstimmung von Modellen auf Apple Silicon ermöglicht.

Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte sich Symbio ansehen, um die kontinuierliche Anpassung und Feinabstimmung von Modellen zu erleichtern. Die Diskussion bietet eine Übersicht der Funktionalität und der Implementierung.

THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO (5/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Diese Diskussion kritisiert die Speicherbegrenzung des Mac Studio im Vergleich zum MacBook Pro, was für die Wahl der Hardware relevant sein kann.

Hardware: Mac Studio, MacBook Pro
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: MacBook Pro 16″ mit M5 Max (~4.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Speicherbegrenzungen des Mac Studio im Vergleich zum MacBook Pro prüfen, um die beste Wahl für seine Anforderungen zu treffen. Die Diskussion bietet kritische Einblicke in die Hardware-Entscheidungen von Apple.

Weitere Diskussionen:

MLX Community Projects
Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers)
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)

👁 1 Aufrufe 👤 1 Leser