MLX-Community: Apple Silicon für lokale KI-Agenten
Das MLX-Projekt ist derzeit in hohem Tempo aktiv, insbesondere im Bereich der lokalen KI-Agenten auf Apple Silicon. Die Community arbeitet intensiv an der Optimierung von Modellen, der Verbesserung der Performance und der Unterstützung neuer Modelle. Für Entwickler, die an Claude-ähnlichen Leistungen auf Mac Studio oder EXO-Clustern interessiert sind, bieten diese Diskussionen wertvolle Einblicke in die aktuelle Entwicklung.
[Kimi-K3 (2.78T) in TP4 auf vier M3 Ultras — dispatch-bound decode, und einige Dinge, die ich falsch hatte [laufende Debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Diskussion zeigt, dass Kimi-K3 (2.78T) auf einem EXO-Cluster von vier M3 Ultras laufen kann, aber die Performance ist dispatch-bound, was für OpenCode-Workloads kritisch sein könnte.
Hardware: 4× M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 20.000 EUR für 2 TB Unified Memory
Kontext (2-3 Saetze): Der Leser sollte prüfen, ob die dispatch-bound Performance für seine Anwendung akzeptabel ist. Die Diskussion enthält detaillierte Messwerte und Optimierungsvorschläge, die für die Entscheidung hilfreich sein können.
Systematische Inferenz-Benchmarks: 5 Modelle × 6 Quantisierungen × 7 Kontextlängen auf M3 Ultra (9/10) — OpenCode-Fit: JA
Verdict (1 Satz): Diese Benchmarks zeigen, dass die Kontextlänge einen größeren Einfluss auf die Performance als die Quantisierung hat, was für die Wahl der Hardware und der Modellgrößen entscheidend ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: Detaillierte TPS-Werte für verschiedene Konfigurationen
Cluster-Bezug: Single-Node
Investment-Empfehlung: 10.000 EUR für 512 GB Unified Memory
Kontext (2-3 Saetze): Der Leser sollte die Benchmarks für verschiedene Modelle, Quantisierungen und Kontextlängen prüfen, um die beste Hardware-Konfiguration für seine Anwendung zu finden. Die Daten sind besonders nützlich für die Evaluierung von MoE-Modellen.
MacProvider — MLX-LM-Endpunkte über das Internet ansprechbar machen, mit verifizierbarer Inferenz (7/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): MacProvider ermöglicht es, MLX-Modelle über das Internet ansprechbar zu machen, was für verteilte Anwendungen nützlich sein kann, aber nicht speziell für EXO-Clustern entwickelt ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Leser sollte die Funktionalität von MacProvider prüfen, insbesondere die verifizierbare Inferenz, die für sicherheitskritische Anwendungen wichtig sein kann. Die Software ist jedoch nicht für verteilte Cluster-Setups optimiert.
Field report: Qwen3.8-2.4T-A95B in TP4 auf vier M3 Ultras (frühe Zahlen) (8/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Qwen3.8-2.4T-A95B kann auf einem EXO-Cluster von vier M3 Ultras laufen, aber die Performance ist stark dispatch-bound, was für OpenCode-Workloads kritisch sein könnte.
Hardware: 4× M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 20.000 EUR für 2 TB Unified Memory
Kontext (2-3 Saetze): Der Leser sollte die early field report prüfen, um die aktuellen Herausforderungen bei der Ausführung von Qwen3.8-2.4T-A95B auf einem EXO-Cluster zu verstehen. Die Diskussion enthält detaillierte Informationen zur Modellgröße und der notwendigen Quantisierung.
Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (6/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Diese Diskussion erkundet die Möglichkeiten der Quantisierung bei sehr niedrigen Bitraten, was für die Reduzierung der Modellgröße und der Speicherverbrauch wichtig sein kann, aber nicht direkt auf OpenCode-Workloads zugeschnitten ist.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Leser sollte die Diskussion über die Quantisierung bei sehr niedrigen Bitraten prüfen, um die Möglichkeiten zur Reduzierung des Speicherverbrauchs zu verstehen. Die Diskussion ist eher theoretisch und enthält keine direkten Benchmarks.
Symbio: Selbst-fine-tuning AI-Agenten (7/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Symbio ist ein lokaler AI-Agent, der automatisch Fehler korrigiert und sich selbst fine-tuning, was für die kontinuierliche Verbesserung von Modellen nützlich sein kann, aber nicht speziell für EXO-Clustern entwickelt ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Leser sollte Symbio prüfen, um die Möglichkeiten der automatischen Fehlerkorrektur und des kontinuierlichen Lernens zu verstehen. Die Software ist jedoch nicht für verteilte Cluster-Setups optimiert.
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%) (8/10) — OpenCode-Fit: JA
Verdict (1 Satz): Diese Diskussion zeigt, dass die Fusionsstrategie für MoE-Modelle bei kleinen Sequenzlängen die Performance erheblich verbessern kann, was für die Ausführung von MoE-Modellen auf Apple Silicon wichtig ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: GLM-5.2
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: 10.000 EUR für 512 GB Unified Memory
Kontext (2-3 Saetze): Der Leser sollte die Fusionsstrategie für MoE-Modelle prüfen, um die Performance bei kleinen Sequenzlängen zu verbessern. Die Diskussion enthält detaillierte Messwerte und Optimierungsvorschläge, die für die Entscheidung hilfreich sein können.
Weitere Diskussionen:
– MLX Community Projects
– MacOS MLX Control Center v0.4 Released
– Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
– JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
– THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO
– Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)