MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt von Apple's ML Research Team ist in stetem Aufschwung. Die

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt von Apple’s ML Research Team ist in stetem Aufschwung. Die Community diskutiert aktuell intensiv über die Unterstützung neuer Modelle, die Performance von lokalen LLMs auf Apple Silicon und die Integration von verteilten Systemen. Für Entwickler, die OpenCode als Agenten-Tool nutzen, ist die Frage, ob sie auf Claude-ähnliche Leistungen mit lokalen Apple-Hardware kommen können, von großer Bedeutung.

[MacOS MLX Control Center v0.4 Released] (6/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Discussion bietet ein GUI-Tool für MLX, das die Integration mit Hugging Face vereinfacht, aber keine direkten Benchmarks oder Hardware-Tests enthält.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte das Tool ausprobieren, um die Benutzerfreundlichkeit und die Integration mit Hugging Face zu prüfen. Es ist besonders nützlich für Entwickler, die eine grafische Oberfläche für MLX benötigen.

[MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference] (8/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): MacProvider ermöglicht die Remote-Zugriffbarkeit von MLX-Endpoints, was für OpenCode-Workloads, die auf lokalen Apple-Hardware laufen, sehr nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Verifikationsfunktionen von MacProvider genauer prüfen, da sie die Zuverlässigkeit der lokalen Inferenz erhöhen. Es ist besonders relevant für Anwendungen, die auf lokalen Geräten laufen, aber von anderen Geräten aus zugänglich sein müssen.

[Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers)] (9/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Field-Report zeigt, dass das Qwen3.8-2.4T-Modell auf einem 4-Node-Cluster von M3 Ultras lauffähig ist, aber die Performance bei langen Kontexten noch optimiert werden muss.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s bei 128 Tokens
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Benchmarks und die Konfiguration des Clusters genauer prüfen, um zu verstehen, wie das Modell auf Apple-Hardware performt. Es ist besonders relevant für Entwickler, die große Modelle auf lokalen Clustern betreiben möchten.

[Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra] (9/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): Diese Benchmarks zeigen, dass der Kontextlänge bei der Performance von LLMs auf Apple-Hardware eine größere Bedeutung zukommt als der Quantisierung.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: Qwen 32B: 5.5 tok/s bei 128K Kontext, Q2: 9.3 tok/s bei 128K Kontext
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB (~10.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Benchmarks für verschiedene Modelle, Quantisierungen und Kontextlängen prüfen, um die besten Konfigurationen für seine Anwendungen zu finden. Es ist besonders relevant für Entwickler, die hohe Performance bei langen Kontexten benötigen.

[JACCL Recv/Send -12 on 4-node TB5 after a successful first generate] (7/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Discussion identifiziert ein Problem mit JACCL auf 4-Node-Clusters, das nach der ersten Generierung auftritt und die Stabilität der Inferenz beeinträchtigt.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s bei 128 Tokens
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Fehlerbehebungsschritte und die Konfiguration des Clusters prüfen, um die Stabilität der Inferenz zu verbessern. Es ist besonders relevant für Entwickler, die verteilte Systeme betreiben.

[Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers] (6/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Discussion erkundet die Möglichkeiten der Quantisierung auf sehr niedrigem Bit-Rate-Level, was für die Effizienz von LLMs auf Apple-Hardware relevant sein kann.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die verschiedenen Quantisierungsmethoden und ihre Auswirkungen auf die Modellqualität prüfen. Es ist besonders relevant für Entwickler, die die Modellgröße reduzieren möchten, ohne die Performance zu stark zu beeinträchtigen.

[Overview of three perf PRs for LLM inference (#3918, #3919, #3920)] (7/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese PRs verbessern die Performance von LLM-Inferenz auf Apple-Hardware durch Optimierungen in verschiedenen Phasen des Decodes.
Hardware: Mac Studio M3 Max
Modell: Qwen3.6-35B-A3B
tok/s-Claim: +6.2% MoE prefill bei 32K Kontext
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Max

Kontext (2-3 Saetze): Der Leser sollte die einzelnen PRs und ihre Auswirkungen auf die Performance prüfen. Es ist besonders relevant für Entwickler, die die Effizienz von LLMs auf Apple-Hardware optimieren möchten.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]] (8/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Discussion zeigt, dass die Performance von Kimi-K3 auf einem 4-Node-Cluster von M3 Ultras dispatch-bound ist, was Optimierungspotenzial bietet.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s bei batch 1, 21.2 tok/s aggregiert bei 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Performance-Optimierungen und die Fehlerbehebungsschritte prüfen, um die Effizienz der Inferenz zu verbessern. Es ist besonders relevant für Entwickler, die große Modelle auf verteilten Systemen betreiben.

Weitere Diskussionen:

Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)

👁 1 Aufrufe 👤 1 Leser