MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt ist aktuell in vollem Schwung, insbesondere bei der Unters

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt ist aktuell in vollem Schwung, insbesondere bei der Unterstützung neuer Modelle und der Optimierung der Performance auf Apple Silicon. Apple-LLMs sind dabei, sich als ernsthafte Alternative zu Cloud-basierten Lösungen zu etablieren, insbesondere für OpenCode-Workloads, die lange Kontexte und effizientes Tool-Calling erfordern.

[Kimi-K3 (2.78T) in TP4 auf vier M3 Ultras — dispatch-bound decode, und einige Dinge, die ich falsch hatte [laufende Debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Discussion ist entscheidend für den Kauf eines Mac Studio Clusters, da sie die Performance von großen Modellen wie Kimi-K3 auf Apple Silicon unter realen Bedingungen zeigt.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 20.000 EUR für 2 TB Unified Memory

Kontext (2-3 Sätze): Der Leser sollte sich die Diskussion ansehen, um die Performance- und Skalierbarkeitsaspekte von Kimi-K3 auf einem Mac Studio Cluster zu verstehen. Es wird auch auf die Herausforderungen bei der Implementierung eingegangen, die für die Optimierung der Performance relevant sind.

Systematische Inferenz-Benchmarks: 5 Modelle × 6 Quantisierungen × 7 Kontextlängen auf M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese Benchmarks sind unerlässlich für den Kauf eines Mac Studio, da sie die Performance von verschiedenen Modellen und Quantisierungen bei unterschiedlichen Kontextlängen detailliert analysieren.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: Detaillierte TPS-Werte für verschiedene Konfigurationen
Cluster-Bezug: Single-Node
Investment-Empfehlung: 10.000 EUR für 512 GB Unified Memory

Kontext (2-3 Sätze): Der Leser sollte die Benchmarks prüfen, um die besten Konfigurationen für seine spezifischen Anforderungen zu finden. Die Daten zeigen, dass die Kontextlänge einen größeren Einfluss auf die Performance hat als die Quantisierung, was für die Wahl der Hardware und des Modells entscheidend ist.

Field report: Qwen3.8-2.4T-A95B in TP4 auf vier M3 Ultras (frühe Zahlen) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Dieser Field Report ist wichtig für den Kauf eines Mac Studio Clusters, da er die Machbarkeit des Betriebs von Qwen3.8-2.4T auf Apple Silicon unter realen Bedingungen zeigt.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 20.000 EUR für 2 TB Unified Memory

Kontext (2-3 Sätze): Der Leser sollte sich die Diskussion ansehen, um die Herausforderungen und die Machbarkeit des Betriebs von Qwen3.8-2.4T auf einem Mac Studio Cluster zu verstehen. Es werden auch die notwendigen Optimierungen und die aktuelle Performance detailliert beschrieben.

MacOS MLX Control Center v0.4 Released (7/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Dieses Tool ist nützlich für den Betrieb von MLX auf einem Mac, aber es hat keinen direkten Einfluss auf die Performance oder die Wahl der Hardware.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Sätze): Der Leser sollte das Tool prüfen, um eine bessere Benutzererfahrung bei der Verwaltung von MLX-Modellen auf seinem Mac zu erhalten. Es ist jedoch eher für Anfänger und weniger für fortgeschrittene Benutzer, die spezifische Performance-Optimierungen benötigen.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (7/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): MacProvider ist eine interessante Lösung, um MLX-Endpoints über das Internet erreichbar zu machen, aber es hat keinen direkten Einfluss auf die Performance oder die Wahl der Hardware.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Sätze): Der Leser sollte sich MacProvider ansehen, um die Möglichkeiten zu erkunden, MLX-Endpoints über das Internet zu verwenden. Es ist besonders nützlich für Anwendungen, die auf mehreren Geräten oder von verschiedenen Standorten aus betrieben werden müssen.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (6/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Diese Diskussion ist relevant für fortgeschrittene Benutzer, die sich mit der Quantisierung von Modellen auf sehr niedrigem Bit-Rate befassen, aber sie hat keinen direkten Einfluss auf die Wahl der Hardware.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Sätze): Der Leser sollte sich die Diskussion ansehen, um die Möglichkeiten der Quantisierung von Modellen auf sehr niedrigem Bit-Rate zu verstehen. Es wird auch auf die Herausforderungen und die aktuellen Forschungsansätze in diesem Bereich eingegangen.

THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO (6/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Diese Diskussion ist relevant für Benutzer, die sich für die Hardware-Entscheidungen von Apple interessieren, aber sie hat keinen direkten Einfluss auf die Wahl der Hardware für MLX.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Sätze): Der Leser sollte sich die Diskussion ansehen, um die Hardware-Entscheidungen von Apple zu verstehen und mögliche Alternativen zu erkunden. Es ist besonders relevant für Benutzer, die sich für die Zukunft der lokalen KI-Agenten auf Apple Hardware interessieren.

Weitere Diskussionen:

MLX Community Projects
Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)

👁 0 Aufrufe 👤 0 Leser