MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt ist derzeit in hohem Tempo aktiv, insbesondere im Bereich

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt ist derzeit in hohem Tempo aktiv, insbesondere im Bereich der lokalen KI-Agenten auf Apple Silicon. Die Community arbeitet intensiv daran, die Leistung und den Modell-Support zu verbessern, um Claude-ähnliche Fähigkeiten auf lokalen Geräten wie dem Mac Studio zu erreichen.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für die Integration in OpenCode-Workloads und lokale Agenten-Anwendungen entscheidend ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): MacProvider ist ein Projekt, das MLX-Endpoints über das Internet erreichbar macht, was für Anwendungen wie long-running personal agents, privacy-sensitive tooling und dev workflows wichtig ist. Es bietet Authentifizierung, Rate-Limiting und verifizierbare Inference, was die Verwendung von MLX in der Cloud erschwert.

Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (9/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Dieser Bericht zeigt, dass das Qwen3.8-2.4T-Modell auf einem 4-knotigen M3 Ultra Cluster laufen kann, aber die Leistung bei 4-bit Quantisierung kritisch ist.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s bei 128 Tokens
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB für 2 TB Unified Memory (~40.000 EUR)

Kontext (2-3 Saetze): Der Bericht beschreibt die Leistung des Qwen3.8-2.4T-Modells auf einem 4-knotigen M3 Ultra Cluster. Die Leistung bei 4-bit Quantisierung ist kritisch, was die Nutzbarkeit für OpenCode-Workloads einschränkt. Es wird empfohlen, die 8-bit Quantisierung zu testen, um die Leistung zu verbessern.

Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese Benchmarks zeigen, dass der Kontextlänge bei langen Kontexten mehr Einfluss auf die Leistung als die Quantisierung hat, was für die Optimierung von OpenCode-Workloads entscheidend ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: 31.2 tok/s (Qwen 32B Q4), 68.4 tok/s (Mixtral 8x7B Q4)
Cluster-Bezug: Single-Node
Investment-Empfehlung: M3 Ultra 512 GB (~10.000 EUR)

Kontext (2-3 Saetze): Die Benchmarks vergleichen verschiedene Modelle, Quantisierungen und Kontextlängen auf dem M3 Ultra. Die Ergebnisse zeigen, dass der Kontextlänge bei langen Kontexten mehr Einfluss auf die Leistung als die Quantisierung hat. Dies ist wichtig für die Optimierung von OpenCode-Workloads, die lange Kontexte benötigen.

JACCL Recv/Send -12 on 4-node TB5 after a successful first generate (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Dieser Bericht beschreibt ein Problem mit JACCL auf einem 4-knotigen TB5 Cluster, das die Stabilität und Leistung bei mehreren Generierungsvorgängen beeinträchtigen kann.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s bei 128 Tokens
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB für 2 TB Unified Memory (~40.000 EUR)

Kontext (2-3 Saetze): Der Bericht beschreibt ein Problem mit JACCL, das nach einem erfolgreichen ersten Generierungsvorgang auftritt. Dies kann die Stabilität und Leistung bei mehreren Generierungsvorgängen beeinträchtigen. Es wird empfohlen, die aktuelle Firmware und die neuesten MLX-Versionen zu verwenden, um das Problem zu minimieren.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Dieser Beitrag diskutiert die Möglichkeit, Gewichte in sehr niedrigen Bitraten zu komprimieren, was für die Optimierung von Modellen auf Apple Silicon relevant sein kann.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag diskutiert die Verwendung von sehr niedrigen Bitraten (1-2 Bit) für die Kompression von Modellgewichten. Es werden verschiedene Ansätze und Werkzeuge vorgestellt, die die Leistung und die Modellgröße optimieren können. Dies ist relevant für die Optimierung von Modellen auf Apple Silicon, insbesondere für OpenCode-Workloads.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Dieser Bericht zeigt, dass die Leistung von Kimi-K3 auf einem 4-knotigen M3 Ultra Cluster dispatch-bound ist, was die Optimierung der Leistung erfordert.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: 2.0 tok/s bei batch 1, 21.2 tok/s aggregiert bei 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× M3 Ultra 512 GB für 2 TB Unified Memory (~40.000 EUR)

Kontext (2-3 Saetze): Der Bericht beschreibt die Leistung von Kimi-K3 auf einem 4-knotigen M3 Ultra Cluster. Die Leistung ist dispatch-bound, was bedeutet, dass die Optimierung der Dispatch-Logik notwendig ist, um die Leistung zu verbessern. Es werden auch einige Probleme beschrieben, die weiter untersucht werden müssen.

Overview of three perf PRs for LLM inference (#3918, #3919, #3920) (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese PRs verbessern die Leistung von LLM-Inferenz auf Apple Silicon, was für die Optimierung von OpenCode-Workloads entscheidend ist.
Hardware: M3 Max
Modell: Qwen3.6-35B-A3B
tok/s-Claim: +6.2% MoE prefill at 32K, +2.8% prefill end to end, +2.0 to 2.8% decode
Cluster-Bezug: Single-Node
Investment-Empfehlung: M3 Max (~6.000 EUR)

Kontext (2-3 Saetze): Die PRs verbessern verschiedene Aspekte der LLM-Inferenz, wie die Tile-Größe, die Fusionslogik und die CPU-Overhead-Reduktion. Die Verbesserungen sind signifikant und können die Leistung von OpenCode-Workloads erheblich steigern.

Weitere Diskussionen:

Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)
Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the frontier?

👁 1 Aufrufe 👤 1 Leser