MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt von Apple steht derzeit im Fokus der Community, insbesonder

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt von Apple steht derzeit im Fokus der Community, insbesondere hinsichtlich der Unterstützung neuer Modelle, der Optimierung der Performance und der Verbesserung der Cluster-Integration. Lokale KI-Agenten auf Apple Silicon sind ein heißes Thema, da sie eine Privatsphäre-gerechte und leistungsstarke Alternative zu Cloud-Lösungen bieten.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für die Integration in OpenCode-Workflows entscheidend ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte prüfen, ob MacProvider für seine Anwendung geeignet ist, insbesondere wenn er MLX-Endpoints über das Internet ansprechen muss. Die verifizierbare Inference ist ein wichtiger Aspekt, der die Zuverlässigkeit der Anwendung erhöht.

Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (9/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die Field-Report zeigt, dass Qwen3.8-2.4T auf vier M3 Ultras lauffähig ist, aber die Performance und die Nützlichkeit für OpenCode-Workloads noch zu prüfen sind.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s (nur bei 128 Tokens)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 20.000 EUR für 4× M3 Ultra 512 GB

Kontext (2-3 Saetze): Der Leser sollte die Early-Numbers und die Einschränkungen des Reports prüfen, insbesondere die Notwendigkeit der 4-bit-Quantisierung und die Auswirkungen auf die Performance bei längeren Kontexten.

Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Die systematischen Benchmarks liefern wertvolle Erkenntnisse über die Performance von verschiedenen Modellen und Quantisierungen, die für die Wahl der Hardware und des Modells entscheidend sind.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: 1.7× F16 bei 128K Kontext (Q2 vs. F16)
Cluster-Bezug: Single-Node
Investment-Empfehlung: 10.000 EUR für M3 Ultra 512 GB

Kontext (2-3 Saetze): Der Leser sollte die Benchmarks prüfen, um die besten Einstellungen für seine spezifischen Anforderungen zu finden, insbesondere hinsichtlich Kontextlänge und Quantisierung.

JACCL Recv/Send -12 on 4-node TB5 after a successful first generate (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Der Fehler bei der JACCL-Kommunikation nach dem ersten Generate ist ein wichtiger Hinweis auf potenzielle Probleme bei der Cluster-Integration.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s (nur bei 128 Tokens)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 20.000 EUR für 4× M3 Ultra 512 GB

Kontext (2-3 Saetze): Der Leser sollte die Fehlerbeschreibung und die möglichen Workarounds prüfen, um sicherzustellen, dass sein Cluster stabil und zuverlässig läuft.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die Diskussion über die Qualität von sehr niedriger Quantisierung bietet wertvolle Einblicke in die Optimierung von Modellen auf Apple Silicon.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die verschiedenen Ansätze zur Quantisierung prüfen, um die beste Balance zwischen Qualität und Performance zu finden.

THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO (6/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Die Diskussion über die Speicherbegrenzungen der Mac Studio ist wichtig für die Hardware-Entscheidung, aber nicht direkt relevant für OpenCode-Workloads.
Hardware: Mac Studio, MacBook Pro
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Speicherbegrenzungen der Mac Studio prüfen, um die beste Hardware für seine Anwendungen auszuwählen.

Weitere Diskussionen:

Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
– [Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939)
Can you stop gradients for part of a tensor?
MLX Community Projects
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)
Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the frontier?

👁 2 Aufrufe 👤 2 Leser