MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt ist aktuell in Bewegung, insbesondere in Bezug auf die Unt

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt ist aktuell in Bewegung, insbesondere in Bezug auf die Unterstützung neuer Modelle, die Optimierung der Performance und die Verbesserung der Cluster-Integration. Apple-LLMs sind dabei, ihre Position im OpenCode-Workload zu stärken, aber es gibt noch Herausforderungen, insbesondere bei der Verarbeitung langer Kontexte und der Tool-Calling-Qualität.

[MacOS MLX Control Center v0.4 Released] (5/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Discussion bietet eine nützliche GUI für MLX auf MacBooks, die die Integration mit Hugging Face vereinfacht, aber keine direkten Vorteile für OpenCode-Workloads bietet.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die GUI ausprobieren, um zu sehen, ob sie die Benutzerfreundlichkeit von MLX auf MacBooks verbessert. Es ist jedoch nicht spezifisch auf OpenCode-Workloads zugeschnitten.

[MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference] (8/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für die Integration in OpenCode-Workloads und die Verifizierung von Inferenzvorgängen sehr nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Architektur von MacProvider prüfen, insbesondere die Verifizierung von Inferenzvorgängen. Dies kann die Zuverlässigkeit und Sicherheit von lokalen LLM-Anwendungen erheblich verbessern.

[Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers)] (9/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Dieser Field Report zeigt, dass das Qwen3.8-2.4T-Modell auf vier M3 Ultra Studios lauffähig ist, aber die Performance bei langer Kontextverarbeitung noch verbessert werden muss.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s bei 128 Tokens
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Benchmarks und die Konfiguration prüfen, um zu verstehen, welche Anpassungen notwendig sind, um die Performance zu optimieren. Besonders die 4-bit-Quantisierung ist entscheidend für die Lauffähigkeit auf dieser Hardware.

[Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra] (9/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): Diese Benchmarks liefern wertvolle Einblicke in die Performance von verschiedenen Modellen und Quantisierungen auf Apple Silicon, insbesondere bei langen Kontexten.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: Qwen 32B: 5.5 tok/s bei 128K Kontext, Q2: 9.3 tok/s bei 128K Kontext
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB (~10.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Benchmarks prüfen, um die besten Konfigurationen für seine spezifischen Anforderungen zu finden. Besonders die Auswirkungen der Kontextlänge auf die Performance sind relevant für OpenCode-Workloads.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]] (8/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Der Field Report zeigt, dass Kimi-K3 auf vier M3 Ultra Studios lauffähig ist, aber die Performance bei der Verarbeitung langer Kontexte noch verbessert werden muss.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s bei batch 1, 21.2 tok/s aggregate bei 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 4× Mac Studio M3 Ultra 512 GB (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Performance-Untersuchungen und die Debugging-Schritte prüfen, um zu verstehen, welche Optimierungen notwendig sind. Besonders die dispatch-bound Decode-Performance ist relevant für die Verarbeitung langer Kontexte.

[Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers] (7/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Discussion untersucht die Möglichkeiten der Aggressiven Quantisierung bei sehr niedrigem Bit-Rate, was für die Effizienz von OpenCode-Workloads relevant sein kann.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die verschiedenen Quantisierungstechniken prüfen, um zu verstehen, wie sie die Modellgröße und die Performance beeinflussen. Besonders die K-quant hierarchische Skalierung und sub-2-bit/Packer sind interessant.

[Overview of three perf PRs for LLM inference (#3918, #3919, #3920)] (7/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese PRs verbessern die Performance von LLM-Inferenz auf Apple Silicon, was für die Effizienz von OpenCode-Workloads relevant sein kann.
Hardware: Mac Studio M3 Max
Modell: Qwen3.6-35B-A3B
tok/s-Claim: +6.2% MoE prefill at 32K, +2.8% prefill end to end
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die PRs prüfen, um zu verstehen, welche Optimierungen vorgenommen wurden und wie sie die Performance verbessern. Besonders die Optimierungen für long-context causal prefill und die CPU-side Overhead-Reduktion sind relevant.

[THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO] (6/10) — OpenCode-Fit: NEIN

Zur Discussion

Verdict (1 Satz): Diese Discussion kritisiert die Speicherbegrenzungen des Mac Studio im Vergleich zum MacBook Pro, was für den Kaufentscheidung relevant sein kann.
Hardware: Mac Studio 96GB, MacBook Pro 128GB
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: MacBook Pro 16″ M5 Max 128GB (~2.500 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Speicherbegrenzungen des Mac Studio prüfen, um zu verstehen, ob der MacBook Pro eine bessere Option für seine Anforderungen ist. Besonders für die Verarbeitung großer Modelle ist der Speicherumfang entscheidend.

Weitere Diskussionen:

Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model)

👁 3 Aufrufe 👤 2 Leser