MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt ist derzeit in vollem Schwung, insbesondere bei der Entwic

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt ist derzeit in vollem Schwung, insbesondere bei der Entwicklung von lokalen LLMs auf Apple Silicon. Die Community arbeitet intensiv an der Optimierung von Modellen, der Verbesserung der Performance und der Unterstützung neuer Modelle. Für Nutzer, die OpenCode-Workloads auf Apple Hardware ausführen möchten, bieten diese Diskussionen wertvolle Einblicke in die aktuelle Entwicklung und die Möglichkeiten, Claude-ähnliche Leistungen zu erreichen.

[Kimi-K3 (2.78T) in TP4 auf vier M3 Ultras — dispatch-bound decode, und einige Dinge, die ich falsch hatte [laufende Debugging]](https://github.com/ml-explore/mlx/discussions/3939) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion zeigt, dass Kimi-K3 auf einem EXO-Cluster von vier M3 Ultras lauffähig ist, aber die Performance ist dispatch-bound, was für OpenCode-Workloads kritisch sein kann.
Hardware: 4× M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate at 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, welche Herausforderungen bei der Ausführung von großen Modellen wie Kimi-K3 auf einem EXO-Cluster auftreten. Insbesondere die dispatch-bound Performance und die Notwendigkeit, die dispatch-Logik zu optimieren, sind wichtig.

Systematische Inferenz-Benchmarks: 5 Modelle × 6 Quantisierungen × 7 Kontextlängen auf M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese Benchmarks zeigen, dass die Kontextlänge einen viel größeren Einfluss auf die Performance hat als die Quantisierung, was für Nutzer mit langen Kontexten wie OpenCode relevant ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Mixtral 8x7B, Llama 405B
tok/s-Claim: Qwen 32B: 5.5 tok/s (128K), Mixtral 8x7B: 9.3 tok/s (128K)
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Benchmarks prüfen, um zu verstehen, wie verschiedene Modelle, Quantisierungen und Kontextlängen die Performance beeinflussen. Besonders die Erkenntnisse über die Dominanz des KV-Caches bei langen Kontexten sind für die Wahl der Hardware und des Modells entscheidend.

MacOS MLX Control Center v0.4 Released (6/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die neue Version des MLX Control Center bietet eine benutzerfreundliche GUI für die Verwaltung von MLX-Modellen auf MacBooks, was für Nutzer, die eine einfache Bedienung bevorzugen, nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die neuen Features des MLX Control Center prüfen, um zu sehen, ob diese für seine Anwendung nützlich sind. Insbesondere die Integration mit Hugging Face und die verbesserte Benutzerfreundlichkeit sind erwähnenswert.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für Nutzer, die ihre Modelle von verschiedenen Geräten aus nutzen möchten, sehr nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte MacProvider prüfen, um zu verstehen, wie es die Erreichbarkeit von MLX-Endpoints über das Internet verbessert. Besonders die verifizierbare Inference und die Authentifizierung sind wichtige Aspekte für die Sicherheit und Zuverlässigkeit.

Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Der Field Report zeigt, dass Qwen3.8-2.4T auf einem EXO-Cluster von vier M3 Ultras lauffähig ist, aber die Performance bei 4-bit Quantisierung kritisch ist.
Hardware: 4× M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Multi-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte den Field Report lesen, um zu verstehen, welche Herausforderungen bei der Ausführung von Qwen3.8-2.4T auf einem EXO-Cluster auftreten. Insbesondere die Notwendigkeit, die Quantisierung zu optimieren, ist wichtig.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion erkundet die Möglichkeiten der effizienten Quantisierung bei sehr niedrigen Bitraten, was für die Reduzierung der Speicherverbrauchs und die Steigerung der Performance relevant sein kann.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, welche Ansätze für die effiziente Quantisierung bei sehr niedrigen Bitraten existieren. Besonders die K-quant hierarchische Skalierung und die benutzerdefinierten Packer sind interessante Themen.

Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion zeigt, dass die Fusion von Experten-Gathers bei MoE-Modellen wie GLM-5.2 die Performance erheblich verbessern kann, was für Nutzer mit MoE-Modellen relevant ist.
Hardware: M3 Ultra 512 GB
Modell: GLM-5.2
tok/s-Claim: ~19.7 tok/s (L=1), ~112 ms (L=2)
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, wie die Fusion von Experten-Gathers die Performance bei MoE-Modellen verbessern kann. Besonders die Messdaten zur Experten-Überlappung sind wichtig.

THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO (5/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Diese Diskussion kritisiert die Entscheidung von Apple, den Mac Studio mit weniger Speicher auszustatten als den MacBook Pro, was für Nutzer, die zwischen Laptop und Desktop wählen, relevant sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, warum der Mac Studio weniger Speicher als der MacBook Pro hat. Dies kann bei der Entscheidung für eine geeignete Hardware relevant sein.

Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model) (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion zeigt, dass das Sliding-Window-Modell bei Gemma-3/4 nicht den KV-Speicher begrenzt, was für Nutzer mit langen Kontexten relevant ist.
Hardware: nicht im Post belegt
Modell: Gemma-3/4
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Diskussion lesen, um zu verstehen, warum das Sliding-Window-Modell bei Gemma-3/4 den KV-Speicher nicht begrenzt. Besonders die Mechanismen der globalen Aufmerksamkeitsschichten sind wichtig.

Weitere Diskussionen:

MLX Community Projects
Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Can you stop gradients for part of a tensor?
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
Symbio: Self fine tuning ai agents

👁 0 Aufrufe 👤 0 Leser