MLX-Community: Apple Silicon für lokale KI-Agenten
Das MLX-Projekt von Apple ist in stetem Aufschwung, insbesondere in Bezug auf die Unterstützung von lokalen LLMs auf Apple Silicon. Die Community arbeitet aktiv daran, neue Modelle zu integrieren, die Performance zu verbessern und verteilte Systeme zu optimieren. Für Entwickler, die OpenCode-Workloads auf lokalen Apple-Geräten betreiben möchten, bieten sich interessante Möglichkeiten, insbesondere bei der Verwendung von Mac Studio und Clustern.
Building a persistent local AI companion across Apple Silicon MLX nodes (8/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Diskussion zeigt, wie Apple Silicon und MLX für komplexe, verteilte AI-Systeme genutzt werden können, was für den Einsatz von Claude-ähnlichen Agenten relevant ist.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: 19 tok/s (bei 32K Kontext)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 20.000 EUR für 2x Mac Studio M3 Ultra 512 GB
Kontext (2-3 Sätze): Der Entwickler beschreibt ein Projekt namens Isla Watson, das auf Apple Silicon und MLX basiert. Es zielt darauf ab, einen persistenten, verteilten AI-Companion zu erstellen, der über mehrere Macs hinweg kooperieren kann. Die Diskussion enthält wertvolle Informationen zur Skalierung und Performance.
[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939) (9/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Diskussion bietet tiefgehende Einblicke in die Performance-Optimierung von Kimi-K3 auf einem 4-Node-Cluster, was für den Einsatz von Claude-ähnlichen Modellen relevant ist.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: 21.2 tok/s aggregate (bei 32 concurrent)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 20.000 EUR für 2x Mac Studio M3 Ultra 512 GB
Kontext (2-3 Sätze): Der Entwickler untersucht die Performance von Kimi-K3 auf einem 4-Node-Cluster aus Mac Studio M3 Ultra. Es werden detaillierte Messergebnisse zur Decode-Geschwindigkeit, Speicherverwendung und Energieverbrauch präsentiert. Die Diskussion enthält auch Erkenntnisse zur dispatch-bound Decode und Vorschläge zur Optimierung.
Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Benchmarks liefern wertvolle Daten zur Performance verschiedener Modelle und Quantisierungen auf Apple Silicon, was für die Wahl der richtigen Hardware und Modelle entscheidend ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: 47.6 tok/s (Q2, 1K Kontext)
Cluster-Bezug: Single-Node
Investment-Empfehlung: 10.000 EUR für Mac Studio M3 Ultra 512 GB
Kontext (2-3 Sätze): Die Diskussion enthält systematische Benchmarks für fünf Modelle, sechs Quantisierungen und sieben Kontextlängen auf einem Mac Studio M3 Ultra. Es werden wichtige Erkenntnisse zur Einflussnahme des Kontexts auf die Performance und zur Effizienz von MoE-Modellen präsentiert.
MacOS MLX Control Center v0.4 Released (7/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Dieses GUI-Tool erleichtert den Einsatz von MLX auf MacBooks, ist aber eher für einfache Anwendungen geeignet und nicht speziell für OpenCode-Workloads.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Sätze): Der Entwickler stellt eine neue Version des MacOS MLX Control Center vor, das eine einfache GUI für MLX-Anwendungen bietet. Es ist besonders nützlich für Entwickler, die eine benutzerfreundliche Oberfläche für MLX benötigen.
Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (8/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Diskussion untersucht die Möglichkeit, Modelle mit sehr niedriger Bit-Genauigkeit zu quantisieren, was für die Effizienz auf Apple Silicon wichtig sein kann.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Sätze): Der Entwickler erforscht die Verwendung von sehr niedriger Bit-Genauigkeit (1-2 Bit) für die Quantisierung von Modellen wie Qwen. Es werden verschiedene Ansätze und ihre Auswirkungen auf die Modellqualität diskutiert, was für die Optimierung von lokalen AI-Systemen relevant ist.
MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (8/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für verteilte Anwendungen und lokale Agenten nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Sätze): MacProvider ist ein Projekt, das MLX-Endpoints über das Internet verfügbar macht, wobei Authentifizierung und verifizierbare Inference berücksichtigt werden. Es ist besonders nützlich für Anwendungen, die auf mehreren Geräten laufen und eine sichere Kommunikation erfordern.
Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (9/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Dieser Field Report zeigt, wie das Qwen3.8-2.4T-Modell auf einem 4-Node-Cluster von Mac Studio M3 Ultra läuft, was für die Wahl der richtigen Hardware und Quantisierung entscheidend ist.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: 19 tok/s (bei 32K Kontext)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 20.000 EUR für 2x Mac Studio M3 Ultra 512 GB
Kontext (2-3 Sätze): Der Entwickler berichtet über die Ausführung des Qwen3.8-2.4T-Modells auf einem 4-Node-Cluster von Mac Studio M3 Ultra. Es werden detaillierte Messergebnisse zur Stabilität, Durchsatz und Verhaltensproben präsentiert, die für die Entscheidung, ob dieses Modell für Claude-ähnliche Anwendungen geeignet ist, hilfreich sind.
Weitere Diskussionen:
– MLX Community Projects
– Awesome MLX — curated list of 80+ MLX projects, tools, and resources
– Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
– JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
– Can you stop gradients for part of a tensor?
– Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
– Symbio: Self fine tuning ai agents
– Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)