MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt (Machine Learning on Apple Silicon) ist derzeit in hohem T

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt (Machine Learning on Apple Silicon) ist derzeit in hohem Tempo weiterentwickelt, insbesondere im Bereich der Unterstützung neuer Modelle, der Optimierung der Performance und der Verbesserung der Cluster-Integration. Für Entwickler, die an der lokalen Ausführung von Claude-ähnlichen Modellen auf Apple Silicon interessiert sind, bieten sich zahlreiche interessante Diskussionen und Projekte an.

Awesome MLX — curated list of 80+ MLX projects, tools, and resources (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion bietet eine umfassende Übersicht über das MLX-Ökosystem, die für Entwickler nützlich ist, die Claude-ähnliche Modelle auf Apple Silicon betreiben möchten.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag präsentiert eine kuratierte Liste von über 80 MLX-Projekten, die in verschiedene Kategorien wie Core Framework, Inference & Serving, Training & Fine-tuning, Audio & Speech, Image & Video, Vision & Multimodal, Embeddings & RAG, Swift Ecosystem und Models unterteilt sind. Ein Quick Start-Handbuch und ein einfacher Einreichungsprozess machen es einfach, neue Projekte hinzuzufügen.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939) (9/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion bietet wertvolle Einblicke in die Leistung und die Debugging-Prozesse beim Betrieb von Kimi-K3 auf einem vierknotigen Mac Studio M3 Ultra Cluster.
Hardware: 4× M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate at 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 2x Mac Studio M3 Ultra 512 GB = 1 TB Unified Memory (~20.000 EUR)

Kontext (2-3 Saetze): Der Beitrag beschreibt die Leistung und die Debugging-Prozesse beim Betrieb von Kimi-K3 (2.78T) auf einem vierknotigen Mac Studio M3 Ultra Cluster. Es werden detaillierte Messwerte zur Decode-Leistung, dem Kontext und dem Energieverbrauch präsentiert. Die Diskussion enthält auch nützliche Erkenntnisse zur dispatch-bound Decode und zur Fehlersuche.

Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA

Verdict (1 Satz): Diese Diskussion bietet umfassende Benchmark-Daten für verschiedene Modelle, Quantisierungen und Kontextlängen auf dem Mac Studio M3 Ultra, die für die Entscheidung zur Hardwareauswahl und Modellkonfiguration hilfreich sind.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: 5 Modelle (Qwen 32B, Llama 405B, Mixtral 8x7B, etc.)
tok/s-Claim: Detaillierte TPS-Werte für verschiedene Konfigurationen
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB (~10.000 EUR)

Kontext (2-3 Saetze): Der Beitrag präsentiert systematische Benchmark-Daten für fünf Modelle, sechs Quantisierungen und sieben Kontextlängen auf dem Mac Studio M3 Ultra. Es werden detaillierte TPS-Werte und TTFT-Zeiten für verschiedene Konfigurationen bereitgestellt, die zeigen, wie sich Kontextlänge und Quantisierung auf die Leistung auswirken.

MacOS MLX Control Center v0.4 Released (6/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Die Veröffentlichung des MacOS MLX Control Center v0.4 bietet eine benutzerfreundliche GUI für MLX, die die Verwaltung und den Betrieb von Modellen auf MacBooks erleichtert.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag stellt eine neue Version des MacOS MLX Control Center vor, die eine benutzerfreundliche GUI für MLX bietet. Es werden neue Features wie die Integration mit Hugging Face und verbesserte Benutzerfreundlichkeit hervorgehoben. Die GUI kann für Entwickler nützlich sein, die MLX auf ihren MacBooks verwenden.

MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference (8/10) — OpenCode-Fit: JA

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpunkte über das Internet zu erreichen, was für Anwendungen wie lokale Personal-Agenten und Entwicklungsworkflows von großer Bedeutung ist.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag stellt MacProvider vor, eine Schicht über mlx-lm, die es ermöglicht, MLX-Endpunkte über das Internet zu erreichen. Es werden Features wie Authentifizierung, Routing und verifizierbare Inference hervorgehoben. Die Diskussion ist besonders relevant für Entwickler, die MLX-Modelle in lokalen Anwendungen einsetzen möchten.

Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (8/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Field Report gibt erste Einblicke in die Leistung von Qwen3.8-2.4T-A95B auf einem vierknotigen Mac Studio M3 Ultra Cluster, was für die Entscheidung zur Modellauswahl und Hardwarekonfiguration hilfreich ist.
Hardware: 4× Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 2x Mac Studio M3 Ultra 512 GB = 1 TB Unified Memory (~20.000 EUR)

Kontext (2-3 Saetze): Der Beitrag präsentiert eine Field Report zum Betrieb von Qwen3.8-2.4T-A95B auf einem vierknotigen Mac Studio M3 Ultra Cluster. Es werden detaillierte Informationen zur Modellkonvertierung, Leistung und Verhaltensproben bereitgestellt. Die Diskussion enthält auch Erkenntnisse zur Quantisierung und der Speicherverwaltung.

Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (7/10) — OpenCode-Fit: BEDINGT

Verdict (1 Satz): Diese Diskussion untersucht die Qualität von sehr niedrig bitweiten Quantisierung in MLX und diskutiert mögliche Ansätze zur Optimierung der Modellgröße und Leistung.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag untersucht die Qualität von sehr niedrig bitweiten Quantisierung in MLX, insbesondere die Verwendung von 1-bit, ternary und 2-bit Quantisierung. Es werden Ansätze zur Optimierung der Modellgröße und Leistung durch gemischte Allokation und benutzerdefinierte Packer diskutiert. Die Diskussion ist besonders relevant für Entwickler, die sich mit der Quantisierung von Modellen auf Apple Silicon befassen.

THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO (6/10) — OpenCode-Fit: NEIN

Verdict (1 Satz): Diese Diskussion kritisiert die aktuelle Speicherkonfiguration von Apple-Produkten und hebt hervor, dass der 16-Zoll MacBook Pro mehr Speicher hat als der Mac Studio.
Hardware: Mac Studio, MacBook Pro
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Beitrag kritisiert die aktuelle Speicherkonfiguration von Apple-Produkten, insbesondere die Tatsache, dass der 16-Zoll MacBook Pro mehr Speicher hat als der Mac Studio. Es wird darauf hingewiesen, dass Apple diese Entscheidung getroffen hat, ohne dies öffentlich zu kommunizieren. Die Diskussion ist eher allgemein und weniger spezifisch für die MLX-Community.

Weitere Diskussionen:

MLX Community Projects
Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Can you stop gradients for part of a tensor?
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
Symbio: Self fine tuning ai agents
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)

👁 0 Aufrufe 👤 0 Leser