MLX-Community: Apple Silicon für lokale KI-Agenten

# MLX-Community: Apple Silicon für lokale KI-Agenten ![MLX Repository](https://opengraph.githubassets.com/1/ml-explore/mlx) Das MLX-Projekt (Machine Learning on Apple Silicon) ist derzeit in vollem

MLX-Community: Apple Silicon für lokale KI-Agenten

MLX Repository

Das MLX-Projekt (Machine Learning on Apple Silicon) ist derzeit in vollem Schwung, insbesondere bei der Entwicklung von lokalen KI-Agenten und der Optimierung von LLMs (Large Language Models) auf Apple-Hardware. Die Community arbeitet intensiv an der Unterstützung neuer Modelle, der Verbesserung der Performance und der Erweiterung der Funktionalität für OpenCode-Workloads.

[Awesome MLX — curated list of 80+ MLX projects, tools, and resources] (6/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Sammlung von MLX-Projekten bietet eine umfassende Übersicht, die für die Entwicklung von OpenCode-Agenten nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Liste durchgehen, um relevante Tools und Projekte für seine spezifischen Anforderungen zu finden. Besonders die Kategorien „Inference & Serving“ und „Training & Fine-tuning“ können für die Entwicklung von OpenCode-Agenten hilfreich sein.

[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]] (8/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Discussion liefert wertvolle Einblicke in die Performance von Kimi-K3 auf einem 4-Node-Cluster, was für den Einsatz von OpenCode-Agenten relevant sein kann.
Hardware: 4× M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate at 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 2x Mac Studio M3 Ultra 512 GB = 1 TB Unified Memory (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Performance-Daten und die Debugging-Informationen prüfen, um zu verstehen, wie Kimi-K3 auf einem 4-Node-Cluster läuft. Besonders die dispatch-bound Decode-Problematik und die Power-Verbrauchszahlen sind relevant.

[Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra] (9/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): Diese umfassenden Benchmark-Daten sind entscheidend für den Vergleich verschiedener Modelle und Quantisierungen auf Apple-Hardware, insbesondere für OpenCode-Workloads.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: 5 Modelle (Qwen, Llama, Mixtral, etc.)
tok/s-Claim: Variiert je nach Modell, Quantisierung und Kontextlänge
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB (~10.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Benchmark-Daten sorgfältig durchgehen, um die besten Modelle und Quantisierungen für seine spezifischen Anforderungen auszuwählen. Die Daten zeigen, dass der Kontextlänge eine größere Bedeutung für die Performance zukommt als der Quantisierungsgrad.

[MacOS MLX Control Center v0.4 Released] (5/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Die MLX Control Center GUI kann die Verwaltung von MLX-Modellen auf MacBooks erleichtern, aber sie ist eher für Einzelnutzer geeignet.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die GUI ausprobieren, um zu sehen, ob sie für seine Bedürfnisse geeignet ist. Besonders die Integration mit Hugging Face und die neuen Features in v0.4 sind erwähnenswert.

[MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference] (7/10) — OpenCode-Fit: JA

Zur Discussion

Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für die Entwicklung von OpenCode-Agenten nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte MacProvider ausprobieren, um zu sehen, wie es für seine Anwendungen geeignet ist. Die Verifizierung von Inferences und die Unterstützung von Multi-Tenant-Routing sind besonders interessant.

[Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers)] (8/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Field-Report liefert wertvolle Einblicke in die Performance von Qwen3.8-2.4T auf einem 4-Node-Cluster, was für den Einsatz von OpenCode-Agenten relevant sein kann.
Hardware: 4× M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 2x Mac Studio M3 Ultra 512 GB = 1 TB Unified Memory (~20.000 EUR)

Kontext (2-3 Saetze): Der Leser sollte die Field-Report-Daten sorgfältig durchgehen, um zu verstehen, wie Qwen3.8-2.4T auf einem 4-Node-Cluster läuft. Besonders die Notwendigkeit der 4-bit-Quantisierung und die Stabilität der Inferences sind relevant.

[Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers] (6/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Diese Discussion untersucht die Möglichkeiten der sehr niedrigen Bit-Quantisierung, was für die Effizienz von OpenCode-Agenten relevant sein kann.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte die Diskussion über die Quantisierungstechniken lesen, um zu verstehen, wie sie die Modellgröße und die Performance beeinflussen. Besonders die K-quant-hierarchische Skalierung und die sub-2-bit/Packer sind interessant.

[Symbio: Self fine tuning ai agents] (6/10) — OpenCode-Fit: BEDINGT

Zur Discussion

Verdict (1 Satz): Symbio ist ein lokaler AI-Agent, der sich selbst feintunen kann, was für die Entwicklung von OpenCode-Agenten nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar

Kontext (2-3 Saetze): Der Leser sollte Symbio ausprobieren, um zu sehen, wie es für seine Anwendungen geeignet ist. Die automatische Fehlerkorrektur und das dynamische Feintuning sind besonders interessant.

Weitere Diskussionen:

MLX Community Projects
Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
Can you stop gradients for part of a tensor?
Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO

👁 4 Aufrufe 👤 4 Leser