MLX-Community: Apple Silicon für lokale KI-Agenten
Das MLX-Projekt (Machine Learning on Apple Silicon) ist derzeit in vollem Schwung, insbesondere bei der Entwicklung von lokalen KI-Agenten und der Optimierung von LLMs (Large Language Models) auf Apple-Hardware. Die Community arbeitet intensiv an der Unterstützung neuer Modelle, der Verbesserung der Performance und der Erweiterung der Funktionalität für OpenCode-Workloads.
[Awesome MLX — curated list of 80+ MLX projects, tools, and resources] (6/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Sammlung von MLX-Projekten bietet eine umfassende Übersicht, die für die Entwicklung von OpenCode-Agenten nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Leser sollte die Liste durchgehen, um relevante Tools und Projekte für seine spezifischen Anforderungen zu finden. Besonders die Kategorien „Inference & Serving“ und „Training & Fine-tuning“ können für die Entwicklung von OpenCode-Agenten hilfreich sein.
[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]] (8/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Discussion liefert wertvolle Einblicke in die Performance von Kimi-K3 auf einem 4-Node-Cluster, was für den Einsatz von OpenCode-Agenten relevant sein kann.
Hardware: 4× M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate at 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 2x Mac Studio M3 Ultra 512 GB = 1 TB Unified Memory (~20.000 EUR)
Kontext (2-3 Saetze): Der Leser sollte die Performance-Daten und die Debugging-Informationen prüfen, um zu verstehen, wie Kimi-K3 auf einem 4-Node-Cluster läuft. Besonders die dispatch-bound Decode-Problematik und die Power-Verbrauchszahlen sind relevant.
[Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra] (9/10) — OpenCode-Fit: JA
Verdict (1 Satz): Diese umfassenden Benchmark-Daten sind entscheidend für den Vergleich verschiedener Modelle und Quantisierungen auf Apple-Hardware, insbesondere für OpenCode-Workloads.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: 5 Modelle (Qwen, Llama, Mixtral, etc.)
tok/s-Claim: Variiert je nach Modell, Quantisierung und Kontextlänge
Cluster-Bezug: Single-Node
Investment-Empfehlung: Mac Studio M3 Ultra 512 GB (~10.000 EUR)
Kontext (2-3 Saetze): Der Leser sollte die Benchmark-Daten sorgfältig durchgehen, um die besten Modelle und Quantisierungen für seine spezifischen Anforderungen auszuwählen. Die Daten zeigen, dass der Kontextlänge eine größere Bedeutung für die Performance zukommt als der Quantisierungsgrad.
[MacOS MLX Control Center v0.4 Released] (5/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Die MLX Control Center GUI kann die Verwaltung von MLX-Modellen auf MacBooks erleichtern, aber sie ist eher für Einzelnutzer geeignet.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Leser sollte die GUI ausprobieren, um zu sehen, ob sie für seine Bedürfnisse geeignet ist. Besonders die Integration mit Hugging Face und die neuen Features in v0.4 sind erwähnenswert.
[MacProvider — making mlx-lm endpoints addressable over the internet, with verifiable inference] (7/10) — OpenCode-Fit: JA
Verdict (1 Satz): MacProvider ermöglicht es, MLX-Endpoints über das Internet zu erreichen, was für die Entwicklung von OpenCode-Agenten nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Leser sollte MacProvider ausprobieren, um zu sehen, wie es für seine Anwendungen geeignet ist. Die Verifizierung von Inferences und die Unterstützung von Multi-Tenant-Routing sind besonders interessant.
[Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers)] (8/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Field-Report liefert wertvolle Einblicke in die Performance von Qwen3.8-2.4T auf einem 4-Node-Cluster, was für den Einsatz von OpenCode-Agenten relevant sein kann.
Hardware: 4× M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Multi-Node
Investment-Empfehlung: 2x Mac Studio M3 Ultra 512 GB = 1 TB Unified Memory (~20.000 EUR)
Kontext (2-3 Saetze): Der Leser sollte die Field-Report-Daten sorgfältig durchgehen, um zu verstehen, wie Qwen3.8-2.4T auf einem 4-Node-Cluster läuft. Besonders die Notwendigkeit der 4-bit-Quantisierung und die Stabilität der Inferences sind relevant.
[Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers] (6/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Discussion untersucht die Möglichkeiten der sehr niedrigen Bit-Quantisierung, was für die Effizienz von OpenCode-Agenten relevant sein kann.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Leser sollte die Diskussion über die Quantisierungstechniken lesen, um zu verstehen, wie sie die Modellgröße und die Performance beeinflussen. Besonders die K-quant-hierarchische Skalierung und die sub-2-bit/Packer sind interessant.
[Symbio: Self fine tuning ai agents] (6/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Symbio ist ein lokaler AI-Agent, der sich selbst feintunen kann, was für die Entwicklung von OpenCode-Agenten nützlich sein kann.
Hardware: nicht im Post belegt
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Leser sollte Symbio ausprobieren, um zu sehen, wie es für seine Anwendungen geeignet ist. Die automatische Fehlerkorrektur und das dynamische Feintuning sind besonders interessant.
Weitere Diskussionen:
– MLX Community Projects
– Suggestion: auto CPU/GPU dispatch heuristic + GPU-side extended-precision („decimal“) arithmetic
– JACCL Recv/Send -12 on 4-node TB5 after a successful first generate
– Can you stop gradients for part of a tensor?
– Overview of three perf PRs for LLM inference (#3918, #3919, #3920)
– Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
– THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO