MLX-Community: Apple Silicon für lokale KI-Agenten
Das MLX-Projekt von Apple entwickelt sich kontinuierlich weiter, insbesondere im Bereich der lokalen KI-Agenten auf Apple Silicon. Aktuell steht der Fokus auf der Verbesserung der Modell-Unterstützung, der Quantisierung, der Performance und der Skalierung auf Clustern. Für Nutzer, die OpenCode-Workloads mit langen Kontexten und Tool-Calling-Funktionen ausführen möchten, sind diese Entwicklungen von großer Bedeutung.
JACCL Recv/Send -12 on 4-node TB5 after a successful first generate (6/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Diskussion zeigt Probleme bei der verteilten Ausführung von Modellen auf einem 4-Node-Cluster, was für den Betrieb von Claude-ähnlichen Agenten relevant ist.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: DeepSeek-V4-Pro-0813
tok/s-Claim: 19 tok/s (erste Generate)
Cluster-Bezug: Multi-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Nutzer berichtet über Fehler beim zweiten Generate in einer verteilten Umgebung. Es werden verschiedene Workarounds erwähnt, aber das Problem bleibt bestehen. Für den Betrieb von Claude-ähnlichen Agenten auf einem Cluster ist dies ein wichtiger Hinweis auf potenzielle Stabilitätsprobleme.
Field report: Qwen3.8-2.4T-A95B in TP4 on four M3 Ultras (early numbers) (7/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Field-Report zeigt, dass das Qwen3.8-2.4T-Modell auf einem 4-Node-Cluster lauffähig ist, aber die Performance und Stabilität weiter optimiert werden müssen.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Qwen3.8-2.4T-A95B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Multi-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Bericht beschreibt die ersten Erfahrungen mit dem Qwen3.8-2.4T-Modell auf einem 4-Node-Cluster. Es wird detailliert auf die Hardware- und Software-Stacks eingegangen und die ersten Stabilitäts- und Performance-Messungen präsentiert. Für den Betrieb von Claude-ähnlichen Agenten sind diese Informationen wertvoll, um die Grenzen des aktuellen Setups zu verstehen.
Quality quantization at very low bpw (<= 2 bit): mixed allocation + custom packers (5/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Diese Diskussion erkundet die Möglichkeiten der Quantisierung bei sehr niedrigen Bit-Raten, was für die Effizienz von Modellen auf Apple Silicon relevant sein kann.
Hardware: nicht im Post belegt
Modell: Qwen
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Nutzer untersucht, wie man durch gemischte Quantisierung und benutzerdefinierte Packer die Modellgröße reduzieren kann, ohne die Qualität zu stark zu beeinträchtigen. Es werden Vergleiche zu anderen Projekten wie GGUF und llama.cpp gezogen. Für den Betrieb von Claude-ähnlichen Agenten könnten diese Erkenntnisse hilfreich sein, um die Speicherverwendung zu optimieren.
Overview of three perf PRs for LLM inference (#3918, #3919, #3920) (8/10) — OpenCode-Fit: JA
Verdict (1 Satz): Diese PRs verbessern die Performance von LLM-Inferenz auf Apple Silicon, was für den Betrieb von Claude-ähnlichen Agenten entscheidend ist.
Hardware: M3 Max
Modell: Qwen3.6-35B-A3B
tok/s-Claim: +6.2% MoE prefill at 32K, +2.8% prefill end to end, +2.0 to 2.8% decode
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Drei Performance-PRs werden vorgestellt, die verschiedene Aspekte der LLM-Inferenz optimieren. Die Verbesserungen betreffen die Kernel-Performance, die Maskierung und den CPU-Overhead. Diese Optimierungen können die Gesamtleistung von Claude-ähnlichen Agenten erheblich steigern.
[Kimi-K3 (2.78T) in TP4 on four M3 Ultras — dispatch-bound decode, and some things I had wrong [ongoing debugging]](https://github.com/ml-explore/mlx/discussions/3939) (7/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Diskussion zeigt, dass das Kimi-K3-Modell auf einem 4-Node-Cluster lauffähig ist, aber die Performance durch dispatch-bound Decode eingeschränkt wird.
Hardware: 4x Mac Studio M3 Ultra 512 GB
Modell: Kimi-K3 (2.78T)
tok/s-Claim: ~2.0 tok/s single stream, 21.2 tok/s aggregate at 32 concurrent
Cluster-Bezug: Multi-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Nutzer untersucht die Performance des Kimi-K3-Modells auf einem 4-Node-Cluster. Es wird detailliert auf die dispatch-bound Decode-Performance eingegangen und die Auswirkungen auf die Gesamtleistung analysiert. Für den Betrieb von Claude-ähnlichen Agenten sind diese Erkenntnisse wichtig, um die Grenzen des aktuellen Setups zu verstehen.
Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra (9/10) — OpenCode-Fit: JA
Verdict (1 Satz): Diese systematischen Benchmarks liefern wertvolle Erkenntnisse zur Performance von verschiedenen Modellen und Quantisierungen auf Apple Silicon, was für den Betrieb von Claude-ähnlichen Agenten entscheidend ist.
Hardware: Mac Studio M3 Ultra 512 GB
Modell: Qwen 32B, Llama 405B, Mixtral 8x7B
tok/s-Claim: Detaillierte TPS-Werte für verschiedene Modelle, Quantisierungen und Kontextlängen
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Die Benchmarks zeigen, dass die Kontextlänge einen größeren Einfluss auf die Performance als die Quantisierung hat. Es werden detaillierte TPS-Werte für verschiedene Modelle, Quantisierungen und Kontextlängen präsentiert. Diese Daten sind entscheidend für die Entscheidung, welche Hardware und Modelle für den Betrieb von Claude-ähnlichen Agenten am besten geeignet sind.
THE MACBOOK PRO HOLDS MORE MODEL WEIGHTS THAN THE MAC STUDIO (5/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Diese Diskussion kritisiert die aktuelle Speicherbegrenzung des Mac Studio und die daraus resultierenden Einschränkungen für den Betrieb von KI-Modellen.
Hardware: Mac Studio, MacBook Pro
Modell: nicht im Post belegt
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Nutzer kritisiert, dass der Mac Studio weniger Speicher als der MacBook Pro hat, was die Fähigkeit einschränkt, große KI-Modelle lokal zu betreiben. Es wird darauf hingewiesen, dass Apple diese Entscheidung getroffen hat, ohne dies offenzulegen. Für den Betrieb von Claude-ähnlichen Agenten sind diese Informationen relevant, um die Hardware-Entscheidungen zu treffen.
Sliding window doesn’t bound KV memory on Gemma-3/4 — the global-attention layers grow unbounded (note + growth model) (6/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Diskussion zeigt, dass das KV-Cache-Gedächtnis bei Gemma-3/4-Modellen unbeschränkt wächst, was für den Betrieb von Claude-ähnlichen Agenten mit langen Kontexten relevant ist.
Hardware: nicht im Post belegt
Modell: Gemma-3/4
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Nutzer erklärt, dass das KV-Cache-Gedächtnis bei Gemma-3/4-Modellen unbeschränkt wächst, obwohl diese als sliding-window-Modelle beschrieben werden. Es werden detaillierte Erklärungen zur Mechanik und den Auswirkungen auf die Speicherverwendung gegeben. Für den Betrieb von Claude-ähnlichen Agenten mit langen Kontexten sind diese Informationen wichtig, um potenzielle Speicherprobleme zu vermeiden.
Streaming-video VLMs in MLX are LM-prefill-bound — what does M5’s Neural Accelerator do to the frontier? (7/10) — OpenCode-Fit: BEDINGT
Verdict (1 Satz): Diese Diskussion untersucht, wie die Neural Accelerator des M5-Chips die Performance von streaming-video VLMs verbessern könnte.
Hardware: M3 Max, M5
Modell: FastVLM-0.5B, FastVLM-1.5B, FastVLM-7B, Idefics3-8B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Nutzer untersucht, wie die Neural Accelerator des M5-Chips die Performance von streaming-video VLMs verbessern könnte. Es wird detailliert auf die aktuelle Performance und die möglichen Verbesserungen eingegangen. Für den Betrieb von Claude-ähnlichen Agenten mit Video-Unterstützung sind diese Erkenntnisse relevant, um die Hardware-Entscheidungen zu treffen.
atlas: measured-cost quantization for MLX — give it a RAM budget, it finds the optimal (bit-width, group-size) plan (6/10) — OpenCode-Fit: NEIN
Verdict (1 Satz): Diese Diskussion stellt ein neues Quantisierungstool vor, das die Modellgröße und die Performance optimiert.
Hardware: nicht im Post belegt
Modell: Qwen2.5-7B-Instruct, TinyLlama-1.1B
tok/s-Claim: nicht im Post belegt
Cluster-Bezug: nicht im Post belegt
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Nutzer stellt ein neues Quantisierungstool vor, das die Modellgröße und die Performance optimiert. Es wird detailliert auf die Funktionsweise und die Ergebnisse eingegangen. Für den Betrieb von Claude-ähnlichen Agenten könnten diese Erkenntnisse hilfreich sein, um die Speicherverwendung und die Performance zu optimieren.
mlx-serve: native Zig LLM server for Apple Silicon – OpenAI + Anthropic + Ollama APIs, no Python (8/10) — OpenCode-Fit: JA
Verdict (1 Satz): Diese Diskussion stellt eine native Zig-Serverlösung für MLX-Modelle vor, die OpenAI-, Anthropic- und Ollama-APIs unterstützt.
Hardware: nicht im Post belegt
Modell: verschiedene MLX-Modelle
tok/s-Claim: 35%+ faster decode than LM Studio on Gemma 4 E4B
Cluster-Bezug: Single-Node
Investment-Empfehlung: nicht aus Titel ableitbar
Kontext (2-3 Saetze): Der Nutzer stellt `mlx-serve` vor, eine native Zig-Serverlösung für MLX-Modelle, die OpenAI-, Anthropic- und Ollama-APIs unterstützt. Es wird detailliert auf die Funktionen und die Performance-Vorteile eingegangen. Für den Betrieb von Claude-ähnlichen Agenten ist diese Lösung besonders interessant, da sie eine Python-freie Umgebung bietet und die Performance verbessert.
Weitere Diskussionen:
– Symbio: Self fine tuning ai agents
– Small-L fused expert gather for fine-grained MoE decode — measured expert-overlap data on GLM-5.2 (34% adjacent-token, depth-graded to 52%)
– Can you stop gradients for part of a tensor?
– MLX Community Projects