I spent five months of high-school evenings building a local AI that actually runs my PC. Files, apps, browser, voice, and it holds up on a 9B. (10/10)

![Vorschau](https://www.redditstatic.com/shreddit/assets/favicon/192x192.png) ## I spent five months of high-school evenings building a local AI that actually runs my PC. Files, apps, browser, voice,

Vorschau

I spent five months of high-school evenings building a local AI that actually runs my PC. Files, apps, browser, voice, and it holds up on a 9B. (10/10)

Bewertung: Relevanz 3/3 | Qualitaet 3/3 | Umsetzbarkeit 2/2 | Aktualitaet 2/2 = 10/10

Hearth ist ein offenes, selbstgebautes AI-System, das lokal auf einem PC läuft und verschiedene Aufgaben wie Dateiverwaltung, App-Kontrolle, Browser-Steuerung und Sprachbefehle ausführen kann. Es ist besonders relevant für den Nutzer, da es komplett selbst-hosted ist, Open Source und auf lokalen GPUs wie der RTX 3090 laufen kann. Der Nutzer sollte Hearth testen, um zu sehen, wie es in seinem Homelab integriert werden kann, insbesondere für automatisierte Aufgaben und Smart Home Integrationen.

open-deepthink 0.1.11 — Qualitative self-attention in multi-agent brainstorming + App Slot Machine (diffusion for app prompts) + portable /qnn & /qdad skills (9/10)

Bewertung: Relevanz 3/3 | Qualitaet 3/3 | Umsetzbarkeit 2/2 | Aktualitaet 1/2 = 9/10

Open-deepthink ist ein offenes, multi-agentiges System, das LLMs wie Neuronen in einem Netzwerk behandelt. Es bietet qualitative Selbst-Aufmerksamkeit, eine App-Slot-Maschine und portable Skills. Dies ist sehr relevant für den Nutzer, da es erweiterte Funktionen für lokale LLMs und KI-Tools bereitstellt, die in einem Homelab integriert werden können. Der Nutzer sollte die neuen Features testen, insbesondere die qualitative Selbst-Aufmerksamkeit und die App-Slot-Maschine, um zu sehen, wie sie in bestehende Workflows integriert werden können.

I built an open-source tool to version, compare and approve plans, then execute them with interactive, and isolated worker agents. Works with Codex & Claude Code. (9/10)

Bewertung: Relevanz 3/3 | Qualitaet 3/3 | Umsetzbarkeit 2/2 | Aktualitaet 1/2 = 9/10

BDFL ist ein offenes Delegations-Tool, das es ermöglicht, Pläne zu versionieren, zu vergleichen und in kleineren Schritten auszuführen. Es unterstützt verschiedene LLMs wie Codex und Claude Code. Dies ist sehr relevant für den Nutzer, da es die Planung und Ausführung von Aufgaben in einem Homelab vereinfacht. Der Nutzer sollte BDFL testen, um zu sehen, wie es in bestehende Workflows integriert werden kann, insbesondere für komplexe Projekte und Aufgaben.

DSV4 Flash DSpark is the GOAT on Dual Sparks (8/10)

Bewertung: Relevanz 3/3 | Qualitaet 2/3 | Umsetzbarkeit 2/2 | Aktualitaet 1/2 = 8/10

DSV4 Flash DSpark ist ein hochleistungsfähiges Modell, das auf Dual Spark-GPUs ausgeführt wird. Es bietet schnelle und qualitativ hochwertige Antworten, was es sehr relevant für den Nutzer macht, der lokale LLMs auf RTX 3090 und anderen GPUs betreibt. Der Nutzer sollte das Modell testen, um zu sehen, wie es in bestehende Workflows integriert werden kann, insbesondere für schnelle und genaue Aufgaben.

What’s the best uncensored model out there for 16Gb VRAM + 64Gb RAM? (7/10)

Bewertung: Relevanz 2/3 | Qualitaet 2/3 | Umsetzbarkeit 2/2 | Aktualitaet 1/2 = 7/10

Dieser Post diskutiert die besten uncensored Modelle für Systeme mit 16GB VRAM und 64GB RAM. Es ist relevant für den Nutzer, der lokale LLMs betreibt, da es ihm hilft, die besten Modelle für seine Hardware auszuwählen. Der Nutzer sollte die vorgeschlagenen Modelle testen, um zu sehen, welche am besten zu seinen Anforderungen passen.

Apple M5 isn’t making full use of its matmul cores yet (7/10)

Bewertung: Relevanz 2/3 | Qualitaet 2/3 | Umsetzbarkeit 1/2 | Aktualitaet 2/2 = 7/10

Dieser Post behandelt die Optimierung von LLMs auf Apple M5-Chips. Es ist relevant für den Nutzer, der auch AMD-GPUs betreibt, da es allgemeine Optimierungstechniken für LLMs auf verschiedenen Hardwareplattformen aufzeigt. Der Nutzer sollte die vorgeschlagenen Optimierungen testen, um zu sehen, ob sie auch auf seine AMD-GPUs anwendbar sind.

PSA on Laguna S-2.1 – Use the updated chat template and GGUF (7/10)

Bewertung: Relevanz 2/3 | Qualitaet 2/3 | Umsetzbarkeit 2/2 | Aktualitaet 1/2 = 7/10

Dieser Post informiert über Updates für das Laguna S-2.1-Modell, einschließlich eines verbesserten Chat-Templates und GGUF-Dateien. Es ist relevant für den Nutzer, der lokale LLMs betreibt, da es die Leistung und Stabilität der Modelle verbessert. Der Nutzer sollte die neuen Dateien testen, um zu sehen, wie sie die Leistung seiner Modelle verbessern.

Qwen, llama.cpp and rocm in docker weirdness (6/10)

Bewertung: Relevanz 2/3 | Qualitaet 2/3 | Umsetzbarkeit 1/2 | Aktualitaet 1/2 = 6/10

Dieser Post diskutiert Probleme beim Betrieb von Qwen und llama.cpp in Docker-Containern auf ROCm-basierten Systemen. Es ist relevant für den Nutzer, der ROCm auf seinen AMD-GPUs verwendet. Der Nutzer sollte die beschriebenen Probleme beachten und mögliche Workarounds testen, um die Kompatibilität zu verbessern.

I trained a 0.5M model on 1B tokens of Fineweb-edu dataset (6/10)

Bewertung: Relevanz 2/3 | Qualitaet 2/3 | Umsetzbarkeit 1/2 | Aktualitaet 1/2 = 6/10

Dieser Post beschreibt die Erstellung eines kleinen LLMs, der auf einem spezialisierten Datensatz trainiert wurde. Es ist relevant für den Nutzer, der kleine, spezialisierte Modelle für spezifische Aufgaben benötigt. Der Nutzer sollte das Modell testen, um zu sehen, wie es in seine Anwendungen integriert werden kann.

I distilled an 8B teacher into a 0.6B student on my Mac (MLX). The 0.6B went from 36% to 100% on the task, but few-shot prompting actively made it worse. (6/10)

Bewertung: Relevanz 2/3 | Qualitaet 2/3 | Umsetzbarkeit 1/2 | Aktualitaet 1/2 = 6/10

Dieser Post beschreibt die Distillation eines großen Modells in ein kleineres Modell, das auf einem Mac mit MLX läuft. Es ist relevant für den Nutzer, der kleine, effiziente Modelle für spezifische Aufgaben benötigt. Der Nutzer sollte die Distillationstechniken testen, um zu sehen, wie sie in sein Setup integriert werden können.

To use –cpu-moe or not to use? That is the question. (5/10)

Bewertung: Relevanz 2/3 | Qualitaet 1/3 | Umsetzbarkeit 1/2 | Aktualitaet 1/2 = 5/10

Dieser Post diskutiert die Verwendung der `–cpu-moe`-Option in llama.cpp. Es ist relevant für den Nutzer, der LLMs auf lokalen GPUs betreibt, da es die Performance beeinflusst. Der Nutzer sollte die Option testen, um zu sehen, welche Einstellungen die besten Ergebnisse liefern.

Nicht bewertet:

– Prompt Injection in NeurIPS 2026? [D]
– I distilled an 8B teacher into a 0.6B student on my Mac (MLX). The 0.6B went from 36% to 100% on the task, but few-shot prompting actively made it worse.

👁 4 Aufrufe 👤 4 Leser