DeepSeek V4 Flash auf dem DGX Spark: unsere Einstellungen
Welche Flags wir für DeepSeek-V4-Flash im 3-Bit-Quant gesetzt haben — Kontext, KV-Cache, Sampler-Reihenfolge, DRY — und warum jede einzelne.
WeiterlesenExperimente mit lokaler KI aus eigener Hand — Aufbau, Messung, Ergebnis. Ehrlich dokumentiert, auch die Fehlschläge.
Welche Flags wir für DeepSeek-V4-Flash im 3-Bit-Quant gesetzt haben — Kontext, KV-Cache, Sampler-Reihenfolge, DRY — und warum jede einzelne.
WeiterlesenEin Assistent auf nanobot verlor seine Rolle: Bei stark quantisierten Modellen entscheidet die Position im Systemprompt, nicht die Wiederholung.
Weiterlesenpaperless-ai klassifizierte wochenlang nichts: Der Restrict-Modus unterdrückte still das Tag-Vokabular — 3.335 Aufrufe ohne Wirkung.
WeiterlesenVier Tuning-Eingriffe und eine Vektordatenbank: alle plausibel, alle wieder ausgebaut. Was am Ende wirklich half, kostete keine Rechenzeit.
WeiterlesenWir haben Jack Dorseys Agenten-Chat lokal aufgesetzt, zum Laufen gebracht und am selben Abend wieder entfernt. Der Grund war nicht die Software — und die lehrreichste Stunde kam ganz am Schluss.
WeiterlesenEin kleines lokales Modell mit prüfbarer Wissensbasis schlug ein 120B-Modell — von 37 auf 91 % Tool-Trefferquote an einem Tag, ohne einen Trainingsschritt.
WeiterlesenAb 2. August verlangt der AI Act Kennzeichnung von KI-Inhalten — mit redaktioneller Verantwortung greift eine Ausnahme. Warum wir trotzdem kennzeichnen.
WeiterlesenEine KI, die selbstbewusst danebenliegt, ist gefährlicher als eine, die sich ehrlich enthält. Warum wir Enthaltung höher werten als Trefferquote.
WeiterlesenA/B-Tests zeigen: Beim 27B-Modell kauft der Thinking-Modus nur Wartezeit. Mehr billige Versuche und kleinerer Zuschnitt sind der Hebel.
WeiterlesenEin lokaler KI-Server, drei Modelle für drei Aufgaben: warum ein kleines MoE ein größeres Dense-Modell schlägt — und Bandbreite mehr zählt als Parameter.
Weiterlesen