LeanOn Labor: Modell im Telefon

Experiment zur Spec „On-device LLM evaluation“. Ein kleines Sprachmodell wird in diesem Browser geladen (nichts verlässt das Gerät, nur der Modell-Download kommt von Hugging Face) und arbeitet mit synthetischen Tagebuchdaten. Gemessen werden Download, Ladezeit, erstes Token, Tokens pro Sekunde und ob die Ausgabe taugt.

Am 04.09.2026 neu gebaut, nach drei Befunden: die Eingabe steht jetzt als Fließtext da statt als Wertepaare (ein Modell ahmt die Form seiner Eingabe nach), die Chat-Vorlage kommt aus der Modelldatei selbst statt aus einer Vermutung, und gewürfelt wird mit den empfohlenen Werten (Temperatur 0,3, min_p 0,15, Wiederholungsbremse 1,05) statt streng gierig. Dazu wahlweise ein Beispiel und ein vorgegebener Satzanfang. Der Text soll neutral sein, ein Bericht für die Ärztin und keine Ich-Erzählung; die Prüfung meldet jedes ich, mein oder Sie. Die größeren Modelle (1,7B bis 3,8B) laufen praktisch nur auf dem Grafikchip; im Prozessor-Motor endet der Browser bei etwa 2 GB Modelldatei.

Bereit.

Eingabe (genau das bekommt das Modell)


  

Ausgabe

Prüfung

noch nichts

Messwerte

Vergleichswert: die deterministische Kurzfassung der Patienten-App braucht 0 Sekunden und macht per Konstruktion keinen Zahlenfehler. Das Modell muss sich daran messen lassen.