LeanOn Labor: Modell im Telefon

Experiment zur Spec „On-device LLM evaluation“. Ein kleines Sprachmodell wird in diesem Browser geladen (nichts verlässt das Gerät, nur der Modell-Download kommt von Hugging Face) und arbeitet mit synthetischen Tagebuchdaten. Gemessen werden Download, Ladezeit, erstes Token, Tokens pro Sekunde und ob die Ausgabe taugt.

Am 15.09.2026 ergänzt: der Fall Emma Mueller mit genau den Eingaben der Klinik-Demo und zwei neue Aufgaben. Aktuelle Beschwerden soll aussehen wie der Anamnese-Entwurf der Klinik; Behandlerfragen mit Frage und Antwort setzt jede Antwort unter ihre Frage und nimmt die offenen Punkte vom letzten Termin dazu. In beiden schreibt das Modell nur je Notiz einen kurzen Stichpunkt; eine englische Notiz wird vorher in einem eigenen Aufruf übersetzt. Zahlen, Daten und welche Notiz zu welcher Frage gehört, macht die Seite, und jeder Stichpunkt wird geprüft; fällt er durch, steht die Notiz im Wortlaut da. Die Fragen der Patientin gehen nie an das Modell.
Welches Modell aufs iPhone passt (Stand 15.09.2026, iPhone 16 Pro): Gemma 3 1B schreibt am besten (alle Durchläufe bestanden, 10 von 12 Stichpunkten angenommen) und läuft dort mit llama.cpp im Browser: vier Notizen in 21 Sekunden mit mehreren Threads, in 32 Sekunden mit einem (der allererste Lauf mit einem Thread brauchte 88 Sekunden). Das ist auf Telefonen jetzt vorausgewählt. Mit WebLLM auf dem Grafikchip reicht dem Tab für Gemma der Arbeitsspeicher nicht, ebenso für Qwen3.5 0.8B; dort lädt nur Llama 3.2 1B, das schwächer schreibt. Stürzt ein Ladeversuch ab, wählt die Seite die nächste Möglichkeit und nennt, wie weit das Laden kam. Die Speicherpuffer des Grafikchips sind kein Hindernis: das iPhone 16 Pro erlaubt 1 GB je Puffer, der Wert steht unter dem Status. Und llama.cpp läuft jetzt auch in Safari (dort fehlt WebAssembly mit 64-Bit-Speicher, daher der Fehler mit BigInt; die Seite nimmt dann wllama 2.3.7).
Am 04.09.2026 neu gebaut, nach drei Befunden: die Eingabe steht jetzt als Fließtext da statt als Wertepaare (ein Modell ahmt die Form seiner Eingabe nach), die Chat-Vorlage kommt aus der Modelldatei selbst statt aus einer Vermutung, und gewürfelt wird mit den empfohlenen Werten (Temperatur 0,3, min_p 0,15, Wiederholungsbremse 1,05) statt streng gierig. Dazu wahlweise ein Beispiel und ein vorgegebener Satzanfang. Der Text soll neutral sein, ein Bericht für die Ärztin und keine Ich-Erzählung; die Prüfung meldet jedes ich, mein oder Sie. Die größeren Modelle (1,7B bis 3,8B) laufen praktisch nur auf dem Grafikchip; im Prozessor-Motor endet der Browser bei etwa 2 GB Modelldatei.

Bereit.

Eingabe (genau das bekommt das Modell)


  

Ausgabe

Prüfung

noch nichts

Messwerte

Vergleichswert: die deterministische Kurzfassung der Patienten-App braucht 0 Sekunden und macht per Konstruktion keinen Zahlenfehler. Das Modell muss sich daran messen lassen.