Welches lokale Modell läuft auf welcher Hardware?

Welches lokale Modell läuft auf welcher Hardware?

- Matt

Die häufigste Enttäuschung beim ersten Versuch mit lokalen Modellen: Man lädt etwas herunter, es startet, und dann antwortet es mit zwei Wörtern pro Sekunde. Das liegt fast immer daran, dass das Modell nicht in den Grafikspeicher passt.

Die Rechnung

Ein Modell hat eine Anzahl Parameter, üblicherweise in Milliarden. Der Speicherbedarf ergibt sich aus Parametern mal Bytes pro Parameter:

Quantisierung Bytes/Parameter 8B-Modell 14B-Modell
FP16 (unquantisiert) 2 ~16 GB ~28 GB
Q8 1 ~8 GB ~14 GB
Q5_K_M ~0,7 ~5,6 GB ~10 GB
Q4_K_M ~0,55 ~4,5 GB ~8 GB

Dazu kommt der Speicher für den Kontext, der mit der Länge wächst. Als grobe Reserve rechne ich 1 bis 2 GB obendrauf.

Passt das Ergebnis in den Grafikspeicher, läuft alles auf der GPU. Passt es nicht, lagert die Software Teile in den Arbeitsspeicher aus, und die Geschwindigkeit bricht um eine Größenordnung ein. Genau dieser Übergang ist die Klippe.

Was Quantisierung kostet

Q4_K_M ist der übliche Kompromiss und in den meisten Fällen kaum vom Original zu unterscheiden. Unterhalb davon, also bei Q3 oder Q2, wird es merklich: Das Modell bleibt sprachlich flüssig, fängt aber an, Details zu erfinden. Das ist die unangenehmste Fehlerart, weil sie nicht wie ein Fehler aussieht.

Meine Regel: lieber ein kleineres Modell mit Q4 als ein größeres mit Q2.

Praktisch

Bei 8 GB Grafikspeicher sind 8B-Modelle mit Q4 die vernünftige Wahl. Bei 12 bis 16 GB kommen 14B-Modelle dazu. Alles darüber wird für den Hausgebrauch teuer.

Ohne dedizierte Grafikkarte läuft es trotzdem, nur eben auf der CPU. Bei einem 8B-Modell mit Q4 lande ich dann bei etwa 5 bis 8 Wörtern pro Sekunde, was zum Zuschauen zu langsam, für einen Hintergrundprozess aber vollkommen ausreichend ist.

Was ich vorher gern gewusst hätte: Der Arbeitsspeicher ist selten das Problem, der Grafikspeicher fast immer.