@floknowsai: Wenn dein lokales KI-Modell zu langsam ist, solltest du dir diese Fähigkeiten und dieses Wissen aneignen. Dein Modell liest für jedes Token alle Modellgewichte einmal aus dem Speicher. Je mehr dabei zu lesen ist, desto weniger Tokens pro Sekunde bekommst du. Passt es nicht ganz in deinen Grafikspeicher, regelst du das über GPU Offload. Wie viel gelesen wird, bestimmt die Quantisierung im Namen deiner GGUF-Modelldatei, meistens Q4 oder Q8. #ki #lokaleki #ollama #lmstudio #grafikkarte