@floknowsai: Wenn dein lokales KI-Modell zu langsam ist, solltest du dir diese Fähigkeiten und dieses Wissen aneignen. Dein Modell liest für jedes Token alle Modellgewichte einmal aus dem Speicher. Je mehr dabei zu lesen ist, desto weniger Tokens pro Sekunde bekommst du. Passt es nicht ganz in deinen Grafikspeicher, regelst du das über GPU Offload. Wie viel gelesen wird, bestimmt die Quantisierung im Namen deiner GGUF-Modelldatei, meistens Q4 oder Q8. #ki #lokaleki #ollama #lmstudio #grafikkarte

Florian Schünemann
Florian Schünemann
Open In TikTok:
Region: DE
Sunday 30 August 2026 11:23:43 GMT
3236
138
12
4

Music

Download

Comments

chrisd50
Chris :
Hat jemand Erfahrung mit einem Mac M5 Pro und 128GB RAM? Bin am überlegen einen Mac Studio mit der Config zu holen.
2026-08-30 13:58:04
1
hh_jung1406
Andreas S. :
Welches Model ist für Mac m5 Max 128 GB am besten geeignet?
2026-08-30 14:41:55
0
dubdubtv0
Dubdub :
Und was geht mit einem M5 Pro 64 GB? 😅
2026-08-30 14:36:16
0
orangensaft344
Orangensaft 🍊🇩🇪🇹🇷 :
Empfiehlst du ein System mit Rtx 5090 oder ein Mac mit unified memory für lokale kis?
2026-08-30 12:00:36
0
clachoflink
𝕮𝖑𝖆𝖈𝖍𝖔𝖋𝖑𝖎𝖓𝖐 :
Ich habe 12 GB vram
2026-08-30 12:14:44
0
To see more videos from user @floknowsai, please go to the Tikwm homepage.

Other Videos


About