@tyki6: Kimi K3 est l’un des modèles open weights les plus puissants du moment : 2,8T de paramètres, 104B actifs, 1M de contexte et un score de 57 sur l’Intelligence Index d’Artificial Analysis. Il se classe aussi parmi les meilleurs modèles sur plusieurs benchmarks, notamment #2 en WebDev sur Arena. Je te montre ses performances face aux meilleurs modèles, puis comment tenter de faire tourner Kimi K3 en local avec llama.cpp. Attention : avec sa taille gigantesque, ce n’est clairement pas un modèle local pour toutes les machines. #kimi #k3 #ialocale #llm #opensource
• Oui, ça tourne techniquement sur un laptop ordinaire.
• Non, ce n’est pas utilisable. Sur 8 Go de RAM tu es à ~26 secondes par token. Une réponse de 100 tokens = 40+ minutes. Sur 64 Go tu descends à ~20 s/token. Même sur machine lourde (128 Go+) tu restes à plusieurs secondes par token.
• Tu dois stocker 1,56 To de poids + ~100 Go de trunk. Disque rapide obligatoire, sinon c’est encore plus lent.
• C’est une démo technique de streaming de poids, pas un outil de productivité. Personne ne s’en sert pour bosser sérieusement.
Le TikTok omet volontairement le coût d’opportunité massif (temps, stockage, frustration) pour maximiser les likes et le FOMO. Classique contenu IA 2026 : on prend un exploit d’ingénierie marginal et on le vend comme la révolution locale.
Si tu cherches vraiment une IA locale puissante et utilisable aujourd’hui, ce n’est pas ça. C’est du marketing déguisé en info.
2026-08-10 22:17:31
21
NetAndFun 🇷🇪🎰🇷🇪🕊️ :
8 Go RAM : techniquement oui
8 Go RAM : utilisable au quotidien → absolument pas 😄
À 33 secondes/token, une réponse de seulement 100 tokens prendrait théoriquement autour de :
55 minutes
et cela sans compter les variations de charge, les accès SSD, le contexte, etc.
Le même développeur indique qu’en montant à environ 128 Go de RAM, il arrivait autour de 20 secondes/token.😇😇😇
2026-08-10 21:33:42
8
Årano :
Ça marche sur téléphone?
2026-08-11 12:15:50
0
Alain :
mais n'importe quoi ?? vous faites que des additions avec lol.. parfois j'ai des conso de 500'000 tokens pour du code avec plugin... et là c'est 1 token en 28 sec... j'ai pas une vie devant moi pour faire qqch LOL
2026-08-11 18:58:59
0
KuroLoL :
La version 3 milliards de paramètre c est ridicule … ça ne sert à rien même
2026-08-11 07:39:08
0
🇫🇷✝️Disobey_yell✝️🇫🇷 :
même cette version c'est minimum 4 gpu H100 pour avoir une productivité correcte. donc autant passer sur d'autres ia locales performantes pour moins cher.
2026-08-11 07:53:54
0
chlorwasser :
on en parle du nombre de token par seconde ?
2026-08-11 14:46:04
0
Nicolas :
3 milliards c'est nul 🙄😳
a moins d'un miracle
2026-08-11 17:20:36
0
Nicolas 🥹 :
3 milliards de paramètres 😂😂😂😂😂😂😂😂😂😂😂🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣🤣
2026-08-11 15:15:18
0
annil88 :
Je préfère glm 5.2 leur tchat est encore gratuit depuis leur site internet
2026-08-11 07:22:46
0
rifinotarek :
Pas sérieux mon ami
2026-08-11 07:20:39
0
Toonight :
Faut arrêter de raconter des conneries. C’est un modèle ultra distillé qui n’a aucun rapport avec les benchmark du gros modèle frontière.. 👎🏻
2026-08-11 22:00:40
0
Conspirationniste :
traptum.com l’a Deja fait et c’est francais
2026-08-11 05:36:32
0
To see more videos from user @tyki6, please go to the Tikwm
homepage.