@rickbjia: Qwen 3.8 un 73% MÁS RÁPIDO con solo 2 líneas 🤯 He conseguido acelerar Qwen 3.8 27B un 73% en local, pasando de 40,94 a 70,84 tokens por segundo en una RTX 5070 de 12 GB. Primero probé DFlash 2, una de las nuevas técnicas de speculative decoding que está dando mucho que hablar. Después activé MTP, que ya viene integrado en Qwen 3.8, y la diferencia fue enorme en mi configuración. ⚡ DFlash 2: 41,05 tok/s 🚀 MTP: 70,84 tok/s He dejado en GitHub todos los comandos, configuraciones y pasos para replicar la prueba. Los resultados pueden cambiar según GPU, quantización, contexto y versión de llama.cpp. Menos humo. Más IA real.
Ricardo Bertran
Region: ES
Monday 14 September 2026 11:27:14 GMT
Music
Download
Comments
usern8akmngm5k :
Pues poner las características del PC, sistema operativo, etc…?
2026-09-14 12:57:13
1
ROOT :
Gracias capo e aprendido mucho contigo
2026-09-14 17:00:23
1
Ricardo Bertran :
🚀 Todos los comandos y configuraciones de MTP + DFlash 2 están en el repo de GitHub: github.com/RicardoBertran/qwen38-mtp-dflash-benchmark
2026-09-14 11:29:03
3
Monkixl.Leo :
Gracias 🫡😎
2026-09-14 12:40:40
1
Chusseur :
Que cuantizacion usas?
Para que quepa en 12gb de VRAM
2026-09-14 13:23:44
0
Xarly CR :
pero he visto tu repo y la ventana de contexto de 4k, eso es xq es una prueba o no te cabe un contexto razonable en la VRAM de no se 128k para programar por ej. Alucina mucho con esta config?
2026-09-14 20:52:35
1
Jim :
yo buscando una 3060 de 12gb 😢 aver que tal jala.
2026-09-15 00:03:54
0
KilzaNiko :
Esta ia es uncensored?
2026-09-14 23:21:54
0
nelsoncorrea-52 :
que tan seguro es tener la IA en local no fuga información al tener el internet conectado
2026-09-14 21:49:55
0
KilzaNiko :
Pero cuanto contexto? por que si es de poco no es que sirva mucho la verdad 😔
2026-09-14 22:16:47
0
Ozzy🧬 :
2026-09-14 19:42:47
1
betobr77 :
👍👍👍
2026-09-14 17:52:59
0
To see more videos from user @rickbjia, please go to the Tikwm
homepage.