@yasminacodes: Ejecutar modelos de lenguaje en local con contenedores Docker se ha vuelto la norma para no pagar APIs externas. Herramientas como Ollama o LM Studio dominan por su extrema facilidad de uso, pero en realidad, la inmensa mayoría comparten el mismo motor interno: llama.cpp. Interactuar directamente con esta librería open source te otorga un control absoluto sobre la optimización y el rendimiento del hardware, además de darte acceso inmediato a las últimas novedades sin esperar actualizaciones de terceros. Sin embargo, para proyectos estándar, la ligera pérdida de rendimiento que suponen los gestores visuales compensa con creces el tiempo que ahorras en configuración. El verdadero avance que popularizó llama.cpp (y por extensión, Ollama) fue la adopción del formato de cuantización GGUF. Este estándar comprime drásticamente los parámetros matemáticos de los modelos de IA, permitiendo que LLMs pesados puedan ejecutarse de forma fluida utilizando únicamente la memoria RAM de un ordenador convencional, sin requerir hardware de servidor. #llmlocal #ollama #ia #llamacpp
YasminaCodes
Region: AR
Thursday 10 September 2026 23:17:09 GMT
Music
Download
Comments
JackRiichi :
llama.cpp
2026-09-11 05:39:05
15
Leo :
llama.cpp o vllama en Linux te darán siempre la mejor experiencia, en Windows lo mejor es ML Studio por su fácil uso y puedes escoger el motor de inferencia que necesites y Maclo mejor es MLX o en su defecto exodus para juntar 2 o más Macd para inferencia
2026-09-12 23:52:57
4
Fernanda Jovel :
Puedo correr algún modelo en mi humilde RTX 5050 o mejor ni intento?
2026-09-13 02:22:01
0
asdfgh :
Con lo pésimo que es Ollama y sus modelos fine-tuned. Pero si quieren algo más fácil, por qué no mejor instalan OpenCode, OpenClaw o algún agent y se registran por api key para evitar meter todo el proceso pesado de una IA local
2026-09-11 06:33:28
6
Wick :
No tenía ganas de ir al Gym, me motivaste :v ya voy saliendo para allá (buen trabajo de hombros (de manera respetuosa y de admiración honesta)) postdata: hay buenos gestores de LLMS locales que aprovechan hardware nuevo como NPU’s. Uso de hecho uno de estos para correr pruebas sobre una lap con un Ryzen con NPU y la diferencia es notable que cuando corro sobre GPU.
2026-09-11 01:29:22
10
Brain Eater :
En Mac te recomiendo probar oMLX.
Ollama va genial con modelos como Gemma 4 para usarlo a modo "chat", pero se traba mucho cuando lo usas en modo agente con OpenCode, Pi, etc.
Al usar oMLX con OpenCode o Pi me va mucho mejor, no se traba, y los resultados obtenidos son muy buenos.
Hoy me ha hecho todos los cambios que le he pedido a un programa en Spring Boot bastante extenso, los ha documentado, y me ha creado los tests, tirando todo de Gemma 4 E4B en un MacMini M4 de 16 GB. El total de la sesión han sido casi 80.000 tokens, con una velocidad de unos 25 tokens/segundo
2026-09-15 21:20:58
1
Luis F. :
llama.cpp puede ejecutarse paralelamente para varios users?
2026-09-11 04:06:17
1
່ :
yo he usado Vllm en local con alto flujo de peticiones de usuarios va mucho más mejor que Ollama y exprime más la gpu sacándole más rendimiento
2026-09-11 03:48:50
0
aleeyanezr :
No entiendo nada pero me quede en video
2026-09-11 19:02:35
0
975ma :
Ollama es un wrapper sobre llama.cpp, no una alternativa de motor
2026-09-11 03:42:15
3
cristiansinh :
Tengo 8gb vram gráfica pero de AMD 😭
2026-09-13 16:19:49
0
Agustin Bustos :
Como que usas Windows?
2026-09-11 12:30:22
0
andriw750 :
pero si mi gráfica es de 4 GB ;(?
2026-09-11 03:31:31
1
𝕄𝕣.𝕎𝕙𝕚𝕥𝕖 💎 :
disculpa no pude concentrarme 🥰, cual era la pregunta ?
uso ollama local + podman. mejores si claro usar modelos gratis de algunos proveedores. como pienso en seguridad uso lo mejor de ambos mundos, diseñe mi propio Brain, gasto menos de 5$ y gasto 30M de tokens distribuidos
2026-09-11 14:31:36
0
Nauzet 🇮🇨 :
está claro que sí, ya tiene una tarjeta gráfica potente para otras cosas para ejecutar modelos en local. está bastante bien que la utilice.. y te ahorras la suscripción.
pero gastarme 2500 € en una tarjeta gráfica moderna para ejecutar modelos y que vayan a buena velocidad.... solo para eso... tiene que estar justificado.
todo esto teniendo en cuenta que no seas autónomo y te lo puedas desgravar en tu actividad empresarial
2026-09-11 08:20:44
0
cabezón 🇳🇮 :
pero por que no pagar 20$ o 40$ mes si trabajan en Desarrollo 🙄 o incluso cobrarselo al cliente o la empresa
2026-09-11 05:17:44
0
El panoli :
yo utilizo la api de gemini, va muy bien ya que no tengo una gráfica dedicada, la recomiendo mucho
2026-09-12 16:57:25
2
QSerieVeo :
No me mola. Probé todas y si no tienes un montón de vram no haces nada. Para hablar de tonterías si, te contesta y tal. Pero acostumbrado a gemini o chat gpt multimodal...
2026-09-11 17:31:38
4
manuXD32 :
Llama-swap es mi go-to, si creas una pequeña interfaz para añadir modelos fácilmente se vuelve mucho más conveniente y versátil que ollama🥰
2026-09-11 00:09:17
3
ElSeñorNutria :
yo lo hago todo desde la nube y con los gratis, con Google me basta, lo que me di cuenta es que la gente no sabe formalizar los requerimientos y problemas. con los más básico aún me es suficiente para programación y multimedia.
2026-09-11 09:07:37
0
Giovanni :
he visto proyectos que están usando el hardware directamente revísalos, todo en llama.cpp y otra opción es vllm que ya hay alguna que otra implementación con turboquant, en cualquier caso el llm que uses las versiones distilled están muy bien para equipos que no sean muy potentes
2026-09-11 10:50:35
0
Rafa :
Una ventaja de ollama es que puedes usar un solo api para llamar a modelos locales y combinarlo con su cloud. No es el fin del mundo pero es simplicidad.
2026-09-11 05:41:06
2
To see more videos from user @yasminacodes, please go to the Tikwm
homepage.