Sobre modelos de IA locales - ollama, LM Studio, qwen...

estaba buscando por el foro algún hilo oficial de todo esto, IA locales, modelos LLM, ollama, LM Studio, etc. y no he encontrado nada

no hay? no hay siquiera un subforo para esto?
Busca thelastdragon en youtube.

Tiene un video sobre eso.
Imagino que para poder utilizar estas cosas será imprescindible una GPU de considerable potencia. Con una modesta 1050ti me puedo olvidar de ello, ¿no?
Yo he empezado a trastear con lm studio. Tengo una 4070 laptop y si bien parece que se le va menos la olla que a gemini gratuito, no acabo de pillarle el punto, tambien puede ser que no de con el modelo mas adecuado
SirAzraelGrotesque escribió:Imagino que para poder utilizar estas cosas será imprescindible una GPU de considerable potencia. Con una modesta 1050ti me puedo olvidar de ello, ¿no?


No. Yo ejecuto llama3 con ollama teniendo una 1030 de 2 gigas. Y el proce no va mucho mas allá: ryzen 5600. Eso sí, calzo la "burrada" de 16 gigas de ram.
Peeeeeeeeeeero, no puedo ir mucho más alla. Por lo que he visto, si paso a modelos mas grandes se me saturan la ram y la vram.
Respecto a la velocidad de respuesta, si lo uso sin que haga consultas web, va muy bien, contesta rapidísimo.

Ten en cuenta que existen modelos de AI que corren mas que decentemente en RPi5, que no es precisamente un supercomputador.
@Esog Enaug Gracias. Me planteo echarle un vistazo entonces. :)
Si quieres algo rápido para empezar, te instalas Ollama que te ofrece directamente frontend y varios modelos seleccionables para descargar y probar. La VRAM de tu GPU determinará los modelos que puedas cargar.
si, estoy probando ollama en windows con mi RTX 3080 10GB

el modelo qwen3 8B se ejecuta muy fluido
Yo estoy usando Qwen 3.6 35B en CPU, pringaos.

16 GB de memoria RAM compartida.
Gurlukovich escribió:Yo estoy usando Qwen 3.6 35B en CPU, pringaos.

16 GB de memoria RAM compartida.


¿Como? Yo estoy intentándolo con varios programas que, supuestamente, me reparten la carga entre CPU y GPU y lo que veo es que, generalmente, usa sobre todo la GPU (1030 de 2 gigas [qmparto] ) y no me coge demasiada RAM (tengo 16 gigas). Los que mejor me van son modelos de 3b (llama3 y similares). Lo he intentado también creando un ecosistema con distintos servers en docker y no logro pasar de resultados mierdosos (similares a lo que me da una Rpi4 con un sistema IA especialmente configurado) y mi CPU le da mil vueltas a una Rpi4.
Esog Enaug escribió:
Gurlukovich escribió:Yo estoy usando Qwen 3.6 35B en CPU, pringaos.

16 GB de memoria RAM compartida.


¿Como? Yo estoy intentándolo con varios programas que, supuestamente, me reparten la carga entre CPU y GPU y lo que veo es que, generalmente, usa sobre todo la GPU (1030 de 2 gigas [qmparto] ) y no me coge demasiada RAM (tengo 16 gigas). Los que mejor me van son modelos de 3b (llama3 y similares). Lo he intentado también creando un ecosistema con distintos servers en docker y no logro pasar de resultados mierdosos (similares a lo que me da una Rpi4 con un sistema IA especialmente configurado) y mi CPU le da mil vueltas a una Rpi4.

Con Ollama :p

Es un MoE, de los 35B sólo 3 son activos, usando un modelo altamente cuantizado cob APEX (se cuantiza selectivamente según él impacto que pueda tener en la inteligencia del modelo) se puede reducir el tamaño en si hasta 10 GB, suficiente para que quepa entero en RAM y lo tenga que rascar el disco.
https://huggingface.co/mudler/Qwen3.6-3 ... -Nano.gguf

Luego hay que cuantizar también el contexto a q0_8, eso deja en la mitad la RAM. Tampoco es que se puedan hacer maravillas, 16k quizá, no conseguí meterle turbo.

Me base en parte el método de este tipo que lo puso en 6GB VRAM, y luego preguntando a Gemini en el navegador.
https://m.youtube.com/watch?v=8F_5pdcD3HY

En tu caso con 2GB me temo que sólo puedes hacer como yo, hacerlo correr en CPU, no te caben los 3GB activos enteros, y no se si llegará a hacer algo, con la GPU integrada al final es más lento que en CPU, pero bueno, yo con un intel 11th de de portátil de hace 5 años le llego a sacar 10 tokens/s, no es una maravilla, pero está casi lo que sería velocidad de lectura. Tengo que hacer algunos test más a ver si le araño un poco más.
Se supone que es automático, si el modelo no entra en VRAM empieza a tirar de RAM compartida, lo que pasa es que el rendimiento cae en picado. Si usas un miniPC con todo shared memory no tienes ese problema, lo que pasa es que la iGPU de por sí es más floja que las discretas.
11 respuestas