Esog Enaug escribió:Gurlukovich escribió:Yo estoy usando Qwen 3.6 35B en CPU, pringaos.
16 GB de memoria RAM compartida.
¿Como? Yo estoy intentándolo con varios programas que, supuestamente, me reparten la carga entre CPU y GPU y lo que veo es que, generalmente, usa sobre todo la GPU (1030 de 2 gigas
![Que me parto! [qmparto]](/images/smilies/net_quemeparto.gif)
) y no me coge demasiada RAM (tengo 16 gigas). Los que mejor me van son modelos de 3b (llama3 y similares). Lo he intentado también creando un ecosistema con distintos servers en docker y no logro pasar de resultados mierdosos (similares a lo que me da una Rpi4 con un sistema IA especialmente configurado) y mi CPU le da mil vueltas a una Rpi4.
Con Ollama

Es un MoE, de los 35B sólo 3 son activos, usando un modelo altamente cuantizado cob APEX (se cuantiza selectivamente según él impacto que pueda tener en la inteligencia del modelo) se puede reducir el tamaño en si hasta 10 GB, suficiente para que quepa entero en RAM y lo tenga que rascar el disco.
https://huggingface.co/mudler/Qwen3.6-3 ... -Nano.ggufLuego hay que cuantizar también el contexto a q0_8, eso deja en la mitad la RAM. Tampoco es que se puedan hacer maravillas, 16k quizá, no conseguí meterle turbo.
Me base en parte el método de este tipo que lo puso en 6GB VRAM, y luego preguntando a Gemini en el navegador.
https://m.youtube.com/watch?v=8F_5pdcD3HYEn tu caso con 2GB me temo que sólo puedes hacer como yo, hacerlo correr en CPU, no te caben los 3GB activos enteros, y no se si llegará a hacer algo, con la GPU integrada al final es más lento que en CPU, pero bueno, yo con un intel 11th de de portátil de hace 5 años le llego a sacar 10 tokens/s, no es una maravilla, pero está casi lo que sería velocidad de lectura. Tengo que hacer algunos test más a ver si le araño un poco más.