Primero prueba a exprimir a tope lo que tienes, siempre estás a tiempo de gastar, pero quizás te llevas un chasco, para jugar sigues teniendo buena GPU.
Aquí otro en el equipo rojo con una RX 9070 XT de 16GB, toca luchar un poco más para que funcionen las cosas, pero se aprende por el camino.
Los modelos que por ahora me llaman más la atención y te recomendaría experimentar, probando varios parámetros
(las velocidades que me dan a mi luego de afinar con la 9070 XT)
Tira de
llama.cpp con el backend de
Vulkan, ROCm me ha dado más dolores de cabeza y el rendimiento en mi caso ha sido el mismo.
Para validar que los parámetros te ayudan a ir a mejor, usa llama-bench.
No uses la UI que te da llama.cpp, usa algo como
OpenCode que le permita usar herramientas para validarse a si mismo, sino se comparan churros con merinas.
Intentaría mantener casi siempre un contexto mínimo de 128k, en repositorios serios menos te lo comes y debes ir compactando, y antes de compactar, empieza nuevo contexto. Revisa siempre cuanto permiten tener los diferentes modelos de manera nativa y las configuraciones que te dice quien lo ha subido.
Qwen3.6 en mis tareas se queda corto, necesita que lo lleve de la mano, le gusta dar demasiadas vueltas sobre si mismo. Si fuese más rápido, no me molestaría, pero no llega a lo que dan las suscripciones.
Con la salida de Qwen3.8 Flash Next lo estoy probando para tareas que sino dejaría paradas, por, de nuevo, la velocidad que me sacaría canas, pero francamente sorprendido con sus resultados, la típica prueba de un prompt para generar el universo en HTML sin dependencias con OpenCode, en mi caso, lo clavó, pero claro, 17 minutazos.
Si los resultados que te dan los modelos abiertos, en local, te valen, te gustan y tu único problema pasa a ser tiempo o no poder cargar modelos por tamaño, entonces ahí ya puedes plantear gastar en ello.
Por ahora en el curro tengo GitHub Copilot que se acaba demasiado rápido (pero no lo pago yo
![demoniaco [sati]](/images/smilies/nuevos2/demonio.gif)
), OpenCode Go para lo personal y con modelos como DeepSeek V4 Flash tienes para aburrir sin que sea un atraco a mano armada, por ahora me parece la suscripción más interesante con la que puedes comparar 1:1 resultados en local contra la nube de modelos similares (Qwen).
Si los precios no fueran una locura, me pillaría algo como la DGX Spark o un Ryzen AI MAX 395+.