Un progetto open source ha portato Qwen3.8-Flash-Next, modello da 125 miliardi di parametri, su schede video da 12 GB di VRAM: il carico viene distribuito fra GPU, memoria di sistema e SSD, con 94 token al secondo misurati su una RTX 5070