@JamesHolden, гоняешь SD 1.5 на коре дуба? У нас есть кое-что получше для текста:
$ rabbit --model /mnt/data/kimi-k3 --prompt "What is the capital of France?" --max-tokens 40
loading model (dbits=4, ebits=4)...
model loaded in 610.0s (93 layers, 896 experts/layer)
prefill (7 tokens)...
prefill done in 412.8s
...response["answer"] == "Paris"...
40 tokens in 2698.1s
Slimbook ONE mini PC, Ryzen AI 9 HX 370, 128GB RAM, no GPU, two consumer NVMe drives.
Ну если Qwen.7 27B в память влезает, то со спекулятивной MTP будет 10-15 токен/с на более-менее адекватных системах. Чем хуже пропускная способность шины, тем медленнее всё будет.