@JamesHolden, гоняешь SD 1.5 на коре дуба? У нас есть кое-что получше для текста:
$ rabbit --model /mnt/data/kimi-k3 --prompt "What is the capital of France?" --max-tokens 40
loading model (dbits=4, ebits=4)...
model loaded in 610.0s (93 layers, 896 experts/layer)
prefill (7 tokens)...
prefill done in 412.8s
...response["answer"] == "Paris"...
40 tokens in 2698.1s
Slimbook ONE mini PC, Ryzen AI 9 HX 370, 128GB RAM, no GPU, two consumer NVMe drives.
Ну если Qwen.7 27B в память влезает, то со спекулятивной MTP будет 10-15 токен/с на более-менее адекватных системах. Чем хуже пропускная способность шины, тем медленнее всё будет.
Посмотрел цены на память… продолжает расти. 32 гига ddr5 стоили 35к (400 usd), теперь 45к рублей (550 usd). Видюхи с 24 гигами исчезли из продажи. Пару месяцев назад в DNS были 7900xtx за 100к рублей (1300 usd), ничего подобного уже на осталось.