aiに聞いたら下記サイトを教えてくれた。

http://huggingface.co/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF/tree/main

5070tiには下記モデルがいいということで動かしたが重かった。

Huihui-Qwen3.8-27B-abliterated-UD-Q3_K_XL.gguf

小さめの量子モデルを動かしてみたら実用的な速度だった。

Huihui-Qwen3.8-27B-abliterated-UD-IQ2_S-MTP.gguf

LMstudioで動かした。

設定のLibraryからコンテキスト長やGPUオフロードを変更した。

すべてGPUにしたら早くなった。

KVキャッシュをQ4に量子化した。

コンテキスト長は大きすぎると動かなくなるため10万トークンくらいがよい??

6万だとコンテキスト超えると圧縮できないでエラーで止まった。


使用環境

5070ti, 32gm ram


量子化こんなにしてもちゃんと動くのすごい。

前のqwenだと量子化したモデルだと狂っていたから。

実用的な速度だがクラウドよりは遅く、reasoningが長引くと結構時間がかかる。

ちょっとしたabiteratedに聞きたいことがある場合はちょうどいいかもしれない。