5070tiでQwen3.8-27B-abliteratedを動かしてみた
2026年9月5日土曜日
aiに聞いたら下記サイトを教えてくれた。
http://huggingface.co/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF/tree/main
5070tiには下記モデルがいいということで動かしたが重かった。
Huihui-Qwen3.8-27B-abliterated-UD-Q3_K_XL.gguf
小さめの量子モデルを動かしてみたら実用的な速度だった。
Huihui-Qwen3.8-27B-abliterated-UD-IQ2_S-MTP.gguf
LMstudioで動かした。
設定のLibraryからコンテキスト長やGPUオフロードを変更した。
すべてGPUにしたら早くなった。
KVキャッシュをQ4に量子化した。
コンテキスト長は大きすぎると動かなくなるため10万トークンくらいがよい??
6万だとコンテキスト超えると圧縮できないでエラーで止まった。
使用環境
5070ti, 32gm ram
量子化こんなにしてもちゃんと動くのすごい。
前のqwenだと量子化したモデルだと狂っていたから。
実用的な速度だがクラウドよりは遅く、reasoningが長引くと結構時間がかかる。
ちょっとしたabiteratedに聞きたいことがある場合はちょうどいいかもしれない。
コメント
0 件のコメント :
コメントを投稿