zenn.dev
3日前
RTX 5090 + RAM 128GBでQwen3.8-Flash-Nextをllama.cppで動かしてみた
RTX 5090(32GB)とRAM 128GBの1台構成で、125B規模のMoEモデルQwen3.8-Flash-NextをUnslothのUD-Q2_K_XL量子化とllama.cpp対応版で動作検証した記事。-ncmoeでGPUに載せるMoEエキスパート数を調整するのが最も効果的で、CPUスレッド数は物理コア数と同じ8が最良、CPUコア固定で速度のばらつきが縮小した。最終的に64kコンテキストで短文生成約48 tokens/s、16kトークン入力後でも約43 tokens/sを達成した一方、micro-batch削減やn-gram投機デコードは効果がなかった。
RTX 5090(32GB)とRAM 128GBの1台構成で、125B規模のMoEモデルQwen3.8-Flash-NextをUnslothのUD-Q2_K_XL量子化とllama.cpp対応版で動作検証した記事。-ncmoeでGPUに載せるMoEエキスパート数を調整するのが最も効果的で、CPUスレッド数は物理コア数と同じ8が最良、CPUコア固定で速度のばらつきが縮小した。最終的に64kコンテキストで短文生成約48 tokens/s、16kトークン入力後でも約43 tokens/sを達成した一方、micro-batch削減やn-gram投機デコードは効果がなかった。