www.infoq.com 昨日 14:05

FreeToken Unlocks Frontier MoE Inference on Consumer Hardware via Dynamic Co-Execution

UC BerkeleyとMITの研究者らが、コンシューマー向けGPUで大規模MoEモデルを動かすオープンソース推論エンジン「FreeToken」を発表した。CPUとGPU間の帯域を動的に見て計算を分割するq*ポリシーと、専門家重みのダブルバッファリング、エージェント向けのセマンティックアンカーによるKVキャッシュ再利用を特徴とし、Ollama/llama.cppやvLLM/KTransformersに対して数倍の速度向上を報告している。8GBのRTX 4060でQwen3.6-35Bを動かした例など、コンシューマー機でのフロンティア級モデル推論の敷居を下げる内容。

UC BerkeleyとMITの研究者らが、コンシューマー向けGPUで大規模MoEモデルを動かすオープンソース推論エンジン「FreeToken」を発表した。CPUとGPU間の帯域を動的に見て計算を分割するq*ポリシーと、専門家重みのダブルバッファリング、エージェント向けのセマンティックアンカーによるKVキャッシュ再利用を特徴とし、Ollama/llama.cppやvLLM/KTransformersに対して数倍の速度向上を報告している。8GBのRTX 4060でQwen3.6-35Bを動かした例など、コンシューマー機でのフロンティア級モデル推論の敷居を下げる内容。
↗ 元記事を開く