www.infoq.com
昨日 14:05
FreeToken Unlocks Frontier MoE Inference on Consumer Hardware via Dynamic Co-Execution
UC BerkeleyとMITの研究者らが、コンシューマー向けGPUで大規模MoEモデルを動かすオープンソース推論エンジン「FreeToken」を発表した。CPUとGPU間の帯域を動的に見て計算を分割するq*ポリシーと、専門家重みのダブルバッファリング、エージェント向けのセマンティックアンカーによるKVキャッシュ再利用を特徴とし、Ollama/llama.cppやvLLM/KTransformersに対して数倍の速度向上を報告している。8GBのRTX 4060でQwen3.6-35Bを動かした例など、コンシューマー機でのフロンティア級モデル推論の敷居を下げる内容。
UC BerkeleyとMITの研究者らが、コンシューマー向けGPUで大規模MoEモデルを動かすオープンソース推論エンジン「FreeToken」を発表した。CPUとGPU間の帯域を動的に見て計算を分割するq*ポリシーと、専門家重みのダブルバッファリング、エージェント向けのセマンティックアンカーによるKVキャッシュ再利用を特徴とし、Ollama/llama.cppやvLLM/KTransformersに対して数倍の速度向上を報告している。8GBのRTX 4060でQwen3.6-35Bを動かした例など、コンシューマー機でのフロンティア級モデル推論の敷居を下げる内容。