「MoE(混合エキスパート)はパラメータを増やすほど、結局は通信コストで重くなる」——これは半ば常識として語られてきました。その前提を揺さぶる報告が出ています。
Allen Institute for AI(Ai2)が公開したIntroducing Olmo-core 3: Open, scalable training infrastructure for large MoEsでは、MoE訓練基盤を再設計し、1トークンあたりのアクティブパラメータ数(約3.2B)を固定したまま、エキスパート数を8から128へ、総パラメータ容量を4.6Bから47Bへ拡張しても、スループットの低下を5%未満に抑えたと報告しています。同じ基盤は1兆パラメータ規模でも検証済みとのことです。
ポイントは、「エキスパートを増やす」と「通信・調整コストが膨らむ」が、これまでほぼセットで語られてきた点にあります。MoEは本来、入力ごとに一部の専門家だけを使うことで効率化を図る仕組みですが、専門家の数が増えるほど、どの専門家にどう振り分けるかという調整の負荷が増し、効率化の利点を食いつぶしていきます。従来は「専門家を増やす=速度が落ちる」というトレードオフが前提でしたが、Olmo-core 3は、このトレードオフ自体を訓練基盤側の設計で切り離せることを示しました。
これは、アカデミアや中小ラボにとって軽視できない変化です。これまで大規模MoEの訓練は、巨大テック企業の専有インフラでなければ現実的ではありませんでした。しかしOlmo-core 3はオープンに公開されており、同等の設計思想を自前のクラスタで試せる可能性が開かれつつあります。「パラメータ容量を増やす」という選択肢が、一部の大企業だけのものではなくなりつつある——それが、この報告が示す最大の示唆だと言えるでしょう。
関連記事
- Improving our alignment and security efforts
- Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice Cloning
- Introducing SynthID Bio
参考文献
コメント