推論エンジンcolibriがGitHubで公開、2.8兆パラメータの超巨大MoEモデルをC言語・依存性ゼロで実行可能に

GitHubで急浮上したcolibriは、VRAM、RAM、ストレージを単一の階層として扱うマルチティア管理により、Kimi K3などの最大2.8Tパラメータに及ぶ巨大MoEモデルを消費者向けハード…
AIの動向が実務の判断材料になる更新です。 GitHubで急浮上したcolibriは、VRAM、RAM、ストレージを単一の階層として扱うマルチティア管理により、Kimi K3などの最大2.8Tパラメータに…
JustVugg氏は、フロンティア級の混合エキスパート(MoE)モデルを一般的なハードウェアで実行するための推論エンジン「colibri」を公開しました。純粋なC言語で実装されており、外部ライブラリへの依存が一切ないゼロ・デペンデンシー構成が特徴です。VRAM、システムメモリ、ストレージを一つの推論階層として扱う「AIメモリ・マルチティアリング」により、通常は実行が困難な超大規模モデルの稼働を実現しています。
現時点でGLM-5.3(744B)やDeepSeek V4.1 Flash(552B)、最大でKimi K3(2.8T)を含む9つのモデルファミリーに対応しています。従来の推論エンジンがモデル全体をVRAMやRAMに収めることを前提としていたのに対し、colibriはエキスパート層をディスクからストリーミングすることで、ハードウェアの物理的なメモリ制限を越えた推論を可能にしました。各モデルの実装は単一のCファイルで完結しており、チャット、APIサーバー、Webフロントエンドの各機能が提供されています。
ただし、ストレージI/OやCPU/GPUのオーバーラップを駆使した実験的な実装であるため、実行速度に関するサービス品質保証(SLA)は設定されていません。また、システムの動作は再現可能なエンドツーエンドの計測に基づいたアグレッシブな最適化が適用されるため、実行環境の入出力性能によってパフォーマンスが大きく変動する制約があります。
Related tools
この記事に関連するおすすめツール
比較検討しやすい導入候補を優先して表示しています。一部リンクは広告・アフィリエイトを含む場合があります。
フェレット記者の用語メモ
vram
GPUに搭載されたビデオ専用メモリで、LLM推論ではモデルの全重みをここに載せるのが理想だよ。ここから溢れるとシステムメモリやディスクへ逃がすことになるけど、その瞬間に通信帯域が10分の1以下に激減して推論が激重になる。量子化によるサイズ圧縮とVRAM容量のパズルで失敗すると、使い物にならないシステムが爆誕するよ。
比較: システムメモリ(RAM)
出典: GitHub Trending
要点を短く整理して掲載しています。詳細は出典を確認してください。



