
AirLLM、4GBのGPUで70Bモデルの推論を可能にするレイヤー共有技術を公開
AirLLMは、量子化や蒸留を行わずに70Bモデルを4GBのGPUで動作させ、DeepSeek-V3(671B)も12GB以下で推論可能です。メモリ消費を劇的に抑え、民生用PCでの巨大モデル実行を実…
1件のニュース

AirLLMは、量子化や蒸留を行わずに70Bモデルを4GBのGPUで動作させ、DeepSeek-V3(671B)も12GB以下で推論可能です。メモリ消費を劇的に抑え、民生用PCでの巨大モデル実行を実…