ニュース

最大2倍高速な推論エンジン「Magnitude」公開、ハードごとに自動最適化

 Magnitude AIは、AIエージェント向けに開発したオープンソースのLLM推論エンジン「Magnitude」を公開している。ライセンスはApache-2.0で、トークン費用はかからず完全無料で利用できる。

 Magnitudeは、実行するデバイス固有のハードウェアに合わせて、カーネルをローカルで自動コンパイル・チューニングする推論エンジン。llama.cppやOllama、LM Studioなどの一般的な推論エンジンが採用する汎用の事前コンパイルではなく、実行端末のチップに直接合わせてカーネルを最適化する点が特徴だ。人気のあるオープンウェイトモデルファミリー向けに、手動で最適化されたカーネルも搭載する。

 推論パフォーマンスはllama.cppと比較して最大2倍の処理速度を達成したとしている。Metal環境ではデコード処理を92%高速化し、NVIDIA CUDA環境でも19%の高速化を実現した。メモリ管理も効率化されており、エージェント1つあたりの消費量を27%削減。エージェント停止時には使用メモリを即座に解放する。また、セッション間でプレフィックスキャッシュを共有することで、複数エージェントの同時実行時に生じる速度低下を防ぐ。

 プライバシー面では、プロンプトや送信ファイル、モデルデータをすべてローカル端末内に保持。外部サーバーへのデータ送信は一切行なわれず、モデルのダウンロード完了後はインターネット接続なしで利用できる。

 対応OSはmacOS/Windows/Linux。対応ハードウェアはApple Silicon GPU、NVIDIA GPU、AMD GPU、CPU。固定の最低動作要件はなく、スペックに応じて小規模モデルから大規模モデルまで柔軟に対応する。AIエージェントはPi、OpenCode、Hermes、Codex、OpenClaw、Claude Code、Oh My Pi、Clineに連携対応。これら以外のアシスタントやエージェントも、OpenAI互換API経由で接続できる。提供形態はGUI搭載のデスクトップアプリケーションで、Magnitude CLIを標準同梱しており個別インストールは不要。