ニュース

llama.cpp 0.6.0公開。GLM-5.3-Flash対応やMetal高速化

 ローカルLLM実行環境の定番がまた一歩進化した。ggml-orgは10月5日(現地時間)、新モデル「GLM-5.3-Flash」をサポートしたLLM実行用ソフト「llama.cpp」の新バージョン「v0.6.0」を公開した。GitHubから無料でダウンロードでき、ライセンスはMIT。

 llama.cpp v0.6.0では、新しいバッチAPI「llama_batch_ext」を搭載。トークンと埋め込みを混在させた入力や、MTP(Multi-Token Prediction)向けの状態埋め込みを扱える「llama_process()」を導入している。また、新モデルへの対応、Apple GPU向けの高速化、Web UIの刷新などが行なわれた。

 新対応のモデルとしては、Zhipu AIの総パラメータ320B(3,200億)のテキスト+画像対応ハイブリッドモデルであるGLM-5.3-Flashをはじめ、総パラメータ124Bのマルチモーダル対応モデル「Ling 3.0 VL」、テキストと画像の両方に対応した判断モデル「Clef」、判断モデル「Nimble」などが挙げられている。

 Qwen4Expについてはサポートの品質が向上したほか、MTPによる投機的デコードでDGX Spark上のデコード速度が約1.5倍に向上するという。

 Apple GPU向けには、Metalバックエンドに投機的デコードとバッチデコード向けの少数行MMA行列演算カーネルを追加し、行列演算が最大で約3倍高速になった。さらに、F16 KVキャッシュ向けのMetalテンソルAPIフラッシュアテンションカーネルも新たに実装された。

 サーバー機能では、判断モデルをサポートする「/v1/systemone」APIを新設。「/v1/embeddings」は画像/音声/動画といったコンテンツの入力を受け付けるようになり、「/v1/models」ではモデルの入出力モダリティを示す「architecture」オブジェクトを返すようになった。

 このほか、多くの不具合修正、UIの変更、内部で使用するggmlのアップデートなどが行なわれた。