ニュース
llama.cpp 0.6.0公開。GLM-5.3-Flash対応やMetal高速化
2026年10月6日 13:03
ローカルLLM実行環境の定番がまた一歩進化した。ggml-orgは10月5日(現地時間)、新モデル「GLM-5.3-Flash」をサポートしたLLM実行用ソフト「llama.cpp」の新バージョン「v0.6.0」を公開した。GitHubから無料でダウンロードでき、ライセンスはMIT。
llama.cpp v0.6.0では、新しいバッチAPI「llama_batch_ext」を搭載。トークンと埋め込みを混在させた入力や、MTP(Multi-Token Prediction)向けの状態埋め込みを扱える「llama_process()」を導入している。また、新モデルへの対応、Apple GPU向けの高速化、Web UIの刷新などが行なわれた。
新対応のモデルとしては、Zhipu AIの総パラメータ320B(3,200億)のテキスト+画像対応ハイブリッドモデルであるGLM-5.3-Flashをはじめ、総パラメータ124Bのマルチモーダル対応モデル「Ling 3.0 VL」、テキストと画像の両方に対応した判断モデル「Clef」、判断モデル「Nimble」などが挙げられている。
Qwen4Expについてはサポートの品質が向上したほか、MTPによる投機的デコードでDGX Spark上のデコード速度が約1.5倍に向上するという。
Apple GPU向けには、Metalバックエンドに投機的デコードとバッチデコード向けの少数行MMA行列演算カーネルを追加し、行列演算が最大で約3倍高速になった。さらに、F16 KVキャッシュ向けのMetalテンソルAPIフラッシュアテンションカーネルも新たに実装された。
サーバー機能では、判断モデルをサポートする「/v1/systemone」APIを新設。「/v1/embeddings」は画像/音声/動画といったコンテンツの入力を受け付けるようになり、「/v1/models」ではモデルの入出力モダリティを示す「architecture」オブジェクトを返すようになった。
このほか、多くの不具合修正、UIの変更、内部で使用するggmlのアップデートなどが行なわれた。







![REBON / BUGS LIFE / DIGITAL GIRL [Explicit] 製品画像:1位](https://m.media-amazon.com/images/I/51vxV7ji6SL._SL160_.jpg)





![【Amazon.co.jp限定】 伊藤園 磨かれて、澄みきった日本の水 2L 8本 ラベルレス [ ケース ] [ 水 ] [ ペットボトル ] [ 箱買い ] [ ストック ] [ 水分補給 ] 製品画像:4位](https://m.media-amazon.com/images/I/41m8ly-SllL._SL160_.jpg)





