トピック

マウスコンピューター「DAIV」から登場した128GBメモリ搭載ローカルLLM向けPC。大規模モデルの実力に迫る

~ローカルLLMの動作性能から文書解析まで、実力を実機で検証した

マウスコンピューターのローカルAI向けミニPC「DAIV CX-A9A60(Copilot+ PC)

 ChatGPTやClaudeを始めとする生成AIは、いまや仕事の道具として当たり前の存在になった。その一方で、使い込むほどに「壁」も見えてくる。セキュリティ規定で社内文書や顧客情報をクラウドに送ることが禁止されていることや、従量課金やサブスク費用が積み上がることなどだ。

 そこから出てくるのが「もっと自由に、好きなだけ使いたい」という素朴な欲求だ。この壁への答えとして注目を集めているのが、AIモデルをPC上で動かす「ローカルLLM」という選択肢だ。

 gpt-ossやQwen、Gemmaといったオープンモデルの性能向上により、かつてはデータセンター級の設備が必要だった言語モデルが、いまや1台のPCで実用レベルで動く時代になった。データは一切社外に出ず、生成量や試行回数を気にする必要もない。条件さえ整えば、ローカルLLMは「試してみる技術」から「業務の基盤」に変わり得る段階に来ている。

 問題は、その「条件」だ。どのクラスのモデルが、どんなPCで、どの程度快適に動くのかが分からないために踏み出せない人も多いのではないだろうか。

 そこで本記事では、生成AI分野の実践と発信で知られる新 清士氏を検証者に迎え、マウスコンピューターが展開するクリエイターPCブランド「DAIV」のローカルLLM向けPC「DAIV CX-A9A60」(以下、DAIV CX)を用いて、この疑問へ正面から答えていく。

 DAIV CXは8月下旬に発売されたばかりの新製品。128GBのユニファイドメモリを備え、最大96GBをグラフィックスメモリに割り当てられ、ローカルLLMのために生まれてきたような1台だ。ユニファイドメモリの容量128GBはCPUとGPUで共有し、利用するローカルLLMやアプリケーション、設定に応じてメモリの利用配分は変動し、グラフィックスメモリは最大96GBまで割り当て可能となる。

 いわゆるミニPCに属する小型筐体であることや、使い慣れたWindows環境のまま運用できることも強みとなる。

 実際にどの規模のモデルが動き、どんな速度で応答し、どこまで実用性があるのか。以降、実機での検証結果を軸に具体的に見ていこう。

本体正面に電源ボタン、動作モード切替ボタン、SDカードスロット、USB4、USB 3.2 Gen 2 2基、音声出力を備える。動作モード切替ボタンはパフォーマンスモードとサイレントモードを切り替えられる
本体右側面
本体左側面
本体背面にUSB 2.0 2基、HDMI、DisplayPort、USB4、USB 3.2 Gen 2、2.5GbE、音声出力、電源端子を備える
新 清士氏のプロフィール
1970年生まれ。株式会社バリーン・スタジオ Creative Tech Lab.所属/デジタルハリウッド大学大学院教授。ゲームジャーナリストとして活躍後、VRマルチプレイ剣戟アクションゲーム『ソード・オブ・ガルガンチュア』の開発を主導。クラフト系サバイバルゲーム『Exelio』のAIによるキャラクターデザイン、3Dプロップを担当。著書に『メタバースビジネス覇権戦争』(NHK出版新書)。AIのエンタメ分野応用に関連する記事を多数執筆。

新 清士氏による「DAIV CX」の検証内容

 使ってみたい大型のローカルLLMがある。しかし、メモリ(VRAM)の限界から動作させることができないというケースが増えている。そういう中で、128GBの大容量ユニファイドメモリとRyzen AI Max+ 395を搭載するWindows PC「DAIV CX」が新しい選択肢として登場した。

Ryzen AI Max+ 395と128GBのユニファイドメモリを搭載する

 今回、大きく以下の4点について確認、検証を行なった。

  • Windowsでの環境設定
  • 大型ローカルLLMの動作
  • 日本語100問の応答
  • 25ページの資料整理

 同じPCで動かしても、モデルによって回答の速さや内容は変わる。大型モデルを使える大容量メモリが、実際の作業でどのように役立つのか。回答を待つ時間と、その回答がどこまで使えるかの両面からDAIV CXの実力を見ていく。

DAIV CXの主な仕様
CPURyzen AI Max+ 395(cTDP 45~120W)
メモリ128GB(ユニファイド)
GPURadeon 8060S(CPU内蔵)
ストレージ2TB SSD(NVMe Gen4×4 Western Digital WD_BLACK SN850X)
ネットワークWi-Fi 7
インターフェイスUSB4 2基、USB 3.2 Gen 2 3基、USB 2.0 2基、2.5GbE、音声出力2基、SDカードスロット、HDMI、DisplayPort、指紋認証(電源ボタン)
本体サイズ78.5×198×205mm(突起物含む)
OSWindows 11 Pro
価格94万9,800円

Windowsでの導入の容易さ

 DAIV CXはWindowsがインストールされているため、多くの人が使い慣れたWindows PCとして扱うことができる。

 評価機では、初回起動時にパスワードを設定した後、「Windows Update」が行なわれた。Windows PCの利用経験者であれば迷うことはない。

 筆者の場合は、別のメインPCから操作することを前提としていたため、その後「SSH」を通じて制御できるよう設定した。SSHは、別のPCからコマンドを送って操作するための仕組みだ。

 具体的には、OpenAIの「GPT-6 Astra」を動作させるCodexを、DAIV CXとメイン機の両方にインストールして、SSHの設定を行なった。Codexの支援を受けながら設定し、約15分でメインPCからSSH経由で操作できるようになった。今回は計測をまとめて実行するために設定した。

 次にローカルLLMを動かすための環境を整えた。Windows環境で使える一般的なLLMアプリとして「LM Studio」を選んだ。公式サイトからWindows用のインストーラーをダウンロードし、セットアップするだけで済む。このあたりも同様だ。

 従来、ローカルLLMの運用というと、Linux環境の構築やコマンドライン操作が前提になりがちだった。DAIV CXなら、LM Studio対応モデルである限り、Windows PCのセットアップと同じ感覚でそこまで到達できる。専用機を別途管理する負担がなく、既存のPC運用の延長線上に置ける。この導入ハードルの低さは、DAIV CXの大きな強みだ。

DAIV CXで実際にLM Studioを動かしている画面。「Qwen3.8-Flash-Next」が自己紹介をしている
DAIV CX上のLM Studioで「Qwen3.8-Flash-Next」がサーバーとして動作している状態

動作検証のために大型ローカルLLMモデル3種と中型モデル2種を選定

 まず、動作させるローカルLLMの選定を行なった。DAIV CXは、CPUとGPUが共有する128GBのユニファイドメモリを搭載している。このうち、最大96GBをGPU用メモリとして割り当てられる。基本的に、VRAMの容量に収まるサイズのLLMを動かすことができる。

 ただし、モデルのファイル容量だけで、動かせるかどうかは判断できない。たとえば、22.7GBのモデルは24GBのVRAMに収まりそうに見えるが、会話や資料の処理にも同じVRAMを使うため、実際には不足する場合がある。モデル本体に加え、処理に使う空き容量も必要というわけだ。

 検証にあたってモデルとして選定したのは、動作に大容量のVRAMを必要とする大型ローカルLLMとして「Qwen3.8-Flash-Next」(IQ2_M、81.27GB)、「gpt-oss-120b」(MXFP4、63.39GB)の2つ。

 そして、VRAMが24GBあるコンシューマ向けdGPU搭載PCでも試されることが多いローカルLLMとして「Qwen3.8 27B」(Q5_K_S、20.61GB)、「Gemma 4 31B Instruct」(Q5_K_S、22.7GB)を選んだ。

 この4モデルはいずれもLM Studioでダウンロードして動作させることができ、サーバー化してほかのPCからもアクセスして利用できるため、導入が容易だった。

 さらに、高性能と評価されている「GLM-5.3-Flash」(AJ-IQ2_XXS、87.35GB)も導入した。ただし、GLM-5.3-Flashは計測時点(9月14日現在)ではLM Studioに未対応だったため、Linux上に用意した専用の実行環境で動かした。

 モデルは、いずれも必要メモリを抑えた量子化版を使用している。gpt-oss-120b のみ2025年8月のモデルだが、できるだけ検証時点の最新モデルを使っている。

 ここで強調しておきたいのは、80GB級を含む5モデルを1台のPCに同居させ、切り替えながら検証できたこと自体だ。後述する通り、大型3種はVRAM 24GBや48GBのdGPUでは動作せず、選定の段階で候補から外れる。96GBをグラフィックスメモリに割り当てられるDAIV CXだからこそ、この顔ぶれが最初からすべて候補に残った。

5モデルの容量と実行方法

 まず、Qwen3.8-Flash-Nextを使って、一度に扱う文脈の上限である「コンテキスト長」の設定を検討した。

 入力する資料だけでなく、指示や会話履歴、生成する思考・回答にも、この枠を使う。ローカルLLMの利用に際して、モデルを読み込んだ上で、どの程度のコンテキスト長の設定をするべきなのかというのが、重要なポイントになる。コンテキスト長が大きいほど、必要となるVRAM量が大きくなるためだ。

 モデルによって必要なメモリ量は異なり、コンテキスト長の設定は速度にも影響するため、単純に大きければいいというものではない。どの程度のサイズまで取れて、動作するのかを確認する必要がある。

 適切な最大サイズを調べたところ、Qwen3.8-Flash-Nextでは、コンテキスト長を262,144トークンに設定してモデルを読み込み、短い入力に回答できることを確認できた。

 このときの物理メモリの空きは最小で約20.9GiBだった。これは26万トークン分の資料を読み込ませた結果ではない。26万トークンは、日本語だとざっくり26万~52万文字ほどに相当し、400字詰め原稿用紙なら約655~1,311枚、つまり、長編小説数冊分に相当する容量を扱うことができることを意味する。

 大型ローカルLLMを動かしつつ、これほどのコンテキスト長を扱えるというのは魅力的だ。ただし、これは思考や回答に使う領域も含むため、その容量すべてを資料の入力に使えるわけではない点には注意が必要となる。

 なお、コンテキスト長を増やすことは、扱える枠を広げるということであって、回答が速くなるわけではない。

 整理すると、DAIV CXは80GB級の大型モデルを読み込んでなお、書籍数冊分の資料を一度に扱える余白を残している。モデルの大きさとコンテキスト長のどちらかをあきらめるというトレードオフに悩まされないことが128GBユニファイドメモリの特色だ。この余白が実作業で何をもたらすかは、後述する25ページの資料整理で確認する。

26万トークン設定で、何を確認したか

日本語評価データセット33問と100問の応答結果

 各モデルでの応答速度を計測した結果はどうか?評価には、ELYZAが公開している日本語の指示応答データセット「ELYZA-tasks-100」を使った。100問の測定結果から、質問・指示の本文が短い順に33問を取り出し、短い入力に対する動作を比較している。本文は1問あたり8~75文字で、5モデルとも同じ設問を使った。

 短い33問での推定生成速度の中央値は、gpt-oss-120bが46.5トークン/sec、Qwen3.8-Flash-Nextが27.9トークン/sec、GLM-5.3-Flashが13.1トークン/secだった。この結果にはモデルの思考出力も含まれる。

 一般的にチャット用途では10~15トークン/secが下限で、20~30トークン/secで快適といわれている。その観点から見ると、gpt-oss-120b とQwen3.8-Flash-Nextは快適域に入っており、80GB級の大型モデルであっても対話的に使える速度が出ている。

 GLM-5.3-Flashは実用下限の水準にとどまる。ただし、87.35GBという検証中最大のモデルがローカルの1台で動作し、チャットとして成立する速度を維持できること自体が、大容量メモリの面目躍如といえるだろう。

短い33問: 生成速度と回答待ち時間
短い設問と実回答: 知識・計算・文章
短い設問と実回答: ゲームの企画

 さらに、「ELYZA-tasks-100」の100問すべてにも回答させた。評価結果は、各設問の基準に沿って回答内容を1~5点で採点した平均だ。時間と点数を合わせて、自分の用途に必要な応答性と回答品質を見た。品質の判定は、GPT-6 Astraに行なわせた。

 結果として、5モデルとも100問を最後まで処理し切った。数時間に及ぶ連続推論でも動作は安定しており、まとまった量のタスクを流し続ける使い方に耐えることが確認できた。

DAIV CXで100問を処理するのにかかった時間
回答の内容評価: 平均点と得点の分布

 ここで気になるのがハイエンドdGPU搭載機との性能差だろう。そこで、同じ量子化モデルを使い、ハイエンドdGPU搭載PC 2機種と100問の合計所要時間を比較した。

 Qwen3.8 27BではDAIV CXに対してdGPU搭載機の方が高い性能を発揮しているのが目立つ。

 Gemma 4 31B Instructでも48GB機とは差があるが、VRAM 24GB機はGemma 4 31B Instructでは失速し、DAIV CXとの差が縮まった。断定はできないものの、ファイル容量22.7GBがVRAM 24GBをほぼ使い切るためと考えられる。

 いずれにせよ、この結果で時間だけを見るとdGPU搭載機の方が優勢に映る。ただし、内容評価では差は出ていない。質の面では大きな差がないということだ。

 また、最大の留意点として、これ以外の大型モデル3種は、VRAM 24GBのdGPUでも、VRAM 48GBのdGPUでもVRAM容量が足りず、そもそも動かすことができなかった。

同じモデルを3台で比較した結果

 基本的にLLMのパラメータが増えれば増えるほど、出力の品質が向上する。どの程度の品質が必要かはユーザーや用途によって変わってくる。しかし、ChatGPTやClaudeなどクラウド系サービスの品質に慣れていると、24GBや48GBに収まるモデルの品質では不十分と感じることがあるだろう。

 その観点でいうとgpt-oss-120b であっても、フロンティアモデルと比べれば回答内容に満足できないこともあるだろう。選択の基準はこう整理できる。

 VRAMに収まる中型モデルを速度重視で回すならdGPU搭載機に分がある。一方、クラウド級により近い品質の大型モデルを手元に置きたいなら、それが動く環境はこの価格帯ではDAIV CXが有力な候補となる。60GBや80GBといったクラスのLLMが動くこと自体が、本製品の価値だ。

25ページのドキュメントの要約

 最後に、PDF資料を読み込んで要約するという作業を行なわせた。資料は、スタンフォード大学HAIの「The 2026 AI Index Report」第9章「Public Opinion」(世論)の25ページ分だ。

 これは世界各国の人々がAIにどのような期待や不安を抱いているかを、仕事への影響やAIへの信頼などの観点からまとめた英語の資料である。国別の割合や調査年などの数値情報も多い。そこで、PDFから抽出したテキストを使い、Qwen3.8-Flash-Nextが内容を正確に整理できるかを試した。

 Qwen3.8-Flash-Nextに、同じ資料の先頭1、3、5、10、25ページをそれぞれ渡した。コンテキスト長は262,144、思考と回答を合わせた出力上限は65,536トークンだ。各条件を独立した会話で1回ずつ実行し、モデルの読み込み時間は集計から除いている。

25ページの資料で、要約と事実整理を試す

 1ページは1分25秒、3~10ページは12分01秒~15分35秒、25ページは29分03秒で回答が完了した。25ページでは回答本文が出始めるまで27分18秒かかっていることから、この手の処理を行なう場合は、画面を見ながら待つのではなく、処理を任せて別の作業を進めるべきだろう。

 注目すべきは、Qwen3.8-Flash-Nextが25ページの資料の中から、AIへの不安の増加幅が「2ポイント」と「3ポイント」に分かれて記載されている原資料側の不整合を検出したことだ。資料全体を一度に読み込めたからこそ拾えた、横断的なチェックの成果といえる。

 一方で、調査の実施年を「2024/2025年」と記載する誤りもあった。これはモデルの性質によるもので、クラウドのAIでも起こり得る、AI活用に共通する注意点だ。

Qwen3.8-Flash-Nextの資料整理: ページ数と待ち時間
Qwen3.8-Flash-Nextの資料整理: 内容はどこまで使えるか
Qwen3.8-Flash-Next: 25ページの要約(実回答)
GLM-5.3-Flash: 25ページの要約(実回答)

 ここで重要なのは、ローカル環境なら確認のための再実行や別モデルでの検算を、利用料や回数制限を気にせず何度でも行なえることだ。加えて、実務でこうした資料整理の対象となるのは、多くの場合そもそも社外に出せない文書だろう。手元で完結するDAIV CXの環境は、その前提に最初から合致している。

 なお、大量の文書を読み込ませて参照しながら回答させるこの能力は、社内資料を検索・参照して答えるRAGのような使い方の土台になるものだ。

大型ローカルLLMを「日常の道具」にする1台、DAIV CX

 今回の検証では、DAIV CXがローカルLLMの実用環境として十分に機能することを確認できた。Windows上のLM Studioで環境構築から運用までがほぼ完結し、128GBのユニファイドメモリによって、24GBや48GBのVRAMでは動かせない80GB級の大型モデルまで選択肢に入る。動く範囲の広さと、始めるまでの障壁の低さ。この2つを1台で両立していることが、DAIV CXの核となる特徴だ。

 もちろん、VRAMに収まる中型モデルを速く回すことが目的なら、dGPU搭載機という選択もある。だが、VRAMの上限に縛られず、より大きく、クラウド級に近い品質のモデルを手元で動かすという使い方の受け皿になれるのは大容量ユニファイドメモリ機ならではだ。

 また、本記事はLLMに用途を絞ったが、生成AIには画像や動画の生成という領域もある。こちらはメモリ容量よりGPUの演算性能が生成速度に直結するため、高性能dGPUを搭載したPCの方が適している。

 「DAIV」のラインナップでも、dGPU搭載のデスクトップやノートが用意されており、LLM中心ならDAIV CX、画像/動画生成が主目的ならdGPU搭載機と、用途に応じて選び分けるのが正解だ。

 加えて、今回は計測していないが、ハイエンドdGPUがピーク時に600W近くを要するのに対し、本製品はモバイル向けに設計されたSoCを核とする小型筐体であり、消費電力は圧倒的に小さい。資料整理のように処理を数十分実行させる使い方や、サーバー化して常時待機させる運用では、電力と発熱の少なさが「回し続けやすさ」につながる。

 そして、クラウド型サービスとの対比で見たときのローカルLLMの本質的な価値も、改めて言及しておきたい。最大の訴求点は、社外に出せない情報を扱えることだ。

 企業でローカルLLMの導入が検討されるのは、単なるチャット用途だけではない。社内文書の検索や要約、契約書や技術資料のレビュー、研究開発におけるナレッジ活用など、業務データを活用したAI利用ニーズが高まっている。

 顧客情報、契約書、設計データ、人事資料など、業務で本当にAIに任せたい文書ほど、セキュリティ規定でクラウドに送れないというジレンマがある。ローカルLLMは構成や運用次第で機密情報を外部AIサービスへ送信せずに処理できるため、機密データを扱う企業や研究機関にとって有力な選択肢となる(※外部通信の有無は利用するアプリケーションや設定、接続するサービスによって異なる)。クラウドサービスの規約や学習利用の扱いを個別に確認する必要もない。

 「AIを使ってよいか」の判断で止まっていた業務にAIを入れられることこそ、ローカルの決定的な価値だ。

電源ボタンに指紋認証センサーを内蔵
ミニPC内部は大半を冷却機構が占める

 加えてコストの構造も変わる。使えば使うほど従量課金やサブスク費用が積み上がるクラウドと違い、初期投資の後はどれだけ生成しても電気代を除いて基本的に追加費用がかからない。確認のための再実行や別モデルでの検算も、料金や回数制限を気にせず好きなだけ行なえる。冒頭で挙げた「壁」への答えを、DAIV CXは1台のWindows PCとして机の上に置ける形にしている。

 短い相談には対話的に使い、まとまった資料の整理は処理を任せて別の作業を進める。そうした使い分けで大型ローカルLLMを日常に取り入れたい人にとって、DAIV CXは現実的な答えになる。

 留意点があるとすれば、本製品がAMDプラットフォームであることだろう。生成AIの分野では、特定のプラットフォームに最適化されたモデルやツールが先行し、開発環境の充実度でも一日の長がある。

 ただし、そうした環境の多くはLinuxベースの運用が前提となっており、慣れていない人にとっては導入も日々の操作も障壁が高い。

 対してDAIV CXはWindowsそのものだ。OSやアプリの操作に新しく覚えることがほとんどなく、インストールも通常のWindowsソフトと変わらない。Microsoft Intuneを始めとする既存のデバイス管理基盤にもそのまま載せられるため、会社の管理下にあるPCとして運用できる。個人はもちろん、業務導入を考える場面でこの相性の良さは効いてくる。