ニュース
Qwen3.8-Flash-NextがゲーミングPCで爆速に動く「Strata」登場
2026年10月2日 12:59
総パラメータ125B(1,250億)、アクティブパラメータ6B(60億)の大規模モデルが、ビデオカード1枚のゲーミングPCで秒間60~95トークンの速度で動く。開発者のNiko1221氏は、Alibabaの大規模言語モデル「Qwen3.8-Flash-Next」をコンシューマ向けPCで高速に実行するための推論エンジン「Strata」をGitHubで公開している。ライセンスはMIT。
Strataは、本来なら数百GBのVRAMを備えたハードウェアが必要なQwen3.8-Flash-Nextを、12~24GBのVRAMを搭載したNVIDIA製ビデオカード1枚と64GBのメインメモリで高速に動かすことを目的としたソフトウェア。VRAM 12GB以上のGeForce RTX 20/30/40/50シリーズと、量子化モデルに応じたメインメモリ、約80GBのディスク空き容量が必要。対応OSはWindows 10/11またはLinux。
公開されているベンチマークによれば、GeForce RTX 5070(12GB)とRyzen 5 7600、64GBメモリの環境において、最も軽量な量子化モデル「Q2_0」が短い対話で93tok/s、128Kコンテキストでも74tok/sを記録。推奨の「IQ2_XS」では79tok/s、プロンプト読み込みは2,090tok/sとなる。
より大容量のVRAMを備えるGeForce RTX 3090(24GB)では、100~140tok/sに達すると見込まれている。NVIDIA製ビデオカードを2~3枚搭載している場合は、モデルを複数カードに分散して処理することも可能だ。
セットアップは簡単。Windows版はGitHubからダウンロードしたZIPを展開し、「START-HERE.bat」をダブルクリックするだけ。Python環境や推論エンジン、モデル(約70GB)のダウンロードまで自動で完了する。Linux版は「setup.sh」で同様にセットアップでき、Dockerfileも用意される。
起動後はブラウザからチャットや稼働状況のモニタリングが行なえる。また、「http://127.0.0.1:8080/v1」でOpenAI互換、「/v1/messages」でAnthropic互換のAPIを提供するため、既存のAIコーディングエージェントなどからローカルモデルとして利用できる。
また、画像入力にも対応し、思考(Thinking)の深さはoff/low/medium/highの4段階から選べる。なお、Linux環境ではAMD Radeon RX 7900/9070シリーズなどでの動作も実験的にサポートしている。
量子化モデルはQ2_0(必要メモリ37.6GB)、IQ2_XS(同39.2GB)、IQ3_XXS(同47GB)、IQ3_S(同54.8GB)の4種類を用意。IQ3_Sは公開ベンチマークでフル精度モデルと同等の精度を持つという。このほか、推論を短くして回答を早く返すUkisAI製ファインチューン「Swift 1.5」も選択できる。
説明によればVRAMが大きいビデオカードであればあるほど高速で、なおかつ複数のビデオカードがある場合は、インストール時に両方使うこともできる。GeForce RTX 5080+RTX 3090の環境では、プロンプトの読み取り速度が5080単体の場合よりも18~20%高速だったという。
Strataが高速な理由とは?
Strataが高速な理由は、モデルをPC全体で分担して処理する仕組みにあるという。
Qwen3.8-Flash-NextはMoE(Mixture of Experts)構造で、2万4,576個のエキスパートを持つのだが、1トークンの生成に使われるのはそのうち10個だけだという。そこでStrataは、あらゆる単語の処理に必要な部分と、頻繁に使われる数千のエキスパートだけをVRAMに置き、メインメモリに全エキスパートデータを保存。ビデオカード側にないエキスパートが必要になった場合は、CPUが並行して処理するため、GPUとCPUのどちらも待つ必要がない。
また、大容量なルックアップテーブルはSSD上に置かれているが、必要なほんの数行だけを読み出す。使用中にどのエキスパートがよく使われるかを学習し、GPU側に置く構成も最適化していく。
加えて、モデル組み込みの小型ヘルパーが次の数トークンを推測し、メインモデルが一括で検証して採用するかどうかを判断する投機的デコーディングを採用。ヘルパーが推測、メインモデルが単語の決定を行なうため、出力品質を保ったまま1.6~1.8倍の高速化を実現したとしている。プロンプトの読み込みも最大8,192トークン単位でまとめて処理するため、長文のドキュメントやコードベースでも1,000tok/s以上で読み込める。








![REBON / BUGS LIFE / DIGITAL GIRL [Explicit] 製品画像:1位](https://m.media-amazon.com/images/I/51vxV7ji6SL._SL160_.jpg)





![【Amazon.co.jp限定】 伊藤園 磨かれて、澄みきった日本の水 2L 8本 ラベルレス [ ケース ] [ 水 ] [ ペットボトル ] [ 箱買い ] [ ストック ] [ 水分補給 ] 製品画像:4位](https://m.media-amazon.com/images/I/41m8ly-SllL._SL160_.jpg)





