ニュース

Qwen3.8-Flash-Nextローカル実行環境「Strata」更新。旧世代GeForceやArcに一筋の光

 コンシューマ向けPCでローカルLLM「Qwen3.8-Flash-Next」を手軽に動かせるオープンソースの推論環境「Strata」の最新版「v0.1.39」が10月4日に公開された。GitHubで無償公開されており、既存ユーザーはUPDATE.bat(Linuxはupdate.sh)の実行で更新できる。

 Strataは、Niko1221氏が開発するワンクリックインストールでWindows/Linux上にローカルLLMサーバーを構築できるツール。OpenAI/Anthropic互換APIをローカルホストで提供し、オプションで画像入力にも対応する。

 v0.1.39では性能面の改善が中心で、デコード処理の最適化により、GeForce RTX 5070での実測で約6%(Q2_0)の速度向上を達成。加えて、長文プロンプトの処理速度や非常に長いコンテキストの性能を改善したほか、マルチGPU構成の高速化を図った。

 機能面では、複数リクエストの同時処理に対応。リクエスト1つあたりの速度は低下するが待ち時間を短縮でき、4基のGPUによる構成では8リクエスト合計で、単独時の120tok/sに対し360tok/sを記録したという。

 実験的機能として、古いGPUやIntel GPU、古いCPUへの対応も追加された。CUDA 13が非対応のGPU(Pascal/Volta世代のGeForce GTX 10シリーズやP40、V100など)向けにCUDA 12.9ベースのエンジンを用意したほか、Intel Arc向けのSYCL版(Linuxのみ)、AVX2非対応の旧世代CPUへの対応も加わった。

 さらに、OpenAI Responses API(/v1/responses)を実装し、OpenAIのコーディングエージェント「Codex CLI」から利用可能になった。このほか、メモリ使用量に上限を設けた際にプロンプト処理が遅くなる前バージョンの問題や、多数の不具合の修正が含まれる。