西川善司のグラフィックスMANIAC

DLSS 5の正体は1回推論の画像生成AI、NVIDIAが明かした3D誘導型の中身とは

DLSS 5にまつわる物議

 本誌読者でDLSSを聞いたことがないという人は少数派だとは思うが、まず大前提として「DLSSとは何か」を軽くおさらいしておきたい。DLSSは、Deep Learning Super Samplingの略。ゲーム側で描画したゲーム映像を、情報が損失した映像(画像)として捉え、これを復元するという発想で入力映像を高画質化する仕組みだ。

 ディープラーニング系AIを応用した画像復元技術であることから頭にDeep Learning(DL)のキーワードが付いている。DLSSはもともと超解像処理とアンチエイリアスに特化した機能を有していたが、2023年のDLSS 3.5では、レイトレーシング映像のデノイズ(ノイズ低減)を実践するレイ再構成技術も統合された。

 そのDLSSの最新版が“5”で、2026年3月時に、DLSS 5の予告発表が行なわれた際には、以下のような比較画面ショットが提示されて、多くのゲームファンの物議を醸した。おおよそ議論は「ここまで陰影表現を変えてしまってもよいものか」という点に集中した。

物議を呼んだ比較画面(DLSS 5オフ)
バイオハザードレクイエムのグレースのDLSS 5オフ結果
物議を呼んだ比較画面(DLSS 5オン)
バイオハザードレクイエムのグレースのDLSS 5オン結果

 NVIDIAは、遡ること、2025年1月にGeForce RTX 50シリーズを発表した際に「NVIDIA RTX Kit」を発表している。この中には「NVIDIA RTX Neural Faces」(以下、RTX Neural Faces)というものがあり、これは大ざっぱにいうと、低品質に描画した顔面描画結果を、事前学習させたAIにリアルタイムスタイル変換するものだ。

 そのため、GPUの描画性能が低いマシン(環境)でも、AI性能が高ければ、パストレ級の顔面ゲームグラフィックスを出力できるというものであった。

 いわゆる、顔面の形状まで変えてしまうようなタイプのスマホアプリの美化フィルタみたいなものだ。NVIDIAが1年前にこの技術を発表していたので「これがDLSSに組み込まれたのか」と誤認してしまった人も多かったようだ。

DLSS 5と混同されたRTX Neural Faces
素のレンダリング結果
NVIDIA RTX Neural Faces適用後
NVIDIA RTX Neural Facesのパイプライン概念図

 しかし、これは「技術誤認」だ。

 DLSS 5は、基本的にはDLSSの延長線上にある技術のままであり、ゲームエンジン(グラフィックスエンジン)から、必要な内部パラメータを得て、描画結果を高画質方向へ調整するタイプの技術に留まっている。

 対して、RTX Neural Facesは、ゲーム開発元での、登場するキャラクターごとの個別のAIトレーニングフェーズが必要であり、AI技術を活用したリアルタイム映像加工技術という点にDLSSとの共通点はあるが、開発パイプラインがまったく違う。

 分かりやすい視点で説明すれば、 DLSS 5では3Dモデル形状は変わらず陰影結果だけが変わるのに対して、RTX Neural Facesでは、元画の顔モデルの形状も変わってしまう ので、この点で大きく違う。

 では、DLSS 5はどんな技術なのか……という点に関して、NVIDIAは2026年3月時点では一切開示しなかった。これも、各所で色んな考察が語られ、議論が白熱した遠因にもなった。

 さて、「ジオメトリは不変」「陰影だけ過剰なまでにリアルになる」というDLSS 5の動作特性から、当初筆者はオフライン・パストレーシングによって描画されたお手本画像と、リアルタイム描画のゲーム映像フレーム・G-Bufferパラメータ群との相関を学習させたAIモデルだと想定していた。

 今回、開示された詳細論文に目を通したところ、この予想はおおよそ当たっていた。しかし、ランタイム時にゲーム映像の生フレームとG-Buffer(後述)を入力して推論させる、従来のDLSS技術の延長線上にある画像復元・再構築系AIだと考えていた部分は完全に誤っていた。

DLSS 5解説の前提となる「G-Buffer」とは何か

 本題であるDLSS 5解説の理解に必要な基礎知識となる、この「G-Buffer」の解説をしておこう。

 G-Bufferとは、近代ゲームグラフィックスの基礎概念となっているキーワードである、PBR(Physically Based Rendering: 物理ベースレンダリング)の実用化とともに台頭してきた技術になる。

 近代PBRゲームグラフィックスは、多段パイプラインで描画されており、まず、画面解像度にて、画面上の3Dオブジェクト達に対するライティングを後回しにして、複数のバッファ(これがG-Buffer)に対して、材質パラメータの“数値のみ”を描画する。

 描画されるPBR材質パラメータは、ベースカラー(アルベド)、法線ベクトル(ピクセル単位の向きを表すベクトル)、粗さ(ラフネス)、金属性(メタリック)など。

 後段で、G-Bufferに書き込まれたデータは逐次取り出して、後回しにしていたそのピクセルへのライティング(光を当てる)や、シェーディング(当てた光の振る舞いを回収する)を実践して、最終的な表示用の画像を構築する。実質的なピクセル色の算定を後回しにするレンダリング手法であることから、このテクニックはDeferred Rendering(あるいはDeferred Shading)と呼ばれる。

 ざっくりとまとめるとすれば、G-Bufferとは、要するに画面上の各ピクセルについて「そこに何が見えていて、どんな材質で、どちらを向いているか」を記録した巨大な画面解像度相当サイズのデータベースのようなもの……と理解すると分かりやすいかもしれない。ちなみに、このG-Bufferはゲームの場合、毎フレーム構築することになる。

材質パラメータを記録するG-Buffer
G-Bufferの概念図解

 G-Bufferに書き込まれた材質パラメータは、もともとは複数のテクスチャマップに分散させて記録されていた数値データだ。どんなに高解像度のテクスチャであっても、3Dモデル上のポリゴンにマッピングされる際には、テクスチャは縮小処理が行なわれて描画される。

 つまり、元々記録されていた材質パラメータはG-Bufferに書き込まれた段階で低解像度化してしまう。数値データの正確性が損失するのだ。当時の筆者は、DLSS 5はこの損失したG-Bufferに対する損失補償を行なう仕組みなのではないか、と考えていた。

 DLSS 5オンの結果画像で共通している「唇のシワ」や「ほうれい線」などの鮮鋭化は、G-Buffer内の法線ベクトルの品質が向上した結果の典型事例なので、これがこの考察の起点となっていた。

 しかし、DLSS 5は筆者の想像の斜め上をいく、とんでもない技術だった(笑)。 実際にはDLSS 5は、本当に画像生成系AIだったのだ 。

DLSS 5は技術的には画像生成系AIだった。そもそも画像生成系AIってなに?

 詳細については、その仕組みを解説した論文が出ているので、興味がある人はそちらを参照してほしいが、本稿ではその概念をできる範囲で詳しく解説したい。

 NVIDIAは、DLSS 5に採用した技術を「3D-Guided Neural Rendering」(3D誘導型ニューラルレンダリング)と呼称しているが、 その実態はDiffusion Transformer系の画像生成AIの流れを汲むものだ 。そう、一世を風靡した「Stable Diffusion」などの系譜と同じなのだ。

 なお、NVIDIAは、DLSS 5に用いた、この画像生成系AI技術名を「One-Step Pixel-Space Diffusion Transformer」だと明言している。

 ということは、DLSS 5を理解するには、Diffusion系の画像生成AIについての本質を理解する必要があるということだ。

 Diffusion系の画像生成AIは、砂嵐のようなランダムノイズを出発点として、AIによるノイズ除去を何度も繰り返しながら、目的の画像へと近づけていくという、一見すると気が遠くなるようなテクニックである。

 ピンとこない人もいると思うので、概念的な例でまずは概説しよう。

 たとえば、ノイズまみれになって耳の部分が見えなくなった犬の写真があったとする。この写真を熟練した絵画の修復師に渡せば、その人は犬の種類や頭の大きさ、顔の形などを手がかりとして、「この犬なら、ここにはこんな耳があったはずだ」と推測しながら、失われた部分を描き直せるかもしれない。

 Diffusion系画像生成AIも、イメージとしてはこれに近い。

 「ここに犬がいる画像を作ってほしい」という依頼、すなわちテキストプロンプトを与えられた“画像の修復師=AI”が、最初はほとんど砂嵐にしか見えないノイズ画像を前にして、「ここには犬の頭がありそうだ」「ここには耳がありそうだ」と少しずつ画像の内容を推定し、不要と思われるノイズを取り除いていく。そして、その処理を何段階にもわたって繰り返すことで、徐々に目的の画像へと近づけていくのである。

ノイズから画像を作るDiffusionの考え方
DLSS 5技術には、Diffusion系画像生成系技術の基礎概念が取り入れられている

 初期の代表的なDiffusionモデルでは、この処理を数百~数千段階程度にわたって行なう方式も存在した。その後は、サンプリング手法の改良やモデルの蒸留などによって必要な処理回数は大幅に削減され、近年では数十ステップ程度、方式によってはさらに少ない段数で画像を生成できるものも登場している。

 いずれにせよ、Diffusion系画像生成AIの基本的な考え方は、テキストプロンプトなどの条件を手がかりとして、AIがノイズの中から「本来ここにはどんな画像があるべきか」を推定し、段階的に画像を作り上げていくというものだ。

 画像生成AIを使ったことがある人なら、同じテキストプロンプトを入力しても、生成される画像が毎回少しずつ違うことを経験しているだろう。その主な理由は、生成の出発点として使われるランダムノイズや、サンプリング過程に確率的な要素が含まれることにある。

 さらにDiffusion系AIでは、各段階の推論結果が次の段階の入力として引き継がれていくため、出発点にあったわずかな違いが、何度もの反復処理を通じて最終的に大きな違いへと発展することもある。

 つまり、推論の繰り返し回数が多いこと自体が、毎回異なる画像を生み出す直接原因というわけではないが、生成結果の違いとまったく無関係でもないのである(もちろん、乱数シードや生成条件を固定し、決定論的に処理すれば、同じ結果を再現できる場合もある)。

 いずれにせよ、ゲーム映像の場合は、毎フレーム、映像が変わってしまっては困ってしまう。

DLSS 5の動作メカニズムに迫る

 そこで、NVIDIAのDLSS 5では、一般的な画像生成系AIとは異なり、同じ状況では再現性のある画像を生成する「One-Step Pixel-Space Diffusion Transformer」というテクニックが採用された。

 頭の「One-Step」という技術名は、一般的なDiffusion系画像生成AIのように、ノイズ除去の推論を何段階にもわたって繰り返すのではなく、1回の推論で最終画像を生成することを意味している。反復的な確率サンプリングを行なわないため、一般的なDiffusion系画像生成AIと比べて出力を決定論的にしやすい。

 続くキーワードの「Pixel-Space」は、ゲームグラフィックスに詳しい読者ならば、画面座標系(Screen-Space)を意味するように思ってしまいそうだが、厳密にはそうではない。

 本来、Diffusion系AIは、ピクセルの集まりで表現される画像データそのもの(Pixel-Space)を取り扱わず、輪郭、形状、質感や色傾向、そのほか、人間には理解しづらい意味的特徴といった潜在ベクトル(Latent Vector)空間……すなわち「Latent-Space」に変換して画像を取り扱うのが一般的だ。これは、潜在ベクトル空間でAI処理した方が演算量とメモリ消費を大幅に減らせるから。

 しかし、DLSS 5では、ピクセル集合体の画像そのもの「Pixel-Space」で取り扱う。ここも一般的な画像生成系AIとは大きな相違点となる。

 このPixel-Space/画像データからLatent-Space/潜在ベクトルデータへの変換を担当するのがVAE(Variational Autoencoder:変分オートエンコーダ)なのだが、この潜在ベクトル空間へ変換するということは、事実上の不可逆圧縮することに相当する。

 最終的にDLSS 5の出力は、人間が見慣れたPixel-Space/画像データへ戻す必要があるので、この不可逆圧縮処理の影響で、細い線、小さな文字、微細テクスチャ、エッジ位置といった1ピクセル単位のディテールが損失することになる。

 NVIDIAの開示した論文では「演算負荷低減のことを考えればLatent-Spaceで処理した方が軽かった」「しかし、高画質を優先したために演算負荷の高いPixel-Spaceでの処理を採択した」といった理由が述べられている。

DLSS 5がDiffusionに加えた独自チューニング
DLSS 5がDiffusion系技術を応用するために行なった独自チューニングのすべて

 DLSS 5の推論実行にあたっては、ゲーム(ゲームエンジン、グラフィックスエンジン)からDLSS 5が受けとる情報は、GPUが描画した生フレーム(カラーバッファ)以外には、過去フレームから1ピクセル単位の動きベクトル情報(ベロシティバッファ)相当のみだと明言された。つまり、 DLSS 5は、筆者が当初推測していたような、G-Buffer系の情報を、推論時には一切受けとらないのだ 。

推論時にDLSS 5が受け取る入力
NVIDIAが提示したDLSS 5の推論時の動作イメージ図。実際にはこれ以外にDLSS 5内部パラメータが前フレームから継承入力される。これについては後述

 なお、NVIDIAによれば、G-Buffer的な情報については、AIモデルの学習時に、生成結果が元のオブジェクト、形状、色、光と影の関係を維持しているかを評価するために使用しているとのことである。

 換言すればDLSS 5は、学習時において、最終カラー画像と、法線やアルベド、ライティング結果などのG-Buffer的なシーン属性情報との対応関係を学習し、その関係をモデルの重みとして獲得しているということだ。

G-Buffer情報を使うのは学習時だけ
NVIDIAが提示したDLSS 5の学習フェーズ時の概念図

 ここで重要なのは、この「3Dシーンへの拘束」と、「フォトリアルな見え方の獲得」は、厳密には別の役割を担っているという点だ。

 前者については、G-Buffer的なレンダラー由来の情報を学習時の監督信号として利用することで、元のオブジェクト形状や材質、ライティングと生成結果との整合性を学習する。一方でDLSS 5は、実世界の視覚データから学習した「Appearance Prior(外観に関する事前知識)」も備えている。

 この学習結果が後者の「フォトリアルな見え方の獲得」と深く関係している。ちなみに、論文によると、Appearance Priorについては「実世界の見え方」を、オフラインCGではなく、大規模な実写の写真データから統計的に学習したと明言している。

 具体的には、材質、照明、表面形状、シーン文脈が写真の中でどう見えるのか、を統計学的な視点で学ばせたとしている。

 一方で、推論時には、こうして学習した知識を使い、GPUが描画したカラー画像を基準に、その中に存在するオブジェクト、材質、空間関係、光源などを推定しながら、元のシーン構造や意味をできるだけ維持したまま、肌の表面下散乱、布地の光沢、髪や葉を透過する光といった、従来のリアルタイムレンダリングでは表現コストの高かった外観を生成する。

推論フェーズと学習フェーズの役割分担
DLSS 5の推論フェーズと学習フェーズのおさらい

 上の図解でも示しているように、DLSS 5の推論時に動きベクトル情報が必要になるのは、学習によって獲得した時間方向の知識を活用するために、前フレームと現在フレームとの間で「画面上のどの部分がどこへ移動したのか」という対応関係を知る必要があるため。

 そう、DLSS 5のAIは学習フェーズで、連続するフレームの中で、物体や材質の見え方、陰影、ハイライト、細かな質感などが、物体やカメラの動きに伴ってどのように連続して変化していくのか、という時間方向の表現について学習している。

 こうした時間方向の知識が重要になるのは、生成した画像の時間的一貫性、すなわちTemporal Consistencyを維持するためだ。

 たとえば、前フレームでDLSS 5が生成した肌の陰影や細かな質感があった場合、現在フレームでは、ゲームエンジンから与えられた動きベクトル情報を手掛かりとして、その表面が画面上のどこへ移動したのかを把握できる。

 これによって、同じ表面に属する陰影や質感を理由なく別の表現へ変化させるのではなく、必要な変化だけを加えながら時間方向に連続的な表現を生成しやすくなる。

 つまり、ユーザーから見たDLSS 5適用後のゲーム映像において、「肌の質感がフレームごとに微妙に変わる」「髪のハイライトがチラつく」「服の模様が時間方向に揺らぐ」といった、生成AI特有の時間方向の不安定さを極力抑えることにつながるのだ。

時間方向の知識を学習するのは生成した画像の時間的一貫性、すなわちTemporal Consistencyを維持するため

 さて、推論時には、前段までに解説した情報以外にも、DLSS 5のAIが過去のフレームから持ち越している「Temporal State」情報と、ゲーム開発者が指定する「Artistic Direction」用の制御値も活用される。

 論文でもDLSS 5の推論時には、現在のレンダリング済みフレーム、ゲームエンジンから与えられるモーションベクトル、過去から持ち越されるTemporal State、そしてArtistic Direction用の値が条件として入力される、と説明されている。

 「Temporal State」情報とは、DLSS 5が前フレームまでの処理から次のフレームへ持ち越していく、時間方向の内部状態情報のことだ。ゲームエンジンから入力される動きベクトル情報(ベロシティバッファ)とは別物で、こちらはDLSS 5自身がフレーム間の時間的一貫性を維持するために保持する情報、と理解すればよいだろう。

 論文でもDLSS 5は、フレームストリームを因果的に処理しながら「carried temporal state」(過去の推論で得た状態を次フレームへ持ち越す情報)を引き継ぐ仕組みであると説明されている。

 ただし、今回公開された論文でもTemporal Stateの具体的なデータ構造についてはあまり細かく語られていない。どのような特徴量を、どのような空間的表現で保持しているかまでは明らかにされていないので、「DLSS 5が過去の処理結果から持ち越す内部状態情報」程度として理解しておくのが無難だ。

 一方の「Artistic Direction」は、DLSS 5が画像を生成する際のテイストや効果強度をゲーム開発者側から指定するための制御機構、といったイメージになる(下記)。

 これは論文では、Appearance Modelの選択、効果強度、色応答、空間的/意味的マスクなどによって、「どのような変換を」「どの程度」「画面のどこに」適用するかを制御する仕組みとして説明されている。

 なお、このArtistic Direction関連の用語については下で個別にフォローしていくが、NVIDIAの発表資料と9月に公開された論文とで若干呼び方が異なっている点に留意したい。

 以下では、NVIDIAの発表側で使われている名称を先に、論文中の名称を括弧内に併記することにする。

Appearance Model

 どんな写実的表現に寄せるかを決めるモデル選択(詳細は後述)。現在のDLSS 5ではA/B/Cで表される3つの学習済みAppearance Modelが用意されており、それぞれTone、Color、Material Appearanceなどの傾向が異なる。植生、光、肌などの扱いにもモデルごとの差がある。論文では、これら複数のモデルによって、広大な写実的画像分布の一部を3つのAIモデルが離散的にカバーする、という考え方が示されている。

公開されたAppearance Model A/B/Cの図解
NVIDIAが、3つあるAIモデルについて提示した図解はこれだけで、あまり詳しくは語られていない。なお、学習データセットがABCの3モデル個別に3つあるといったことは明言されていない

Structure Intensity(Structure Strength)

 細かな材質・ディテール・局所コントラストをどれだけ変えるかを調整するパラメータ。おおむね画像の高空間周波数成分側に対する効果強度の設定に相当する(詳細は後述)。論文では「Structure Strength」という名称で記述されており、値を0にするとStructure方向のEnhancementを抑え、1では学習済み変換を最大限適用する仕組みとなっている。

Tone Intensity(Tone Strength)

 広域的な明るさや照明感をどれだけ変えるかを調整するパラメータ。おおむね画像の低空間周波数成分側に対する効果強度の設定に相当する(詳細は後述)。論文では「Tone Strength」という名称が使われており、Structure Intensity(Structure Strength)とは独立して調整できる。

Chroma Adjustment(Color Response)

 色味や色応答に関するArtistic Directionの制御要素。論文では「chroma adjustment」「color response」という表現が使われているが、現在公開されているDLSS 5 SDKのUIでは、これに対応する独立した調整項目は設けられていない。実際のSDKでは、広域的なライティングと色応答は主としてTone Intensity(Tone Strength)の制御対象に統合された可能性が高い。また、Appearance Model A/B/C自体もそれぞれ異なる色・トーン特性を持つので、こちらに統合された可能性もある。

Semantic AI Masking(Automatic Masking / Semantic Mask)

 DLSS 5自身が入力映像から意味的な領域を自動認識してマスクを生成し、その領域だけに異なる効果強度を適用する仕組み。2026年9月時点で論文に具体的な実装例として記載されている対象は「skin」、すなわち肌領域のみである(詳細は後述)

Engine-level Masking(Manual Masking / Manual Spatial Mask)

 ゲームエンジン側から、画面の場所ごとにStructure Intensity(Structure Strength)とTone Intensity(Tone Strength)の効果量を指定するための手動生成マスク。ゲーム開発者がゲームエンジン上で、ピクセル単位のDLSS5効果具合を2Dのスカラーマップとして生成し、DLSS 5へ入力する仕組みとなる。

 ここで重要なのは、上記パラメータのすべてが画面座標系で与えられるパラメータというわけではない、という点だ。

 上記Appearance Model、Structure Intensity(Structure Strength)、Tone Intensity(Tone Strength)、Chroma Adjustment(Color Response)などは、基本的には画像全体に対するグローバルな制御値として扱われる。

 一方、Engine-level Masking(Manual Masking / Manual Spatial Mask)は、ゲームエンジン側で生成したピクセル単位の値を2Dマップ(画面座標系のバッファ)としてDLSS 5へ入力する。

 論文には、ToneとStructureの値をピクセルごとに指定し、それらのスカラー値からなる「2D surface」をDLSS 5へ渡すと明記されている。このマスクは推論時にはモデルへの追加チャンネルとして入力されるため、ゲーム開発者は、画面上の場所ごとにStructure Intensity(Structure Strength)とTone Intensity(Tone Strength)の効き具合を変えることができる。

材質ごとに効きを変えるEngine-level Masking
DLSS 5 SDKの画面。1ピクセル単位での「Structure×Tone」強度設定を、画面内の特定の材質表現について行ないたい場合は、ゲームエンジン側が運用しているマテリアルID、オブジェクトIDなどを利用して生成した、画面座標系の自主マスク(Engine-level Masking)をDLSS 5に入力できる
同じ画面のマスク表示をオフにした状態
同一画面において、マスク表示をオフにした画面

 Semantic AI Masking(Automatic Masking / Semantic Mask)の仕組みは少し異なる。

 これはゲームエンジン側がマスク画像を生成してDLSS 5へ渡すのではなく、DLSS 5自身が入力映像を解析して、該当する意味領域を自動的に推定する仕組みだ。2026年9月時点の論文では、その具体的な対象として「skin」、すなわち"肌"の認識のみが実装されている。

肌だけを自動認識するSemantic AI Masking
2026年9月時点のDLSS 5では、Semantic AI Masking(Automatic Masking / Semantic Mask)はキャラクター(人肌)にのみ対応している

 実際、論文では、開発者が従来作成していた肌用のピクセル単位マスクを不要にするため、モデル自身にskinのSemantic Maskを学習させた、と説明されている。そして手動で生成していたピクセル単位マスクの代わりに、「skin」と判定されたピクセルだけに作用する新しいグローバルStrengthパラメータを与える仕組みとなっている。

 つまり、Semantic AI Maskingでは、どのピクセルが「肌」なのかを判断する部分はDLSS 5のAI自身が担当し、ゲーム開発者側は、その自動抽出された肌領域に対してどれくらい強くDLSS 5の効果を適用するかをグローバルなStrength値として指定する、という構造になっている。

肌・肌以外・画面全体で効果を切り分けた3例
論文の図解(Figure 8より)。AIが自動推定したskin-mask領域に応じて、肌部分だけにEnhancementを適用する例(d)、逆に肌以外だけにEnhancementを適用する例(b)、そして画面全体へ適用する例が示されている(c)。現時点では肌領域が具体的な実装対象となっているが、論文では将来的に、髪、植生、布地、個別の材質、さらにはゲーム開発者が定義したSemantic Groupなどへ拡張できる可能性についても言及されている

 このように整理すると、DLSS 5のArtistic Direction機構は、大きく「画像全体の外観を決めるグローバルな制御」と、「画面内の場所や意味的領域ごとに効果量を変えるローカルな制御」の2段構えになっている、と理解すると分かりやすい。

 前者にはAppearance Model、Structure Intensity(Structure Strength)、Tone Intensity(Tone Strength)、Chroma Adjustment(Color Response)などがある。

 後者にはDLSS 5自身が意味領域を認識するSemantic AI Masking(Automatic Masking / Semantic Mask)と、ゲーム側が明示的なピクセル単位マスクを与えるEngine-level Masking(Manual Masking / Manual Spatial Mask)がある。

画面全体に効くGLOBAL CONTROL
DLSS 5 SDKの画面。「GLOBAL CONTROL」は、画面全体に対するDLSS 5の調整値を意味する。いわゆるグローバル設定

 ということで、ここまでをまとめると、DLSS 5は、画像生成系AIの系譜にありながら、ゲーム側が描画した生フレーム(カラーバッファ)と、その生フレームとG-Buffer情報の強い相関学習データに強く拘束されてほぼ暴れない生成特性を獲得し、推論も1回(One-Step)のみ行なうことで、安定した高品位な写実的な映像加工を実現できているわけである。

Temporal StateとArtistic Directionの引き継ぎ
DLSS 5 は、AIが過去のフレームから持ち越している「Temporal State」情報と、ゲーム開発者が指定する「Artistic Direction」用の制御値も、次フレームへと持ち越される

DLSS 5はゲーム映像の何を変えるのか。そして何を変えないのか

 実際にDLSS 5は、ゲーム映像に対してどんな影響を及ぼすのか。あるいは及ぼさないのか。ここではそのあたりに言及したい。

 まずはゲーム開発者側が最も気にするであろう「何を変えないのか」から。

 NVIDIAによれば、AI部分が「One-Step」推論で、処理次元が「Pixel-Space」であることから、入力されたゲーム映像に存在するピクセル単位のエイリアシング(つまりジャギー)まで残るとしている。DLSS 5のAIは元画像の構造を守り過ぎるほど守る設計となっている、とNVIDIAは豪語する。

 では、DLSS 5自体はジャギーが低減できないのかといえば、その通り。しかし、そこはそれ、エイリアス(ジャギー)低減については、DLSS 5の前段処理(いわゆるDLSS 4世代の超解像パイプライン)で済んでいる、という認識なのだ。NVIDIAは、 「潰れた細部や欠落したジオメトリ形状」はDLSS 5で修復されないとしている 。RTX Neural Facesとは違うと、明言しているわけだ。

歪んだ窓枠はDLSS 5でも直らない
NVIDIAが出したDLSS 5の論文の図解より。歪んだ窓枠の画像(左)を、DLSS 5へ入力しても、その歪みは訂正されない。DLSS 5は「これは窓枠だから、本当はこういう完全な直線形状だったはずだ」と直すAIではないのだ

 逆に、DLSS 5が大胆に変えてくるのが「材質表現や光が照らされたことによる陰影、表面形状が現実世界ではどう見えるべきか」の部分だ。上でも述べたように「Artistic Direction」のパラメータで効果の強弱は制御できるが、ゲーム側から手渡されたゲーム映像に対する色や階調を、1ピクセル単位で改変する。特に、具体的な事例として、NVIDIAは、論文上でも皮膚、髪、葉、布、雪、半透明材質などを挙げている。そして、DLSS 5のAIは、ゲーム画面上のそうした表現のピクセルに対し、現実に近い写実表現に近づくよう、許容された範囲内で最大限に改変を施すことになる。

 筆者が、実際にDLSS 5対応ゲームの映像を見て、個人的に「ハッ」とさせられたのは、ゲーム画面上に点在するすべての顔面に対する陰影表現の品質アップだ。特に分かりやすいのは、欧米人の顔面特有の突き出た額の下の目回りのくぼみ陰影がリアルに浮かび上がるところ。ほかにも、腕や手、指に対する追加の陰影も驚くほど本物っぽくなる。

DLSS 5の効果が最も出るのは顔の陰影
最も分かりやすいDLSS 5オンによる恩恵は、顔面に出る

 DLSS 5の対応一号作品として露出が高まっている、バスケットボールゲーム「NBA 2K27」においても、コート内のスタープレイヤー達の顔面表現のリアリティが向上するのは当然として、表現予算が大幅にカットされて、シンプルな陰影表現となっているカメラマンや観衆などのNPCの見映えがグッと豊かになるのもおもしろい。もちろん、主役級キャラより目立っては本末転倒だが、少なくとも、同じ世界観に併存するNPCとして"大きな格差を感じない程度"までの見映え向上には、DLSS 5が大きく貢献していることが実感できた。

NPCの見映えも底上げされる
モブキャラの品質アップはDLSS 5の効果的な使い方かもしれない

 もちろん、DLSS 5は、ゲームメカニクスに無関係な量産型の大道具・小道具オブジェクトのディテールアップ、接地感も良くしてくれる。これも、同じ理由で、ゲーム世界の説得力アップに貢献するので好印象である。

小道具の質感と接地感も向上する
右側の積み上がった釜、火がくべられている釜、湯気を上げている釜の質感が、DLSS 5オンでは大幅に向上している

 で、多くのゲームファンが気になるのは、「その表現は物理的に正しいのか」という点だろうか。この問に対する模範解答としては 「正しいところも、違うところも混在する」 という感じになる。

 視線依存の鏡面反射の陰影の再現には、光源ベクトルや視線ベクトルの情報が不可欠だが、そういったパラメータ群すらも、DLSS 5は入力不要となっている。これらの情報についても、DLSS 5のAIは生フレーム(カラーバッファ)と動きベクトル情報(ベロシティバッファ)との関係性から推論する。

 つまり、NVIDIAは、もともと、DLSS 5の効果が物理的に正しいかについては不問にしていて、NVIDIAのスタンスとしても「正確性は問わない。説得力があれば良し」ということのようだ。

 まあ、これはゲームグラフィックスの成り立ちからして、現実世界の光学現象の再現は最初からあきらめており、限られた演算予算の中でゲームファンを楽しませられればよしとしているので、この部分をとやかく言う人は少ないだろう。

追加陰影が狙うのは物理精度ではなく説得力
DLSSオン時の追加陰影は「物理的な正しさ」ではなく、「説得力の増強」を目指したものだとされる

 ところで、ユーザーの中には「アニメ調のゲームにおいてはDLSS 5は役に立つのか」という疑問を持った人もいると思う。NVIDIA側も「フォトリアル表現ではないゲームにおいても魅力的な結果を返すことがある」という回答に留まっている。

 DLSS 5は、基本的には、写実表現の増強を行なうものなので、相性は良くないはずだが、近年のアニメ調のゲームでも人肌の皮下散乱表現や金属マテリアルに鏡像や動的なハイライトを返すような「プチ写実ルックな劇画表現」も増えてはいるので、特定のタイトルではおもしろい表現になる可能性は否定できない。

 ちなみに、アニメ調のゲーム「NTE: Neverness to Everness」が、DLSS 5対応表明を行なっている点も見逃せない。

DLSS 5はどの程度ゲーム開発者から制御できるのか

 DLSS 5は画像生成系AIの一種であることが分かったが、ゲーム側がGPUで描画した生フレームに強く拘束されること、そして最終チューニングはゲーム開発者側が行ない、ゲーム側の世界観を破綻させるようなチューニング設定をユーザーには行なわせないため、通常のゲームファンががっかりするような見た目になることはない(と思われる)。

 それと昨今、出回っているバスケットボールゲーム「NBA 2K27」から抜いたDLSS 5モジュールを無理矢理、DLSS 5未対応ゲームに適用し、DLSS 5の暴れっぷりを「お笑いネタ」でSNSへ投稿する事例が増えているが、正規の利用法ではないため、あれらは「DLSS 5の実力」と思わない方が良いだろう。

 それはそうとして、ゲーム開発者はDLSS 5をどの程度制御できるのか……という点は気になることだろう。

 上でも軽く触れているが、2026年9月にアナウンスされたDLSS 5において、ゲーム開発側は、自身で開発したゲームにDLSS 5を適用することに対して「Appearance Model」をA/B/Cの3つから選択できるようになっている。

 NVIDIAの説明では、これを「A/B/Cの3つのAIモデル」というふうに説明していたが(下図)、それぞれの特性についての詳細は非公開とされた。

 NVIDIAの説明は「A/B/Cは品質の高低ではない」ということと、「フォトリアルとは何か、に対する3つの捉え方に相当する」ということの2点にとどまる。論文にも明確な説明はないが、ABC、どのモデルを選択しても実行時の負荷は変わらないと考えるのが自然だ(変わったら明記するはずのため)。

A/B/Cで変わる陰影の出方
NVIDIAが論文で示しているABCの3つのAIモデルごとの陰影の出方の違いを表した図解。ゲーム開発者は、DLSS 5が提供する「Appearance Model」を、このA/B/Cの3モデルから選択できるようになっている

 同じシーンをカメラで撮影したとしても、撮影された写真(映像)に宿る写実的な表現は、撮像素子の「フィルム/デジタル」「レンズの光学特性」「カラーグレーディング」「トーンマッピング」で変わってくる。論文による説明では、ABCの3つのAIモデルはその違いだ、という説明になっている。

 最初、筆者はテレビの画質モードに相当するような違いではないかと考えていた。より具体的にいえば、「どんな種類のカメラやレンズで撮影された映像なのか」とか「色温度の高低や階調特性はどうか」といった映像特性の違いで3バリエーション設定されたのではないか、という話だ。

 ただ、上図を見ると、色温度や彩度の高低では説明できない違い……たとえば頭髪のハイライトの出方がまったく違うとかも出ているので、もう少し複雑なものなのかもしれない。

 上の画面ショットを見た感じでは、モデルAは、色温度高め(寒色系)で、彩度よりも階調重視していて、モデルBは反対に、色温度低め(暖色系)で、階調よりも彩度とコントラスト重視な画調に見える。モデルCは、AとBの中間的な画調で、テレビ製品でいうと「標準」画質モード的なイメージだが。

 いずれ、このAIモデルABCの違いに関しての詳細な情報開示に期待したい。

Structure Intensityとモデル選択で変わる見え方
採用AIモデルを「B」として、Structure Intensityを25%/50%/95%に設定した際の見え方の違い
Structure Intensityを80%に設定した際、AIモデルA/B/Cの出力の違い

 ABCの3モデルのうち、ゲーム開発者が1画面内で同時に選択できるのはどれか1つのみとなる。モデルの切換は任意のタイミングで行なえるが、「背景物はモデルAで、人肌はモデルBで」という使い方はできない。

 同一シーン内における細かな効果調整は、上ですでに紹介済みの、DLSS 5のAIの内部パラメータである「Artistic Direction」に含まれるStructure/Toneにおいて、それぞれの強度を個別設定することが可能となっている。

 そして、この「Structure×Tone」という2軸アプローチの調整は、DLSS 5の仕様上は、ゲーム開発者が、画面内の任意の1ピクセル単位に対して行なうことができる。

 これまた、上でも軽く触れているが、DLSS 5では、自動的に、人物(人肌)領域かそれ以外の背景かを識別する自動マスク(Automatic Masking)生成機能があり、人肌にはこれだけ、人肌以外にはこれだけ……といったDLSS 5の効果の「Structure×Tone」による2軸強度設定を、それぞれに切り分けて行なうことができる。

 人肌以外のオブジェクトについて、もし1ピクセル単位での「Structure×Tone」強度設定を、画面内の特定の材質表現について行ないたい場合は、ゲームエンジン側が運用しているマテリアルID、オブジェクトIDなどを駆使して生成した、画面座標系の自主マスクをDLSS 5に入力できる。

開発者がDLSS 5を制御する3つのレイヤー
ゲーム開発者は、3つのレイヤーからDLSS 5の効き方を制御できる

一般ユーザーによるDLSS 5の調整は基本的に行なえない方針がとられる(例外はあり?)

 なお、前段までで解説してきた、自由度の高いDLSS 5のパラメータ設定は、一般ユーザーに全開放はされない方針になるようだ。一部のSNSで公開されているような、流出版のDLSS 5を活用した非公式な暴れ画像のような表現は、正規版では行なえないのだと思う。

 もちろん、実際の市販ゲームの中には、DLSS 5の効果を「弱中強」のような感じで、描写が破綻しない範囲での、分かりやすい形でのオプション選択は提供されることになるとは思う。

 とにかく、DLSS 5対応のゲームにおいて、特定のユーザーが、その効果演出が気に入らなかった場合は、DLSS 5をオフにすればいいのだ。

 筆者が心配するのは、ユーザーがDLSSシリーズ全体の設定について、何をどう設定すればいいか、今後、ますます混乱してしまいそうな点だ。

 DLSS 4以前は、DLSS関連の設定といえば、以下のような設定項目が並んでいて、DLSS自体のバージョンが変わっても、ゲーム側の、このメニューラインナップは大きく変わってこなかった。

  • DLSS Super Resolution(超解像)
  • DLSS Ray Reconstruction(レイトレ/パストレのノイズ低減)
  • DLSS Multi Frame Generation(フレーム生成)

 しかし、DLSS 5では、話が変わってくる。DLSS 5は、名前上は「バージョン番号の上がったDLSS」だが、DLSS 4以前とはパイプライン上で別モノの機能であり、DLSS 4以前の機能ラインナップに対しての新追加機能となるため、その扱いはややこしいのだ。

 さすがに「DLSS 5」単体名をゲームグラフィックスのメニューに出すと、ユーザーは「何の設定だ、これ」という感じで、意味不明に陥りかねない。

 そこで、実際のDLSS 5採用の初タイトルであるバスケットボールゲーム「NBA 2K27」のグラフィックスオプションを確認してみたところ、本作品では「DLSS 5」と表記せず、「DLSS Neural Rendering」(日本語版: DLSSニューラルレンダリング)という表記としている。

 おそらく、ほかのゲームでも、NBA 2K27のような、DLSS 5内の特有の新機能名の形で新設定項目をラインナップさせて来るのではなかろうか。

NBA 2K27での表記は「DLSSニューラルレンダリング」
日本語版の「NBA 2K27」のゲームグラフィックス設定画面

DLSS 5が使えるGPUは? DLSS 5対応のゲームは出てくるのか?

 もう一点、ユーザーが気になるのは、どの世代のGeForceで使えるか……ではないだろうか。これについては、 現状、GeForce RTX 50シリーズのみへの対応 となっている。負荷はそれなりに高く(詳細は後述)、グラフィックスメモリ使用量も小さくはないので、筆者的には、ミドルアッパークラスのGeForce RTX 50シリーズ向け……という印象を持つ。

 流出したDLSS 5を、リバースエンジニアリングして、GeForce RTX 40以前に対応させた事例もあるようだが、NVIDIA自身は、GeForce RTX 50シリーズ専用のFP4やNVFP4といった4bit浮動小数点への最適化の方に意欲を燃やしている(後述)。よって、直近でNVIDIAがDLSS 5をGeForce RTX 40シリーズ以前へ対応させることはなさそうとみる。

 なにしろ、現状のDLSS 5は、GeForce RTX 50シリーズをもってしても軽量なAIとはいいがたく、NVIDIAとしては、ユーザーに対し、GeForce RTX 50シリーズへの移行を促したいというのが本音だと思われるため。

 2026年9月時点では、「NBA 2K27」のみであっても、DLSS 5対応予定を表明しているゲームラインナップは相当数あるので、GPUの買い替えを検討している人は、希望のゲームの発売のタイミングでの買い替えはおすすめだと思う。

【表1】DLSS 5 対応表明ゲーム一覧(2026年9月5日時点)
タイトル
(リンクはNVIDIA公式ソース)
区分NVIDIA発表日発表内容備考
NBA 2K27対応済み2026-09-03DLSS 5 with 3D-Guided Neural Renderingを実装して発売。RTX 50シリーズおよびGeForce NOWで利用可能DLSS 5初の実装・発売タイトル
AION 2対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
Assassin’s Creed Shadows対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
Black State対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
CINDER CITY対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
Delta Force対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
Hogwarts Legacy対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
Justice対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
NARAKA: BLADEPOINT対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
NTE: Neverness to Everness対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
Phantom Blade Zero対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
Resident Evil Requiem対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
Sea of Remnants対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
Starfield対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
The Elder Scrolls IV: Oblivion Remastered対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理
Where Winds Meet対応予定表明2026-03-16NVIDIAが「DLSS 5 will come to games including ...」として導入予定を公式発表2026年9月5日時点では、NVIDIAの公式な対応予定表明として整理

 とはいえ、長期的に見れば、筆者は、GeForce RTX 40シリーズ以前への対応はあるかもしれない、と考えている。というのも、DLSS 5は、その推論を走らせるにあたって必要なのは、映像の生フレーム(カラーバッファ)と動きベクトル情報(ベロシティバッファ)だけなので、ゲーム用途以外への応用、たとえば準リアルタイム、非リアルタイムな映像作品への適用も期待されているからだ。

 非ゲームではG-Bufferの生成は困難だが、動きベクトル情報(ベロシティバッファ)の生成は、動画データであれば、MPEGエンコーダ側のOFA(オプティカルフローアクセラレータ)を使って生成できる。

 つまり、完璧に動作させようとすればG-Buffer的な情報が必要なDLSS 4以前と比べて、DLSS 5は汎用性が高いのだ。そう、そのぶん、DLSS 5に対する動画勢からの関心は強い。

 その証拠に、最近では非公式プレイヤー/変換ツールが、オープンソースの動画変換ツール「FFmpeg」を活用して、流出版のDLSS 5を動画へ適用させた事例が注目を集めたばかりだ。

DLSS 5のパフォーマンスは?

 パフォーマンス面について触れておこう。

 2026年9月初旬時点では、DLSS 5対応ゲームはバスケットボールゲームの「NBA 2K27」のみ。このタイトルに限定される話ではあるが、GeForce RTX 5090で動作させたDLSS 5において、 4K出力時の処理時間は8ms、消費ビデオメモリは最大731MB だったということが、NVIDIAから発表されている。

 また、NVIDIA調べでは「NBA 2K27」においてGeForce RTX 50シリーズの各GPU、各解像度でDLSS 5を実行した場合、 その性能コストは平均しておよそ50~60%だと説明された 。

 つまり、60fps映像に対してDLSS 5を適用した場合、これが24fps~30fpsになるということだ。フレーム時間に対するDLSS 5処理の所要時間が50%~60%を占めることから、フレームレートは30fps以下にまで下がる可能性があることを意味する。

 NVIDIAが公開している「DLSS Programming Guide」(2026年3月版)によれば、GeForce RTX 5090で動作させた「DLSS Super Resolution」(超解像処理)が約0.9~1.4ms、「Multi Frame Generation」(MFG: 複数フレーム生成)は約1.0~3.0ms程度なので(下表)、おそらく歴代のDLSS機能群の中では最も負荷の高い処理系となっている。

【表2】DLSS Frame Generation/Multi Frame Generationの処理時間
出力解像度2× FG4× MFG
1080p1.07ms1.78ms
1440p1.46ms2.48ms
4K1.72ms3.32ms

 DLSS超解像処理は、GPUで実レンダリングする映像解像度を下げることでGPU負荷を軽減させることができたので、DLSS超解像処理自体に数ms程度の時間を要したとしても、フレームレート向上が望める機能だった。フレーム生成機能も同様だ。

 しかし、DLSS 5の場合は、 純粋に追加負荷を掛けてゲーム映像の品質を向上させる機能なので、機能の特質が異なっている 。

 また、DLSS 5のAIを動作させるために消費されるグラフィックスメモリが最大731MB(NBA 2K27の場合)は、DLSS 5実行時のピークフットプリントだと思われ、これはビデオメモリ8GB程度のエントリーモデルのGeForce RTX 50シリーズにはシビアな動作条件になると思う。

 なお、NVIDIAの論文によると、DLSS 5のAI本体の「One-Step Pixel-Space Diffusion Transformer」は、約1億5,400万(154M)パラメータ仕様であることが明らかにされている。

 仮に154Mパラメータを単純にFP8(8bit浮動小数点)で保持すると考えた場合、「154M×1バイト=約154MB」となり、これだけでも154MBのメモリを消費するのだ。

 冒頭で筆者が「DLSS 5はミドルアッパークラスのGeForce RTX 50シリーズ向けかも」という印象を持った根拠はここにもあり、近年そこかしこで聞かれる「近代PCゲーミングにおいてGPUのビデオメモリ搭載量は8GBでは不足気味」という定説は、ますますリアリティを持ち始めている。

1,920×1,080ドットでのDLSS 5パフォーマンス
2,560×1,440ドットでのDLSS 5パフォーマンス
3,840×2,160ドットでのDLSS 5パフォーマンス
各解像度、各モデルにおけるDLSS 5のパフォーマンス。平均フレームレートを表した棒グラフの値は6倍フレーム生成を適用してのフレームレートなので注意。フレーム生成なしの“素のフレームレート”を知りたい場合は6で除算しよう

 なお、NVIDIAは、DLSS 5は、3月時点の開発途上版時点から半年間で5倍のパフォーマンス向上を果たす最適化に成功したと述べており、この努力は引き続き行なわれるとのこと。

 上でも軽く触れているが、NVIDIAは、DLSS 5に対してFP4/NVFP4への最適化も検討していると見られ、これによってパフォーマンスはさらに改善する可能性は高い。

 ブロックFP4とも呼ばれるNVFP4化の最大の対象となりそうなのは、Transformer内部で大量のTensor Core演算を行なうMatMul(行列積)処理だ。

 具体的には、Q/K/V Projection(入力特徴を「検索側のQ」「照合側のK」「内容側のV」という3種類の特徴へ変換する処理)、Attentionにおける行列積(QとKから特徴同士の関連度を求め、その結果を重みとしてVから必要な情報を取り出す処理)、Output Projection(Attentionで得られた特徴を、次段の処理で扱える形へ変換・整理する処理)、MLP(Multi-Layer Perceptron: 多層パーセプトロン。Attentionで集められた特徴を非線形に変換・加工する処理)などが挙げられる。

 また、画像処理モデルとしてConvolution(畳み込み)層を含んでいる場合には、そこで行なわれる演算もNVFP4化の候補となる。

 といっても、人間の知覚において精度的に敏感な部分……たとえば画像入出力や時間方向処理の大部分はFP8やFP16(16bit浮動小数点)のまま残存せざるを得ないので、今の2倍の性能になるとは考えにくい。筆者推測値になるが、せいぜい現在の8msが6msになれば“御の字”といったところか。

半年で5倍に向上したDLSS 5の処理性能
NVIDIAによれば、DLSS 5は3月でのアナウンス後、度重ねた最適化の連続の末、6カ月の9月には5倍にパフォーマンスが向上したという。FP4/NVFP4への対応でどこまでパフォーマンスが上がるのだろうか

DLSS 5の写実度はGPT Image 2と互角、Gemini 3 Proは上回る

 最後に、DLSS 5の品質面についても言及しておきたい。

 論文によると、NVIDIAは、DLSS 5の処理結果に対し、109ものシーンを使ってGPT Image 2とGemini 3 Proと、その画質の比較を行なっている。

 先に結果だけ示すと「DLSS 5の写実再現能力」は、

  • DLSS 5 50.63% vs GPT Image 2 49.37%
  • DLSS 5 62.00% vs Gemini 3 Pro 38.00%

だったと発表している。

 なお、評価軸は「物理的正確さ」ではなく、「人間の知覚における写実的説得力」だとしている。まあ、DLSS 5のAIの素性からそうなることは上でも解説済みなので、ここで引っかかることはない。ただ、DLSS 5の写実的説得力がGPT Image 2と拮抗し、Gemini 3 Proを圧倒しているというのはすごいことだ。

 この評価のされ方だが、「人間の知覚における写実的説得力」については、GPUが普通に描画したゲーム映像的なものをDLSS 5を適用した結果と、商業AIのGPT Image 2とGemini 3 Proに対し「この画像の写実度を高めて」として生成された画像を比較するテストになる。

 具体的には、入力画像となるGPUが描画した生フレームについて評価参加者には見せず、DLSS 5処理結果とGPT Image 2処理結果、DLSS 5処理結果とGemini 3 Pro処理結果のペアを見せて、どちらが写実的説得力が高いかを選ばせるテスト方式だったという。評価者数は非公表だが、794件の有効なペア比較判定を集計して得られたのが前出の評価スコアになる。

 また、上の人間による評価とは別に、入力画像に対し過剰な加工が行なわれていないか、については「DINOv2 Patch Distance」と「LPIPS」といったAIを用いて「物体や人物、意味的内容が元のGPU生フレームからどの程度、変質したか」の評価も行なったそうだ。

 結果は以下の通り。スコアが小さければ小さいほど変質していない(≒元画像の内容が保持されている)を表す。

DINOv2 Patch Distance

  • DLSS 5: 0.0364
  • GPT Image 2: 0.1405
  • Gemini 3 Pro: 0.1223

LPIPS

  • DLSS 5: 0.0618
  • GPT Image 2: 0.3386
  • Gemini 3 Pro: 0.3112

 この評価軸でもDLSS 5は最も優秀だったということになる。

 ただ、この結果を踏まえて、NVIDIAは、論文において、とても興味深い意見も述べている。それは「DLSS 5の処理結果が人間にとっていくらリアルに見えたとしても、それは物理的により正確であることを表してはいない」とし、同時に「DLSS 5がレイトレーシングやパストレーシングを不要にするものではない」と言いきっている点だ。

 シンプルに「物理的に正確なことに勝るものなし」という理屈はごもっともなのだが、それ以上に、NVIDIAがDLSS 5において 「DLSS 5に入力する“GPUが実描画した生フレームの品質”が、高ければ高いほど、DLSS 5の品質も高くなる」 と言及している点は興味深い。

 要は、DLSS 5はレイトレやパストレの代替とはならず、あくまで「入力画像の見た目の写実度を強化する後段処理」ということなのだ。上流のレンダリング品質が高いほどDLSS 5にも有利であり、物理的正確性の基準は依然としてGPUが描画する生フレームの方にあるわけである。

入力がレイトレなら出力もよりリアルになる
同一シーンをラスタライズ法とレイトレーシング法で描画し、それぞれをDLSS 5に入力した結果。レイトレ版をDLSS 5に通したバージョンの方が、葉の透過光の具合が圧倒的にリアルだ。DLSS 5の効果の上げ幅は入力画像の品質に左右される

DLSS 5はニューラルレンダリングのニュースタイルとなるか

 本稿は、PC Watch向けに寄稿した記事としては、過去最長レベルの長さになってしまったが、これはDLSS 5が「DLSSの最新版である」という以上に、とても重大なネタで、過剰に省略できなかったためだ。

 今後、半導体製造プロセスが進化しても、その密度向上ペースは小刻みなものになる。詳細は省くが、2nmより先の製造プロセスの微細化ペースが劇的に落ちることが主因だ。よって事実上、製品の値上げに限度のある民生向けGPUの演算性能の向上率は鈍化する。ざっくりといえば「コストパフォーマンスが悪くなる」ということだ。

 ということは、まじめな幾何学的、光学的な正確性を求めるアプローチでのゲームグラフィックス品質の向上も鈍化するわけだ。

 ではどうするか、といえば、AIに頼ることになる。だからこそ、一般的なIT業界のみならず、「コンピュータを使った遊び」でしかないはずのゲーム業界までもが、AI支援の「ニューラルレンダリング」重視へ舵を切ろうとしているのだ。

 AI支援の間接照明「ニューラル・ラディアンス・キャッシュ」をはじめとして、近年、各GPUメーカーやCG技術研究者達が、多様なニューラルレンダリング手法を提唱している中で、NVIDIAが提唱したDLSS 5は、半自動で映像品質を上げられる「ニューラルレンダリング」技術として、今後、ますます業界からの注目を集めていくことになると思う。

 もちろん、これに対抗すべく、NVIDIA競合のAMDやIntelがどのような動きを見せるかも見どころである。