福田昭のセミコン業界最前線
メモリコスト6分の1でAI推論、Samsungの「zNAND-O」
2026年9月28日 06:24
NANDフラッシュメモリのシリコンダイを積層する高性能大容量メモリモジュールが高性能AI推論システム向けメモリとして注目を浴びている。本コラムですでに報じたように、半導体メモリ大手のSandiskとSK hynixが2025年8月から共同で、広帯域フラッシュモジュール「HBF(High Bandwidth Flash)」を開発中である(参考記事)。
フラッシュダイを積層する高性能大容量モジュールの開発が相次ぐ
そしてこの8月には、半導体メモリ最大手のSamsung ElectronicsがNANDフラッシュメモリのシリコンダイを積層する高性能メモリモジュール「zNAND-O(On-device)」を開発中であることを明らかにした。
2026年8月4日から6日に米国カリフォルニア州のシリコンバレーで開催されたメモリとストレージのイベント「FMS(Future of Memory and Storage)」の基調講演で構想を述べたのを皮切りに、公式Webサイトでも同年8月末から9月初めに情報を追加した。
ワイヤボンディング積層とTSV積層の違い
従来から、NANDフラッシュメモリのダイを積層する大容量モジュールは存在していた。フラッシュダイを垂直方向に積層し、ワイヤボンディングによって接続する。そして積層構造全体を1個のプラスチックパッケージに封止する。
ただしワイヤボンディングでは寄生素子が無視できないため、高速化に限界がある。そこで寄生素子の少ないシリコン貫通電極(TSV)を使ってダイ間を接続し、全体性能(速度と消費電力)を高めることが試みられてきた(参考記事)。
ここで問題となるのが、コストの上昇だ。TSVはワイヤボンディングに比べ、製造コストが大幅に高い。単なるメモリダイ積層では製品の付加価値が大容量化だけにとどまるため、コスト上昇を吸収しづらい。
しかしTSV積層でも、モジュール全体として大きな付加価値を得られるのであれば、コスト上昇を吸収できる。その先がけがDRAMダイ積層の広帯域モジュール「HBM(High Bandwidth Memory)」だろう。
そしてNANDフラッシュダイ積層の広帯域モジュール「HBF」はHBMのフラッシュ版といえる。Samsung Electronics(以降はSamsungと表記)が開発中の「zNAND-O」は、両者に続く広帯域メモリモジュールだ。
「zNAND-O」と「HBF」は似ているが、違う
「zNAND-O」メモリモジュールは、NPU(Neural Processing Unit)といったAIアクセラレータと組み合わせて同一のパッケージに封止することを想定した。メモリモジュールの構成は最下層がベースダイ(ロジックダイ)、その上が4枚あるいは8枚のコアダイ(NANDフラッシュダイ)である。1枚のベースダイと複数枚のコアダイという組み合わせは、HBMおよびHBFと変わらない。
「zNAND-O」と広帯域フラッシュ「HBF」は一見すると、かなり似ている。しかし詳細は異なる。まず、コアダイの枚数(メモリモジュール当たり)が違う。「zNAND-O」は4枚あるいは8枚であるのに対し、「HBF」は8枚あるいは16枚と2倍の枚数になる。
次にメモリモジュールとAIアクセラレータのインターフェイスが違う。いずれもチップレット向け入出力規格「UCIe(Universal Chiplet Interconnect Express)」を採用しているものの、「zNAND-O」は樹脂基板(パッケージ基板)向けの「UCIe-S(Standard Package)」を選択しているのに対し、「HBF」は中間基板(インターポーザ)向けの「UCIe-A(Advanced Package)」を選んだ。
コアダイのNANDフラッシュメモリは微妙に異なる。「zNAND-O」では製造プロセスがV10世代(BV10世代とも表記)、多値記憶方式はSLC(1bit/セル)方式である(つまり多値記憶ではない)。BV10世代のNANDフラッシュはワード線の積層数が400層を超える最新世代だ。BV世代では周辺回路とメモリセルアレイを異なるウェハで作成してから、お互いのウェハを貼り合わせて製造する。
そしてSLC方式なので読み出しの遅延時間(レイテンシ)が短い。コアダイの記憶容量と入出力数は不明である(後述のAIシステムから推定するとコアダイの容量は512Gbitとみられる)。
一方、「HBF」のコアダイは記憶容量が256Gbit、入出力バス幅が1,024bitである。製造技術と多値記憶方式は規定していない。256Gbitと少なめの記憶容量から、多値記憶方式はMLC(2bit/セル)方式あるいはSLC(1bit/セル)方式だとみられる。
数兆パラメータを扱うAIシステム向けメモリのアーキテクチャ
Samsungはイベント「FMS」の基調講演で、数兆個と大規模なパラメータを扱うAIシステムで「zNAND-O」を導入するとメモリアーキテクチャがどのように変わるかを示した。比較対象はDRAMモジュール(ユニファイドメモリアーキテクチャ(UMA))を備えたシステム(従来システム)である。
従来システムはCPU、NPU、GPUがUMAのDRAMモジュールにアクセスする。AIシステムの高性能化によってパラメータ数が1兆を超え、KVキャッシュの記憶容量が拡大すると、DRAMモジュールでは記憶容量が不足する、あるいはDRAMのコストが許容困難なレベルに上昇する。
「zNAND-O」を導入したシステムでは、NPUがDRAMと「zNAND-O」モジュールにアクセスする。「zNAND-O」モジュールに格納するのは、読み出し動作が主体のモデルパラメータ(重み付けパラメータ)である。記憶容量当たりのコストが低いNANDフラッシュメモリを活用することで、メモリコストを従来システムと比べて大きく減らせる。
6分の1のメモリコストでほぼ同等の推論性能を達成
Samsungはさらに、DRAMのみのAIシステムと「zNAND-O」を導入したAIシステムで、メモリコストと推論性能をシミュレーションによって比較した。大規模言語モデル(LLM)は「GPT-OSS-120B」、コンテキスト長は32Kトークンとした。
シミュレーションによると、「zNAND-O」の導入によってメモリコストを6分の1と大きく低減したにもかかわらず、推論性能(トークン/秒)はDRAMのみのAIシステムとほぼ同等だった。また格納できる推論モデルの最大パラメータ数は、2倍に増えた。
現在のところ、「zNAND-O」は構想段階にある。製品サンプルは2028年の予定と、まだ先だ。今後の研究開発による成果を期待したい。

















![【Amazon.co.jp限定】 伊藤園 磨かれて、澄みきった日本の水 2L 8本 ラベルレス [ ケース ] [ 水 ] [ ペットボトル ] [ 箱買い ] [ ストック ] [ 水分補給 ] 製品画像:4位](https://m.media-amazon.com/images/I/41m8ly-SllL._SL160_.jpg)





