コンテンツにスキップ

NPUとは

NPUとは、ニューラルネットワークの計算だけを引き受けるために、チップへ載せる専用の演算ユニットです。

ルネサスのMPU「RZ/V2L」の仕様表には、3D GPUとしてArm Mali-G31が載る一方で、NPUの欄はYesと記されています。同じ製品ページの本文では、そのAIアクセラレータが同社の「DRP-AI」であると書かれています(同社の製品仕様)。1つのチップの中に、絵を描く演算ユニットとAIの計算を担う演算ユニットが別々に用意されている構成です。

NEDOとルネサスが2022年12月に出した共同発表は、AIアクセラレータを、ニューラルネットワークなど機械学習のアルゴリズムを実行するエンジンと記しています。中核は積和演算ユニットで、ニューラルネットワークで多用される積和演算だけに特化した演算器を大量に並列動作させる構造です。

専用の演算ユニットをわざわざ載せる理由は、電力と発熱にあります。同じ発表は、AI処理には大量の演算が必要なため既存のAIチップでは発熱が実用化の障害になり、カメラやロボットへ載せるには発熱抑制のためのファンが要る点を挙げています。ファンは実装コストとスペース、そして騒音と故障を持ち込みます。

そのうえで、100Wクラスのパソコンで動かすような高度なAI処理を数W以内へ収める性能が要る、と同発表は述べています。この数字が、NPUという専用ユニットが生まれた理由です。

電力を食っている正体は、データの移動です

Section titled “電力を食っている正体は、データの移動です”

ルネサスのDRP-AIホワイトペーパーによると、AIアクセラレータの消費電力は、行列演算そのものによる分に加えて、アクセラレータ内部と外部メモリのあいだのデータ移動による成分も大きくなってきています(2021年6月時点の同社の記述)。

同社は、GPGPUの高並列演算で広く使われるim2colという手法を引き合いに出しています。3×3のフィルタを使う畳み込み演算では、1画素のデータが9回のフィルタ演算に使われます。im2colは行列演算の並びに合わせて画像データをあらかじめ並べ直すため、1画素が9か所へ複製され、データ量が9倍にふくらみます。

DRP-AIの積和演算ユニットは、取り込んだデータを隣のレジスタへ送りながら使い回します。これにより、外部メモリと内部バッファから演算器へのデータロード回数が、GPUと比べて最大で9分の1になるとしています。

AIの電力を食うのは、演算よりデータの移動です
同じ畳み込み演算でも、外部メモリへ取りにいく回数はここまで開きますGPGPUで広く使うim2col ── 行列演算の順へ展開してから流します外部メモリ1画素を9か所へ複製します3×3フィルタの展開データ量 9倍GPUの演算器ルネサス DRP-AI ── 取り込んだデータを隣のレジスタへ送り、使い回します外部メモリレジスタ間で送って再利用しますロード回数最大9分の1積和演算ユニットルネサスのDRP-AIホワイトペーパー(2021年6月)に載る、同社の設計方針とGPUとの比較です
NPUが削っているのは、演算の速さよりもデータの往復です。同じ畳み込み演算を走らせても、外部メモリへ取りにいく回数が最大で9分の1まで縮みます。

もう一つ、NPUだけが使える近道があります。

同ホワイトペーパーによると、画像認識のAIでは、全レイヤの平均で50%以上の入出力データがゼロの値になります。積和演算の結果がマイナスになったものをゼロへ置き換える活性化関数が広く使われているためです。

ゼロを掛けた結果はゼロですから、この演算を走らせても答えは同じままです。DRP-AIは、演算の要素ごとに入力へゼロが来ることを事前に検知して、その動作を省くスイッチングを備えています。同社は、この仕組みによって不要な演算にかかる電力を削っているとしています。

NEDOとルネサスの2022年12月の共同発表は、この方向をさらに進めた測定値を出しています。

認識精度への影響が小さい演算を省く枝刈りという手法をAI軽量化に使い、演算量を最大90%削減しました。そのとき認識精度の低下は3%程度にとどまり、ほぼ同等の精度を保てたとしています(モデルによって異なります)。電力効率は1W当たり10TOPSで、従来技術と比べて最大10倍、同社の現行製品と比べても10倍以上とされています。

この数字は、10分の1に軽量化した畳み込み層を試作チップで測った結果です。

演算を9割削っても、認識精度の低下は3%程度です
削る量と、失う精度は、それぞれ別の幅で動きます枝刈り前後の演算量枝刈り前枝刈り後(最大90%を削減)10分の1棒の長さは演算量の比ですそのときの認識精度枝刈り前枝刈り後代償はこの幅、低下は3%程度です(対象により異なります)電力効率は1W当たり10TOPS、従来技術と比べて最大10倍ですNEDOとルネサスが2022年12月に発表した、試作チップでの測定値です
枝刈りは、演算量を10分の1へ落としながら認識精度の低下を3%程度に抑えた例です。削る量と失う精度がそれぞれ別の幅で動く点が、AI軽量化という手法の土台になっています。

専用にした分だけ、硬くなります

Section titled “専用にした分だけ、硬くなります”

専用化には代償が付きます。ルネサスのDRP-AIホワイトペーパーは、消費電力を抑える手立てとして特定のAI処理に特化した専用ハードウェアを挙げたうえで、AIモデルは日々進化しているため、特定のAIに特化したハードウェアはすぐ陳腐化するという課題を並べて示しています。

同社の答えが、動的再構成という方式です。NEDOとの共同発表によると、チップ内の演算器の回路接続構成を、処理内容に応じて動作クロックごとに切り替えます。必要な演算回路だけが動くため消費電力が小さく、高速化も両立します。同ホワイトペーパーはさらに、学習済みモデルを実行ファイルへ変換するソフトウェアを継続して更新することで、ハードウェアを変えずに新しいAIモデルへ対応できるとしています。

こうした専用チップの開発は、公的な事業としても続いています。NEDOの「高効率・高速処理を可能とするAIチップ・次世代コンピューティングの技術開発」は事業期間を2016年度から2027年度とし、2024年度の予算額は48億円です。

冷却の面での結果も公表されています。ルネサスの試作実験では、TinyYolov2を動かしたとき、市販のGPUがヒートシンク付きで表面温度79.0℃だったのに対し、DRP-AIの試作品はヒートシンクなしで40.9℃、フレームレートは42fpsでした(同社の試作実験)。製品版のRZ/V2Lの製品ページにも、ヒートシンクや冷却ファンなどの放熱対策が不要と記載されています。

NPUとは何ですか?

ニューラルネットワークの計算だけを引き受けるためにチップへ載せる専用の演算ユニットです。ルネサスのMPU「RZ/V2L」の仕様表にはNPUの欄があってYesと記され、同じ製品ページの本文では、そのAIアクセラレータが同社の「DRP-AI」であると書かれています。

GPUとどう使い分けますか?

置き場所と役割で役目を分担します。産業技術総合研究所のABCI 3.0のように、大規模な学習はGPUを6,128基そろえたシステムが担います。手元の機器で学習済みの判断を走らせる部分を、NPUが小さな電力で引き受けます。

なぜAIの計算はそんなに電力を食うのですか?

演算そのものに加えて、データの移動が電力を占めるためです。ルネサスのDRP-AIホワイトペーパーは、AIアクセラレータの消費電力のうち、内部および外部メモリとのデータ移動による成分が大きくなってきたと記しています。

積和演算とは何ですか?

掛け算した結果を足し合わせる計算です。NEDOとルネサスの共同発表は、ニューラルネットワークの演算で積和演算が多用されるため、これに特化した演算ユニットを大量に並列動作させると高速化できると記しています。

枝刈りとは何ですか?

認識精度への影響が小さい演算を省くAI軽量化の手法です。NEDOとルネサスの共同発表によると、演算量を最大90%削減した場合でも認識精度の低下は3%程度にとどまったとされています(モデルによって異なります)。

TOPSとは何ですか?

1秒あたりの演算回数を兆回単位で表す言葉です。NEDOとルネサスは、1W当たり10TOPSという電力効率を2022年12月に発表しました。1W当たりの値が大きいほど、同じ量の演算をより小さな電力で終えられます。

専用にすると困ることはありますか?

柔軟性を手放す点です。ルネサスのDRP-AIホワイトペーパーは、特定のAIに特化したハードウェアがAIモデルの進化ですぐ陳腐化する点を課題として挙げ、回路のつなぎ方を動作中に切り替える方式でこれに備えたと記しています。

  • GPUとは ── 描画のために育ち、汎用の並列演算へ広がった側
  • ASICとは ── 用途を1つへ絞って作る、専用化そのものの考え方

この記事の事実は、誰でも読める公開資料を根拠とし、各URLの到達可否をこちらで実測しています。したがって、リンク先が移動または消滅した場合は、その旨をこのページへ反映します。

回答待ち 更新中 公開Q&A

このページの質問窓口

AIに疑問を送る

「匿名で送信する」を押して内容を送ると、受付ID付きの回答URLを発行します。URLでは進捗を追うことができ、通常は1日以内に回答します。個人情報を取り除いて編集した質問と回答だけを、承認済み資料の出典リンクとともに公開Q&A一覧へ掲載します。

通常、1日以内に回答します 回答待ち 更新中

  1. 匿名で送る 分かりにくい箇所、指摘、追加してほしい内容を書きます。
  2. 受付IDと回答URLを保存する 送信後に発行されるURLへ、進捗が順次反映されます。
  3. 進捗と回答を追う URLには、受付済み、回答作成中、解決済みの状態と回答が載ります。
公開Q&A一覧へ 5〜4,000文字。氏名・連絡先などの個人情報、秘密情報は入力禁止です。

このフォームは匿名です。氏名・連絡先・応募情報などの個人情報、秘密情報、社外秘情報、契約情報、非公開資料の入力は禁止です。投稿原文は運営用DBに保存し、公開面には、個人情報・秘密情報・危険な命令を除く安全審査と読みやすい文章への編集を経た質問文と回答だけを載せます。状態は「受付済み」「回答作成中」「解決済み」の3段階です。安全審査の結果によっては公開を保留します。サイト側の機械検査を通った内容だけを運営側のAI回答作成環境へ送り、回答案の作成と、それとは独立したAI審査に使います。機械検査には見落としの可能性があり、回答作成と審査の履歴は利用中の環境に保持されます。IPアドレスや端末情報は送信対象外です。回答URLは公開Q&A用で、共有先からも開けます。送信により、この利用条件と審査後のQ&A公開に同意したものとします。