GPU(描画・並列計算)— 同じ計算を大量にこなす職人

中級の解説は準備中のため、中級の内容を表示しています。

概要 — まず全体をつかむ

初級ではGPUを「大人数の単純作業チーム」と捉えました。中級では、なぜ大量並列で速いのか、その実行方式とメモリの仕組みを見ます。

詳細 — 1段階ずつ追う

これは何をする係?

GPUは、多数の単純なコア(シェーダコア/CUDAコアなど)を数千個そなえ、同じ命令を別々のデータへ一斉に適用します。この方式を SIMT(Single Instruction, Multiple Threads)と呼びます。

アニメーション『CPUとGPU(少数万能 vs 大量並列)』を開く
CPU と GPU の違いコアの「数」と「使い方」が正反対CPU少数(数個)の万能で速いコアコア速い・万能コア速い・万能コア速い・万能コア速い・万能処理のしかた ── 順番に1つずつ仕事1仕事2仕事3コア(1つ)複雑な仕事を、順番に1つずつ処理GPU多数(数千)の単純なコア小さな単純コアが何千個も処理のしかた ── いっせいに並列で同じ計算×大量配って、全コアで同時に描画・AIなど「同じ計算の大量繰り返し」はGPUが得意
  • オフロード — CPUが全体を制御し、重い並列計算だけをGPUへ渡す(丸投げして結果を受け取る)
  • VRAM — GPU専用の高速メモリ。数千コアへデータを供給するため、広いメモリ帯域が命
  • スレッドの束 — 多数のスレッドをまとめ(ワープ/ウェーブ)、同じ命令で流す

登場人物メモ:

  • ※1 シェーダコア/CUDAコア — GPU内の小さな演算ユニット。単純だが数が多い
  • ※2 メモリ帯域 — 1秒あたりに読み書きできるデータ量。コアが多いほど帯域が効く

CPUとの違い

  1. CPU — 少数の高性能コア。分岐予測やキャッシュで複雑・逐次な処理を速く
  2. GPU — 多数の単純コア。同じ計算を大量並列(スループット重視)に

設計思想が逆です。CPUは1つの仕事を速く終わらせる(レイテンシ重視)、GPUは大量の仕事をまとめてこなす(スループット重視)。だから両者は役割分担し、CPUが制御役・GPUが計算役になります。

描画以外の使いみち

描画(グラフィックス)で培った並列演算は、汎用計算にも転用されました。これを GPGPU(General-Purpose computing on GPU)と呼びます。

  • AI・機械学習 — 行列積など大量の積和演算を一括処理。学習・推論の主役
  • 動画エンコード/編集 — 大量のピクセル処理を並列化
  • 科学計算・シミュレーション — 流体・物理など並列化しやすい計算

こうした計算を書くための API も整いました。CUDA(NVIDIA専用)、OpenCL(汎用)、描画では Vulkan/DirectX/Metal などです。近年GPUが注目されるのは、この並列計算がAIと相性抜群だからです。

⚠️ うまくいかないとき

  • 分岐が多い処理は苦手 — スレッドごとに進む道が分かれる(分岐ダイバージェンス)と、束で揃えられず並列度が落ちる
  • 逐次依存が強い処理 — 前の結果を待つ処理はCPU向き
  • メモリ帯域の壁 — 計算よりデータ供給が追いつかないと、コアが遊ぶ
  • 発熱・消費電力が大きい — 大量に動くぶん電力と冷却を食う。冷却不足でクロックが落ちることも

理解度チェック

そのまま解けます(成績は保存されません)。無料アカウントを作ると、学習の記録と進捗の山登りが始まります。

1. GPUが多数のコアで同じ命令を一斉に走らせる実行方式を何と呼ぶ?

2. GPUが高い演算性能を出すために特に重要なのはどれ?

3. CPUとGPUの設計思想の違いとして正しいのはどれ?

4. GPUが苦手で、むしろCPUに向くのはどんな処理?

5. GPUを使うときの「オフロード」の説明として正しいのはどれ?

6. GPUで条件分岐が多い処理の性能が落ちやすいのはなぜ?

7. GPUで同じ命令を共有して一斉実行する、スレッドをまとめた束を NVIDIA では何と呼びますか(カタカナで)。

8. GPUの大量並列の力を、画面描画ではなく汎用的な計算に転用することを何と呼びますか(略語で)。