問1. 小さな配列をCPU側で用意し、GPUで1回だけ軽い計算をして結果をCPUへ戻す処理が、CPU単体より遅くなった。最も疑うべき原因は?
問2. SIMTで動くGPUのワープ(32スレッドの束など)の中で、if文により半分が真・半分が偽に分かれた。ハードウェアは何をするか?
問3. GPUがメモリ待ち(数百サイクルのレイテンシ)を「隠す」主な仕組みはどれか?
問4. あるGPUカーネルで、演算ユニットの利用率は低いのにメモリ帯域はほぼ上限に張り付いていた。この状態の呼び方と対処として適切なのは?
問5. GPGPU(汎用GPU計算)で行列積やベクトル演算が特に速い、その本質的な理由に最も近いのは?
問6. GPUの「共有メモリ(オンチップの高速な作業場)」の説明として正しいのはどれ?
問7. GPUのSIMTでスレッドをまとめる単位を、小さいものから大きいものへ正しく並べたのはどれ?