「Parallel and Concurrent Programming in Haskell」という本に載ってた
フロイド-ワーシャル法のRepa版とCUDA版を試してみたけど、
6コア使ったRepa版の方がCUDA版より明らかに少し速かった。

グラフの頂点数は250個、Repa版は0.62秒、CUDA版は0.86秒。
頂点数1000個だと、Repa版は11.13秒、CUDA版は13.11秒。
頂点数2000個だと、Repa版は62.88秒、CUDA版は69.27秒。

こんなもんなのか?
グラボは Qudro K2000M なんだが、CUDA性能としてはゴミかな?