> ネックになりそうなのは、STL の場合のように代入演算子が使えないので、
> char 単位にデータ転送しているところかな。

double が異様に遅いのはこのせいだな。
インライン展開しまくり、かつ代入演算子に変えたら、sort() に肉薄した。

my_qsort = 1965
qsort = 4715
sort = 1753

でもやっぱり sort() のが遅いけど。


あと、↓でより正確に測れる。

#pragma comment(lib , "winmm.lib")
#define clock_t DWORD
#define clock() timeGetTime()