* CUDA: fix thread/block count in quantized cpy kernel launches * tests: add uneven block count cpy case