ggml-cuda: Allow transpose-free gemmv computation (#26171)

When matrix's weights are shaped 1xK is leverage a transpose-free
computation to use mat_mul_vec_f.
This commit is contained in:
Robert Esclapez
2026-07-30 21:39:46 +08:00
committed by GitHub
parent 6b36c23056
commit e1a1abb787
2 changed files with 18 additions and 0 deletions
+4
View File
@@ -8838,6 +8838,10 @@ static std::vector<std::unique_ptr<test_case>> make_test_cases_eval() {
test_cases.emplace_back(new test_mul_mat(GGML_TYPE_Q8_0, GGML_TYPE_F32, 2880, 32, 2880, {1, 1}, {1, 1}));
test_cases.emplace_back(new test_mul_mat(GGML_TYPE_MXFP4, GGML_TYPE_F32, 2880, 32, 2880, {1, 1}, {1, 1}));
// m == 1, with n on both sides of MMVF_MAX_BATCH_SIZE (8): mmvf below, operand swap above
for (int64_t n : {1, 7, 8, 9, 16, 128, 512}) {
test_cases.emplace_back(new test_mul_mat(GGML_TYPE_F32, GGML_TYPE_F32, 1, n, 2048, {1, 1}, {1, 1}));
}
#if 0
{