Johannes Gäßler and Aman Gupta
6515610506
CUDA: fix should_use_mmvf for ne11 == 1 ( #17085 )
...
* CUDA: fix should_use_mmvf for ne11 == 1
* Apply suggestion from @am17an
Co-authored-by: Aman Gupta <amangupta052@gmail.com >
---------
Co-authored-by: Aman Gupta <amangupta052@gmail.com >
2025-11-07 20:53:14 +01:00
Johannes Gäßler
aa374175c3
CUDA: fix crash on uneven context without FA ( #16988 )
2025-11-06 14:05:47 +01:00
Aman Gupta
463bbf20bf
CUDA: add unused vars to mmvf and mmvq ( #16807 )
2025-10-28 10:31:21 +08:00
Aman Gupta
f77c13b91f
CUDA: General GEMV fusion ( #16715 )
2025-10-26 19:28:04 +08:00
Aman Gupta
1ee9d0b415
CUDA: use fastdiv + ggml_cuda_mad for mmvf ( #16557 )
...
* CUDA: use fastdiv + ggml_cuda_mad for mmvf
* use bf16 directly + fix formatting
* Add exception for HIP code
2025-10-14 13:16:21 +02:00
R0CKSTAR
8ad038c0fd
musa: add GGML_UNUSED_VARS ( #15446 )
...
Signed-off-by: Xiaodong Ye <xiaodong.ye@mthreads.com >
2025-08-21 11:06:05 +08:00
uvos and Johannes Gäßler
5ba36f6103
HIP: Cleanup hipification header ( #15285 )
...
add expicit conversion operator to support older versions of rocm
Switch over to hip_bf16 from legacy hip_bfloat16
Simplify RDNA3 define
Reduce swap over of new hipblas api to rocm 6.5 as this version is used for rocm 7.0 previews
---------
Co-authored-by: Johannes Gäßler <johannesg@5d6.de >
2025-08-14 16:23:56 +02:00
Johannes Gäßler
1d72c84188
CUDA: GEMM for FP32/FP16/BF16 and ne11 <= 16 ( #15131 )
...
* CUDA: GEMM for FP32/FP16/BF16 and ne11 <= 16
2025-08-07 10:53:21 +02:00