Johannes Gäßler
|
e95d0bc8fd
|
CUDA: fix FA VKQ accumulator overflow (#17746)
|
2025-12-05 09:18:10 +01:00 |
|
 Johannes GäßlerandAman Gupta
|
2e1c9cd814
|
CUDA: generalized (mma) FA, add Volta support (#17505)
* CUDA: generalized (mma) FA, add Volta support
* use struct for MMA FA kernel config
---------
Co-authored-by: Aman Gupta <aman>
|
2025-12-03 16:57:05 +01:00 |
|
 R0CKSTARandJohannes Gäßler
|
c6f7a423c8
|
[MUSA] enable fp16/fast_fp16/bf16_mma on PH1 (#17551)
* [MUSA] enable fp16/fast_fp16/bf16_mma on PH1
Signed-off-by: Xiaodong Ye <xiaodong.ye@mthreads.com>
* Update ggml/src/ggml-cuda/fattn-vec.cuh
Co-authored-by: Johannes Gäßler <johannesg@5d6.de>
* Update ggml/src/ggml-cuda/fattn-vec.cuh
Co-authored-by: Johannes Gäßler <johannesg@5d6.de>
* Update ggml/src/ggml-cuda/fattn-tile.cuh
Co-authored-by: Johannes Gäßler <johannesg@5d6.de>
* Address review comments
Signed-off-by: Xiaodong Ye <xiaodong.ye@mthreads.com>
---------
Signed-off-by: Xiaodong Ye <xiaodong.ye@mthreads.com>
Co-authored-by: Johannes Gäßler <johannesg@5d6.de>
|
2025-11-28 14:08:29 +01:00 |
|
Johannes Gäßler
|
73955f7d2a
|
CUDA: no FP16 arithmetic for vector FA kernel (#17558)
|
2025-11-28 10:29:09 +01:00 |
|
Johannes Gäßler
|
9c7185dd28
|
CUDA: enable FA for FP32 KV cache (#16546)
|
2025-10-14 14:22:47 +02:00 |
|
R0CKSTAR
|
91a2a56556
|
musa: update compile flags (#16265)
Signed-off-by: Xiaodong Ye <yeahdongcn@gmail.com>
|
2025-10-02 16:29:56 +03:00 |
|
Johannes Gäßler
|
75a3a6c2cd
|
CUDA: refactor and deduplicate vector FA kernels (#16208)
* CUDA: refactor and deduplicate vector FA kernels
|
2025-09-27 18:45:07 +02:00 |
|