Skip to content

[CUDA] Serve quantized KV caches with XQA: attention sinks, independent and per-channel scales - #29900

Merged
Tianlei Wu (tianleiwu) merged 5 commits into
mainfrom
tlwu/20260725/increase_xqa_coverage
Jul 27, 2026
Merged

Tianlei Wu (tianleiwu) merged 5 commits into
mainfrom
tlwu/20260725/increase_xqa_coverage

Commits

Commits on Jul 26, 2026

Commits on Jul 27, 2026