Single-GPU LLM decode research prototype: paged KV cache, Triton attention, CUDA append, scheduling, shared prefixes, and multi-layer transactions.
cuda pytorch triton gpu-kernels kv-cache llm-inference paged-attention flashinfer prefix-caching systems-research inference-runtime request-scheduling
-
Updated
Jul 26, 2026 - Python