diff --git a/benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/b200-fp4/8k1k.yaml b/benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/b200-fp4/8k1k.yaml index 39801bfa8e..408125950a 100644 --- a/benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/b200-fp4/8k1k.yaml +++ b/benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/b200-fp4/8k1k.yaml @@ -3,7 +3,7 @@ base: name: qwen3.5-fp4-b200-sglang-8k1k model: path: hf:nvidia/Qwen3.5-397B-A17B-NVFP4-V2 - container: lmsysorg/sglang:v0.5.19-cu130 + container: lmsysorg/sglang:v0.5.20-cu130 precision: fp4 resources: gpu_type: b200 @@ -33,7 +33,7 @@ base: mamba-ssm-dtype: bfloat16 attention-backend: trtllm_mha moe-runner-backend: flashinfer_trtllm - cuda-graph-max-bs: 4 + cuda-graph-max-bs-decode: 4 max-prefill-tokens: 16384 chunked-prefill-size: 16384 mem-fraction-static: 0.8 @@ -64,7 +64,7 @@ zip_override_tp2_ep1: agg: gpus: 2 args: - cuda-graph-max-bs: [4, 8, 16, 32, 64, 128] + cuda-graph-max-bs-decode: [4, 8, 16, 32, 64, 128] scheduler-recv-interval: [10, 30, 30, 30, 30, 30] tensor-parallel-size: 2 benchmark: diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index 7ee2ca0bee..be8d5c007c 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -1194,7 +1194,7 @@ qwen3.5-fp8-b200-sglang-agentic-mtp: - { tp: 4, ep: 1, spec-decoding: mtp, kv-offloading: dram, kv-offload-backend: { name: hicache }, conc-list: [16, 18, 20, 22, 24, 28, 32] } qwen3.5-fp4-b200-sglang: - image: lmsysorg/sglang:v0.5.19-cu130 + image: lmsysorg/sglang:v0.5.20-cu130 model: nvidia/Qwen3.5-397B-A17B-NVFP4-V2 model-prefix: qwen3.5 runner: cluster:b200-nscale