Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
Original file line number Diff line number Diff line change
Expand Up @@ -14,7 +14,7 @@ check_env_vars \
MODEL TP CONC EP_SIZE KV_OFFLOADING \
TOTAL_CPU_DRAM_GB RESULT_DIR DURATION

SCHEDULER_RECV_INTERVAL=${SCHEDULER_RECV_INTERVAL:-30}
SCHEDULER_RECV_INTERVAL=${SCHEDULER_RECV_INTERVAL:-60}

if [[ -n "${SLURM_JOB_ID:-}" ]]; then
echo "JOB $SLURM_JOB_ID running on ${SLURMD_NODENAME:-unknown}"
Expand Down Expand Up @@ -90,7 +90,7 @@ export SGLANG_USE_AITER=1
export SGLANG_USE_AITER_UNIFIED_ATTN=1
export AITER_FLYDSL_FORCE=1
export SGLANG_MAMBA_SSM_DTYPE=bfloat16
export ROCM_QUICK_REDUCE_QUANTIZATION=INT8
export ROCM_QUICK_REDUCE_QUANTIZATION=INT4
export SGLANG_TIMEOUT_KEEP_ALIVE=1800

if [ "${EVAL_ONLY:-false}" != "true" ]; then
Expand All @@ -113,7 +113,7 @@ SGLANG_CMD=(
--watchdog-timeout 1200
--page-size 16
--kv-cache-dtype fp8_e4m3
--cuda-graph-max-bs "$CUDA_GRAPH_MAX_BS"
--cuda-graph-max-bs-decode "$CUDA_GRAPH_MAX_BS"
--max-running-requests "$MAX_RUNNING_REQUESTS"
--max-prefill-tokens 16384
--chunked-prefill-size 16384
Expand Down
2 changes: 1 addition & 1 deletion configs/amd-master.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -361,7 +361,7 @@ qwen3.5-fp4-mi355x-sglang-mtp:
- { tp: 4, conc-start: 4, conc-end: 16, spec-decoding: mtp }

qwen3.5-fp4-mi355x-sglang-agentic-mtp:
image: lmsysorg/sglang-rocm:v0.5.19-rocm720-mi35x-20260908
image: lmsysorg/sglang-rocm:v0.5.19-rocm720-mi35x-20260911
model: amd/Qwen3.5-397B-A17B-MXFP4
model-prefix: qwen3.5
runner: cluster:mi355x-amds
Expand Down
10 changes: 10 additions & 0 deletions perf-changelog.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -7408,3 +7408,13 @@
- "Enable required power for the seven existing B200 Kimi-K3 recipes, use the pinned AgentX producer and shared collector, fix the exporter import URI, and record DCP8 with offload disabled to match the serving commands."
- "启用 Kimi-K3 B200 实测功耗并修正 DCP 与 Offload 元数据。"
pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/3043

- config-keys:
- qwen3.5-fp4-mi355x-sglang-agentic-mtp
scenario-type:
- agentic-coding
description:
- "Bump image to lmsysorg/sglang-rocm:v0.5.19-rocm720-mi35x-20260911."
- "Rename --cuda-graph-max-bs to --cuda-graph-max-bs-decode for sglang 0.5.19."
- "Prefill allreduce INT4; scheduler-recv-interval default 60."
pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2972